Tim peneliti dari beberapa universitas membandingkan pelatihan standar dengan metode Implicit Chain of Thought (ICoT). Mereka fokus pada ketergantungan jangka panjang, yaitu kebutuhan model untuk menyimpan produk parsial dan jumlah berjalan selama perhitungan panjang.
Hasilnya, model yang dilatih secara standar dengan dua sampai dua belas lapis memiliki akurasi sangat rendah, sementara model ICoT mencapai 100% akurasi. Peneliti menemukan bahwa ICoT mengkodekan nilai antara dalam hidden states dan mengatur jalur perhatian untuk menyimpan lalu mengambil kembali informasi itu. Menambahkan tujuan pelatihan untuk melacak jumlah berjalan meningkatkan akurasi model dua lapis menjadi sangat tinggi tanpa supervisi chain-of-thought eksplisit.
Kata-kata sulit
- ketergantungan — kebutuhan model menyimpan informasi dalam waktu lamaketergantungan jangka panjang
- produk — hasil bagian dari perhitungan atau operasiproduk parsial
- jumlah berjalan — jumlah yang terus diperbarui selama perhitungan
- jalur perhatian — cara model memilih dan fokus pada informasi
- pelatihan — proses mengajar model agar bisa bekerjapelatihan standar, tujuan pelatihan
- akurasi — tingkat benar hasil atau prediksi model
Tips: arahkan kursor, fokus, atau ketuk kata yang disorot di dalam teks untuk melihat definisi singkat sambil membaca atau mendengarkan.
Pertanyaan diskusi
- Mengapa menurutmu melacak jumlah berjalan bisa meningkatkan akurasi model?
- Apakah kamu pikir metode seperti ICoT berguna untuk tugas perhitungan panjang? Mengapa?
Artikel terkait
Ilmuwan Afrika Selatan Kembangkan Biosensor untuk Deteksi Dini
Di Pertemuan Nobel Laureate Lindau, ilmuwan Jaymi Leigh January memaparkan biosensor generasi berikutnya yang memakai nanoteknologi untuk mendeteksi biomarker penyakit seperti TB, kanker, dan virus. Ia ingin alat ini menjadi portabel dan terjangkau untuk klinik lokal.
Otak Prediksi Frasa, Bukan Hanya Kata Berikutnya
Penelitian menunjukkan otak manusia memprediksi kata dengan mengelompokkan kata secara gramatikal menjadi frasa, berbeda dari model bahasa besar (LLM) yang dilatih untuk menebak kata berikutnya. Temuan ini didukung oleh eksperimen dan rekaman aktivitas otak.
Melihat Ketidakpastian sebagai Peluang
Penelitian ETH Zurich menguji apakah memandang ketidakpastian sebagai peluang mengubah sikap politik. Setelah presentasi singkat, peserta lebih positif terhadap keberagaman, lebih mendukung perubahan sosial, dan lebih kecil kemungkinan memilih AfD.
Peneliti Pakai Pola Kelompok Burung untuk Kurangi Halusinasi AI
Peneliti mengembangkan langkah pra-proses yang menata kalimat seperti kelompok burung sebelum AI membuat ringkasan. Cara ini mengurangi kesalahan fakta pada ringkasan, tetapi tidak sepenuhnya menghilangkan risiko halusinasi.