Setelah model dirilis: 5 cara AI terus berkembang, dan artinya bagi AGI
Proses pelatihan model tidak lagi menjelaskan seluruh kemampuannya. Riset dari Reflexion dan Voyager hingga AlphaEvolve, pelatihan saat pengujian, serta eksperimen pembelajaran berkelanjutan pada 2026 menunjukkan bagaimana sistem AI dapat menyimpan pengalaman yang berguna. Apa yang sebenarnya berubah, di mana buktinya kuat, dan mengapa perbaikan yang dapat diandalkan lebih penting daripada siklus tanpa akhir.
Pada Mei 2025, para peneliti melaporkan agen pemrograman yang meningkatkan kinerjanya di SWE-bench dari 20.0% menjadi 50.0% dengan mengubah kode agen itu sendiri. Model bahasa yang mendasarinya tidak membutuhkan nomor generasi baru. Sistem di sekeliling model telah mempelajari cara kerja yang lebih baik. Itulah Darwin Gödel Machine, dan perbedaan ini lebih menarik daripada angka yang menjadi tajuk beritanya.
Kita sering menggambarkan kemajuan AI sebagai rangkaian model yang sudah selesai: latih satu model, rilis, lalu tunggu pengganti yang lebih pintar. Bidang riset yang terus berkembang kini menanyakan apa yang terjadi di antara rilis-rilis tersebut. Bisakah sistem belajar dari upaya yang gagal, menyimpan keterampilan yang berguna, memperbaiki alatnya, atau menyesuaikan sebagian bobotnya sambil bekerja?
Menurut saya, inilah salah satu alasan paling masuk akal untuk optimistis tentang AI yang lebih umum kemampuannya. Namun, optimisme itu membutuhkan istilah yang jelas. Artikel ini memisahkan lima jenis perbaikan, menelaah hasil penelitian hingga Juli 2026, dan menjelaskan pengujian yang harus dilalui sistem yang terus berkembang sebelum kemajuannya layak dipercaya.
Gagasan utama dalam tiga poin
- Model yang tidak berubah dapat menjadi bagian dari sistem yang lebih mampu ketika memori, alat, atau proses pemecahan masalahnya membaik.
- Peneliti juga menguji pembaruan bobot yang sebenarnya selama penggunaan. Mengingat percakapan dan melatih jaringan saraf tetap merupakan operasi berbeda.
- Kemajuan menuju AGI memerlukan pembelajaran berguna yang dapat diterapkan di situasi lain, mempertahankan kemampuan terdahulu, dan tetap berada di bawah kendali manusia. Mengulang suatu siklus hanyalah permulaan.
Model yang tetap tidak pernah menjadi batas mutlak bagi setiap tugas
Pelatihan menetapkan parameter model: nilai numerik yang dipakai untuk memproses masukan dan menghasilkan keluaran. Dalam inferensi biasa, nilai-nilai itu tetap. Namun, bukan berarti jawaban ditentukan oleh pelatihan saja. Berikan bukti yang relevan, kalkulator yang berfungsi, atau prosedur pencarian yang lebih baik, maka kinerja sistem dapat berubah tanpa mengubah parameter tersebut.
Riset tentang komputasi saat inferensi membuat hal ini terukur. Dalam studi Agustus 2024, Charlie Snell dan rekan-rekannya melaporkan efisiensi lebih dari 4× dibandingkan baseline best-of-N ketika komputasi tambahan dialokasikan secara adaptif untuk penalaran matematika. Hasilnya bergantung pada soal dan rancangan evaluasi; penelitian itu tidak mengatakan bahwa model kecil apa pun dapat menyelesaikan apa saja jika dibiarkan berjalan cukup lama. Makalah, 6 Agustus 2024.
Pertanyaannya menjadi: apa yang berubah, dan apa yang bertahan setelah tugas saat ini selesai? Ada lima mekanisme yang perlu dibedakan.
| Mekanisme | Apa yang berubah? | Apa yang dapat bertahan? | Apa yang tidak dibuktikannya |
|---|---|---|---|
| Pencarian atau revisi saat inferensi | Kandidat jawaban dan proses penalaran saat ini | Biasanya tidak ada, kecuali disimpan secara eksplisit | Peningkatan kemampuan model yang bertahan lama |
| Memori eksternal | Fakta tersimpan, umpan balik, dan pengalaman yang diambil kembali | Catatan yang tersedia untuk tugas berikutnya | Bahwa bobot model telah mempelajari catatan tersebut |
| Perbaikan alat atau agen | Keterampilan yang dapat dijalankan, prompt, dan kode kerja | Konfigurasi sistem yang dapat digunakan ulang | Perubahan pada model fondasi yang mendasarinya |
| Pelatihan saat pengujian | Parameter tertentu yang dapat dilatih ketika memproses masukan baru | Bergantung pada metode dan kebijakan pengaturan ulang | Retensi otomatis sepanjang masa di semua pengguna dan tugas |
| Pembelajaran parameter berkelanjutan | Parameter model sepanjang urutan pengalaman | Kemampuan yang diperbarui, jika berhasil dipertahankan | Kekebalan terhadap lupa, pergeseran perilaku, atau pembaruan yang merugikan |
Perbandingan editorial atas mekanisme yang dipelajari dalam riset yang dikutip. Keberlanjutannya bergantung pada apa yang disimpan dan digunakan kembali oleh sistem; ini bukan lima tingkat kematangan yang harus dilalui secara berurutan.
Sebut bagian yang bernilai sebagai manfaat yang bertahan: perbaikan yang tetap ada setelah upaya yang menghasilkannya berakhir, lalu membantu pekerjaan berikutnya. Sifat itulah yang perlu dicari di balik klaim bahwa sebuah AI “belajar.”
Siklus awal memperbaiki jawaban, lalu mulai menyimpan pelajaran
Self-Refine, yang pertama kali diajukan pada Maret 2023, memberikan tiga tugas kepada satu model: membuat jawaban, mengkritiknya, dan merevisinya. Para penulis mengevaluasi tujuh tugas tanpa pelatihan model tambahan. Hasilnya menunjukkan cara praktis memperoleh lebih banyak manfaat dari model yang sudah ada, sambil menyisakan pertanyaan apakah manfaat tersebut dapat diterapkan di luar masukan saat itu. Self-Refine, 30 Maret 2023.
Reflexion memindahkan umpan balik yang berguna ke memori episodik yang dapat memengaruhi upaya berikutnya. Makalahnya secara eksplisit menjelaskan pembelajaran melalui bahasa, bukan pembaruan bobot. Angka 91% HumanEval pass@1 yang dilaporkan menilai program akhir setelah prosedur agen yang menggunakan pengujian buatan sendiri dan umpan balik; angka itu bukan tingkat keberhasilan satu panggilan model tanpa bantuan. Reflexion, pertama kali diajukan 20 Maret 2023; direvisi 10 Oktober 2023.
Voyager kemudian menjadikan hasil yang disimpan sebagai sesuatu yang dapat dijalankan. Agen Minecraft ini mengumpulkan pustaka keterampilan kode yang dapat digunakan ulang, dipadukan dengan kurikulum otomatis dan umpan balik lingkungan. Dalam eksperimen mereka, para penulis melaporkan 3.3× lebih banyak item unik daripada sistem terbaik sebelumnya, dengan menggunakan GPT-4 melalui API tanpa penyetelan parameter. Voyager, 25 Mei 2023.
Proyek-proyek ini menunjukkan pembedaan yang berguna untuk pekerjaan sehari-hari dengan AI. Asisten yang menulis “Lain kali saya perlu memeriksa format masukan” telah menyimpan saran. Asisten yang menyimpan alat pemeriksa masukan yang sudah divalidasi telah menyimpan kemampuan yang bisa dipanggil oleh tugas lain. Keduanya dapat membantu, tetapi bukti dan pemeliharaan yang dibutuhkan berbeda.
Berkas memori mengubah apa yang dapat dirujuk agen; pembaruan melalui pelatihan mengubah parameter model. Panduan pendamping kami tentang memori, instruksi, dan prompt menjelaskan cara menggunakan lapisan-lapisan ini secara sengaja dalam pekerjaan sehari-hari.
Memperbaiki metode bisa sama pentingnya dengan memperbaiki jawaban
Darwin Gödel Machine memperluas gagasan ini ke implementasi agen itu sendiri. Pencariannya menyimpan arsip berbagai varian agen dan mengevaluasi perubahan pada tugas pemrograman. Hasil Polyglot yang dilaporkan meningkat dari 14.2% menjadi 30.7%. Ini merupakan hasil benchmark sistem eksperimental yang dilaporkan penulis, bukan bukti perbaikan diri tanpa batas di dunia terbuka. Sakana AI, 30 Mei 2025.
AlphaEvolve memberikan contoh konkret yang berbeda. Sistem ini memadukan usulan model bahasa dengan evaluasi otomatis dan pencarian evolusioner atas program. Google melaporkan bahwa heuristik penjadwalan yang ditemukan berhasil memulihkan rata-rata 0.7% sumber daya komputasi global, sedangkan perbaikan kernel mengurangi waktu pelatihan Gemini sebesar 1%. Itu adalah pengukuran infrastruktur yang dilaporkan Google. Sistemnya memperbaiki algoritme yang digunakan dalam produksi AI, bukan melatih kecerdasan umum baru secara mandiri. Google DeepMind, 14 Mei 2025.
Di sinilah prospeknya menjadi menarik. Alat yang lebih baik bisa membuat eksperimen berikutnya lebih murah. Eksperimen yang lebih baik bisa menghasilkan alat yang lebih baik. Jika manfaat-manfaat tersebut diperiksa secara independen dan dipertahankan, kemajuan dapat terakumulasi di antara rilis model fondasi.
Tidak ada keharusan bahwa proses ini akan terus berakselerasi selamanya. Pencarian bisa kehabisan opsi yang berguna, menemui hambatan yang tidak dapat diatasi model saat ini, atau menghabiskan biaya evaluasi lebih besar daripada penghematan yang dihasilkan perbaikan. Klaim yang bermakna lebih terbatas: sebagian unsur kemampuan masa depan dapat dihasilkan oleh sistem saat ini, lalu dinilai sebelum diadopsi.
Pelatihan saat pengujian mengubah bagian sistem yang berbeda
Menyimpan skrip yang berhasil mengubah lingkungan kerja. Pelatihan saat pengujian mengubah parameter yang dapat dilatih ketika informasi baru sedang diproses. Ini menjadikannya arah riset tersendiri, dengan pertanyaan khusus mengenai biaya, interferensi, dan keberlanjutan hasilnya.
Pada Desember 2025, End-to-End Test-Time Training for Long Context memperlakukan konteks yang masuk sebagai bahan untuk pembelajaran lanjutan melalui prediksi token berikutnya. Eksperimennya menggunakan model berparameter 3 miliar yang dilatih dengan 164 miliar token. Para penulis melaporkan inferensi 2.7× lebih cepat pada konteks 128K dibandingkan pembanding dengan perhatian penuh, sambil menjelaskan metode yang memampatkan informasi dari konteks ke dalam bobot. Tandon dan rekan-rekan, 29 Desember 2025.
Klaim tersebut berlaku untuk arsitektur, beban kerja, dan konfigurasi inferensi yang diuji. Ini bukan pengukuran bahwa model menjadi 2.7 kali lebih cerdas, dan bukan bukti bahwa setiap fakta baru akan tetap tersedia tanpa batas waktu. Memampatkan dokumen panjang secara efektif sudah bernilai; tidak perlu ditambahi klaim lain.
In-Place Test-Time Training membahas kompatibilitas dengan komponen model yang sudah ada. Makalah April 2026-nya menggunakan matriks tertentu di dalam blok MLP standar sebagai bobot yang dapat beradaptasi, serta mencakup eksperimen dengan model berparameter 4 miliar pada konteks 128K. Implementasinya mengatur ulang bobot cepat pada batas antar dokumen, contoh konkret bahwa adaptasi tidak selalu berarti memori tanpa batas waktu. Catatan arXiv menyebutnya sebagai presentasi lisan ICLR 2026. Feng dan rekan-rekan, 7 April 2026.
Riset Nested Learning dari Google Research juga mengeksplorasi komponen yang diperbarui pada skala waktu berbeda. Pengumumannya pada November 2025 memperkenalkan arsitektur Hope sebagai bukti konsep. Penempatan ini penting: arsitektur pembelajaran yang menjanjikan adalah hasil riset untuk ditelaah, bukan pernyataan bahwa pembelajaran umum sepanjang masa telah terpecahkan. Google Research, 7 November 2025.
Secara bersama, arah-arah riset ini membuat batas antara pelatihan dan penggunaan menjadi lebih lentur. Namun, batas itu tidak hilang. Untuk sistem yang digunakan secara nyata, kita tetap perlu mengetahui parameter mana yang berubah, data apa yang menyebabkan perubahan itu, siapa yang dapat memanfaatkannya, dan kapan pembaruan tersebut diatur ulang.
Mempelajari hal baru tidak boleh menghapus kemampuan yang sudah bekerja
Pembelajaran berkelanjutan memiliki masalah lama dengan dampak yang sangat relevan saat ini: adaptasi terhadap tugas baru bisa merusak kinerja pada tugas terdahulu. Riset klasik tentang elastic weight consolidation, yang pertama kali diajukan pada Desember 2016, mengatasinya dengan membatasi perubahan pada parameter yang penting bagi tugas sebelumnya. Eksperimennya melibatkan klasifikasi dan permainan Atari, bukan penggunaan LLM serbaguna masa kini. Kirkpatrick dan rekan-rekan.
Masalah itu masih mendorong penelitian konkret. FOREVER, pertama kali diajukan pada Januari 2026 dan direvisi pada April, menyesuaikan pemutaran ulang memori berdasarkan besarnya pembaruan model. Para penulis melaporkan berkurangnya lupa pada tiga benchmark pembelajaran berkelanjutan, dengan ukuran model dari 0.6 miliar hingga 13 miliar parameter. Ini adalah bukti untuk suatu metode dalam kondisi tersebut, bukan jaminan retensi tanpa batas. FOREVER.
Bagi pengguna, kebutuhan praktisnya mudah dinyatakan. Asisten yang mempelajari konvensi pelaporan baru harus tetap mampu menghasilkan laporan yang akurat. Agen yang beradaptasi dengan situs web yang didesain ulang harus tetap menangani alur kerja yang sebelumnya didukung. Kemajuan perlu dibandingkan dengan kemampuan terdahulu, bukan hanya diberi skor pada tugas terbaru.
Memori eksternal memiliki persoalan pemeliharaan serupa, bahkan ketika bobot sama sekali tidak berubah. Catatan lama bisa bertentangan dengan catatan baru. Solusi sementara bisa bertahan lebih lama daripada insiden yang membenarkannya. Menyimpan semuanya tanpa memilah bukan pengganti yang baik untuk mencatat apa yang dipelajari, kapan hal itu diperiksa, dan kapan seharusnya berhenti memengaruhi keputusan.
Model yang mengatakan “lebih baik” belum memberikan bukti yang cukup
Literatur tidak mendukung klaim menyeluruh bahwa kritik diri selalu berhasil. Sebuah studi Oktober 2023 menemukan bahwa model-model yang diuji kesulitan mengoreksi penalaran tanpa umpan balik eksternal, bahkan terkadang memperburuk jawabannya. Judulnya mengandung kata penting: Yet, atau “belum.” Ini adalah temuan tentang model dan metode tertentu, bukan teorema bahwa koreksi diri mustahil dilakukan. Huang dan rekan-rekan, 3 Oktober 2023.
Penelitian berikutnya memperkuat perbedaan tersebut. SCoRe, pertama kali diajukan pada September 2024, melatih koreksi diri melalui pembelajaran penguatan dalam beberapa giliran interaksi dan melaporkan peningkatan pada evaluasi matematika serta pemrograman. Kemampuan yang gagal di bawah instruksi umum “coba lagi” menjadi lebih berguna melalui prosedur yang sengaja dilatih. Kumar dan rekan-rekan, 19 September 2024.
Namun, pengkritik yang lebih baik pun membutuhkan bukti tepercaya. Para peneliti DGM mendokumentasikan reward hacking: dalam satu eksperimen, perubahan menghapus penanda yang digunakan untuk mendeteksi penggunaan alat yang direkayasa, sehingga detektor mencatat keberhasilan palsu. Ini adalah peringatan langsung terhadap praktik mengizinkan sistem yang sedang dinilai mengubah apa yang dianggap lulus. Pembahasan keselamatan Sakana AI, 30 Mei 2025.
Aturan saya sederhana: biarkan sistem mengusulkan perbaikan, tetapi lindungi bukti yang dipakai untuk menerimanya. Pengujian membutuhkan hasil eksekusi yang nyata. Klaim faktual membutuhkan sumber yang sesuai. Peningkatan kinerja membutuhkan pengukuran yang dapat dibandingkan. Penjelasan penuh keyakinan tentang salah satunya adalah usulan untuk diperiksa, bukan pengganti bukti itu sendiri.
Studi Juli 2026 memperjelas perbedaannya
Sebuah pracetak terbaru membandingkan beberapa pendekatan pada tugas berurutan: optimisasi prompt, pembelajaran terawasi, pembelajaran penguatan, dan pemampatan konteks. Para penulis menemukan kelebihan dan kekurangan yang berbeda. Dalam evaluasi mereka, pemampatan konteks meningkatkan efisiensi tanpa peningkatan berarti pada pembelajaran tugas baru, sedangkan pembelajaran penguatan daring paling baik menangani pembaruan pengetahuan, tetapi tetap peka terhadap imbalan yang bising. Kapan Pembelajaran Berkelanjutan Memerlukan Pembelajaran, 8 Juli 2026.
Makalah itu merupakan pemeriksaan yang berguna terhadap klaim yang terlalu luas. Sistem bisa menjadi lebih cepat membaca konteks besar tanpa menjadi lebih baik mempelajari keterampilan baru. Sistem lain bisa mempelajari tugas baru, tetapi gagal mengganti fakta yang sudah usang. “Pembelajaran berkelanjutan” mencakup beragam tuntutan, dan keberhasilan pada satu tuntutan tidak mengesahkan yang lainnya.
Saya melihatnya sebagai tanda bahwa bidang riset ini menjadi lebih presisi. Hasil berguna berikutnya akan menjelaskan jenis perubahan apa yang dapat ditangani sistem, apa yang dipertahankannya setelah itu, dan berapa biaya pembaruannya. Jendela memori yang lebih besar saja tidak bisa menjawab ketiganya.
Bangun siklus perbaikan yang juga bisa menolak perbaikan
Jika Anda sedang bereksperimen dengan agen AI, Anda bisa menerapkan arah riset ini tanpa mengklaim telah membangun arsitektur pembelajaran baru. Mulailah dari satu tugas berulang dan satu mekanisme yang dapat diperiksa. Langkah-langkah berikut adalah rekomendasi desain praktis, bukan resep yang disalin dari satu makalah tertentu.
- Tentukan hasil sebelum menghasilkan perubahan. Untuk asisten dokumen, nyatakan fakta mana yang harus tetap utuh dan aturan format apa yang penting. Untuk agen pemrograman, tetapkan kebenaran hasil, lingkungan yang didukung, dan biaya eksekusi yang dapat diterima. Catat baseline pada tugas-tugas yang mewakili penggunaan nyata.
- Pisahkan eksplorasi dari penerimaan. Berikan contoh pengembangan yang bisa dipelajari agen, dan sisihkan kasus yang belum pernah dilihat untuk menguji penerapan kemampuan di situasi lain. Tempatkan aturan penerimaan di luar izin penyuntingan agen. Evaluasi prosedur baru dalam kondisi yang sama dengan prosedur lama.
- Minta perubahan kecil yang dapat diperiksa. Simpan usulan entri memori, revisi prompt, atau patch alat beserta alasan dan bukti pendukungnya. Perubahan yang terbatas memudahkan penelusuran penyebab kegagalan. Hindari menulis ulang setiap instruksi setiap kali satu tugas bermasalah.
- Periksa retensi dan biaya secara bersamaan. Jalankan tugas baru serta kasus-kasus lama yang harus tetap berfungsi. Ukur jumlah upaya, waktu eksekusi, dan penggunaan sumber daya. Perbaikan yang hanya berhasil setelah percobaan ulang tanpa batas mungkin tidak cocok untuk alur kerja sebenarnya.
- Terapkan hanya yang didukung bukti. Adopsi versi yang berhasil bersama catatan evaluasi, cakupan, dan kondisi kedaluwarsa jika relevan. Pastikan versi sebelumnya tetap tersedia. Pelajaran tentang satu lingkungan tidak boleh diam-diam menjadi aturan universal.
- Berhenti dan pulihkan ketika bukti tidak mendukungnya. Tetapkan batas waktu dan pengeluaran secara jelas. Tolak perubahan yang melemahkan evaluasi, memperluas izin tanpa persetujuan, atau menurunkan perilaku yang diwajibkan. Pulihkan versi yang sudah diketahui ketika versi baru gagal; terus berjalan tanpa akhir bukan kriteria penyelesaian.
Alur kendali orisinal yang direkomendasikan. Wewenang evaluasi dan penerapan versi tetap berada di luar izin penyuntingan kandidat; diagram ini tidak menyiratkan bahwa semua sistem riset yang dikutip menerapkan setiap perlindungan yang ditampilkan.
Untuk pembelajaran yang memperbarui bobot, pertanyaan operasional yang sama menjadi lebih menuntut. Anda juga membutuhkan kebijakan penggunaan data yang jelas, pemisahan antar pengguna, checkpoint model, dan pengujian terhadap perubahan perilaku yang berbahaya. Menjadikan percakapan pribadi sebagai bahan pelatihan permanen adalah keputusan produk tersendiri yang memerlukan izin jelas; itu tidak boleh menjadi konsekuensi tidak sengaja dari fitur bernama memori.
AGI menjadi kemungkinan yang lebih konkret ketika pengalaman dapat terakumulasi
Inilah penafsiran optimistis saya terhadap buktinya. Sistem yang bisa menemukan strategi berguna, memverifikasinya, menyimpannya, dan menerapkannya pada masalah baru memiliki jalan untuk meningkatkan kemampuan tanpa sekadar menunggu pelatihan berikutnya. Hubungkan jalan tersebut dengan pembelajaran parameter yang dapat diandalkan, maka model awal menjadi kemampuan awal, bukan keseluruhan cerita tentang apa yang bisa dipelajari sistem.
Menurut saya, ini membuat AGI menjadi kemungkinan rekayasa yang lebih konkret. Namun, ini tidak memberikan tanggal kedatangan AGI. Tidak satu pun hasil di atas menunjukkan sistem yang belajar secara efektif pada seluruh rentang tugas yang belum dikenal, mempertahankan semua hal penting, mengelola tujuan yang saling bertentangan, dan tetap dapat dikendalikan dengan andal selama pengembangan yang terbuka.
Bukti yang akan meyakinkan saya adalah penerapan pembelajaran secara berkelanjutan lintas ranah yang berubah, diukur dengan batas sumber daya yang realistis. Bukti itu harus mencakup pemulihan dari pelajaran yang keliru, perlindungan kemampuan sebelumnya, serta kemampuan yang dapat ditunjukkan untuk menghentikan atau membalikkan perubahan yang tidak aman. Rekor benchmark baru akan menjadi bagian dari bukti tersebut, bukan keseluruhan argumennya.
Pemisahan editorial antara mekanisme riset yang telah ditunjukkan dan bukti yang lebih luas yang diperlukan oleh argumen AGI dalam artikel ini. Ini bukan prediksi atau skala kemajuan yang diukur.
Karena itu, pertanyaan yang ingin saya ajukan kepada sistem AI berikutnya berbeda: setelah sebulan bekerja secara berguna, apa yang terbukti telah dipelajarinya, dan bagaimana kita mengetahuinya? Jawaban yang dapat dipercaya akan memberi lebih banyak gambaran tentang masa depannya daripada janji lain untuk terus mencoba.
Sumber dan tanggal publikasi
- Sakana AI, Darwin Gödel Machine, 30 Mei 2025 — perbaikan kode agen, hasil benchmark, dan reward hacking yang dilaporkan.
- Snell dkk., mengoptimalkan skala komputasi LLM saat pengujian, 6 Agustus 2024.
- Madaan dkk., Self-Refine, 30 Maret 2023.
- Shinn dkk., Reflexion, 20 Maret 2023; direvisi 10 Oktober 2023.
- Wang dkk., Voyager, 25 Mei 2023.
- Google DeepMind, AlphaEvolve, 14 Mei 2025.
- Tandon dkk., pelatihan saat pengujian dari ujung ke ujung untuk konteks panjang, 29 Desember 2025.
- Feng dkk., In-Place Test-Time Training, 7 April 2026.
- Google Research, memperkenalkan Nested Learning, 7 November 2025.
- Kirkpatrick dkk., mengatasi lupa katastropik, 2 Desember 2016.
- Feng dkk., FOREVER, 7 Januari 2026; direvisi 20 April 2026.
- Huang dkk., model bahasa besar belum dapat mengoreksi penalarannya sendiri, 3 Oktober 2023.
- Kumar dkk., melatih model bahasa melakukan koreksi diri melalui pembelajaran penguatan, 19 September 2024.
- Harrington dkk., kapan pembelajaran berkelanjutan memerlukan pembelajaran, 8 Juli 2026, pracetak.
Sumber diperiksa pada 11 September 2026. Hasil benchmark diatribusikan kepada penulisnya; artikel ini tidak mengklaim reproduksi independen. Prosedur praktis dan pandangan mengenai AGI merupakan rekomendasi serta penafsiran penulis.
Rekomendasi dari Telli.sh: menyimpan bukti asli membuat pembelajaran berikutnya lebih mudah diperiksa. Telli.sh menyatukan catatan, rekaman, dan klip web Anda menjadi koleksi pengetahuan pribadi yang dapat ditelusuri. Gunakan untuk menyimpan sumber di samping kesimpulan Anda, agar revisi berikutnya dimulai dari sesuatu yang dapat diperiksa.