Prinsip Garis Merah

Eksperimen yang dirilis minggu ini menunjukkan bahwa sinyal penghenti "garis merah" yang objektif mengungguli penilaian LLM itu sendiri dalam menghentikan loop agen otonom pada tugas apa pun yang dapat diverifikasi. Dalam benchmark pengodean tingkat kesulitan menengah, agen yang menggunakan garis merah mencapai konvergensi setelah rata-rata 3,3 iterasi; agen yang mengandalkan penilaian mandiri mencapai batas keras delapan langkah tanpa menyelesaikannya.

Mengapa perbandingan ini penting

Agen AI otonom sekarang menghasilkan kode, menulis laporan, dan memproduksi data terstruktur tanpa pengawasan manusia. Setiap iterasi menghabiskan daya komputasi,