Kaedah baharu ABSeeker, “Answer-Backtracked Credit Assignment” (ABC), membolehkan ejen carian jangka panjang (long-horizon search agents) memperoleh kredit bagi setiap langkah individu dan bukannya hanya untuk jawapan akhir, dan model dengan 4 bilion parameter yang dilatih dengannya sudah mampu menandingi atau mengatasi pesaing yang jauh lebih besar.

Penemuan penting ini amat bermakna kerana kebanyakan ejen sedia ada hanya dinilai pada akhir tugasan. Jika jawapan akhir betul, keseluruhan proses dianggap baik; jika salah, seluruh urutan dianggap buruk. Maklum balas "semua-atau-tiada" (all-or-nothing) tersebut menyembunyikan isyarat pembelajaran yang sebenar—langkah yang baik tetapi diikuti oleh kesilapan, atau klik yang tidak berguna tetapi secara kebetulan membawa kepada hasil yang betul. Pendekatan ABSeeker mengubah peraturan tersebut.

Mengapa pendekatan lama tidak mencukupi

Apabila ejen melakukan carian, menulis kod, atau mengumpul bukti, ia biasanya mengambil banyak tindakan: mengeluarkan pertanyaan, membuka halaman, menjalankan arahan, menyemak keadaan sistem, dan sebagainya. Dalam satu larian lima belas langkah, satu kesilapan tunggal boleh menjejaskan jawapan akhir, walaupun langkah-langkah sebelumnya adalah tepat. Sebaliknya, larian yang berakhir dengan jawapan yang betul mungkin bergantung pada nasib semata-mata, dengan kebanyakan langkah tidak memberi sebarang nilai. Latihan yang hanya berdasarkan hasil akhir memaksa model untuk menganggap keseluruhan trajektori sebagai satu "kotak hitam" (black box), menjadikannya sukar untuk mempelajari sub-tingkah laku mana yang sebenarnya berguna.

Situasi ini menyerupai proses penyahpepijatan (debugging) dalam kejuruteraan perisian. Pembangun menjejaki setiap baris, mengasingkan panggilan yang gagal, dan membaikinya. Walau bagaimanapun, ejen tidak diberikan "resit" kerja dalaman yang setanding. Tanpa jejak audit tersebut, pembangun tidak dapat menentukan sama ada penambahbaikan adalah disebabkan oleh penaakulan yang lebih baik atau sekadar kebetulan, dan mereka tidak dapat membetulkan tabiat buruk secara sistematik.

Bagaimana ABC menyusun semula pemberian kredit

Answer-Backtracked Credit Assignment berfungsi secara terbalik daripada jawapan akhir yang betul. Ia terlebih dahulu mengekstrak petunjuk penting yang menjadi sandaran jawapan tersebut—bukti khusus, hasil perantaraan, atau semakan keadaan. Kemudian, ia menjejaki semula melalui rekod jejak, memberikan skor kepada setiap tindakan berdasarkan petunjuk tersebut. Tindakan yang menyumbang secara langsung kepada petunjuk yang diperlukan akan mendapat kredit positif; tindakan yang tidak relevan atau memudaratkan akan menerima skor negatif atau sifar.

Dua rejim latihan dibina berasaskan pemarkahan ini:

  • ABC-SFT (Supervised Fine-Tuning) menyusun semula pemberat fungsi kerugian (loss function) supaya langkah dengan kredit yang lebih tinggi mempengaruhi model dengan lebih kuat. Model belajar untuk mengutamakan tindakan yang secara sejarahnya membawa kepada petunjuk yang berguna.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) menganggap skor setiap langkah sebagai isyarat ganjaran untuk pembelajaran pengukuhan (reinforcement learning), mengukuhkan bahagian carian tertentu yang membantu jawapan muncul.

Dengan menukarkan label lulus/gagal binari kepada peta sumbangan yang terperinci, ABC memberikan isyarat pembelajaran yang jauh lebih kaya kepada model.

Keputusan awal menunjukkan hasil yang memberangsangkan

Penyelidik telah menerapkan ABC kepada model 4 bilion parameter yang sederhana, yang dilengkapi dengan lapisan pengurusan konteks untuk memantau keadaan carian yang sedang berkembang. Dalam tugasan penanda aras yang secara tradisinya memihak kepada ejen yang jauh lebih besar, model yang dilatih dengan ABC sama ada menandingi atau mengatasi sistem yang lebih besar tersebut. Peningkatan prestasi itu dicapai tanpa menambah saiz model, menunjukkan bahawa pemberian kredit yang lebih baik boleh menggantikan jumlah parameter mentah.

Kesimpulan utamanya mudah: berikan model "resit" yang jelas tentang apa yang berjaya, dan ia dapat mengekstrak lebih banyak nilai daripada jumlah data latihan yang sama.

Apa maksudnya untuk ejen dunia nyata

Mana-mana ejen yang melakukan kerja berbilang langkah—pembantu pengekodan, bot ulasan literatur, alat sokongan pelanggan—bergantung pada jejak tindakannya. ABC menunjukkan bahawa memelihara dan menilai jejak tersebut bukanlah sekadar tambahan yang "bagus jika ada"; ia adalah penting untuk pembelajaran yang berkesan.

  • Ejen pengekodan perlu merekodkan pelan,

Answer-Backtracked Credit Assignment mengubah paradigma tentang cara kita mengajar ejen untuk mencari, mengekod, dan menaakul. Dengan memberi ganjaran kepada langkah yang betul sepanjang proses dan bukannya hanya pada hasil akhir, ia membolehkan model bersaiz sederhana belajar seberkesan model yang jauh lebih besar. Bagi sesiapa yang membina ejen yang perlu melaksanakan tugasan berbilang langkah, mengguna pakai rejim latihan berpusatkan jejak bukan lagi satu pilihan—ia adalah jalan menuju AI yang boleh dipercayai, boleh diaudit, dan akhirnya lebih pintar.