HarnessDev: LLM Membina Infrastruktur Mereka Sendiri
ByteDance dan sekumpulan universiti telah melancarkan HarnessDev, sebuah rangka kerja yang membolehkan model bahasa besar (LLM) menulis "sistem operasi ejen" mereka sendiri, yang dipanggil Agent Harnesses. Pasukan tersebut memberikan LLM satu kit permulaan yang ringkas dan membiarkannya melengkapkan selebihnya, menunjukkan bagaimana AI boleh membina lapisan kawalan yang menjalankan gelung penggunaan alatan, langkah pengesahan, dan pengendalian ralatnya sendiri—tanpa manusia perlu menaip setiap baris kod.
Mengapa harness yang dibina sendiri itu penting
Ejen AI telah berkembang daripada pembantu satu-prompt kepada pekerja pelbagai langkah yang memanggil API, membuat pertanyaan pangkalan data, dan menyatukan hasil. Setakat ini, pembangun membina kod orkestrasi secara manual untuk memberitahu model bila perlu memanggil alatan carian, cara menyimpan keadaan perantara, dan cara mengesahkan jawapan akhir. HarnessDev mengubah model tersebut: sebuah seed harness membekalkan kerangka yang mencukupi—fungsi asas untuk pengulangan (looping), pemilihan alatan, dan penjejakan keadaan—dan LLM mengembangkannya menjadi runtime yang lengkap dengan pelbagai ciri.
Dalam penanda aras kertas kerja tersebut, model itu menghasilkan 18 harness yang berbeza, menambah lebih daripada 17,000 baris kod kepada benih (seed) asal. Setiap harness menguruskan kitaran hayat tugasan sepenuhnya: melaksanakan gelung, memilih alatan yang betul, mengekalkan konteks, menjejak keadaan, mengesahkan hasil, dan pulih daripada ralat.
Kos tersembunyi yang didedahkan oleh kajian tersebut
Angka-angka tersebut kelihatan mengagumkan, tetapi penulis memberi amaran bahawa pelaksanaan mentah tidak sama dengan penggunaan praktikal.
- Komponen yang tidak digunakan – Sebahagian besar kod yang dihasilkan tidak pernah dijalankan semasa pelaksanaan tugasan sebenar. LLM menulis fungsi yang tidak pernah dipanggil oleh ejen, menyebabkan pangkalan kod membengkak tanpa memberikan sebarang nilai.
- Kekuncian model (Model lock-in) – Harness cenderung dilaraskan mengikut LLM khusus yang menciptanya. Apabila harness yang sama diberikan kepada model yang berbeza, prestasinya menurun dengan ketara, menunjukkan bahawa logik kawalan yang dijana secara automatik itu mengandungi keunikan khusus model tersebut.
- Jurang pengesahan – Satu harness ujian melaporkan kadar kejayaan sebanyak 99% (99 daripada 100 larian) tetapi hanya betul sebanyak 48% daripada masa tersebut. Tanpa pengesahan yang kuat, ejen boleh membentangkan jawapan yang salah dengan penuh yakin.
- Lebihan token (Token overhead) – Penggunaan token—sebagai proksi kepada kos pengkomputeran—berbeza secara drastik. Satu harness memerlukan token tujuh kali ganda lebih banyak daripada yang lain untuk mencapai hasil yang sama, sekali gus menimbulkan kebimbangan tentang kebolehskalaan dalam tetapan pengeluaran.
Penemuan ini menekankan keperluan untuk reka bentuk yang berdisiplin, walaupun kod tersebut dihasilkan oleh LLM.
Perkara yang perlu diambil perhatian oleh pembangun
- Anggap reka bentuk harness sebagai seni bina – Jangan bergantung kepada model untuk "berfungsi dengan sendirinya." Takrifkan modul yang jelas untuk kawalan gelung, pemilihan alatan, pengendalian keadaan, dan pengesahan sebelum membiarkan LLM melengkapkannya.
- Bina pengesahan yang kuat – Masukkan semakan eksplisit yang membandingkan dakwaan ejen dengan kebenaran asas (ground truth) atau model sekunder. Ketepatan 48% dalam kajian tersebut walaupun kadar kejayaan yang dilaporkan sendiri adalah 99% menunjukkan bahawa pengesahan tidak boleh dianggap sebagai perkara sampingan.
- Pantau bajet token – Harness yang lebih rumit boleh menyebabkan jumlah token melambung tinggi. Lakukan profil terhadap pelbagai varian harness lebih awal untuk mengelakkan lonjakan kos tersembunyi.
- Uji merentasi pelbagai model – Jalankan harness yang sama dengan pelbagai sandaran (back-end) LLM. Jika prestasi merosot dengan tajam, anda mungkin memerlukan reka bentuk yang lebih agnostik-model atau harness berasingan bagi setiap model.
Kesimpulannya: HarnessDev membuktikan bahawa LLM boleh merangka kod kawalan yang menyerupai sistem operasi mereka sendiri.
