Pencarian ejen (agentic retrieval) sedang dicanangkan sebagai langkah seterusnya selepas saluran paip penjanaan dipertingkat pencarian (RAG) tradisional, menjanjikan sistem AI pengeluaran yang berhenti berhalusinasi dan mula "berfikir" tentang cara untuk mengambil maklumat. Penyokongnya mengatakan pendekatan ini boleh mengurangkan kos menjawab pertanyaan pada koleksi dokumen yang besar sehingga 82 kali ganda berbanding memasukkan keseluruhan korpus ke dalam tetingkap konteks model, satu penjimatan yang penting bagi mana-mana perniagaan yang menskalakan AI generatif.
Mengapa saluran paip RAG lama tidak mencukupi
Aliran kerja RAG klasik adalah urutan tetap: pecahkan dokumen kepada cebisan (chunks), benamkan (embed) setiap cebisan dalam ruang vektor padat, kemudian tarik vektor dengan skor tertinggi untuk pertanyaan pengguna. Dalam demonstrasi, kaedah ini kelihatan kemas—model menerima beberapa petikan "relevan" dan menjawab dengan yakin. Walau bagaimanapun, dalam pengeluaran, keyakinan tersebut sering kali tersilap.
Tiga kelemahan sistemik memacu masalah ini:
- Keserupaan vektor ≠ kerelevanan. Dua petikan boleh menjadi dekat secara matematik walaupun menyatakan fakta yang bertentangan, menyebabkan model memetik dakwaan yang salah.
- Fragmentasi memecahkan fakta. Pemecahan (chunking) tetap secara rutin membahagi satu kenyataan kepada dua. Jika model hanya menerima satu bahagian, ia tidak dapat membina semula bahagian yang hilang.
- Pertanyaan yang tidak teratur. Pertanyaan dunia nyata menyimpang daripada data latihan kebanyakan model embedding, jadi carian keserupaan mengembalikan cebisan yang tidak berkaitan.
Apabila saluran paip mengembalikan konteks yang salah, model bahasa hiliran masih menghasilkan jawapan, sering kali dengan kepastian yang tinggi, dan sistem tidak mengeluarkan ralat. Hasilnya ialah halusinasi senyap—kegagalan senyap yang sukar dikesan dalam perkhidmatan langsung.
Pencarian hibrid: satu pembaikan berperingkat
Maklum balas biasa adalah dengan menambah lapisan carian kata kunci di atas vektor padat, mewujudkan pencari hibrid yang boleh menangkap padanan istilah tepat yang terlepas oleh embedding. Menambah penyusun semula (reranker)—model kedua yang menyusun semula senarai yang diambil berdasarkan skor kerelevanan yang dipelajari—meningkatkan ketepatan dengan lebih lanjut.
Pencarian hibrid masih mengikut skrip statik: setiap pertanyaan mencetuskan siri langkah yang sama, tanpa mengira tahap kesukaran atau ketidakpastian. Saluran paip tersebut tidak dapat memutuskan sama ada ia memerlukan lebih banyak data, bagaimana untuk memecahkan soalan kompleks kepada sub-soalan, atau bila petikan yang diambil tidak mencukupi.
Pencarian ejen menganggap carian sebagai satu proses membuat keputusan
Pencarian ejen merangka semula masalah sebagai siri keputusan yang dibuat oleh "ejen" autonomi yang meniru penyelidik manusia. Ejen tersebut boleh:
- Menulis semula pertanyaan. Ia menormalkan penggunaan bahasa kolokial atau kabur sebelum mencari, meningkatkan peluang model pencarian memahami niat tersebut.
- Bertanya jika pencarian diperlukan. Untuk pertanyaan yang mudah, ejen menjawab secara langsung, menjimatkan token dan mengelakkan gangguan yang tidak perlu.
- Merancang carian pelbagai langkah. Soalan kompleks dipecahkan kepada sub-soalan yang lebih kecil, setiap satunya dicari secara bebas, kemudian digabungkan semula.
- Membetulkan diri sendiri. Jika keputusan awal kelihatan lemah—contohnya, skor keyakinan rendah atau bukti yang bercanggah—ejen akan mengeluarkan semula pertanyaan dengan formulasi yang berbeza atau meluaskan skop carian.
Hujah kos: konteks panjang lwn. pencarian
Sesetengah pengulas berpendapat bahawa tetingkap konteks yang semakin besar menjadikan pencarian tidak lagi relevan. Hujah balasnya adalah pragmatik: memasukkan korpus yang besar ke dalam konteks model menelan kos berlipat kali ganda lebih tinggi daripada pencarian yang terfokus. Anggaran meletakkan pencarian 8 hingga 82 kali lebih murah untuk set data yang besar, sambil tetap memberikan asas kontekstual yang diperlukan untuk jawapan yang tepat. Tetingkap konteks panjang kekal berguna untuk penaakulan bernuansa ke atas set dokumen kecil yang dikurasi, tetapi ia tidak dapat menggantikan carian yang boleh diskalakan.
Ketelusan dan pengesahan
Pembantu AI gred pengeluaran mesti mendedahkan sumbernya. Pencarian ejen boleh menyertakan petikan kepada setiap dakwaan, membolehkan penyemak manusia mengesahkan jejak semakan fakta. Pendekatan “tunjukkan-kerja-anda” ini membina kepercayaan dan mendedahkan laluan pencarian yang lemah yang boleh dipelajari oleh ejen untuk dielakkan dalam interaksi masa hadapan.
Apa yang perlu diperhatikan seterusnya
- Peralatan.
- Standard penilaian.
- Projek rintis perusahaan.
Kesimpulan
Pencarian ejen melangkaui saluran paip RAG statik yang terdedah kepada ralat yang mendominasi banyak demonstrasi. Dengan membiarkan sistem AI memutuskan bila dan bagaimana untuk mencari, ia mengurangkan penggunaan token, memotong kos secara drastik, dan—yang paling penting—menawarkan sumber yang boleh disahkan untuk setiap jawapan.
