Bagaimana ujian disediakan
Penulis membina satu sistem penjanaan dipertingkat-carian (RAG) kecil berasaskan dua dokumen buku peraturan pembayaran dan menjalankan dua semakan:
- Ujian imbas kembali (Recall test) – adakah halaman yang betul muncul dalam lima keputusan teratas? Keputusan: 60 %.
- Ujian jawapan – adakah jawapan akhir yang dihasilkan oleh penjana itu betul? Keputusan: 90 %.
Jurang sebanyak 40 % kelihatan mustahil. Jika pencari (retriever) terlepas halaman yang betul empat kali daripada sepuluh, bagaimana model tersebut masih boleh menjawab dengan betul sembilan kali daripada sepuluh?
Percubaan pertama untuk “memperbaiki” pencari (retriever)
Pembangun mencuba dua teknik biasa:
- Carian hibrid (Hybrid search) – mencampurkan isyarat leksikal dan vektor. Imbas kembali kekal sama.
- Penyusun semula (Reranker) – menyusun semula lima halaman yang diambil. Imbas kembali meningkat kepada 70 % tetapi masih jauh ketinggalan berbanding ketepatan jawapan sebanyak 90 %.
Kedua-dua alatan ini hanya menyusun semula apa yang telah diambil; ia tidak boleh memunculkan halaman yang tidak pernah masuk ke dalam set calon. Masalahnya terletak di tempat lain.
Metrik, bukannya model, yang bermasalah
Daripada menilai kejayaan berdasarkan label halaman, penulis memeriksa fakta sebenar dalam cebisan (chunks) yang diambil. Dalam tiga daripada empat "kegagalan", fakta yang betul ada tersedia, tetapi ia berada di halaman yang berbeza daripada yang dijangkakan oleh skrip ujian. Penilaian tersebut menghukum pencari kerana menemui jawapan yang betul pada halaman yang tidak dijangka.
Apabila metrik ditukar kepada “adakah mana-mana cebisan yang diambil mengandungi fakta yang diperlukan?”, imbas kembali melonjak kepada 90 %, menyamai ketepatan jawapan. Pencari berfungsi; kerangka penilaian pula tidak.
Mengapa imbas kembali tradisional boleh mengelirukan
- Pelabelan tahap halaman mencipta kegagalan bayangan. Satu fakta mungkin muncul pada beberapa halaman. Menandakan hanya satu halaman sebagai kebenaran asas (ground truth) menganggap semua padanan betul yang lain sebagai ralat.
- Korpus kecil membesarkan kesan tersebut. Dengan dokumen yang sedikit, satu halaman yang salah dilabel boleh mengubah imbas kembali secara drastik sementara ketepatan jawapan kekal stabil.
- Hingar (noise) embedding menyembunyikan fakta. Vektor memberikan skor kepada keseluruhan halaman; teks undang-undang atau teknikal di sekeliling mencairkan isyarat kaitan ayat sasaran, menyebabkan halaman tersebut jatuh dalam kedudukan ranking walaupun fakta tersebut ada.
Pengajaran praktikal untuk pengamal RAG
- Asingkan kegagalan penyusunan daripada kegagalan pencarian. Penyusun semula (rerankers) hanya membaiki yang pertama; jika cebisan yang betul tidak pernah masuk ke dalam set calon, penyusunan semula tidak membantu apa-apa.
- Label data ujian pada tahap fakta. Kaitkan setiap pertanyaan dengan maklumat khusus yang diperlukannya, bukan pada satu pengenal pasti dokumen sahaja.
- Jangan percayai penanda aras (benchmarks) skala besar untuk set data yang kecil. Korpus kecil yang khusus untuk domain tertentu berkelakuan secara berbeza, dan skor imbas kembali generik boleh mengelirukan.
- Perhatikan kehalusan (granularity) embedding. Cebisan bersaiz halaman mengandungi banyak perkataan, dan teks undang-undang di sekeliling boleh menurunkan kedudukan fakta yang anda perlukan.
Kesimpulannya: skor ketepatan jawapan yang tinggi boleh wujud bersama angka imbas kembali tradisional yang rendah apabila penilaian tidak selaras dengan tugasan. Memperbaiki metrik, bukannya model, dapat menjimatkan masa, mengurangkan amaran palsu, dan menghasilkan penggunaan RAG yang lebih dipercayai.
