Ramai orang terus menulis obituari untuk RAG. Anda mungkin sudah melihat tajuk-tajuk beritanya sekarang. Tingkap konteks yang panjang telah membunuhnya. Ejen telah menggantikannya. Seluruh corak tersebut sudah lapuk. Kebenarannya lebih sempit dan jauh lebih berguna. RAG tidak mati. Apa yang sebenarnya runtuh adalah ilusi selesa bahawa anda boleh membahagikan timbunan dokumen kepada cebisan, memasukkannya ke dalam pangkalan data vektor, dan tiba-tiba memiliki AI yang boleh dipercayai dan benar.

Beberapa tahun lalu, tawaran tersebut sangat menggoda dalam kesederhanaannya. Benamkan (embed) pangkalan pengetahuan anda. Sambungkannya ke LLM. Tanya soalan, dan lihat model menjawab hanya menggunakan data yang anda ambil semula. Untuk demo terkawal dan bot FAQ kecil, ia benar-benar berfungsi. Manual bantuan meja bantuan sebanyak dua puluh halaman. Wiki dalaman yang kemas. Bot tersebut lebih kurang akan memetik perenggan yang betul, dan pihak pengurusan akan meluluskan projek rintis tersebut. Tetapi projek rintis bukanlah produksi. Prototaip tidak mempunyai parut operasi perniagaan yang sebenar.

Data produksi adalah tidak teratur. Ia mengandungi nota penyelesaian masalah yang sama disalin merentasi belasan fail, masing-masing dengan cap masa yang sedikit berbeza dan label status yang bercanggah. Ia mengandungi jadual kompleks yang melimpah merentasi halaman, menghasilkan sesuatu yang tidak masuk akal apabila pembahagi (splitter) memotongnya di tengah-tengah. Ia mengekalkan percanggahan tanpa sebarang permohonan maaf. Manual polisi 2023 menyatakan sesuatu. Pindaan Mac 2024 menyatakan perkara lain. PDF lama tidak pernah diarkibkan. Corak naif iaitu pecah (chunk), simpan, dan ambil semula (retrieve) melayan setiap perenggan sebagai pulau yang terasing. Ia tidak memahami hierarki, sejarah versi, atau penyelesaian konflik. Model berhalusinasi bukan kerana LLM rosak, tetapi kerana konteks yang diterimanya terfragmentasi, terasing, atau salah sama sekali.

Sesetengah pemerhati mendakwa tingkap konteks berjuta-juta token menjadikan pencarian semula tidak relevan. Hujah mereka mudah. Masukkan sahaja keseluruhan korpus ke dalam prom dan biarkan model membaca semuanya. Ini kedengaran elegan. Ia juga sangat optimistik secara berbahaya. Sebuah model mungkin secara teknikal mampu menyerap jumlah teks yang setara dengan sebuah novel pendek, namun mencari satu klausa khusus di tengah-tengah keluasan tersebut tetap merupakan keupayaan yang sangat berbeza. Jarum tetap hilang dalam timbunan jerami. Tingkap konteks yang panjang mengembangkan kanvas yang tersedia, tetapi ia tidak menyelesaikan kerja keras untuk memutuskan apa yang layak mendapat tempat di atas kanvas tersebut. Masalahnya bukan sekadar pencarian semula. Ia adalah, dan sentiasa menjadi, pemasangan konteks.

Daripada Pencarian Naif kepada Kejuruteraan Konteks

Pada tahun 2026, bidang ini semakin matang. Kita sedang beralih daripada fasa di mana RAG dianggap sebagai satu saluran paip (pipeline) linear tunggal kepada seni bina yang melayan konteks sebagai produk yang direkayasa secara sengaja.

Carian hibrid berbanding semantik tulen. Keserupaan semantik sangat baik untuk memahami niat, tetapi ia tidak tepat dengan pengenal pasti yang jitu. Jika seorang jurutera membuat pertanyaan tentang kod ralat khusus seperti ERR_CONNECTION_REFUSED atau versi perisian seperti v3.2.1, carian vektor tulen boleh mencairkan padanan tepat dalam lautan hasil yang serupa secara konsep tetapi tidak relevan secara praktikal. Evolusi di sini adalah mudah. Sistem moden menggabungkan pencarian vektor padat dengan carian kata kunci, menggunakan kaedah seperti BM25 atau indeks songsang bersama-sama dengan embeddings. Nama tepat, kod ralat, rentetan versi, dan ID produk akan ditangkap oleh lapisan kata kunci manakala nuansa konseptual dikendalikan oleh lapisan vektor.

Penyusunan semula (Reranking) sebelum penjanaan. Pencarian semula secara semula jadi cenderung kepada recall. Anda menarik masuk empat puluh atau lima puluh cebisan kerana anda takut terlepas satu perenggan emas. Tetapi memasukkan semua hingar tersebut ke dalam model besar akan membazirkan token dan menenggelamkan isyarat. Reranking menyelesaikan masalah ini dengan model kedua, yang biasanya lebih kecil, yang memberikan skor kepada setiap calon berdasarkan relevansi terhadap pertanyaan khusus. Lima petikan teratas akan diteruskan. Selebihnya dibuang. Ia bertindak sebagai penapis ketepatan antara pencarian semula dan penjanaan, memastikan model penaakulan yang mahal hanya membaca apa yang benar-benar penting.

Pencarian kontekstual yang mengekalkan makna. Proses pemecahan (chunking) adalah satu tindakan yang drastik. Pembahagi boleh memutuskan perenggan daripada pengepala seksyennya, kapsyen jadualnya, penafian undang-undang di sekelilingnya, atau nota kaki yang mengubah maknanya. Pencarian kontekstual mengurangkan kesan ini dengan memperkayakan fragmen sebelum ia sampai kepada model. Anda menambah metadata yang menunjukkan asal-usul: Petikan ini tergolong dalam laporan insiden Q3 2024, bahagian Gangguan Pangkalan Data, Tahap Keseriusan Kritikal. Model tidak hanya melihat ayat yang terapung tetapi maklumat yang mempunyai kedudukan. Fragmen tersebut mendapat semula arahnya.

Laluan modular mengikut niat. Tidak semua soalan sesuai diletakkan dalam stor vektor yang penuh dengan dokumentasi. Pengguna yang bertanya cara menetapkan semula kata laluan mungkin memerlukan artikel bantuan. Pengguna yang bertanya mengapa hasil merosot di Timur Laut pada suku tahun lepas memerlukan SQL terhadap gudang data, bukannya perenggan yang serupa secara semantik tentang strategi jualan serantau. Sistem yang matang kini melalukan pertanyaan mengikut niat, dengan memilih alat yang sesuai. Dokumentasi untuk prosedur. Pangkalan data hubungan untuk analitik berstruktur. Pengumpul log untuk nyahpepijat jejak. API untuk status langsung. Lapisan pengambilan menjadi seorang penghantar, bukan satu monokultur.

Gelung penaakulan ejen. Sesetengah soalan tidak boleh dijawab dengan satu langkah carian sahaja. Ia memerlukan pengolahan semula. Pertanyaan awal yang kabur akan diperjelaskan. Kenyataan yang diambil akan disemak silang dengan sumber kedua. Jika dokumentasi bercanggah dengan spesifikasi API, sistem akan menandakan konflik tersebut dan bukannya mereka-reka jalan tengah. Model tersebut memutuskan bila perlu mencari semula, bila perlu memperhalusi pertanyaannya, dan bila ia telah mengumpul bukti yang mencukupi untuk menjawab. Ini bukan pengambilan sekali jalan (one-shot retrieval). Ia adalah penaakulan berstruktur yang menggunakan carian sebagai subrutin.

GraphRAG untuk soalan hubungan. Soalan perniagaan tertentu adalah mengenai hubungan, bukan ayat. Kegagalan komponen mana yang mencetuskan amaran hiliran yang mana? Pembekal mana yang membekalkan kepada kilang mana, dan apakah laluan alternatifnya? Siapa dalam organisasi yang mempunyai hak membuat keputusan ke atas baris bajet khusus ini? Cebisan teks rata meratakan hubungan ini kerana ia tidak pernah direka untuk mengekalkan topologi. Graf pengetahuan boleh melakukannya. Apabila soalan adalah mengenai pengaruh, salasilah, corak, atau struktur rangkaian, merentasi graf menyediakan konteks yang tidak dapat ditiru oleh sebarang jumlah pengambilan perenggan.

Soalan yang Sebenarnya Penting

Perbincangan mengenai RAG perlu berubah. Berhenti bertanya bagaimana untuk membina paip RAG yang generik. Mula bertanya tugasan khusus apakah yang mesti diselesaikan oleh model, data tepat apakah yang diperlukannya untuk menjadi tepat, dan bagaimana anda mengesahkan bahawa konteks yang dikumpulkan adalah mencukupi. Soalan-soalan ini memaksa anda melihat ke peringkat awal dalam kualiti data, reka bentuk skema, gelung pengesahan, dan asal-usul sumber. Ia mendedahkan sama ada pangkalan pengetahuan anda layak untuk penggunaan automatik.

RAG bukan lagi satu proses linear tunggal yang anda pasang sekali dan lupakan. Ia adalah satu disiplin dalam mengumpulkan konteks yang betul supaya model dapat menaakul dengan berkesan. Ini bermakna menganggap pengambilan sebagai masalah reka bentuk sistem, bukan sekadar import perpustakaan.

Alatan semakin canggih. Carian adalah hibrid. Laluan adalah pintar. Pengambilan adalah berperingkat, diperkaya, dan disahkan. Ilusi mudah tahun 2022 terpaksa runtuh supaya sesuatu yang benar-benar berguna dapat mengambil tempatnya. Tugas anda sekarang bukan sekadar mengambil teks daripada pangkalan data. Ia adalah untuk membina sistem yang mengetahui apa yang diperlukan oleh model sebelum model itu mula berfikir.

Jika anda sedang membina dalam ruang ini, komuniti pembelajaran GyaanSetu adalah tempat untuk bertukar nota praktikal dengan orang yang menyelesaikan masalah yang sama: https://t.me/GyaanSetuAi