Projek AI perusahaan mempunyai corak yang sama. Sebuah pasukan membina prototaip. Demo kelihatan mengagumkan. Kemudian, tiga bulan kemudian, sistem mula runtuh. Respons mula menyimpang. Kos meningkat. Seorang pegawai pematuhan bertanya dari mana jawapan tertentu diperoleh, dan tiada sesiapa di dalam bilik itu yang dapat menjawabnya.
Keruntuhan ini jarang bermula dengan kod yang lemah. Ia bermula dengan satu pilihan seni bina yang dianggap seperti pertandingan populariti: Retrieval-Augmented Generation berbanding fine-tuning.
RAG dan fine-tuning bukanlah dua versi produk yang sama. Ia adalah alatan yang secara asasnya berbeza. Satu mengawal apa yang boleh dilihat oleh model. Satu lagi mengawal bagaimana model bertindak. Memilih kaedah yang salah untuk tugasan tersebut tidak akan kelihatan dalam prototaip. Ia akan muncul kemudian, apabila perniagaan sedang beroperasi di atasnya.
Perangkap Demo
Tekanan untuk melancarkan ciri AI generatif adalah sangat hebat. Pasukan sering memilih satu kaedah kerana mereka melihatnya dalam tutorial yang ditulis dengan baik atau kerana slaid pembentangan vendor menjadikannya kelihatan mudah. Itu adalah cara yang sangat buruk untuk membuat keputusan infrastruktur.
Model yang telah melalui fine-tuning boleh kelihatan ajaib dalam demo yang terkawal. Ia bercakap mengikut nada syarikat anda dan mengenali nama produk anda. Saluran (pipeline) RAG juga boleh kelihatan ajaib. Ia menjawab soalan tentang dokumen yang tidak pernah dilatih padanya. Namun, demo tersebut menyembunyikan realiti operasi. Jika data harga anda berubah setiap minggu dan anda melakukan fine-tuning berdasarkan angka suku tahun lepas, model tersebut akan memberikan angka yang lapuk dengan penuh yakin. Jika pasukan sokongan anda memerlukan setiap jawapan dapat dikesan kembali ke PDF polisi tertentu, model fine-tuned tidak memberikan anda nota kaki. Ia hanya memberikan anda teks.
Apa Maksud RAG Sebenarnya
RAG bermaksud Retrieval-Augmented Generation, tetapi namanya menjadikannya kedengaran lebih kompleks daripada yang sepatutnya. Pada terasnya, RAG menjawab satu soalan: apakah yang perlu dicari oleh model sekarang?
Bayangkan seorang ejen khidmat pelanggan yang dibenarkan mencari wiki syarikat sebelum membalas tiket. RAG melakukan perkara yang sama, tetapi secara automatik. Apabila pengguna bertanya soalan, sistem akan mencari pangkalan data vektor atau storan dokumen untuk cebisan teks yang relevan. Ia kemudian menyerahkan cebisan tersebut kepada model bahasa sebagai konteks, bersama-sama dengan soalan asal. Model tersebut menjana jawapan berdasarkan bukti yang diperoleh.
Pendekatan ini sangat berkesan apabila pangkalan pengetahuan anda berada di luar model. Dokumentasi produk, fail undang-undang, penyelidikan perubatan, dan hamparan inventori semuanya berubah. RAG memastikan model sentiasa dikemas kini tanpa perlu melatih semula satu pun pemberat (weight). Ia juga mewujudkan jejak audit yang semula jadi. Oleh kerana anda tahu dokumen mana yang telah diperoleh, anda boleh menunjukkan kepada juruaudit atau pengawal selia dengan tepat dari mana jawapan itu berasal.
Apa Maksud Fine-Tuning Sebenarnya
Fine-tuning menjawab soalan yang berbeza: bagaimanakah model tersebut harus bertindak?
Daripada memberikan bahan bacaan luaran kepada model, anda mengajarnya melalui contoh. Anda mengumpul beratus atau beribu contoh output yang anda inginkan, dan anda meneruskan latihan model asas menggunakan data tersebut. Proses ini sebenarnya melaraskan parameter dalaman model. Ia mengubah pemberat (weights).
Hasilnya ialah model yang telah menghadam corak-corak tersebut secara dalaman.
