Proyek AI Enterprise memiliki sebuah pola. Sebuah tim membangun prototipe. Demonya terlihat mengesankan. Kemudian, tiga bulan kemudian, sistem mulai runtuh. Respons mulai melenceng. Biaya membengkak. Seorang petugas kepatuhan bertanya dari mana jawaban tertentu berasal, dan tidak ada seorang pun di ruangan itu yang bisa menjawab.
Keruntuhan ini jarang dimulai dengan kode yang buruk. Ini dimulai dengan satu pilihan arsitektur yang diperlakukan seperti kontes popularitas: Retrieval-Augmented Generation versus fine-tuning.
RAG dan fine-tuning bukanlah dua versi dari produk yang sama. Keduanya adalah alat yang secara fundamental berbeda. Yang satu mengontrol apa yang dapat dilihat model. Yang lainnya mengontrol bagaimana model berperilaku. Memilih yang salah untuk pekerjaan tersebut tidak akan terlihat pada prototipe. Hal itu baru akan terlihat kemudian, saat bisnis sudah berjalan di atasnya.
Jebakan Demo
Tekanan untuk merilis fitur AI generatif sangatlah intens. Tim sering kali memilih sebuah metode karena mereka melihatnya di tutorial yang ditulis dengan baik atau karena slide presentasi vendor membuatnya tampak mudah. Itu adalah cara yang buruk untuk membuat keputusan infrastruktur.
Model yang telah di-fine-tune dapat terlihat ajaib dalam demo yang terkendali. Ia berbicara dengan gaya bahasa perusahaan Anda dan mengenali nama-nama produk Anda. Pipeline RAG juga bisa terlihat ajaib. Ia menjawab pertanyaan tentang dokumen yang tidak pernah dipelajari saat pelatihan. Namun, demo tersebut menyembunyikan realitas operasional. Jika data harga Anda berubah setiap minggu dan Anda melakukan fine-tuning pada angka kuartal lalu, model tersebut akan dengan percaya diri mengutip angka yang sudah kedaluwarsa. Jika tim dukungan Anda membutuhkan setiap jawaban untuk dapat ditelusuri kembali ke PDF kebijakan tertentu, model yang di-fine-tune tidak memberikan catatan kaki bagi Anda. Ia hanya memberikan teks.
Apa Arti RAG yang Sebenarnya
RAG singkatan dari Retrieval-Augmented Generation, tetapi namanya membuatnya terdengar lebih kompleks daripada kenyataannya. Pada intinya, RAG menjawab satu pertanyaan: apa yang perlu dicari oleh model saat ini?
Bayangkan seorang agen layanan pelanggan yang diizinkan untuk mencari di wiki perusahaan sebelum membalas tiket. RAG melakukan hal yang persis sama, tetapi secara otomatis. Ketika pengguna mengajukan pertanyaan, sistem mencari basis data vektor atau penyimpanan dokumen untuk potongan teks yang relevan. Sistem kemudian menyerahkan potongan-potongan tersebut ke model bahasa sebagai konteks, bersama dengan pertanyaan aslinya. Model menghasilkan jawaban berdasarkan bukti yang ditemukan.
Pendekatan ini sangat unggul ketika basis pengetahuan Anda berada di luar model. Dokumentasi produk, dokumen hukum, penelitian medis, dan spreadsheet inventaris semuanya berubah. RAG menjaga model tetap mutakhir tanpa melatih ulang satu bobot pun. Ini juga menciptakan jejak audit yang alami. Karena Anda tahu dokumen mana yang diambil, Anda dapat menunjukkan kepada auditor atau regulator dengan tepat dari mana sebuah jawaban berasal.
Apa Arti Fine-Tuning yang Sebenarnya
Fine-tuning menjawab pertanyaan yang berbeda: bagaimana model seharusnya berperilaku?
Alih-alih memberikan materi bacaan eksternal kepada model, Anda mengajarinya melalui contoh. Anda mengumpulkan ratusan atau ribuan contoh output yang Anda inginkan, dan Anda terus melatih model dasar pada data tersebut. Proses ini sebenarnya menyesuaikan parameter internal model. Ini mengubah bobotnya.
Hasilnya adalah model yang telah menginternalisasi pola.
