Fine-tuning, retrieval-augmented generation (RAG), dan prompting biasa masing-masing menyelesaikan kelas masalah yang berbeda untuk large language models (LLM). Memilih yang salah akan membuang siklus GPU, membengkakkan tagihan cloud, dan tetap memberikan jawaban yang salah kepada pengguna. Di bawah ini adalah kerangka kerja langkah demi langkah yang memungkinkan pengembang memutuskan alat mana yang sesuai dengan kasus penggunaan mereka, dan cara menggabungkannya saat dibutuhkan.

Tiga tuas utama

Apa yang berubah Cara kerjanya Penggunaan umum
RAG Menambahkan fakta eksternal ke konteks model pada saat inferensi Memperbarui harga, mengambil dokumen kebijakan terbaru, mengutip data pribadi
Fine-tuning Menyesuaikan bobot internal model untuk mengubah gaya, format, atau perilaku yang berulang Nada yang konsisten, struktur output yang kompleks, klasifikasi throughput tinggi
Prompting Membentuk respons langsung model dengan instruksi dan contoh yang jelas Penalaran umum, prototipe cepat, merilis fitur dalam hitungan hari

Pertanyaan inti yang harus diajukan di awal proyek apa pun adalah: Apakah kekurangannya adalah kesenjangan pengetahuan (knowledge gap) atau kesenjangan perilaku (behavior gap)? Kesenjangan pengetahuan berarti model tersebut tidak memiliki fakta yang tepat; kesenjangan perilaku berarti model tersebut mengetahui faktanya tetapi tidak menyampaikannya dengan cara yang Anda butuhkan.

Ketika masalahnya adalah kesenjangan pengetahuan – gunakan RAG

Jika model berhalusinasi, memberikan angka yang kedaluwarsa, atau tidak dapat menunjukkan sumbernya, masalahnya adalah informasi yang hilang atau usang. RAG menyelesaikannya dengan menarik dokumen atau titik data yang tepat ke dalam prompt saat runtime.

  • Gunakan RAG saat fakta sering berubah—seperti tingkat inventaris, harga pasar, atau tabel regulasi.
  • Gunakan saat Anda harus memberikan kutipan atau penelusuran untuk tujuan kepatuhan atau audit.
  • Gunakan untuk korpus pribadi yang tidak dapat diekspos ke model publik; lapisan pengambilan (retrieval layer) menjaga data tetap berada di balik firewall Anda.

Memperbarui dokumen itu mudah. Melatih ulang model itu sulit.

Ketika masalahnya adalah kesenjangan perilaku – lakukan fine-tune

Jika model sudah mengetahui fakta yang benar tetapi menyampaikannya dalam format, nada, atau struktur yang tidak konsisten, Anda perlu membentuk perilaku internalnya. Fine-tuning menulis ulang bobot model sehingga gaya yang diinginkan menjadi standar (default).

  • Ideal untuk suara khas merek, bahasa hukum, atau output apa pun yang harus mengikuti templat yang ketat.
  • Bekerja dengan baik untuk tugas berulang bervolume tinggi seperti klasifikasi massal, di mana biaya prompt kecil per panggilan akan terakumulasi.
  • Dapat memperpendek prompt, mengurangi penggunaan token dan dengan demikian mengurangi biaya inferensi.

Kesalahan umum adalah melakukan fine-tuning pada model hanya untuk mengajarkan fakta. Hal itu membuang-buang komputasi dan tetap membuat model rentan terhadap pergeseran data (data drift) di masa mendatang. Fakta seharusnya berada di lapisan pengambilan (retrieval layer); fine-tuning seharusnya berada di lapisan perilaku (behavior layer).

Ketika masalahnya adalah kesenjangan instruksi – mulai dengan prompting

Prompt engineering adalah cara termurah dan tercepat untuk menguji apakah model dapat menyelesaikan tugas tersebut. Instruksi yang jelas, contoh few-shot, dan prompting chain-of-thought sering kali menjembatani kesenjangan tanpa perubahan model apa pun.

  • Gunakan untuk mengeksplorasi seperti apa jawaban yang "baik" sebelum berkomitmen pada solusi yang lebih mahal.
  • Terapkan pada tugas-tugas yang berat dalam penalaran, brainstorming, atau skenario apa pun di mana Anda membutuhkan hasil yang cepat.
  • Jika Anda dapat memperoleh hasil yang memuaskan dengan prompt yang dirancang dengan baik, Anda menghindari beban pengumpulan data, pelatihan model, atau pipeline pengambilan data.

Jika Anda belum mencoba prompting yang jelas dan beberapa contoh, Anda belum siap untuk berinvestasi dalam infrastruktur fine-tuning atau RAG.

Alur keputusan

Jalankan kasus penggunaan Anda melalui daftar periksa di bawah ini. Berhenti pada jawaban "ya" pertama dan terapkan teknik tersebut. Jika lebih dari satu kondisi terpenuhi, gabungkan solusi-solusinya.

  1. Sudahkah Anda mencoba prompting dengan instruksi eksplisit dan contoh few-shot? Tidak → mulai dengan prompting.
  2. Apakah kegagalan tersebut berasal dari fakta yang hilang atau kedaluwarsa, atau apakah Anda perlu mengutip sumber? Ya → tambahkan lapisan RAG.
  3. Apakah kegagalan tersebut berasal dari gaya, format yang tidak konsisten, atau kebutuhan akan output yang berulang dengan throughput tinggi? Ya → lakukan fine-tuning pada model.

Ketika kesenjangan pengetahuan dan perilaku terjadi secara bersamaan, gabungkan RAG dan fine-tuning: ambil fakta yang benar terlebih dahulu, lalu biarkan model yang telah di-fine-tune menyajikannya dalam gaya yang diinginkan.

Mengukur keberhasilan

Jangan pernah mengandalkan "intuisi". Bangun set evaluasi kecil yang representatif yang mencakup input inti dan output yang diharapkan. Jalankan set yang sama pada setiap solusi kandidat—hanya prompt, prompt + RAG, prompt + fine-tune, atau seluruh stack. Bandingkan akurasi, kualitas sitasi, biaya token, dan latensi. Data akan menunjukkan lapisan mana yang memberikan nilai nyata dan mana yang hanya merupakan overhead yang tidak perlu.

Memilih pendekatan yang tepat sejak dini akan menghemat waktu, biaya, dan rasa frustrasi. Gunakan prompt terlebih dahulu, tambahkan retrieval saat fakta menjadi kendala, dan lakukan fine-tune saat perilaku menjadi kendalanya. Ukur, iterasi, dan Anda akan menghindari jebakan umum yaitu membuang-buang daya GPU untuk masalah yang salah.