Setiap orang mempunyai pendapat tentang fine-tuning berbanding RAG. Tatal mana-mana forum AI dan anda akan menemui perbincangan hangat yang penuh dengan rajah seni bina dan dakwaan penanda aras (benchmark). Kebanyakan orang yang menulis komen tersebut tidak pernah melatih model menggunakan data mereka sendiri atau melihat saluran paip (pipeline) RAG gagal secara senyap dalam persekitaran produksi.

Saya menghabiskan masa berbulan-bulan menjalankan eksperimen. Dua belas eksperimen, tepat sekali. Saya melakukan fine-tuning pada LLM. Saya melakukan fine-tuning pada embedder. Saya membina enam konfigurasi RAG yang berbeza. Domainnya adalah ramalan kewangan, khususnya cuba meramalkan hasil pasaran yang hingar daripada data sejarah yang tidak teratur. Saya menetapkan piawaian statistik yang ketat kerana saya mahukan jawapan sebenar, bukan sekadar dakwaan dalam hantaran blog.

Kebanyakan eksperimen gagal. Kegagalan tersebut rupa-rupanya jauh lebih berguna daripada sebarang kejayaan yang bernasib baik.

Kebenaran Pahit Tentang Isyarat

Sebelum pergi lebih mendalam, inilah pengajaran yang menghubungkan segalanya. Fine-tuning dan RAG adalah alat untuk mengubah apa yang diketahui atau apa yang dilihat oleh sesuatu model. Ia bukan tongkat sakti yang mencipta isyarat daripada ketiadaan. Jika data asas anda tidak mengandungi corak sebenar yang boleh dieksploitasi, teknik-teknik ini tidak akan menciptanya. Ia hanya akan membantu anda membina cerita yang lebih meyakinkan di sekeliling hingar rawak.

Dalam ramalan kewangan, perangkap ini amat berbahaya. Pasaran memang direka untuk menjadi hingar. Apabila anda menyambungkan LLM yang berkuasa kepada data harga sejarah dan menambah capaian (retrieval) atau fine-tuning, anda tidak secara automatik mendapat kelebihan. Anda hanya mendapat cara yang lebih fasih untuk merasionalkan lambungan syiling. Jika isyarat itu tidak wujud, model tersebut akan menjadi sangat mahir menipu anda. Anda perlu menyemak perkara itu terlebih dahulu.

Apabila Model Lebih Besar Menghafal dan Bukannya Belajar

Kesilapan besar pertama saya adalah menganggap skala akan menyelesaikan segalanya. Saya menguji model dengan 14 bilion parameter berbanding model dengan 7 bilion parameter pada tepat 777 contoh latihan. Model yang lebih besar mencapai eval_loss yang jauh lebih baik. Perplexity-nya menurun. Di atas kertas, ia sedang belajar.

Kemudian saya melihat kadar kemenangan (win rate), iaitu kadar sebenar model membuat ramalan yang betul. Model 14B menunjukkan prestasi yang jauh lebih buruk daripada model 7B. Ia telah menghafal hingar latihan. Dengan kurang daripada 3,000 contoh, model yang lebih besar mempunyai kapasiti yang mencukupi untuk mengalami overfitting pada korelasi palsu dan turun naik rawak dalam data. Ia pada dasarnya membina jadual rujukan (lookup table) hingar.

Model 7B, yang disekat oleh kapasitinya yang lebih kecil, terpaksa mempelajari corak yang lebih luas. Ia tidak mampu untuk menghafal setiap keunikan (idiosyncrasy). Jika anda bekerja dengan set data yang kecil, mulakan dengan model yang lebih kecil. Skala tidak percuma. Ia boleh memudaratkan anda apabila data adalah nipis.

Jangan Percaya pada Keluk Kerugian (Loss Curve)

Saya belajar untuk berhenti merenung keluk kerugian. Sesuatu model boleh meningkatkan cross-entropy pada tahap token sambil menjadi lebih buruk dalam keputusan perniagaan sebenar yang anda titikberatkan. Ini berlaku kerana kerugian pemodelan bahasa memberi ganjaran kepada ramalan token seterusnya secara tepat. Dalam banyak domain, terutamanya kewangan, keputusan yang betul dan token seterusnya yang paling berkemungkinan bukanlah perkara yang sama.

Saya melihat model yang menghasilkan prosa latihan dengan cantik tetapi memilih pertaruhan arah yang salah setiap kali. Kerugian (loss) menurun. Dana (bankroll) juga turut menurun bersamanya. Pilih metrik penilaian anda berdasarkan tugasan dunia sebenar. Jika anda menyusun kedudukan dokumen, ukur kualiti penyusunan. Jika anda meramalkan hasil, ukur ketepatan keputusan. Jangan sesekali membiarkan eval_loss memilih model untuk anda.

Fine-Tuning Hanya Menonjol pada Kosa Kata Asing

Saya menjalankan percubaan fine-tuning embedder pada dua jenis teks yang berbeza. Yang pertama menggunakan berita kewangan standard dan pemfailan awam. Embedder yang telah di-fine-tune dan versi sedia ada (off-the-shelf) menunjukkan prestasi yang serupa. Model asas sudah pun mengenali bahasa ini. Saya sedang melakukan fine-tuning pada kawasan yang sudah biasa.

Set data kedua penuh dengan jargon peribadi, nama kod dalaman, dan singkatan khusus domain yang tidak pernah muncul di internet terbuka. Di sini, fine-tuning meningkatkan ketepatan capaian (retrieval accuracy) sebanyak 79 peratus. Model asas tidak tahu apa maksud istilah-istilah ini. Fine-tuning mengajarnya kosa kata tempatan.

Ini mengubah perspektif keseluruhan latihan ini bagi saya. Fine-tuning bukan tentang menjadikan model lebih pintar dalam pengertian umum. Ia adalah tentang mengajarnya kosa kata baharu, format baharu, atau gaya penulisan (house style) tertentu. Jika data anda kelihatan seperti internet, abaikan fine-tuning. Jika data anda bercakap dalam bahasa yang tidak pernah dilihat oleh model asas, fine-tuning menjadi sangat penting.

RAG Memberikan Anda Kepastian, Bukan Kebenaran

I tested eight separate RAG configurations for prediction tasks. Across the board, adding retrieval changed roughly 30 percent of the model's decisions. That sounds impactful. It was not. Those changes were pure noise. The overall accuracy did not improve. What did change was the model's confidence. RAG made the system sound more certain, cite more sources, and produce longer justifications. All while being just as wrong.

This overconfidence is a product risk. A user sees citations and assumes the model has done its homework. In reality, it was doing sophisticated-looking guesswork.

The most painful lesson came from backtesting one RAG variant. It showed an 11 percent annual profit. On the surface, that looks like a winning strategy. But its AUC, the area under the ROC curve and a measure of classification skill, was 0.486. That is worse than a coin flip, which sits at 0.500. The profit was a fluke of the specific market period, not a repeatable edge. Using P&L alone as a metric is dangerous. Markets hand out lucky streaks all the time. You need statistical skill metrics to separate flukes from competence.

Know What Each Tool Actually Does

So where does this leave us? Use fine-tuning when the model needs to learn new words, specific formats, or a distinctive style. Use RAG when the model needs access to facts, code repositories, or institutional memory that lives outside its weights. Do not use either tool to discover signal in data that has none. If the underlying pattern is not there, retrieval and fine-tuning will only help you dress up the noise in a sharper suit.

The Real Bottleneck

The infrastructure for fine-tuning and RAG has never been easier to set up. You can spin up a pipeline in an afternoon. The technique is no longer the bottleneck. Evaluation is. Most teams skip the hard statistical work and celebrate vanity metrics instead. They ship systems that sound smart but fail silently.

Run honest tests before you spend money. Question your metrics. Check for overfitting. Make sure the model is actually better,