Todo mundo tem uma opinião sobre fine-tuning versus RAG. Percorra qualquer fórum de IA e você encontrará discussões acaloradas, cheias de diagramas de arquitetura e alegações de benchmarks. A maioria das pessoas que escreve esses comentários nunca treinou um modelo com seus próprios dados ou viu um pipeline de RAG falhar silenciosamente em produção.
Passei meses realizando experimentos. Doze deles, para ser exato. Fiz fine-tuning de LLMs. Fiz fine-tuning de embedders. Construí seis configurações diferentes de RAG. O domínio era previsão financeira, especificamente tentando prever resultados de mercado ruidosos a partir de dados históricos desorganizados. Impus a mim mesmo padrões estatísticos rigorosos porque queria respostas reais, não alegações de posts de blog.
A maioria dos experimentos falhou. Essas falhas acabaram sendo muito mais úteis do que qualquer sucesso por sorte.
A Dura Verdade Sobre o Sinal
Antes de entrar nos detalhes técnicos, aqui está a lição que une tudo. Fine-tuning e RAG são ferramentas para mudar o que um modelo sabe ou o que ele vê. Eles não são varinhas mágicas que fabricam sinal do nada. Se os seus dados subjacentes não contêm um padrão real e explorável, essas técnicas não criarão um. Elas apenas ajudarão você a construir uma história mais convincente em torno de um ruído aleatório.
Na previsão financeira, essa armadilha é especialmente perigosa. Os mercados são ruidosos por design. Quando você acopla um LLM poderoso a dados de preços históricos e adiciona recuperação ou fine-tuning, você não obtém automaticamente uma vantagem. Você obtém uma maneira mais articulada de racionalizar lançamentos de moeda. Se o sinal não estiver lá, o modelo se tornará muito bom em mentir para você. Você precisa verificar isso primeiro.
Quando o Maior Memoriza em vez de Aprender
Meu primeiro grande erro foi assumir que a escala resolveria tudo. Testei um modelo de 14 bilhões de parâmetros contra um modelo de 7 bilhões de parâmetros em exatamente 777 exemplos de treinamento. O modelo maior alcançou um eval_loss visivelmente melhor. Sua perplexidade diminuiu. No papel, ele estava aprendendo.
Depois, olhei para a taxa de vitória (win rate), a taxa real na qual o modelo fazia previsões corretas. O modelo de 14B teve um desempenho significativamente pior que o modelo de 7B. Ele havia memorizado o ruído de treinamento. Com menos de 3.000 exemplos, o modelo maior tinha capacidade suficiente para sofrer overfitting em correlações espúrias e oscilações aleatórias nos dados. Ele essencialmente construiu uma tabela de consulta (lookup table) de ruído.
O modelo de 7B, limitado por sua menor capacidade, foi forçado a aprender padrões mais amplos. Ele não podia se dar ao luxo de memorizar cada idiossincrasia. Se você estiver trabalhando com conjuntos de dados pequenos, comece com modelos menores. A escala não é gratuita. Ela pode prejudicá-lo ativamente quando os dados são escassos.
Não Confie na Curva de Perda
Aprendi a parar de encarar curvas de perda. Um modelo pode melhorar sua entropia cruzada ao nível de token enquanto se torna pior na decisão de negócio real que lhe interessa. Isso acontece porque a perda de modelagem de linguagem recompensa a previsão precisa do próximo token. Em muitos domínios, especialmente finanças, a decisão correta e o próximo token mais provável não são a mesma coisa.
Vi modelos que reproduziam a prosa de treinamento lindamente, mas escolhiam a aposta direcional errada todas as vezes. A perda diminuía. O capital diminuía junto. Escolha sua métrica de avaliação com base na tarefa do mundo real. Se você estiver classificando documentos, meça a qualidade do ranking. Se estiver prevendo resultados, meça a precisão da decisão. Nunca deixe o eval_loss escolher o seu modelo por você.
O Fine-Tuning Brilha Apenas com Vocabulário Estrangeiro
Realizei testes de fine-tuning de embedders em dois tipos diferentes de texto. O primeiro usava notícias financeiras padrão e documentos públicos. O embedder com fine-tuning e a versão pronta para uso tiveram um desempenho idêntico. O modelo base já conhecia essa linguagem. Eu estava ajustando em terreno familiar.
O segundo conjunto de dados estava cheio de jargões privados, codinomes internos e abreviações específicas do domínio que nunca apareceram na internet aberta. Aqui, o fine-tuning melhorou a precisão da recuperação em 79 por cento. O modelo base simplesmente não sabia o que esses termos significavam. O fine-tuning ensinou a ele o vocabulário local.
Isso reformulou todo o exercício para mim. Fine-tuning não é sobre tornar um modelo mais inteligente em um sentido geral. É sobre ensinar a ele um novo vocabulário, um novo formato ou um estilo editorial. Se os seus dados parecem com a internet, pule o fine-tuning. Se os seus dados falam uma língua que o modelo base nunca viu, o fine-tuning torna-se essencial.
RAG te dá Certeza, não a Verdade
Testei oito configurações de RAG distintas para tarefas de predição. De forma geral, adicionar a recuperação (retrieval) alterou aproximadamente 30 por cento das decisões do modelo. Isso parece impactante. Não foi. Essas mudanças foram puro ruído. A precisão geral não melhorou. O que mudou foi a confiança do modelo. O RAG fez o sistema parecer mais certo, citar mais fontes e produzir justificativas mais longas. Tudo isso enquanto continuava errando da mesma forma.
Esse excesso de confiança é um risco de produto. Um usuário vê as citações e assume que o modelo fez o dever de casa. Na realidade, ele estava fazendo suposições com aparência sofisticada.
A lição mais dolorosa veio do backtesting de uma variante de RAG. Ela mostrou um lucro anual de 11 por cento. Superficialmente, isso parece uma estratégia vencedora. Mas seu AUC, a área sob a curva ROC e uma medida de habilidade de classificação, era de 0,486. Isso é pior do que o cara ou coroa, que fica em 0,500. O lucro foi um acaso do período específico do mercado, não uma vantagem repetível. Usar apenas o P&L como métrica é perigoso. Os mercados distribuem sequências de sorte o tempo todo. Você precisa de métricas de habilidade estatística para separar o acaso da competência.
Saiba o que cada ferramenta realmente faz
Então, onde isso nos deixa? Use fine-tuning quando o modelo precisar aprender novas palavras, formatos específicos ou um estilo distinto. Use RAG quando o modelo precisar de acesso a fatos, repositórios de código ou memória institucional que reside fora de seus pesos. Não use nenhuma das ferramentas para descobrir sinal em dados que não possuem nenhum. Se o padrão subjacente não estiver lá, a recuperação e o fine-tuning apenas ajudarão você a vestir o ruído com um terno mais elegante.
O Verdadeiro Gargalo
A infraestrutura para fine-tuning e RAG nunca foi tão fácil de configurar. Você pode colocar um pipeline para funcionar em uma tarde. A técnica não é mais o gargalo. A avaliação é. A maioria das equipes pula o trabalho estatístico difícil e celebra métricas de vaidade em vez disso. Eles lançam sistemas que parecem inteligentes, mas falham silenciosamente.
Realize testes honestos antes de gastar dinheiro. Questione suas métricas. Verifique o overfitting. Certifique-se de que o modelo é realmente melhor,
