Fine-tuning, geração aumentada por recuperação (RAG) e prompting simples resolvem cada um uma classe diferente de problemas para grandes modelos de linguagem (LLMs). Escolher a opção errada desperdiça ciclos de GPU, infla as contas de nuvem e ainda deixa os usuários com respostas incorretas. Abaixo está um framework passo a passo que permite aos desenvolvedores decidir qual ferramenta se adequa ao seu caso de uso e como combiná-las quando necessário.
As três alavancas
| O que muda | Como funciona | Uso típico |
|---|---|---|
| RAG | Adiciona fatos externos ao contexto do modelo no momento da inferência | Atualização de preços, busca dos documentos de política mais recentes, citação de dados privados |
| Fine-tuning | Ajusta os pesos internos do modelo para alterar estilo, formato ou comportamento repetível | Tom consistente, estruturas de saída complexas, classificação de alto rendimento |
| Prompting | Molda a resposta imediata do modelo com instruções claras e exemplos | Raciocínio geral, protótipos rápidos, entrega de uma funcionalidade em poucos dias |
A pergunta fundamental a ser feita no início de qualquer projeto é: A deficiência é uma lacuna de conhecimento ou uma lacuna de comportamento? Uma lacuna de conhecimento significa que o modelo simplesmente não possui os fatos corretos; uma lacuna de comportamento significa que ele conhece os fatos, mas não os expressa da maneira que você precisa.
Quando o problema é uma lacuna de conhecimento – recorra ao RAG
Se o modelo alucina, retorna números desatualizados ou não consegue apontar para uma fonte, o problema é a falta de informação ou informações obsoletas. O RAG resolve isso ao buscar o documento ou ponto de dados correto para o prompt em tempo de execução.
- Use RAG quando os fatos mudarem com frequência — como níveis de estoque, preços de mercado ou tabelas regulatórias.
- Use-o quando precisar fornecer citações ou rastreabilidade para fins de conformidade ou auditoria.
- Use-o para corpora privados que não podem ser expostos a um modelo público; a camada de recuperação mantém os dados atrás do seu firewall.
Atualizar um documento é fácil. Retreinar um modelo é difícil.
Quando o problema é uma lacuna de comportamento – faça fine-tuning
Se o modelo já conhece os fatos corretos, mas os entrega no formato ou tom errados, ou com uma estrutura inconsistente, você precisa moldar seu comportamento interno. O fine-tuning reescreve os pesos do modelo para que o estilo desejado se torne o padrão.
- Ideal para a voz específica de uma marca, linguagem jurídica ou qualquer saída que deva seguir um template estrito.
- Funciona bem para tarefas repetitivas de alto volume, como classificação em massa, onde um pequeno custo de prompt por chamada se acumula.
- Pode encurtar os prompts, reduzindo o uso de tokens e, consequentemente, o custo de inferência.
Um erro comum é fazer o fine-tuning de um modelo apenas para ensiná-lo fatos. Isso desperdiça computação e ainda deixa o modelo vulnerável ao futuro desvio de dados (data drift). Fatos pertencem a uma camada de recuperação; o fine-tuning pertence à camada de comportamento.
Quando o problema é uma lacuna de instrução – comece com prompting
A engenharia de prompt é a maneira mais barata e rápida de testar se o modelo consegue resolver uma tarefa. Instruções claras, exemplos de few-shot e prompting de chain-of-thought geralmente suprem a lacuna sem qualquer alteração no modelo.
- Use-o para explorar como é uma resposta "boa" antes de se comprometer com uma solução mais cara.
- Aplique-o a tarefas que exigem muito raciocínio, brainstorming ou qualquer cenário em que você precise de um retorno rápido.
- Se você conseguir resultados satisfatórios com um prompt bem elaborado, evitará a sobrecarga de coleta de dados, treinamento de modelo ou pipelines de recuperação.
Se você ainda não esgotou o uso de prompts claros e alguns exemplos, ainda não está pronto para investir em infraestrutura de fine-tuning ou RAG.
Fluxo de decisão
Passe seu caso de uso pelo checklist abaixo. Pare no primeiro "sim" e aplique essa técnica. Se mais de uma condição se aplicar, combine as soluções.
- Você já tentou fazer o prompting com instruções explícitas e exemplos de few-shot? Não → comece com prompting.
- A falha decorre de fatos ausentes ou desatualizados, ou você precisa citar fontes? Sim → adicione uma camada de RAG.
- A falha decorre de estilo inconsistente, formatação ou da necessidade de uma saída repetível e de alto rendimento? Sim → faça o fine-tuning do modelo.
Quando existirem lacunas tanto de conhecimento quanto de comportamento, combine RAG e fine-tuning: recupere os fatos corretos primeiro e, em seguida, deixe o modelo com fine-tuning renderizá-los no estilo desejado.
Medindo o sucesso
Nunca confie apenas em “vibes”. Construa um conjunto de avaliação pequeno e representativo que capture as entradas principais e as saídas esperadas. Execute o mesmo conjunto em cada solução candidata — apenas prompt, prompt + RAG, prompt + fine-tuning ou a stack completa. Compare a precisão, a qualidade das citações, o custo de tokens e a latência. Os dados dirão qual camada adiciona valor real e qual é um overhead desnecessário.
Escolher a alavanca certa desde o início economiza tempo, dinheiro e frustração. Comece com prompts, adicione recuperação (retrieval) quando os fatos forem o gargalo e faça fine-tuning quando o comportamento for o problema. Meça, itere e você evitará a armadilha comum de desperdiçar poder de GPU no problema errado.
