Fine-tuning, geração aumentada por recuperação (RAG) e prompting simples resolvem cada um uma classe diferente de problemas para grandes modelos de linguagem (LLMs). Escolher a opção errada desperdiça ciclos de GPU, infla as contas de nuvem e ainda deixa os usuários com respostas incorretas. Abaixo está um framework passo a passo que permite aos desenvolvedores decidir qual ferramenta se adequa ao seu caso de uso e como combiná-las quando necessário.

As três alavancas

O que muda Como funciona Uso típico
RAG Adiciona fatos externos ao contexto do modelo no momento da inferência Atualização de preços, busca dos documentos de política mais recentes, citação de dados privados
Fine-tuning Ajusta os pesos internos do modelo para alterar estilo, formato ou comportamento repetível Tom consistente, estruturas de saída complexas, classificação de alto rendimento
Prompting Molda a resposta imediata do modelo com instruções claras e exemplos Raciocínio geral, protótipos rápidos, entrega de uma funcionalidade em poucos dias

A pergunta fundamental a ser feita no início de qualquer projeto é: A deficiência é uma lacuna de conhecimento ou uma lacuna de comportamento? Uma lacuna de conhecimento significa que o modelo simplesmente não possui os fatos corretos; uma lacuna de comportamento significa que ele conhece os fatos, mas não os expressa da maneira que você precisa.

Quando o problema é uma lacuna de conhecimento – recorra ao RAG

Se o modelo alucina, retorna números desatualizados ou não consegue apontar para uma fonte, o problema é a falta de informação ou informações obsoletas. O RAG resolve isso ao buscar o documento ou ponto de dados correto para o prompt em tempo de execução.

  • Use RAG quando os fatos mudarem com frequência — como níveis de estoque, preços de mercado ou tabelas regulatórias.
  • Use-o quando precisar fornecer citações ou rastreabilidade para fins de conformidade ou auditoria.
  • Use-o para corpora privados que não podem ser expostos a um modelo público; a camada de recuperação mantém os dados atrás do seu firewall.

Atualizar um documento é fácil. Retreinar um modelo é difícil.

Quando o problema é uma lacuna de comportamento – faça fine-tuning

Se o modelo já conhece os fatos corretos, mas os entrega no formato ou tom errados, ou com uma estrutura inconsistente, você precisa moldar seu comportamento interno. O fine-tuning reescreve os pesos do modelo para que o estilo desejado se torne o padrão.

  • Ideal para a voz específica de uma marca, linguagem jurídica ou qualquer saída que deva seguir um template estrito.
  • Funciona bem para tarefas repetitivas de alto volume, como classificação em massa, onde um pequeno custo de prompt por chamada se acumula.
  • Pode encurtar os prompts, reduzindo o uso de tokens e, consequentemente, o custo de inferência.

Um erro comum é fazer o fine-tuning de um modelo apenas para ensiná-lo fatos. Isso desperdiça computação e ainda deixa o modelo vulnerável ao futuro desvio de dados (data drift). Fatos pertencem a uma camada de recuperação; o fine-tuning pertence à camada de comportamento.

Quando o problema é uma lacuna de instrução – comece com prompting

A engenharia de prompt é a maneira mais barata e rápida de testar se o modelo consegue resolver uma tarefa. Instruções claras, exemplos de few-shot e prompting de chain-of-thought geralmente suprem a lacuna sem qualquer alteração no modelo.

  • Use-o para explorar como é uma resposta "boa" antes de se comprometer com uma solução mais cara.
  • Aplique-o a tarefas que exigem muito raciocínio, brainstorming ou qualquer cenário em que você precise de um retorno rápido.
  • Se você conseguir resultados satisfatórios com um prompt bem elaborado, evitará a sobrecarga de coleta de dados, treinamento de modelo ou pipelines de recuperação.

Se você ainda não esgotou o uso de prompts claros e alguns exemplos, ainda não está pronto para investir em infraestrutura de fine-tuning ou RAG.

Fluxo de decisão

Passe seu caso de uso pelo checklist abaixo. Pare no primeiro "sim" e aplique essa técnica. Se mais de uma condição se aplicar, combine as soluções.

  1. Você já tentou fazer o prompting com instruções explícitas e exemplos de few-shot? Não → comece com prompting.
  2. A falha decorre de fatos ausentes ou desatualizados, ou você precisa citar fontes? Sim → adicione uma camada de RAG.
  3. A falha decorre de estilo inconsistente, formatação ou da necessidade de uma saída repetível e de alto rendimento? Sim → faça o fine-tuning do modelo.

Quando existirem lacunas tanto de conhecimento quanto de comportamento, combine RAG e fine-tuning: recupere os fatos corretos primeiro e, em seguida, deixe o modelo com fine-tuning renderizá-los no estilo desejado.

Medindo o sucesso

Nunca confie apenas em “vibes”. Construa um conjunto de avaliação pequeno e representativo que capture as entradas principais e as saídas esperadas. Execute o mesmo conjunto em cada solução candidata — apenas prompt, prompt + RAG, prompt + fine-tuning ou a stack completa. Compare a precisão, a qualidade das citações, o custo de tokens e a latência. Os dados dirão qual camada adiciona valor real e qual é um overhead desnecessário.

Escolher a alavanca certa desde o início economiza tempo, dinheiro e frustração. Comece com prompts, adicione recuperação (retrieval) quando os fatos forem o gargalo e faça fine-tuning quando o comportamento for o problema. Meça, itere e você evitará a armadilha comum de desperdiçar poder de GPU no problema errado.