Anthropic removeu 80% do prompt de sistema que guia o Claude Code e relatou que não houve queda em sua capacidade de escrever código. O experimento mostra que, à medida que os grandes modelos de linguagem (LLMs) se tornam mais capazes, os desenvolvedores podem reduzir o andaime volumoso usado para manter os modelos no caminho certo sem prejudicar o desempenho.

Por que o prompt era importante inicialmente

Quando o Claude Code foi lançado, seu prompt de sistema listava dezenas de regras. Engenheiros adicionavam novas linhas sempre que um bug aparecia, mas raramente removiam algo que parecesse funcionar. Com o tempo, o prompt tornou-se um documento emaranhado e estático.

A lacuna do modelo está diminuindo

Essas regras extras escondiam uma “lacuna de modelo” – a diferença entre o que o modelo podia fazer e o que a aplicação exigia. Em 2024, os desenvolvedores precisavam detalhar restrições rigorosas para evitar que o modelo, por exemplo, comentasse o código excessivamente. Hoje, o mesmo modelo pode inferir o estilo desejado a partir de uma única instrução como “siga o estilo de código existente”. As regras deixaram de ser ajuda para se tornarem ruído.

O que está mudando na engenharia de contexto

O corte da Anthropic reflete uma mudança mais ampla na forma como os desenvolvedores estruturam os prompts:

  • Instruções críticas de uma única vez – declare uma regra uma vez e deixe o modelo retê-la.
  • Parâmetros orientados por ferramentas em vez de exemplos few-shot – descreva os formatos de entrada e saída no esquema da ferramenta e deixe o modelo preenchê-los.
  • Divulgação progressiva – forneça apenas o contexto necessário para a etapa atual, adicionando mais depois, se necessário.
  • Mover orientações estáticas para descrições de ferramentas – coisas como “use camelCase para variáveis” pertencem à especificação da ferramenta, não ao prompt de sistema.
  • Substituir regras fixas por heurísticas – deixe o modelo decidir quando uma regra se aplica, em vez de impô-la incondicionalmente.

Essas táticas funcionam porque o modelo já conhece muitas convenções que antes exigiam reforço explícito.

O risco de cortes excessivos

A mesma poda que beneficia os modelos de fronteira pode prejudicar os menores. A Anthropic observa que modelos como o Haiku ainda dependem de prompts mais ricos para se manterem no caminho certo. Remover orientação demais de um modelo menos capaz pode reintroduzir os erros que o prompt original tentava prevenir: nomenclatura inconsistente, comentários excessivos ou casos de borda ignorados.

Como auditar seus próprios prompts

Se você mantém um pipeline de geração de código, uma auditoria de prompt pode revelar peso morto. Um checklist prático é este:

  • Ajustar a densidade de instruções – combine a quantidade de orientação com o modelo que você realmente executa.
  • Excluir instruções duplicadas – se uma regra aparece tanto no prompt de sistema quanto na descrição da ferramenta, mantenha-a apenas uma vez.
  • Transformar exemplos práticos em esquemas mais ricos – substitua exemplos concretos por tipos de parâmetros enumerados ou enums.
  • Externalizar detalhes situacionais – mova grandes blocos de referência para arquivos separados que o modelo possa buscar sob demanda.
  • Remover regras que cobrem comportamentos que desapareceram – se o modelo não adiciona mais comentários indesejados, descarte a regra “sem comentários”.

Não confie no instinto. Use uma “Regra de 3 Testes” simples: execute cinco tarefas de codificação realistas, compare os resultados antes e depois de cada exclusão e observe quaisquer regressões.

  1. Baseline – meça o desempenho com o prompt completo.
  2. Excluir – remova uma linha ou bloco candidato.
  3. Executar novamente – execute as mesmas cinco tarefas.

Se a saída mudar, você identificou uma linha que ainda tem peso. Se não, a linha pode ser omitida com segurança.

O que os desenvolvedores devem observar a seguir

Por enquanto, a conclusão é clara: um prompt de sistema é um documento vivo. Trate cada linha como tendo um prazo de validade, audite regularmente e deixe a crescente competência do modelo fazer o trabalho pesado.

Fonte: dev.to/ialijr/your-system-prompt-has-a-shelf-life-maintaining-prompts-as-models-improve-cd9