O bug de vazamento de prompts da Anthropic expôs uma semana de dados de usuários.

Por que a violação é importante

A interface do modelo da Anthropic permite que desenvolvedores enviem “prompts” — o texto que direciona a resposta de um modelo de linguagem. No incidente, uma falha de armazenamento permitiu que partes não autorizadas lessem esses prompts durante sete dias. O vazamento não envolveu um hack massivo; um pequeno descuido na forma como os prompts eram salvos e recuperados abriu a porta.

O que deu errado

Manter os dados do usuário separados dos pesos do modelo limita a exposição. A criação de trilhas de auditoria permite detectar atividades incomuns precocemente.

Ações imediatas para startups de IA

  • Reforce o manuseio de prompts – Trate cada prompt recebido como uma entrada sensível. Criptografe-o em repouso, restrinja os direitos de leitura/escrita ao menor conjunto de serviços possível e garanta que apenas o mecanismo de execução do modelo possa recuperá-lo.
  • Separe os dados do usuário dos pesos do modelo – Armazene os prompts em um repositório dedicado que seja física e logicamente distinto dos arquivos do modelo. Essa divisão limita o raio de impacto de qualquer violação individual.
  • Crie trilhas de auditoria – Registre cada acesso ao armazenamento de prompts com carimbos de data/hora, IDs de usuário e IPs de origem. Execute análises em tempo real que disparem alertas sobre volumes de leitura anormais ou acessos de serviços inesperados.

O que observar a seguir

Resumo: Uma única falha no manuseio de prompts pode desencadear uma exposição de dados de uma semana inteira. Fundadores de IA devem aplicar o mesmo rigor ao armazenamento de prompts que aplicam a qualquer outro sistema de dados de usuário, ou repetirão o erro caro da Anthropic.