Como a Língua Molda a IA: Estudo da Anthropic Revela Mudanças na Personalidade do Claude
A Anthropic lançou um estudo inovador revelando que a "personalidade" do Claude e suas expressões de valores mudam significativamente dependendo do idioma falado. Do acolhimento no hindi ao rigor técnico no russo, a pesquisa destaca como as nuances linguísticas influenciam profundamente o comportamento da IA.
Mapeando os Valores da IA em Quatro Dimensões
Para entender as nuances da interação com a IA, a Anthropic analisou 309.815 conversas anonimizadas de maio de 2026. Ao processar milhares de termos individuais, a equipe de pesquisa destilou valores humanos complexos em 339 conceitos de nível superior, que foram posteriormente reduzidos a quatro eixos comportamentais centrais:
- Deferência e Cautela: O quanto o modelo concorda com o usuário versus o quanto ele suaviza suas respostas.
- Acolhimento e Rigor: O equilíbrio entre frases empáticas e educadas e o escrutínio crítico baseado em evidências.
- Profundidade e Brevidade: Se o modelo fornece detalhes exaustivos ou respostas concisas e diretas.
- Franqueza e Execução: A tensão entre ser abertamente crítico e focar na conclusão de tarefas.
Esta metodologia permite que os pesquisadores isolem comportamentos linguísticos e específicos do modelo do assunto real da conversa, proporcionando uma visão mais clara dos "padrões normativos" inerentes ao LLM.
Perfis Comportamentais Distintos: Sonnet vs. Opus
O estudo confirma que diferentes modelos dentro da família Claude exibem diferenças comportamentais mensuráveis. Esses perfis geralmente se alinham às percepções dos usuários, criando uma experiência em camadas baseada na versão específica do modelo utilizada:
- Sonnet 4.6: Caracterizado principalmente pelo acolhimento. Ele recorre ao humor, afirma as ideias do usuário e oferece conforto sem julgamentos.
- Opus 4.6: Focado na eficiência de tarefas. Tende a ser direto e evita elaborações desnecessárias.
- Opus 4.7: O "pensador crítico". Este modelo tem maior probabilidade de questionar suposições, sinalizar seus próprios erros e alertar sobre riscos, mesmo quando não solicitado explicitamente.
A Lacuna Linguística: Do Acolhimento do Hindi ao Rigor do Russo
Talvez a descoberta mais impressionante seja como a língua atua como uma lente que remodela as respostas do Claude. Dois usuários fazendo a mesma pergunta em idiomas diferentes podem receber tipos de feedback fundamentalmente distintos.
A pesquisa descobriu que o hindi e o árabe desencadeiam os níveis mais altos de acolhimento, caracterizados por polidez, ludicidade e afirmação. Por outro lado, em inglês e russo, o Claude adota uma postura muito mais rigorosa — questionando suposições, corrigindo detalhes e exigindo evidências.
Outros padrões linguísticos notáveis incluem:
- Árabe: Exibe os níveis mais altos de deferência.
- Inglês: Mostra os níveis mais altos de cautela e suavização de respostas.
- Holandês: Tende a uma alta franqueza e abertura.
- Indonésio: Inclina-se fortemente para a execução e respostas orientadas a resultados.
Por que Isso é Importante para a Indústria de IA
Essas descobertas levantam questões críticas sobre a composição dos dados de treinamento e o potencial de viés linguístico não intencional. A Anthropic sugere que essas mudanças podem decorrer de quantidades desiguais de dados de treinamento ou de diferentes normas conversacionais linguísticas presentes nos conjuntos de dados.
Para desenvolvedores e fundadores que constroem aplicações globais, esta é uma percepção vital: um assistente de IA pode parecer um coach de apoio em um mercado e um auditor rigoroso em outro. À medida que os LLMs se tornam mais integrados aos fluxos de trabalho globais, garantir que essas mudanças linguísticas sejam adaptações intencionais, e não vieses sistêmicos, continua sendo um desafio primordial para a segurança e o alinhamento da IA.
Principais Conclusões
- Relatividade Linguística na IA: As respostas do Claude mudam significativamente conforme o idioma, mostrando alto acolhimento no hindi e alto rigor no russo.
- Níveis de Modelo: Os modelos da Anthropic demonstram personas distintas, com o Sonnet 4.6 sendo mais empático e o Opus 4.7 sendo mais crítico e cauteloso.
- O Desafio dos Dados de Treinamento: As diferenças no comportamento da IA entre os idiomas provavelmente decorrem de distribuições desiguais de dados de treinamento e de normas conversacionais culturais variadas.
