Os algoritmos de contratação deveriam eliminar a inconsistência humana. Alimente um modelo com currículos suficientes e ele julgaria estritamente pelas credenciais. A realidade está se mostrando mais caótica. Um novo estudo da Universidade de Princeton e da Universidade de Chicago mostra que os grandes modelos de linguagem não apenas reciclam preconceitos antigos. Eles fabricam novos estereótipos do nada, e quanto mais inteligente o modelo, mais rápido isso acontece.

Como o Experimento Funcionou

Pesquisadores construíram um mercado de trabalho simulado para observar o viés se formando em tempo real. Eles inventaram quatro grupos étnicos fictícios — Tufa, Aima, Reku e Weki — e incumbiram versões do ChatGPT, Claude e Gemini de preencherem vinte cargos diferentes. A lista variava de médicos e engenheiros a zeladores e faxineiros. Aqui está o detalhe crucial: nos bastidores, cada candidato possuía chances estatísticas de sucesso idênticas. Um Weki tinha exatamente a mesma chance de prosperar como médico que um Tufa. O jogo era matematicamente justo.

Mas não foi a justiça que surgiu. Após cada rodada de contratação, os modelos recebiam um feedback simples sobre se o candidato escolhido teve sucesso ou falhou. Quando um candidato Aima por acaso teve um desempenho abaixo do esperado uma vez em um cargo de alto status, o modelo não tratou isso como um ruído aleatório. Tratou como uma lei. O sistema rapidamente começou a confinar candidatos Aima a cargos de baixo status, como serviços de limpeza. Um único ponto de dado tornou-se destino. A IA havia inventado uma hierarquia que nenhum programador humano escreveu e nenhum conjunto de dados históricos continha.

Quando Modelos Inteligentes Fazem Generalizações Burras

Os pesquisadores mediram os resultados em uma escala de segregação onde 2,0 representa o confinamento total de um grupo a um único nicho. Participantes humanos em estudos psicológicos anteriores pontuaram 0,84. Os modelos de linguagem ultrapassaram esse patamar. O modelo de raciocínio da OpenAI, o3, atingiu 1,83 — uma segregação quase perfeita.

Este é o dilema exploração-explotação saindo do controle. Esses sistemas são ajustados para vencer em problemas matemáticos, desafios de codificação e quebra-cabeças de lógica. Esses domínios recompensam chegar a uma conclusão correta a partir de evidências escassas. Identifique o padrão. Fixe-o. Vá mais rápido. Aplique esse mesmo reflexo a pessoas, e você terá uma classificação étnica baseada em uma única contratação malsucedida.

Pior ainda, o padrão se intensifica à medida que os modelos se tornam mais sofisticados. Sistemas de raciocínio avançado mais recentes, como o o3 da OpenAI e o R1 da DeepSeek, mostraram um viés mais forte justamente por serem generalizadores mais ávidos. Eles otimizam formando regras precocemente e refinando-as agressivamente. Quando o assunto são seres humanos, essa confiança torna-se um problema. O modelo pensa que descobriu uma verdade sobre o grupo Aima. Na realidade, ele construiu uma gaiola a partir de um único ponto fora da curva.

A Armadilha da Memória

O estudo chega em um momento delicado. A indústria está migrando fortemente para a IA "agêntica" — sistemas que retêm memória de longo prazo, constroem perfis detalhados de usuários e personalizam decisões ao longo de meses ou anos. Angelina Wang, cientista da computação na Universidade Cornell, alerta que a memória aprimorada permite que os modelos deem "peso excessivo" a interações anteriores. Um único ponto fora da curva negativo — um empréstimo rejeitado, uma contratação rescindida, uma candidatura sinalizada — é fossilizado em uma suposição permanente. O viés não desaparece com o tempo; ele se endurece. O próprio recurso destinado a tornar a IA mais útil e consciente do contexto pode também torná-la obstinadamente injusta.

O que Realmente Resolve o Problema

Os pesquisadores testaram várias salvaguardas, e os resultados foram um choque de realidade.

Simplesmente dizer a um modelo para "ser justo" não surtiu quase nenhum efeito. A diretriz ficou lá como um mero adorno, enquanto o mecanismo de otimização subjacente trabalhava em direção ao seu objetivo real: maximizar contratações bem-sucedidas. Ética por solicitação é ética ignorada.

A solução que funcionou foi estrutural. Quando os pesquisadores deram aos modelos um bônus matemático adicional por manterem resultados de contratação diversos, a segregação caiu significativamente. O valor social teve que ser incorporado diretamente na função de recompensa, e não apenas acrescentado como um pensamento tardio. Em outras palavras, o modelo teve que sentir o incentivo à justiça em seus cálculos, e não apenas lê-lo em suas instruções.

A higiene de dados também importava. Fornecer contexto pessoal relevante — idade, escolaridade, anos de experiência — deu aos modelos sinais legítimos para ponderar, o que reduziu sua dependência de estereótipos étnicos. Mas, ao incluir detalhes irrelevantes como a cor do cabelo, os sistemas os utilizavam como desculpas para recuar para uma classificação baseada em grupos. Mais informação nem sempre é melhor. Depende inteiramente do que essa informação é e se ela oferece ao modelo um caminho alternativo para o seu objetivo de otimização.

O Caminho à Frente

Tudo isso tem peso porque esses sistemas não estão ficando restritos a janelas de chat. As mesmas arquiteturas estão sendo implementadas, ou estão sendo ativamente preparadas, para aprovações de empréstimos, recomendações de liberdade condicional e decisões de gestão de força de trabalho em escala. Os pesquisadores alertam para “novos vieses” — preconceitos que nenhum ser humano jamais teve e nenhum conjunto de dados históricos codificou, mas que a IA criou para si mesma enquanto buscava eficiência.

A verdade desconfortável é que a capacidade de raciocínio puro e a justiça social podem puxar em direções opostas. Um modelo otimizado para encontrar o caminho mais curto para uma resposta correta encontrará alegremente o caminho mais curto para uma suposição errada sobre as pessoas. Construir sistemas justos não significará apenas pedir gentilmente. Significará redesenhar os objetivos, auditar os loops de feedback e aceitar que certas generalizações — do tipo que reduzem seres humanos a uma categoria após um único erro — nunca devem ser permitidas. Se queremos que a IA julgue candidatos de forma justa, temos que parar de tratar a justiça como uma sugestão e começar a codificá-la como uma restrição rígida. Qualquer coisa menos que isso, e as máquinas otimizarão seu caminho diretamente para o preconceito.