Come la lingua modella l'IA: lo studio di Anthropic rivela i cambiamenti di personalità di Claude

Anthropic ha pubblicato uno studio rivoluzionario che rivela come la "personalità" di Claude e le sue espressioni di valori cambino significativamente a seconda della lingua parlata. Dalla cordialità in hindi al rigore tecnico in russo, la ricerca evidenzia come le sfumature linguistiche influenzino profondamente il comportamento dell'IA.

Mappare i valori dell'IA attraverso quattro dimensioni

Per comprendere le sfumature dell'interazione con l'IA, Anthropic ha analizzato 309.815 conversazioni anonimizzate di maggio 2026. Elaborando migliaia di termini individuali, il team di ricerca ha distillato complessi valori umani in 339 concetti di livello superiore, ulteriormente ridotti in quattro assi comportamentali fondamentali:

  • Deferenza e cautela: quanto il modello concorda con l'utente rispetto a quanto utilizzi espressioni di riserva nelle sue risposte.
  • Cordialità e rigore: l'equilibrio tra un linguaggio empatico e cortese e un esame critico basato sulle prove.
  • Profondità e brevità: se il modello fornisce dettagli esaustivi o risposte concise e dirette.
  • Schiettezza ed esecuzione: la tensione tra l'essere apertamente critici e il concentrarsi sul completamento del compito.

Questa metodologia consente ai ricercatori di isolare i comportamenti linguistici e specifici del modello dall'argomento effettivo della conversazione, fornendo una visione più chiara dei "modelli normativi" inerenti all'LLM.

Profili comportamentali distinti: Sonnet vs. Opus

Lo studio conferma che diversi modelli all'interno della famiglia Claude mostrano differenze comportamentali misurabili. Questi profili spesso si allineano alle percezioni degli utenti, creando un'esperienza a livelli basata sulla specifica versione del modello utilizzata:

  • Sonnet 4.6: Caratterizzato principalmente dalla cordialità. Tende all'umorismo, conferma le idee dell'utente e offre conforto senza giudizio.
  • Opus 4.6: Focalizzato sull'efficienza dei compiti. Tende a essere diretto ed evita elaborazioni non necessarie.
  • Opus 4.7: Il "pensatore critico". Questo modello è più propenso a mettere in discussione le ipotesi, segnalare i propri errori e avvertire dei rischi anche quando non viene esplicitamente richiesto.

Il divario linguistico: dalla cordialità dell'hindi al rigore del russo

Forse il risultato più sorprendente è come la lingua agisca da lente che rimodella i risultati di Claude. Due utenti che pongono la stessa domanda in lingue diverse possono ricevere tipi di feedback fondamentalmente differenti.

La ricerca ha rilevato che l'hindi e l'arabo innescano i massimi livelli di cordialità, caratterizzati da cortesia, giocosità e affermazione. Al contrario, in inglese e russo, Claude adotta una posizione molto più rigorosa: mette in discussione le ipotesi, corregge i dettagli e richiede prove.

Altri pattern linguistici degni di nota includono:

  • Arabo: Mostra i massimi livelli di deferenza.
  • Inglese: Mostra i massimi livelli di cautela e riserva.
  • Olandese: Tende verso un'elevata schiettezza e apertura.
  • Indonesiano: Tende fortemente verso l'esecuzione e risposte orientate ai risultati.

Perché questo è importante per l'industria dell'IA

Questi risultati sollevano questioni critiche riguardanti la composizione dei dati di addestramento e il potenziale di pregiudizi linguistici involontari. Anthropic suggerisce che questi cambiamenti possano derivare da quantità non uniformi di dati di addestramento o da diverse norme conversazionali linguistiche presenti nei dataset.

Per gli sviluppatori e i fondatori che costruiscono applicazioni globali, questa è una consapevolezza vitale: un assistente IA potrebbe sembrare un coach di supporto in un mercato e un auditor severo in un altro. Man mano che gli LLM diventano sempre più integrati nei flussi di lavoro globali, garantire che questi cambiamenti linguistici siano adattamenti intenzionali piuttosto che pregiudizi sistemici rimane una sfida primaria per la sicurezza e l'allineamento dell'IA.

Punti chiave

  • Relatività linguistica nell'IA: Le risposte di Claude cambiano significativamente in base alla lingua, mostrando un'elevata cordialità in hindi e un elevato rigore in russo.
  • Livelli dei modelli: I modelli di Anthropic dimostrano personalità distinte, con Sonnet 4.6 che è più empatico e Opus 4.7 che è più critico e cauto.
  • La sfida dei dati di addestramento: Le differenze nel comportamento dell'IA tra le lingue derivano probabilmente da distribuzioni non uniformi dei dati di addestramento e da diverse norme conversazionali culturali.