Hoe taal AI vormgeeft: Studie van Anthropic onthult verschuivingen in de persoonlijkheid van Claude
Anthropic heeft een baanbrekende studie gepubliceerd die onthult dat de "persoonlijkheid" en de uiting van waarden van Claude aanzienlijk veranderen afhankelijk van de gesproken taal. Van warmte in het Hindi tot technische strengheid in het Russisch; het onderzoek benadrukt hoe linguïstische nuances het gedrag van AI diepgaand beïnvloeden.
Het in kaart brengen van AI-waarden over vier dimensies
Om de nuances van AI-interactie te begrijpen, analyseerde Anthropic 309.815 geanonimiseerde gesprekken uit mei 2026. Door duizenden individuele termen te verwerken, destilleerde het onderzoeksteam complexe menselijke waarden tot 339 concepten op een hoger niveau, die vervolgens werden teruggebracht tot vier kernassen van gedrag:
- Deferentie en voorzichtigheid: In hoeverre het model het met de gebruiker eens is versus in hoeverre het zijn antwoorden nuanceert.
- Warmte en strengheid: De balans tussen empathische, beleefde formuleringen en kritische, op bewijs gebaseerde toetsing.
- Diepgang en beknoptheid: Of het model uitgebreide details geeft of beknopte, directe antwoorden.
- Oprechtheid en uitvoering: De spanning tussen openlijk kritisch zijn en de focus leggen op taakvoltooiing.
Deze methodologie stelt onderzoekers in staat om taalkundige en modelspecifieke gedragingen te isoleren van de eigenlijke inhoud van het gesprek, wat een duidelijker beeld geeft van de "normatieve patronen" die inherent zijn aan het LLM.
Distinctieve gedragsprofielen: Sonnet vs. Opus
De studie bevestigt dat verschillende modellen binnen de Claude-familie meetbare gedragsverschillen vertonen. Deze profielen komen vaak overeen met de perceptie van gebruikers, wat zorgt voor een gelaagde ervaring op basis van de specifieke modelversie die wordt gebruikt:
- Sonnet 4.6: Wordt primair gekenmerkt door warmte. Het maakt gebruik van humor, bevestigt de ideeën van de gebruiker en biedt troost zonder oordeel.
- Opus 4.6: Gericht op taakefficiëntie. Het neigt direct te zijn en vermijdt onnodige uitweidingen.
- Opus 4.7: De "kritische denker". Dit model is eerder geneigd aannames in twijfel te trekken, eigen fouten te signaleren en te waarschuwen voor risico's, zelfs als daar niet expliciet om wordt gevraagd.
De taalbarrière: Van Hindi-warmte tot Russische strengheid
Misschien wel de meest opvallende bevinding is hoe taal fungeert als een lens die de output van Claude hervormt. Twee gebruikers die dezelfde vraag in verschillende talen stellen, kunnen fundamenteel verschillende soorten feedback ontvangen.
Het onderzoek toonde aan dat Hindi en Arabisch de hoogste niveaus van warmte oproepen, gekenmerkt door beleefdheid, speelsheid en bevestiging. Daarentegen neemt Claude in het Engels en Russisch een veel strengere houding aan — het stelt aannames ter discussie, corrigeert details en vraagt om bewijs.
Andere opvallende linguïstische patronen zijn onder meer:
- Arabisch: Vertoont de hoogste niveaus van deferentie.
- Engels: Toont de hoogste niveaus van voorzichtigheid en het maken van voorbehouden.
- Nederlands: Neigt naar een hoge mate van oprechtheid en openheid.
- Indonesisch: Leunt sterk naar uitvoering en resultaatgerichte antwoorden.
Waarom dit belangrijk is voor de AI-industrie
Deze bevindingen roepen kritische vragen op over de samenstelling van trainingsdata en het potentieel voor onbedoelde linguïstische bias. Anthropic suggereert dat deze verschuivingen kunnen voortkomen uit ongelijke hoeveelheden trainingsdata of verschillende taalkundige gesprekscodes in de datasets.
Voor ontwikkelaars en oprichters die wereldwijde applicaties bouwen, is dit een essentieel inzicht: een AI-assistent kan in de ene markt aanvoelen als een ondersteunende coach en in de andere als een strenge auditor. Nu LLM's steeds meer geïntegreerd raken in wereldwijde workflows, blijft het een primaire uitdaging voor AI-veiligheid en alignment om ervoor te zorgen dat deze taalkundige verschuivingen intentionele aanpassingen zijn en geen systemische vooroordelen.
Belangrijkste conclusies
- Linguïstische relativiteit in AI: De reacties van Claude verschuiven aanzienlijk per taal, met veel warmte in het Hindi en veel strengheid in het Russisch.
- Model-hiërarchie: De modellen van Anthropic vertonen duidelijke persona's, waarbij Sonnet 4.6 empathischer is en Opus 4.7 kritischer en voorzichtiger.
- De uitdaging van trainingsdata: Verschillen in AI-gedrag tussen talen komen waarschijnlijk voort uit ongelijke verdelingen van trainingsdata en variërende culturele gesprekscodes.
