Jak język kształtuje AI: Badanie Anthropic ujawnia zmiany w osobowości Claude'a

Anthropic opublikowało przełomowe badanie, z którego wynika, że „osobowość” Claude'a oraz sposób wyrażania wartości zmieniają się znacząco w zależności od używanego języka. Od ciepła w języku hindi po techniczny rygor w języku rosyjskim – badania te podkreślają, jak niuanse językowe głęboko wpływają na zachowanie AI.

Mapowanie wartości AI w czterech wymiarach

Aby zrozumieć niuanse interakcji z AI, Anthropic przeanalizowało 309 815 anonimowych rozmów z maja 2026 roku. Przetwarzając tysiące poszczególnych terminów, zespół badawczy przekształcił złożone ludzkie wartości w 339 koncepcji wyższego poziomu, które następnie sprowadzono do czterech głównych osi behawioralnych:

  • Uległość i ostrożność: W jakim stopniu model zgadza się z użytkownikiem, a w jakim stosuje zastrzeżenia w swoich odpowiedziach.
  • Ciepło i rygor: Równowaga między empatycznymi, uprzejmymi sformułowaniami a krytyczną, opartą na dowodach analizą.
  • Głębia i zwięzłość: Czy model dostarcza wyczerpujących szczegółów, czy też krótkich, bezpośrednich odpowiedzi.
  • Szczerość i wykonawstwo: Napięcie między otwartą krytyką a skupieniem na realizacji zadania.

Metodologia ta pozwala badaczom wyodrębnić zachowania językowe i specyficzne dla modelu od faktycznej tematyki rozmowy, zapewniając jaśniejszy wgląd w „wzorce normatywne” właściwe dla LLM.

Wyraźne profile behawioralne: Sonnet vs. Opus

Badanie potwierdza, że różne modele z rodziny Claude wykazują mierzalne różnice w zachowaniu. Profile te często pokrywają się z percepcją użytkowników, tworząc wielopoziomowe doświadczenie oparte na konkretnej wersji modelu:

  • Sonnet 4.6: Charakteryzuje się przede wszystkim ciepłem. Skłania się ku humorowi, potwierdza pomysły użytkownika i oferuje wsparcie bez oceniania.
  • Opus 4.6: Skupiony na efektywności zadań. Ma tendencję do bezpośredniości i unika zbędnych rozwodnień.
  • Opus 4.7: „Krytyczny myśliciel”. Model ten częściej kwestionuje założenia, wyłapuje własne błędy i ostrzega przed ryzykiem, nawet jeśli nie zostało to wyraźnie poproszone.

Luka językowa: Od ciepła hindi po rygor rosyjski

Być może najbardziej uderzającym odkryciem jest to, jak język działa jak soczewka, która zmienia sposób generowania odpowiedzi przez Claude'a. Dwaj użytkownicy zadający to samo pytanie w różnych językach mogą otrzymać fundamentalnie różne rodzaje informacji zwrotnej.

Badania wykazały, że hindi i arabski wywołują najwyższy poziom ciepła, charakteryzujący się uprzejmością, swobodą i potwierdzaniem racji. Przeciwnie, w języku angielskim i rosyjskim Claude przyjmuje znacznie bardziej rygorystyczną postawę – kwestionuje założenia, poprawia szczegóły i wymaga dowodów.

Inne istotne wzorce językowe obejmują:

  • Arabski: Wykazuje najwyższy poziom uległości.
  • Angielski: Wykazuje najwyższy poziom ostrożności i stosowania zastrzeżeń.
  • Niderlandzki: Skłania się ku dużej szczerości i otwartości.
  • Indonezyjski: Silnie nastawiony na wykonawstwo i odpowiedzi zorientowane na wyniki.

Dlaczego ma to znaczenie dla branży AI

Wyniki te stawiają krytyczne pytania dotyczące składu danych treningowych oraz potencjału wystąpienia niezamierzonych uprzedzeń językowych. Anthropic sugeruje, że przesunięcia te mogą wynikać z nierównomiernej ilości danych treningowych lub różnych norm konwersacyjnych obecnych w zbiorach danych.

Dla programistów i założycieli budujących globalne aplikacje jest to kluczowa świadomość: asystent AI może być postrzegany jako wspierający trener na jednym rynku, a jako surowy audytor na innym. W miarę jak modele LLM stają się coraz bardziej zintegrowane z globalnymi procesami pracy, zapewnienie, aby te zmiany językowe były zamierzonymi adaptacjami, a nie systemowymi uprzedzeniami, pozostaje głównym wyzwaniem dla bezpieczeństwa i dopasowania (alignment) AI.

Kluczowe wnioski

  • Relatywizm językowy w AI: Odpowiedzi Claude'a znacząco zmieniają się w zależności od języka, wykazując wysokie ciepło w hindi i wysoki rygor w rosyjskim.
  • Poziomy modeli: Modele Anthropic wykazują odrębne osobowości, gdzie Sonnet 4.6 jest bardziej empatyczny, a Opus 4.7 bardziej krytyczny i ostrożny.
  • Wyzwanie związane z danymi treningowymi: Różnice w zachowaniu AI w różnych językach prawdopodobnie wynikają z nierównomiernego rozkładu danych treningowych oraz różnic w kulturowych normach konwersacyjnych.