Как язык формирует ИИ: исследование Anthropic выявило изменения в «личности» Claude

Anthropic опубликовала революционное исследование, показывающее, что «личность» Claude и способы выражения ценностей значительно меняются в зависимости от используемого языка. От теплоты в хинди до технической строгости в русском — исследование подчеркивает, насколько глубоко лингвистические нюансы влияют на поведение ИИ.

Картирование ценностей ИИ по четырем измерениям

Чтобы понять нюансы взаимодействия с ИИ, Anthropic проанализировала 309 815 анонимных диалогов за май 2026 года. Обработав тысячи отдельных терминов, исследовательская группа выделила 339 высокоуровневых концепций, представляющих сложные человеческие ценности, которые затем были сведены к четырем основным осям поведения:

  • Уступчивость и осторожность: насколько модель соглашается с пользователем или насколько она осторожничает в своих ответах.
  • Теплота и строгость: баланс между эмпатичными, вежливыми формулировками и критическим, основанным на доказательствах анализом.
  • Глубина и краткость: предоставляет ли модель исчерпывающие детали или лаконичные, прямые ответы.
  • Откровенность и исполнительность: противоречие между открытой критичностью и сосредоточенностью на выполнении задачи.

Эта методология позволяет исследователям отделить лингвистические и специфические для модели особенности поведения от самой темы разговора, обеспечивая более четкое представление о «нормативных паттернах», присущих LLM.

Различные поведенческие профили: Sonnet против Opus

Исследование подтверждает, что различные модели семейства Claude демонстрируют измеримые различия в поведении. Эти профили часто совпадают с восприятием пользователей, создавая многоуровневый опыт в зависимости от используемой версии модели:

  • Sonnet 4.6: В первую очередь характеризуется теплотой. Она склонна к юмору, поддерживает идеи пользователя и предлагает поддержку без осуждения.
  • Opus 4.6: Сосредоточена на эффективности выполнения задач. Она склонна к прямолинейности и избегает лишних подробностей.
  • Opus 4.7: «Критический мыслитель». Эта модель с большей вероятностью подвергнет сомнению предположения, укажет на собственные ошибки и предупредит о рисках, даже если об этом не просили напрямую.

Языковой разрыв: от теплоты хинди до строгости русского

Пожалуй, самым поразительным выводом стало то, как язык выступает в роли линзы, меняющей ответы Claude. Два пользователя, задающие один и тот же вопрос на разных языках, могут получить принципиально разные типы обратной связи.

Исследование показало, что хинди и арабский вызывают самый высокий уровень теплоты, характеризующийся вежливостью, игривостью и поддержкой. Напротив, в английском и русском языках Claude занимает гораздо более строгую позицию — подвергает сомнению предположения, исправляет детали и требует доказательств.

Другие заметные лингвистические паттерны включают:

  • Арабский: демонстрирует самый высокий уровень уступчивости.
  • Английский: показывает самый высокий уровень осторожности и уклончивости.
  • Голландский: склонен к высокой степени откровенности и открытости.
  • Индонезийский: сильно тяготеет к исполнительности и ответам, ориентированным на результат.

Почему это важно для индустрии ИИ

Эти результаты поднимают критические вопросы относительно состава обучающих данных и возможности непреднамеренной лингвистической предвзятости. Anthropic предполагает, что эти сдвиги могут быть вызваны неравномерным объемом обучающих данных или различными лингвистическими нормами общения, присутствующими в наборах данных.

Для разработчиков и основателей, создающих глобальные приложения, это жизненно важное осознание: ИИ-ассистент может восприниматься как поддерживающий коуч на одном рынке и как строгий аудитор на другом. По мере того как LLM все глубже интегрируются в глобальные рабочие процессы, обеспечение того, чтобы эти лингвистические сдвиги были намеренными адаптациями, а не системными искажениями, остается одной из главных задач для безопасности и согласованности (alignment) ИИ.

Основные выводы

  • Лингвистическая относительность в ИИ: ответы Claude значительно меняются в зависимости от языка, демонстрируя высокую теплоту на хинди и высокую строгость на русском.
  • Уровни моделей: модели Anthropic демонстрируют различные «личности»: Sonnet 4.6 более эмпатична, а Opus 4.7 — более критична и осторожна.
  • Проблема обучающих данных: различия в поведении ИИ на разных языках, вероятно, связаны с неравномерным распределением обучающих данных и различиями в культурных нормах общения.