语言如何塑造 AI:Anthropic 的研究揭示了 Claude 的性格转变

Anthropic 发布了一项开创性的研究,揭示了 Claude 的“性格”和价值观表达会随着所使用语言的不同而发生显著变化。从印地语中的热情到俄语中的技术严谨性,该研究强调了语言细微差别如何深刻影响 AI 的行为。

在四个维度上映射 AI 价值观

为了理解 AI 交互中的细微差别,Anthropic 分析了 2026 年 5 月的 309,815 场匿名对话。通过处理数千个独立术语,研究团队将复杂的人类价值观提炼为 339 个更高级别的概念,并进一步将其简化为四个核心行为轴:

  • 顺从与谨慎: 模型在多大程度上同意用户,以及在多大程度上对答案进行规避/留余地。
  • 热情与严谨: 共情、礼貌的措辞与批判性、基于证据的审查之间的平衡。
  • 深度与简洁: 模型是提供详尽的细节,还是简洁、直接的回答。
  • 坦诚与执行: 公开批判与专注于任务完成之间的张力。

这种方法使研究人员能够将语言和模型特定的行为从对话的实际主题中分离出来,从而更清晰地观察大语言模型(LLM)中固有的“规范模式”。

截然不同的行为特征:Sonnet vs. Opus

研究证实,Claude 系列中的不同模型表现出可衡量的行为差异。这些特征通常与用户的感知相一致,根据所使用的具体模型版本创造出分层级的体验:

  • Sonnet 4.6: 主要特征是热情。它倾向于幽默,肯定用户的想法,并在不作评判的情况下提供安慰。
  • Opus 4.6: 专注于任务效率。它倾向于直接,避免不必要的赘述。
  • Opus 4.7: “批判性思考者”。该模型更有可能质疑假设、指出自身的错误,并在未被明确要求时发出风险警告。

语言鸿沟:从印地语的热情到俄语的严谨

或许最令人震惊的发现是,语言如何像透镜一样重塑 Claude 的输出。两个用不同语言询问相同问题的用户可能会收到截然不同的反馈类型。

研究发现,印地语阿拉伯语会触发最高水平的热情,其特点是礼貌、风趣和肯定。相反,在英语俄语中,Claude 采取了更加严谨的立场——质疑假设、纠正细节并要求证据。

其他显著的语言模式包括:

  • 阿拉伯语: 表现出最高水平的顺从。
  • 英语: 显示出最高水平的谨慎和规避。
  • 荷兰语: 倾向于高度的坦诚和开放。
  • 印尼语: 严重倾向于执行和结果导向的回答。

为什么这对 AI 行业至关重要

这些发现引发了关于训练数据构成以及潜在无意识语言偏见的批判性问题。Anthropic 指出,这些转变可能源于训练数据量的不均衡,或者是数据集中存在的不同语言对话规范。

对于构建全球化应用的开发者和创始人来说,这是一个至关重要的认识:AI 助手在某个市场可能感觉像是一位给予支持的教练,而在另一个市场则可能像是一位严厉的审计员。随着 LLM 更加深入地融入全球工作流,确保这些语言转变是刻意的适应而非系统性偏见,仍然是 AI 安全与对齐面临的主要挑战。

核心要点

  • AI 中的语言相对论: Claude 的回答随语言的不同而发生显著变化,在印地语中表现出高度的热情,在俄语中表现出高度的严谨。
  • 模型分层: Anthropic 的模型展示了截然不同的个性,Sonnet 4.6 更具共情力,而 Opus 4.7 则更具批判性和谨慎性。
  • 训练数据挑战: 不同语言之间 AI 行为的差异可能源于训练数据分布不均以及不同的文化对话规范。