언어가 AI를 형성하는 방식: Anthropic의 연구를 통해 밝혀진 Claude의 성격 변화
Anthropic은 사용되는 언어에 따라 Claude의 "성격"과 가치 표현이 크게 달라진다는 획기적인 연구 결과를 발표했습니다. 힌디어의 따뜻함부터 러시아어의 기술적 엄격함에 이르기까지, 이번 연구는 언어적 뉘앙스가 AI의 행동에 얼마나 깊은 영향을 미치는지 보여줍니다.
4가지 차원을 통한 AI 가치 매핑
AI 상호작용의 미묘한 차이를 이해하기 위해, Anthropic은 2026년 5월의 익명화된 대화 309,815건을 분석했습니다. 연구팀은 수천 개의 개별 용어를 처리하여 복잡한 인간의 가치를 339개의 상위 개념으로 추출했으며, 이를 다시 4가지 핵심 행동 축으로 압축했습니다.
- 순응 및 주의(Deference and Caution): 모델이 사용자의 의견에 얼마나 동의하는지, 아니면 답변을 얼마나 신중하게 유보(hedging)하는지 여부.
- 따뜻함 및 엄격함(Warmth and Rigor): 공감적이고 정중한 표현과 비판적이고 증거 기반의 면밀한 검토 사이의 균형.
- 깊이 및 간결함(Depth and Brevity): 모델이 상세한 정보를 제공하는지, 아니면 간결하고 직접적인 답변을 제공하는지 여부.
- 솔직함 및 실행력(Candor and Execution): 공개적으로 비판적인 태도를 취하는 것과 작업 완료에 집중하는 것 사이의 긴장 관계.
이러한 방법론을 통해 연구자들은 대화의 실제 주제와는 별개로 언어적 및 모델 특유의 행동을 분리해낼 수 있으며, 이를 통해 LLM에 내재된 "규범적 패턴(normative patterns)"을 더욱 명확하게 파악할 수 있습니다.
뚜렷한 행동 프로필: Sonnet vs. Opus
이번 연구는 Claude 제품군 내의 서로 다른 모델들이 측정 가능한 행동 차이를 보인다는 점을 확인했습니다. 이러한 프로필은 종종 사용자의 인식과 일치하며, 사용되는 특정 모델 버전에 따라 계층화된 경험을 제공합니다.
- Sonnet 4.6: 주로 따뜻함이 특징입니다. 유머를 활용하고 사용자의 아이디어를 긍정하며, 판단 없이 위로를 건넵니다.
- Opus 4.6: 작업 효율성에 집중합니다. 직접적인 경향이 있으며 불필요한 부연 설명을 피합니다.
- Opus 4.7: "비판적 사고가"입니다. 이 모델은 명시적으로 요청받지 않더라도 가정을 의심하고, 자신의 실수를 지적하며, 위험성을 경고할 가능성이 더 높습니다.
언어의 격차: 힌디어의 따뜻함부터 러시아어의 엄격함까지
아마도 가장 놀라운 발견은 언어가 Claude의 결과물을 재구성하는 렌즈 역할을 한다는 점일 것입니다. 서로 다른 언어로 동일한 질문을 던진 두 사용자는 근본적으로 다른 유형의 피드백을 받을 수 있습니다.
연구 결과, 힌디어와 아랍어는 정중함, 유쾌함, 긍정적 태도를 특징으로 하는 가장 높은 수준의 따뜻함을 유도하는 것으로 나타났습니다. 반대로, 영어와 러시아어에서 Claude는 가정을 의심하고, 세부 사항을 수정하며, 증거를 요구하는 훨씬 더 엄격한 태도를 취합니다.
기타 주목할 만한 언어적 패턴은 다음과 같습니다:
- 아랍어: 가장 높은 수준의 순응성을 보입니다.
- 영어: 가장 높은 수준의 주의 및 신중한 유보(hedging)를 보여줍니다.
- 네덜란드어: 높은 솔직함과 개방성을 보이는 경향이 있습니다.
- 인도네시아어: 실행 및 결과 중심의 응답에 크게 치우쳐 있습니다.
이것이 AI 산업에 중요한 이유
이러한 발견은 학습 데이터의 구성과 의도치 않은 언어적 편향의 가능성에 대해 중요한 질문을 던집니다. Anthropic은 이러한 변화가 학습 데이터 양의 불균형이나 데이터셋에 존재하는 서로 다른 언어적 대화 규범에서 비롯될 수 있다고 시사합니다.
글로벌 애플리케이션을 구축하는 개발자와 창업자들에게 이는 매우 중요한 깨달음입니다. AI 어시스턴트가 어떤 시장에서는 든든한 코치처럼 느껴지지만, 다른 시장에서는 엄격한 감사관처럼 느껴질 수 있기 때문입니다. LLM이 글로벌 워크플로우에 더욱 통합됨에 따라, 이러한 언어적 변화가 시스템적 편향이 아닌 의도적인 적응이 되도록 보장하는 것이 AI 안전 및 정렬(alignment)의 주요 과제로 남아 있습니다.
핵심 요약
- AI에서의 언어적 상대성: Claude의 응답은 언어에 따라 크게 달라지며, 힌디어에서는 높은 따뜻함을, 러시아어에서는 높은 엄격함을 보여줍니다.
- 모델 계층화: Anthropic의 모델들은 뚜렷한 페르소나를 보여주며, Sonnet 4.6은 더 공감적이고 Opus 4.7은 더 비판적이고 신중합니다.
- 학습 데이터의 과제: 언어별 AI 행동의 차이는 불균형한 학습 데이터 분포와 다양한 문화적 대화 규범에서 비롯될 가능성이 높습니다.
