Ngôn ngữ định hình AI như thế nào: Nghiên cứu của Anthropic tiết lộ sự thay đổi trong tính cách của Claude
Anthropic vừa công bố một nghiên cứu mang tính đột phá, tiết lộ rằng "tính cách" và cách thể hiện các giá trị của Claude thay đổi đáng kể tùy thuộc vào ngôn ngữ đang được sử dụng. Từ sự ấm áp trong tiếng Hindi đến sự khắt khe về kỹ thuật trong tiếng Nga, nghiên cứu làm nổi bật cách các sắc thái ngôn ngữ ảnh hưởng sâu sắc đến hành vi của AI.
Bản đồ các giá trị AI qua bốn khía cạnh
Để hiểu được các sắc thái trong tương tác với AI, Anthropic đã phân tích 309.815 cuộc hội thoại ẩn danh từ tháng 5 năm 2026. Bằng cách xử lý hàng nghìn thuật ngữ riêng lẻ, nhóm nghiên cứu đã đúc kết các giá trị phức tạp của con người thành 339 khái niệm cấp cao hơn, sau đó được thu gọn thành bốn trục hành vi cốt lõi:
- Sự phục tùng và thận trọng: Mức độ mô hình đồng ý với người dùng so với mức độ nó đưa ra các câu trả lời dè dặt.
- Sự ấm áp và khắt khe: Sự cân bằng giữa cách diễn đạt đồng cảm, lịch sự và sự xem xét kỹ lưỡng, dựa trên bằng chứng.
- Độ sâu và sự ngắn gọn: Liệu mô hình cung cấp chi tiết đầy đủ hay các câu trả lời ngắn gọn, trực tiếp.
- Sự thẳng thắn và tính thực thi: Sự giằng co giữa việc phê bình thẳng thắn và việc tập trung vào hoàn thành nhiệm vụ.
Phương pháp này cho phép các nhà nghiên cứu tách biệt các hành vi đặc thù của ngôn ngữ và mô hình khỏi nội dung thực tế của cuộc hội thoại, mang lại cái nhìn rõ ràng hơn về các "mô hình chuẩn mực" vốn có trong LLM.
Các hồ sơ hành vi riêng biệt: Sonnet so với Opus
Nghiên cứu xác nhận rằng các mô hình khác nhau trong gia đình Claude thể hiện những khác biệt về hành vi có thể đo lường được. Các hồ sơ này thường phù hợp với nhận thức của người dùng, tạo ra một trải nghiệm phân tầng dựa trên phiên bản mô hình cụ thể được sử dụng:
- Sonnet 4.6: Đặc trưng chủ yếu bởi sự ấm áp. Nó thiên về sự hài hước, khẳng định các ý tưởng của người dùng và mang lại sự an ủi mà không phán xét.
- Opus 4.6: Tập trung vào hiệu quả công việc. Nó có xu hướng trực tiếp và tránh việc giải thích không cần thiết.
- Opus 4.7: "Người tư duy phản biện." Mô hình này có nhiều khả năng đặt câu hỏi về các giả định, tự chỉ ra lỗi sai của mình và cảnh báo về các rủi ro ngay cả khi không được yêu cầu rõ ràng.
Khoảng cách ngôn ngữ: Từ sự ấm áp của tiếng Hindi đến sự khắt khe của tiếng Nga
Có lẽ phát hiện đáng kinh ngạc nhất là cách ngôn ngữ đóng vai trò như một lăng kính định hình lại các phản hồi của Claude. Hai người dùng đặt cùng một câu hỏi bằng các ngôn ngữ khác nhau có thể nhận được các loại phản hồi khác biệt về mặt bản chất.
Nghiên cứu cho thấy tiếng Hindi và tiếng Ả Rập kích hoạt mức độ ấm áp cao nhất, đặc trưng bởi sự lịch sự, vui vẻ và sự khẳng định. Ngược lại, trong tiếng Anh và tiếng Nga, Claude áp dụng lập trường khắt khe hơn nhiều—đặt câu hỏi về các giả định, sửa lỗi chi tiết và yêu cầu bằng chứng.
Các mô hình ngôn ngữ đáng chú ý khác bao gồm:
- Tiếng Ả Rập: Thể hiện mức độ phục tùng cao nhất.
- Tiếng Anh: Cho thấy mức độ thận trọng và dè dặt cao nhất.
- Tiếng Hà Lan: Có xu hướng thẳng thắn và cởi mở cao.
- Tiếng Indonesia: Nghiêng mạnh về tính thực thi và các phản hồi hướng tới kết quả.
Tại sao điều này lại quan trọng đối với ngành công nghiệp AI
Những phát hiện này đặt ra các câu hỏi quan trọng liên quan đến thành phần dữ liệu đào tạo và khả năng xảy ra định kiến ngôn ngữ không mong muốn. Anthropic cho rằng những sự thay đổi này có thể bắt nguồn từ lượng dữ liệu đào tạo không đồng đều hoặc các chuẩn mực hội thoại ngôn ngữ khác nhau có trong các bộ dữ liệu.
Đối với các nhà phát triển và những người sáng lập đang xây dựng các ứng dụng toàn cầu, đây là một nhận thức quan trọng: một trợ lý AI có thể mang lại cảm giác như một huấn luyện viên hỗ trợ ở thị trường này nhưng lại giống như một kiểm toán viên nghiêm khắc ở thị trường khác. Khi các LLM ngày càng được tích hợp sâu hơn vào các quy trình làm việc toàn cầu, việc đảm bảo rằng những thay đổi ngôn ngữ này là sự thích nghi có chủ đích thay vì là những định kiến mang tính hệ thống vẫn là một thách thức hàng đầu đối với sự an toàn và căn chỉnh (alignment) của AI.
Những điểm chính cần lưu ý
- Tính tương đối của ngôn ngữ trong AI: Các phản hồi của Claude thay đổi đáng kể theo ngôn ngữ, thể hiện sự ấm áp cao trong tiếng Hindi và sự khắt khe cao trong tiếng Nga.
- Phân tầng mô hình: Các mô hình của Anthropic thể hiện các cá tính riêng biệt, với Sonnet 4.6 đồng cảm hơn và Opus 4.7 có tính phản biện và thận trọng hơn.
- Thách thức về dữ liệu đào tạo: Sự khác biệt trong hành vi của AI giữa các ngôn ngữ có khả năng bắt nguồn từ sự phân bổ dữ liệu đào tạo không đồng đều và các chuẩn mực hội thoại văn hóa khác nhau.
