كيف تشكل اللغة الذكاء الاصطناعي: دراسة من Anthropic تكشف عن تحولات في شخصية Claude

أصدرت Anthropic دراسة رائدة تكشف أن "شخصية" Claude وتعبيراته عن القيم تتغير بشكل كبير اعتمادًا على اللغة المستخدمة. فمن الدفء في اللغة الهندية إلى الصرامة التقنية في اللغة الروسية، تسلط الدراسة الضوء على كيفية تأثير الفروق اللغوية الدقيقة بعمق على سلوك الذكاء الاصطناعي.

رسم خرائط قيم الذكاء الاصطناعي عبر أربعة أبعاد

لفهم الفروق الدقيقة في التفاعل مع الذكاء الاصطناعي، قامت Anthropic بتحليل 309,815 محادثة مجهولة الهوية من مايو 2026. ومن خلال معالجة آلاف المصطلحات الفردية، استخلص فريق البحث قيمًا بشرية معقدة في 339 مفهومًا رفيع المستوى، والتي تم تقليصها لاحقًا إلى أربعة محاور سلوكية أساسية:

  • الامتثال والحذر: مدى موافقة النموذج للمستخدم مقابل مدى تحفظه في إجاباته.
  • الدفء والصرامة: التوازن بين الصياغة المتعاطفة والمهذبة وبين التدقيق النقدي القائم على الأدلة.
  • العمق والإيجاز: ما إذا كان النموذج يقدم تفاصيل شاملة أم إجابات موجزة ومباشرة.
  • الصراحة والتنفيذ: التوتر بين النقد الصريح والتركيز على إنجاز المهام.

تسمح هذه المنهجية للباحثين بعزل السلوكيات اللغوية وتلك الخاصة بالنموذج عن الموضوع الفعلي للمحادثة، مما يوفر رؤية أوضح "للأنماط المعيارية" المتأصلة في النماذج اللغوية الكبيرة (LLM).

ملفات سلوكية متميزة: Sonnet مقابل Opus

تؤكد الدراسة أن النماذج المختلفة ضمن عائلة Claude تظهر اختلافات سلوكية ملموسة. وغالبًا ما تتماشى هذه الملفات مع تصورات المستخدمين، مما يخلق تجربة متدرجة بناءً على إصدار النموذج المستخدم:

  • Sonnet 4.6: يتميز أساسًا بالدفء؛ حيث يميل إلى الفكاهة، ويؤكد على أفكار المستخدم، ويقدم الدعم دون إطلاق أحكام.
  • Opus 4.6: يركز على كفاءة المهام؛ ويميل إلى أن يكون مباشرًا ويتجنب الإطالة غير الضرورية.
  • Opus 4.7: "المفكر النقدي"؛ حيث يميل هذا النموذج إلى التشكيك في الافتراضات، وتنبيه المستخدم لأخطائه الخاصة، والتحذير من المخاطر حتى عندما لا يُطلب منه ذلك صراحةً.

الفجوة اللغوية: من الدفء الهندي إلى الصرامة الروسية

لعل النتيجة الأكثر إثارة للدهشة هي كيف تعمل اللغة كعدسة تعيد تشكيل مخرجات Claude. فمن الممكن لمستخدمين يطرحان نفس السؤال بلغات مختلفة أن يتلقيا أنواعًا مختلفة تمامًا من الردود.

وجدت الأبحاث أن اللغتين الهندية والعربية تحفزان أعلى مستويات الدفء، والتي تتميز بالتهذيب والمرح والتأييد. وعلى العكس من ذلك، في اللغتين الإنجليزية والروسية، يتبنى Claude موقفًا أكثر صرامة، حيث يشكك في الافتراضات، ويصحح التفاصيل، ويطالب بالأدلة.

وتشمل الأنماط اللغوية البارزة الأخرى ما يلي:

  • العربية: تظهر أعلى مستويات الامتثال.
  • الإنجليزية: تظهر أعلى مستويات الحذر والتحفظ.
  • الهولندية: تميل إلى الصراحة والانفتاح العاليين.
  • الإندونيسية: تميل بشدة نحو التنفيذ والاستجابات الموجهة نحو النتائج.

لماذا يهم هذا قطاع الذكاء الاصطناعي

تثير هذه النتائج أسئلة حاسمة تتعلق بتكوين بيانات التدريب وإمكانية حدوث تحيز لغوي غير مقصود. وتشير Anthropic إلى أن هذه التحولات قد تنبع من عدم التوازن في كميات بيانات التدريب أو اختلاف المعايير اللغوية للمحادثة الموجودة في مجموعات البيانات.

بالنسبة للمطورين والمؤسسين الذين يبنون تطبيقات عالمية، يعد هذا إدراكًا حيويًا: فقد يبدو المساعد الذكي كمدرب داعم في سوق ما، وكمدقق صارم في سوق أخرى. ومع زيادة دمج النماذج اللغوية الكبيرة (LLMs) في سير العمل العالمي، يظل ضمان أن تكون هذه التحولات اللغوية تكيفات مقصودة وليست تحيزات نظامية تحديًا رئيسيًا لسلامة الذكاء الاصطناعي ومواءمته.

النقاط الرئيسية المستخلصة

  • النسبية اللغوية في الذكاء الاصطناعي: تتغير ردود Claude بشكل كبير حسب اللغة، حيث تظهر دفئًا عاليًا في الهندية وصرامة عالية في الروسية.
  • تدرج النماذج: تظهر نماذج Anthropic شخصيات متميزة، حيث يكون Sonnet 4.6 أكثر تعاطفًا، بينما يكون Opus 4.7 أكثر نقدًا وحذرًا.
  • تحدي بيانات التدريب: من المرجح أن تنبع الاختلافات في سلوك الذكاء الاصطناعي عبر اللغات من التوزيع غير المتكافئ لبيانات التدريب واختلاف معايير المحادثة الثقافية.