כיצד השפה מעצבת את ה-AI: מחקר של Anthropic חושף שינויים באישיות של Claude
Anthropic פרסמה מחקר פורץ דרך החושף כי ה"אישיות" של Claude והביטויים של ערכיו משתנים באופן משמעותי בהתאם לשפה המדוברת. מחום בהינדי ועד להקפדה טכנית ברוסית, המחקר מדגיש כיצד דקויות לשוניות משפיעות עמוקות על התנהגות ה-AI.
מיפוי ערכי AI לאורך ארבעה ממדים
כדי להבין את הדקויות של אינטראקציית AI, Anthropic ניתחה 309,815 שיחות אנונימיות ממאי 2026. באמצעות עיבוד של אלפי מונחים בודדים, צוות המחקר זיקק ערכים אנושיים מורכבים ל-339 מושגים ברמה גבוהה יותר, אשר צומצמו עוד יותר לארבעה צירי התנהגות מרכזיים:
- ציות וזהירות: עד כמה המודל מסכים עם המשתמש לעומת עד כמה הוא נמנע מהצהרות נחרצות בתשובותיו.
- חמימות וקפדנות: האיזון בין ניסוח אמפתי ומנומס לבין בחינה ביקורתית מבוססת ראיות.
- עומק ותמציתיות: האם המודל מספק פירוט מקיף או תשובות תמציתיות וישירות.
- כנות וביצוע: המתח בין ביקורתיות גלויה לבין התמקדות בהשלמת המשימה.
מתודולוגיה זו מאפשרת לחוקרים לבודד התנהגויות לשוניות וספציפיות למודל מנושא השיחה עצמו, ובכך לספק מבט ברור יותר על ה"דפוסים הנורמטיביים" הטבועים ב-LLM.
פרופילי התנהגות מובחנים: Sonnet לעומת Opus
המחקר מאשר כי מודלים שונים בתוך משפחת Claude מציגים הבדלים התנהגותיים מדידים. פרופילים אלו תואמים לעיתים קרובות את תפיסות המשתמשים, מה שיוצר חוויה מדורגת המבוססת על גרסת המודל הספציפית שבה נעשה שימוש:
- Sonnet 4.6: מאופיין בעיקר בחמימות. הוא נוטה להומור, מאשר רעיונות של המשתמש ומציע נחמה ללא שיפוטיות.
- Opus 4.6: מתמקד ביעילות משימה. הוא נוטה להיות ישיר ונמנע מפירוט מיותר.
- Opus 4.7: ה"חושב הביקורתי". מודל זה נוטה יותר להטיל ספק בהנחות, לסמן טעויות של עצמו ולהזהיר מפני סיכונים גם כשלא נדרש לכך במפורש.
פער השפות: מחמימות בהינדי לקפדנות ברוסית
אולי הממצא המדהים ביותר הוא האופן שבו השפה פועלת כעדשה המעצבת מחדש את הפלטים של Claude. שני משתמשים השואלים את אותה שאלה בשפות שונות עשויים לקבל סוגים שונים לחלוטין של משוב.
המחקר מצא כי הינדי וערבית מעוררים את רמות החמימות הגבוהות ביותר, המאופיינות בנימוס, שובבות ואישור. לעומת זאת, באנגלית וברוסית, Claude נוקט בעמדה קפדנית הרבה יותר — הטלת ספק בהנחות, תיקון פרטים ודרישת ראיות.
תבניות לשוניות בולטות נוספות כוללות:
- ערבית: מציגה את רמות הציות הגבוהות ביותר.
- אנגלית: מראה את רמות הזהירות וההימנעות מהצהרות נחרצות הגבוהות ביותר.
- הולנדית: נוטה לכנות ופתיחות גבוהות.
- אינדונזית: נוטה מאוד לביצוע ותגובות מכוונות תוצאות.
מדוע זה חשוב לתעשיית ה-AI
ממצאים אלו מעלים שאלות קריטיות בנוגע להרכב נתוני האימון והפוטנציאל להטיה לשונית בלתי מכוונת. Anthropic מציעה כי שינויים אלו עשויים לנבוע מכמויות לא אחידות של נתוני אימון או מנורמות שיחה לשוניות שונות הקיימות במאגרי הנתונים.
עבור מפתחים ומייסדים שבונים אפליקציות גלובליות, זוהי תובנה חיונית: עוזר AI עשוי להרגיש כמו מאמן תומך בשוק אחד וכמבקר קפדני בשוק אחר. ככל ש-LLMs הופכים למשולבים יותר בתהליכי עבודה גלובליים, הבטחה ששינויים לשוניים אלו הם התאמות מכוונות ולא הטיות מערכתיות נותרת אתגר מרכזי עבור בטיחות ויישור (alignment) של AI.
נקודות מפתח
- יחסיות לשונית ב-AI: התגובות של Claude משתנות משמעותית לפי שפה, תוך הצגת חמימות גבוהה בהינדי וקפדנות גבוהה ברוסית.
- דירוג מודלים: המודלים של Anthropic מציגים אישיותיות מובחנות, כאשר Sonnet 4.6 אמפתי יותר ו-Opus 4.7 ביקורתי וזהיר יותר.
- אתגר נתוני האימון: הבדלים בהתנהגות ה-AI בין שפות נובעים ככל הנראה מהתפלגויות לא אחידות של נתוני אימון ומנורמות שיחה תרבותיות משתנות.
