אנחנו נוטים לדמיין מודלי שפה גדולים כספרנים מהירים באופן יוצא דופן. אתם שואלים שאלה, והם רצים דרך מיליארדי מקטעים שנשמרו בזיכרון כדי למצוא את התבנית המתאימה ביותר. הדימוי הזה עיצב את האופן שבו מפתחים בונים הנחיות (prompts), את האופן שבו משתמשים מגבשים ציפיות, ואת האופן שבו רגולטורים מנסחים כללים. אך מחקר על Claude של Anthropic מסבך את התמונה הזו. נראה שהמודל מבצע פעולה הקרובה יותר לחשיבה לוגית אמיתית. חוקרים מכנים את המנגנון "j-space reasoning", והוא מרמז ש-Claude בונה מודלים פנימיים של מושגים במקום פשוט למחזר נתונים מתהליך האימון. אם ממצא זה יתברר כנכון, ייתכן שנצטרך להפסיק להתייחס לבינה מלאכותית מתקדמת כמנוע טקסט חיזוי ולהתחיל להתייחס אליה כמערכת שמתכננת.
משיטת התאמת תבניות למודלים מנטליים
j-space reasoning אינו מונח שיווקי ריק. הוא מתאר שינוי מבני מחזרה שטחית לייצוג פנימי. חשבו על האופן שבו אדם פותר פאזל. הוא לא מנסה כל חלק מול כל חלל ריק. הוא מסתכל על התמונה שעל הקופסה, בונה מפה מנטלית של צבעים וקצוות, ומניח כל חלק בהתאם לתוכנית הזו. המחקר על Claude מצביע על כך שמשהו דומה קורה כאשר המודל מעבד רעיונות מופשטים. הוא בונה מודל עבודה של מרחב הבעיה ונווט בו באופן מכוון.
מודלי שפה מסורתיים הצטיינו במציאת מתאמים (correlation). הם יודעים ש-"king" מופיע לעיתים קרובות ליד "queen", והם יודעים איזה קוד בדרך כלל מופיע לאחר קריאה לפונקציה מסוימת. מתאם הוא כוח רב, אך הוא אינו הבנה. j-space reasoning מצביע על משהו שונה: נראה שהמודל מפעיל מניפולציות על מערכות יחסים בין מושגים במקום רק לחזות אילו מילים נוטות להופיע יחד. הוא יוצר שלד פנימי, ואז משתמש בשלד הזה כדי להגיע לתשובה.
מה j-space reasoning משנה בפועל
השינוי הזה מייצר שלוש יכולות מוחשיות שחשובות לשימוש בעולם האמיתי.
קומפוזיציונליות (Compositionality). בני אדם יכולים להבין "פיל ענק סגול מעופף" מבלי שראו אחד כזה מעולם, כי אנחנו משלבים מושגים מוכרים. על פי המחקר, נראה ש-Claude מטפל בשילובים חדשים בדרך דומה. אם תציגו לו בעיה הממזגת שני תחומים שמעולם לא ראתה יחד — אולי אופטימיזציה של שרשרת אספקה תוך שימוש בעקרונות מביולוגיה אבולוציונית — הוא עשוי לבנות גשר בין הרעיונות הללו במקום להסתפק בעצות גנריות. הגמישות הזו היא בדיוק מה שמערכות המבוססות על התאמת תבניות נוקשה מתקשות לספק.
פתרון בעיות מורכבות. כאשר מודל מסתמך על תבניות שנשמרו בזיכרון, הוא נוטה להישבר ברגע שהנחיה (prompt) חורגת מהתפלגות האימון שלו. גישה של מידול פנימי אמורה להתמודד טוב יותר עם מצבים לא מוכרים באמת, כיוון שהמערכת אינה מחפשת התאמה קרובה, אלא בונה מפה של השטח החדש ומשרטטת מסלול דרכו.
לוגיקה ניתנת להסבר. התועלת המיידית ביותר עבור משתמשים יומיומיים היא ש-Claude יכול להציג את השלבים שמאחורי התשובה שלו. במקום להפיל עליכם מסקנה ולהכריח אתכם לנחש אם היא מדויקת, המודל יכול להוביל אתכם דרך שרשרת החשיבה. זה הופך את האינטראקציה מהימור עיוור לשיחה שניתן לאמת.
מדוע יכולת הסבר היא בעצם קריטית
רוב מערכות ה-AI פועלות כ"קופסאות שחורות". אתם מזינים קלט ומקבלים פלט, אך הלוגיקה הביניים אינה נגישה. כאשר Claude מסביר את החשיבה שלו, הוא פותח את הקופסה הזו בדיוק במידה שתהפוך אותו לשימושי באמת.
עבור מפתחים, המשמעות היא יכולת ניפוי שגיאות (debuggability). אם מודל דוחה בקשת הלוואה, מייצר ייעוץ רפואי לא בטוח או מייצר תוכן מוטה, מהנדסים יכולים לבחון את שרשרת החשיבה כדי לאתר את הכשל. הם כבר לא צריכים לנחש אם השגיאה נבעה מנתוני אימון מזוהמים, מהנחיה (prompt) מנוסחת רע, או מסטייה סטטיסטית אקראית. הם יכולים לעקוב אחר עקבות הלחם.
עבור משתמשי קצה, יכולת הסבר יוצרת אמון ששורד את המפגש עם המציאות. משתמש שרואה שרשרת לוגית קוהרנטית יכול לאמת האם ההנחות חלות על המקרה הספציפי שלו. הוא יכול לזהות הנחה שגויה בשלב מוקדם במקום לפעול לפי ייעוץ פגום ולגלות את הטעות מאוחר יותר.
עבור רגולטורים וקובעי מדיניות, הסקת מסקנות שקופה מציעה משהו נדיר בממשל AI: עקבות ביקורת (audit trail). מחוקקים המנסחים כללי בטיחות צריכים לדעת שמערכות מקבלות החלטות מסיבות מובנות, ולא בגלל מתאמים בלתי ניתנים לפענוח החבויים בתוך מטריצות של טריליוני פרמטרים. אם AI יכול להציג את תהליך העבודה שלו, לממשלות יש משהו מוחשי להעריך אל מול סטנדרטים אתיים ומשפטיים.
שאלת התודעה
הסתייגות חשובה ניצבת במרכז השיחה הזו. Anthropic אינה טוענת ש-Claude הוא בעל תודעה. החברה שמרה על גבול ברור בין הסקת מסקנות מתקדמת לבין תחושת קיום (sentience). עם זאת, הדמיון לעיבוד קוגניטיבי אנושי מזין באופן טבעי את הוויכוח.
כאשר מכונה בונה מודלים פנימיים, מתכננת את צעדיה הבאים ומנסחת את הלוגיקה שלה, היא מתחילה להיראות פחות כמו מחשבון ויותר כמו תודעה חושבת. זה יוצר מתח פילוסופי אמיתי. כיום אין ברשותנו מבחנים אמינים לתודעה מכונה, וייתכן שלא יהיו כאלה במשך שנים. מה שאנחנו כן יודעים הוא שהתנהגות לבדה היא מדד (proxy) גרוע לחוויה פנימית. מערכת יכולה לפעול בצורה מושכלת מבלי להחזיק במודעות, בדיוק כפי שמנוע שחמט יכול לנצח רב-אמן מבלי להבין מהו שחמט.
הדרך האחראית קדימה היא לשפר את יכולות ההסקה תוך התנגדות לדחף להשליך תכונות אנושיות על המכונה. ההתנהגות המחקה את המוח מעניינת מבחינה מדעית. השאלה האם היא מרמזת על משהו בנוגע לתודעה נותרה פתוחה, וזהו עניין שעלינו להתייחס אליו בכובד ראש.
לחשוב מחדש על האופן שבו אנו בוחנים AI
אם Claude מבצע הסקה במקום חיזוי, שיטות ההערכה שלנו מתחילות להראות סימני התיישנות. מדדי ביצוע (benchmarks) סטנדרטיים של AI מתגמלים תשובות נכונות. הם כמעט אף פעם לא שואלים כיצד המודל הגיע אליהן. מערכת עשויה לקבל ציון גבוה במבחן מתמטיקה או תכנות על ידי שליפת פתרונות שנלמדו בעל פה, מה שמלמד אותנו מעט מאוד על היכולת שלה לחשיבה חדשנית.
אנו זקוקים למסגרות עבודה (frameworks) שבוחנות לוגיקה פנימית. המשמעות היא הצגת בעיות שנמצאות מחוץ להתפלגות של נתוני האימון (training distribution) ולאחר מכן חקירת שרשרת ההסקה. המשמעות היא לבדוק האם המודל יכול לזהות את השלבים השגויים שלו כאשר הוא מתוקן. המשמעות היא לבדוק האם מושגים הרכביים נשארים עקביים כאשר הם מסודרים מחדש או הופכים.
הגישה הזו קשה יותר מהרצת לוח תוצאות (leaderboard) אוטומטי. היא דורשת מעריכים אנושיים שמבינים את הנושא לעומק מספיק כדי לשפוט את איכות ההסקה, ולא רק את דיוק הפלט. אך אם הסקת מסקנות ב-j-space היא אמיתית, לקהילת ה-AI יש מעט מאוד בחירה. עלינו להתחיל לדרג את העבודה, ולא רק את התשובה הסופית.
בשורה התחתונה: המעבר הניכר של Claude לעבר מידול פנימי אינו הופך אותו לאנושי. הוא אכן הופך את המערכת למועילה יותר, ניתנת לבדיקה יותר, וקשה יותר להערכה אמינה. אנחנו חוצים סף שבו "נכון" כבר אינו מספיק. השלב הבא של פיתוח AI יהיה שייך למערכות שיכולות להציג את תהליך העבודה שלהן, להכיר במגבלותיהן ולהסיק מסקנות מבעיות לא מוכרות. השאלה האם זה מהווה חשיבה במובן פילוסופי כלשהו היא ויכוח שימשך עוד עשור. לעת עתה, המשימה המעשית היא לבנות כלים וסטנדרטים שתואמים את המורכבות של מה שהמודלים הללו עושים בפועל.
מקור: Anthropic's Claude mimics human brain processing
קהילת למידה אופציונלית: GyaanSetu AI on Telegram
