OpenAI’s GPT-5.5 Codex נתקל בקושי. מפתחים ב-GitHub וב-Hacker News החלו לסמן דפוס התנהגות מוזר בשבועות האחרונים. המודל, שנבנה לטיפול במשימות קידוד וחשיבה מורכבות, נתקל במשהו שמשתמשיו מכנים reasoning-token clustering. התוצאה היא פלט שמרגיש מקוטע, לוגיקה שמדלגת על שלבים, ותשובות שמפספסות את המטרה גם כשהדקדוק החיצוני נראה מושלם. עבור כלי שמוצג כעוזר רציני להנדסת תוכנה, תקלה מסוג זה היא הרבה מעבר להפרעה קלה.
מה המשתמשים רואים בפועל
הדיווחים לא הגיעו כקופסאות של תלונות מעורפלות. המשתמשים תיארו כשלים ספציפיים. מפתח עשוי לבקש מהמודל לבצע refactor לפונקציה, לעקוב אחר באג במספר קבצים, או לאכוף תבנית עיצוב (design pattern) מסוימת, והמודל יתחיל חזק לפני שיסטה מהמסלול. הוא לא פשוט הפיק תשובות שגויות. נראה היה שהוא מאבד את הרצף באמצע תהליך מחשבתי רב-שלבי. פונקציה שאמורה לכלול חמישה שלבים לוגיים עשויה לקרוס בשלב השלישי, או לייצר קוד שנראה תקין מבחינה מבנית אך מתעלם ממקרי קצה קריטיים. הבעיה נשאה חתימה מובהקת: המודל לא נכשל בשפה; הוא נכשל בניהול הלוגיקה שלו עצמו.
המכניקה של reasoning-token clustering
כדי להבין מדוע זה חשוב, כדאי לקחת צעד אחורה ולהסתכל על האופן שבו מודלי שפה גדולים קוראים בפועל. הם לא סורקים משפטים כפי שבני אדם עושים. הם מחלקים טקסט לטוקנים (tokens) — מקטעי תווים, הברות, ולפעמים מילים שלמות. הטוקנים הללו הם חומר הגלם של המכונה, לבני הלגו שהיא עורמת כדי ליצור תגובות.
reasoning-token clustering הוא האופן שבו המודל מקבץ טוקנים קשורים בזמן שהוא עובר מהנחת היסוד למסקנה. בריצה תקינה, המודל מאגד טוקנים הקשורים לחוט לוגי אחד, פותר את המחשבה הזו, ואז עובר בצורה נקייה לצבר (cluster) הבא. כאשר הצבירה נכשלת, טוקנים מחוטי חשיבה שונים מסתבכים זה בזה. משתנה לוגי אחד "מדליף" לתוך אחר. התחביר נשאר שלם, אך ארכיטקטורת המחשבה מתפרקת.
חשבו על זה כמו על שף ששוכח איך לחתוך ירקות. המטבח מלא במלאי, המתכון פתוח על השיש, ולשף יש שנות ניסיון. אך אם עבודת ההכנה הבסיסית מתערבבת — בצל נשפך לתוך בלילת עוגה כי סביבת העבודה לא הייתה מאורגנת — התוצאה הסופית תהיה גרועה לא משנה כמה הטבח מיומן בשאר הדברים. עבור GPT-5.5 Codex, הטוקנים הם המרכיבים, וצבירות החשיבה (reasoning clusters) הן עמדות ההכנה. כשהעמדות הללו הופכות למבולגנות, המנה מתפרקת.
דוגמה קונקרטית עוזרת להבין. דמיינו שאתם מבקשים מהמודל לבצע debug לסקריפט Python שמטפל באימות משתמשים (user authentication). המשימה דורשת לשמור על שלושה חוטים נפרדים בו-זמנית: hashing של סיסמאות, ניהול סשנים (session management), ושאילתות בסיס נתונים. אם צבירות החשיבה מדליפות זו לתוך זו, המודל עלול להחיל לוגיקת סשן על שגרת ה-hashing, או להתייחס למשתנה בסיס נתונים כאילו היה קלט גולמי של משתמש. הקוד שיווצר עשוי לעבור במבט חטף, אך ייכשל תחת עומס אמיתי או יפתח פרצת אבטחה. הכשל אינו בדקדוק של הקוד. הוא בלוגיקה של המחשבה שיצרה אותו.
מדוע הארכיטקטורה מתקשה
הדור הנוכחי של המודלים נדחף לפעול בצורה קרובה יותר לבני אדם. השאיפה הזו מוסיפה מורכבות. המערכת אינה רק חוזה את הטוקן הבא על בסיס דפוסים סטטיסטיים מנתוני האימון שלה. היא מנסה לסמלץ סגנון חשיבה שמרגיש טבעי, הקשרי ושיחתי.
המנדט הכפול הזה יוצר חיכוך. טיפול בשפה טהורה — טון, סגנון, ניואנסים, זרימה שיחתית — הוא משימה חישובית שונה מאשר חשיבה לוגית קפדנית ומובנית. ביצוע של שניהם בו-זמנית מותח את הארכיטקטורה. העיצוב הנוכחי מתקשה לטפל גם בחשיבה וגם בשפה בו-זמנית. במקום שרשראות לוגיות רציפות ונקיות, המודל מייצר לעיתים חשיבה שמתפתלת או חוזרת על עצמה בדרכים שמרגישות אנושיות אך הן רשלניות מבחינה חישובית.
דמיינו עורך דין המנסה לנסח חוזה הדוק ובו בזמן מאים שירה מדוברת. שניהם משימות שפה, אך הם דורשים משמעת שונה. כאשר המודל נוטה יותר מדי לכיוון של ביטוי זורם ואנושי, יכולתו לשמור על תשתית לוגית קשיחה נחלשת. הניסיון להישמע טבעי מוסיף עומס קוגניטיבי, ומורכבות רבה יותר אינה מובילה תמיד לתוצאות טובות יותר. למעשה, מבקשים מהמודל לחשוב ולהקסים בו-זמנית, וחומרת מנגנוני הקשב טרם השיגה את האיזון הנדרש לדרישה המפוצלת הזו.
למה זה חשוב מחוץ למעבדה
לתקרית זו יש משקל משני טעמים נפרדים.
ראשית, זוהי תזכורת בוטה לכך שה-AI אינו מושלם. אפילו המודלים הטובים ביותר טועים כשהם מגיעים לגבולותיהם. מחזור השיווק סביב מודלי שפה גדולים מוכר אותם לעיתים קרובות כמערכות דמויות אורקל, אך הם נותרים מנועים הסתברותיים. הם מנחשים מה יהיה הטוקן הבא, ולפעמים הניחושים הללו מצטברים לשטות שנשמעת קוהרנטית. צפייה במודל קוד מוביל כמו GPT-5.5 Codex נתקע בלוגיקה שלו היא בדיקת מציאות בריאה. היא מסמנת את הגבול בין התאמת תבניות לבין הבנה אמיתית, והגבול הזה הוא עדיין מוחשי מאוד.
שנית, עסקים מסתמכים על המודלים הללו. ביצועים ירודים משפיעים על פיתוח מוצרים ושירות לקוחות בדרכים ישירות ומדידות. סטארט-אפ המשתמש ב-Codex כדי ליצור תשתית backend עלול להשיק פרצת אבטחה מכיוון שהמודל ערבב בין שתי שכבות אימות. בוט שירות לקוחות המופעל על ידי ארכיטקטורה דומה עלול להבטיח החזרים כספיים או חריגות במדיניות שהוא אינו יכול לעבד בפועל, מה שיוצר חשיפה משפטית ומשתמשים כועסים.
הסיכונים עולים עוד יותר כשמסתכלים מעבר לתוכנה. מקרים כאלה מעלים שאלות כבדות משקל לגבי שימוש ב-AI בתחומי הבריאות או בנהיגה עצמית. אם מודל יכול לבלבל אשכולות טוקנים בזמן כתיבת שאילתת SQL, מה יקרה כשהוא יפרש סריקה רפואית או ינתח נתוני חיישנים בזמן אמת עבור רכב אוטונומי? המכניקה שבבסיס הדברים — התאמת תבניות סטטיסטית על פני מיליארדי פרמטרים — היא זהה ביסודה. אמון במערכות אלו בתחומים בעלי השלכות קריטיות דורש רמה של אמינות בהסקה שכישלונות באשכולות טוקנים מערערים ישירות.
מעידה, לא קריסה
קביעה שמדובר בכישלון תהיה טעות. בעיות אלו הן חלק מבניית טכנולוגיה חדשה. כל קפיצת מדרגה משמעותית ביכולות ה-AI לוותה בתקופה של התנהגות שבירה. מודלי GPT מוקדמים הפיקו הזיות לגבי עובדות בביטחון מבלבל. מחוללי תמונות עיווטו בעבר ידי אדם. מודלי קוד מוציאים באופן שגרתי לולאות אינסופיות כאשר הם ניצבים בפני הוראות מעורפלות. כל פגם חשף גבול, וחוקרים השתמשו בגבולות הללו כדי לצייר מפות טובות יותר.
חוקרים משתמשים בשגיאות הללו כדי לתקן ולשפר את המערכות. המשוב שזורם משרשתי GitHub וממדורי התגובות ב-Hacker News אינו רק רעש. זהו מידע אבחוני גולמי מהעולם האמיתי. כאשר מאות מפתחים מבצעים בדיקות עומס למודל לאורך אלפי משימות נפרדות, הם חושפים מצבי כשל שצוות הבטחת איכות פנימי לא יכול לשחזר במלואם. הביקורת המבוססת על הקהילה (crowdsourced) מהדקת את לולאת המשוב ומאלצת הוצאת תיקונים מהירים וממוקדים יותר.
תקרית זו תוביל ככל הנראה לגרסה טובה יותר של המודל. OpenAI נהגה לבצע איטרציות מהירות ברגע שפגם מתועד ומובן. בין אם התיקון כולל התאמה של מנגנון הקשב, דיוק האופן שבו שכבות ההסקה משוקללות מול שכבות השפה, או הכנסת שלבי אימות חדשים שתופסים אשכולות טוקנים סבוכים לפני שהם מגיעים למשתמש, התוצאה נוטה להיות מערכת עמידה יותר.
הלקח האמיתי
עבור מפתחים עובדים, הלקח הוא פרקטי. התייחסו לקוד ולהסקה שנוצרו על ידי ה-AI כטיוטה ראשונית, ולא כמוצר מוגמר. הריצו בדיקות. עברו על הלוגיקה ידנית. הניחו שהמודל עלול להיות ערבב את אשכולות הטוקנים הפנימיים שלו גם כאשר הפלט נראה מלוטש על פני השטח. התחביר היפה עשוי להסתיר מחשבה מבולבלת.
עבור התעשייה בכללותה, הפרק הזה מדגיש שההתקדמות בבינה מלאכותית אינה קו ישר. זהו לופ של שחרור, שבירה, אבחון ותיקון. GPT-5.5 Codex מעד, אך המעידה הזו היא בדיוק הדרך שבה הגרסה הבאה לומדת ללכת ישר יותר.
קהילת למידה אופציונלית: [
