מעבר ל-Transformers: הסטארט-אפים שמגדירים מחדש את העידן הבא של LLMs
עידן ה-transformer ניצב בפני צוואר בקבוק יסודי, כאשר הדרישות החישוביות של מודלי שפה גדולים (LLMs) מגיעות לנקודת שבירה. בעוד שהמאמר "Attention Is All You Need" מ-2017 הניח את היסודות לבום ה-AI הנוכחי, דור חדש של סטארט-אפים מתחרה כעת להחליף או להמציא מחדש את הארכיטקטורה הליבתית כדי להשיג יעילות אמיתית.
צוואר הבקבוק של ה-Transformer: מדוע dense attention נכשל
במשך כמעט עשור, ה-transformer שימש כמנוע של תעשיית ה-AI, המונע על ידי מנגנון הידוע בשם "dense attention". תהליך זה משווה כל token בבלוק טקסט לכל token אחר באמצעות הכפלה בקנה מידה עצום. למרות הדיוק המדהים בלכידת המשמעות הסמנטית, המורכבות המתמטית אינה מתרחבת (scales) בצורה טובה.
לדוגמה, מסמך בן 10,000 מילים יכול לדרוש מה-transformer לבצע כ-50 מיליון פעולות הכפלה. הצמיחה הריבועית הזו בחישוב מובילה לשני אתגרים אדירים: צריכת אנרגיה שוברת שוויון וחלונות הקשר (context windows) מוגבלים. כאשר על פי הדיווחים OpenAI עומדת להוציא 50 מיליארד דולר על מחשוב השנה, ודרישות החשמל של מרכזי הנתונים צפויות להכפיל את עצמן עד שנת 2030, התעשייה נתקלת בחומה של עלויות ושל פיזיקה כאחד.
לחשוב מחדש על Attention: עלייתם של מנגנוני sparse
כדי לפתור את משבר היעילות, מספר סטארט-אפים מנסים להתרחק מ-dense attention לעבר "sparse attention". במקום לחשב כל צירוף מילים אפשרי, sparse attention מתמקד רק בקשרים הרלוונטיים ביותר, מה שמפחית משמעותית את העומס החישובי.
הסטארט-אפ Subquadratic, שבסיסו במיאמי, הוא מוביל בתחום זה עם מודל ה-SubQ שלו. בניגוד למנגנוני sparse קודמים שהתקשו לשמור על דיוק, Subquadratic טוענת שהטכנולוגיה שלה מתחרה ב-LLMs המקובלים במשימות ייעודיות כמו קידוד (coding) וחיפוש. הגישה שלהם כוללת מערכת דינמית שמזהה בזמן אמת אילו מילים באמת חשובות עבור קטע טקסט נתון, במקום לבזבז מחזורי חישוב על tokens לא רלוונטיים.
Power Retention: תנועה לעבר סיכומים מתגלגלים (Rolling Summaries)
גישה אחרת כוללת התרחקות מוחלטת ממנגנון ה-attention. חברת Manifest AI שבסיסה בסן פרנסיסקו חלוצה בטכניקה הנקראת "power retention". בעוד שמודלים של sparse attention כמו SubQ עדיין מנסים לשמור על תמונה כללית של כל חלון ההקשר, power retention פועל על ידי אספקת סיכום מתגלגל (rolling summary) של הזיכרון למודל.
ככל שמידע חדש נכנס לחלון ההקשר, המודל מזהה ומשמיט נתונים פחות רלוונטיים, מה שמבטיח שהעומס החישובי יישאר בטווח ניתן לניהול ללא קשר לגודל הקלט. Manifest AI כבר הוכיחה את ההיתכנות של גישה זו על ידי:
- המרת מודל ה-open-source StarCoder ל-PowerCoder באמצעות power retention.
- השקת Brumby, מודל שהם טוענים כי הוא מתחרה במודלי ה-open-source הפופולריים Qwen של Alibaba.
היכולת להתאים מודלי transformer קיימים למודלים של power retention עם אימון מחדש מינימלי מרמזת כי המעבר ל-"LLMs+" — הדור הבא של המודלים — עשוי לקרות הרבה יותר מהר מהצפוי.
נקודות מפתח
- מגבלת ה-Transformer: הצמיחה הריבועית של dense attention הופכת את ה-LLMs הנוכחיים ליקרים מאוד להפעלה וקשים להרחבה (scale) עבור מאגרי נתונים עצומים או הסקה (reasoning) ארוכת טווח.
- Sparse לעומת Retention: סטארט-אפים תוקפים את הבעיה משני כיוונים: Subquadratic מייעלת את ה-attention באמצעות חישובים sparse (מודל SubQ), בעוד ש-Manifest AI מחליפה אותו בסיכומים מתגלגלים (Power Retention).
- הכרח כלכלי: ככל שעלויות המחשוב של AI מגיעות לעשרות מיליארדי דולרים, המנצח בעידן ה-AI הבא יהיה ככל הנראה זה שיפתור את בעיית היעילות, ולא רק את בעיית קנה המידה הגולמי.
