חוקרים הכריזו על מסגרת למידת חיזוק (reinforcement learning) חדשה בשם Ring-Zero המאפשרת למודל שפה בעל טריליון פרמטרים ללמוד לחשוב תוך עמידה במגבלות תקציב טוקנים, והמודל השיג ציון של 84.2% במבחן המתמטיקה AIME לשנת 2026. התוצאה מראה כי בקנה מידה כזה, המודל יכול לרכוש הרגלי פתרון בעיות שלב-אחר-שלב שמהנדסים נהגו לקודד באופן קשיח בתוך פרומפטים.
למה זה חשוב
ביצועים ברמת AIME מהווים מזה זמן רב מדד (benchmark) ל"חשיבה כמותית ברמה אנושית". השגת טווח של 84.2% ללא דוגמאות שנכתבו על ידי בני אדם מעלה כי יכולות החשיבה של המודל נובעות מהדינמיקה של האימון עצמו, ולא מפיגומים (scaffolds) שנוצרו ידנית. עבור חברות המפתחות סוכני AI, המשמעות ברורה: כתיבה ותחזוקה של מתכוני פרומפטים מורכבים יכולות להיות מוחלפות על ידי לולאת אימון שמלמדת את המודל מתי כדאי לחשוב יותר ומתי קיצור דרך זול יספיק.
מ-prompt engineering לדינמיקת אימון
במשך שנים, מפתחים הסתמכו על תבניות פרומפט כגון "פרק את הבעיה לחלקים" או "אמת את התשובה שלך" כדי להניע מודלי שפה גדולים לחשיבה רב-שלבית. תבניות אלו פועלות כפיגום חיצוני; המודל עוקב אחר ההוראות אך אינו מפנים את התהליך. Ring-Zero הופכת את הפרדיגמה הזו. המודל מקבל תיאור משימה יחד עם תשובה ניתנת לאימות — אמת קרקעית (ground-truth) שניתן לבדוק באופן אוטומטי. לאחר מכן הוא מייצר סדרה של ניסיונות, מקבל תגמול רק כאשר הניסיון תואם לתשובה הניתנת לאימות, ומעדכן את המדיניות (policy) שלו באמצעות למידת חיזוק.
מכיוון שהתגמול קשור ליעד שקשה לרמות (התשובה חייבת להיות נכונה, לא רק סבירה), המודל מגלה דפוסי חשיבה בעצמו. המאמר טוען שברגע שקיים אות תגמול אמין, הרחבת המודל לטריליון פרמטרים מעלה באופן אוטומטי את סוגי טריקי ה-prompt-engineering שמהנדסים הכניסו ידנית עבור מודלים קטנים יותר.
צינור האימון בן ארבעת השלבים
תהליך האימון של Ring-Zero מתבצע בארבעה שלבים נפרדים:
- RL בשלב ראשון – המודל בוחן עקבות חשיבה (reasoning traces) אפשריים, ולומד אילו רצפי טוקנים נוטים להוביל לתשובות נכונות.
- זיקוק עצמי (Self-distillation) – עקבות איכותיים חוזרים אל המודל ומייצבים את דפוסי החשיבה המתהווים.
- RL בשלב שני – לולאה בעלת רזולוציה עדינה יותר משכללת את המדיניות תוך שמירה על השיפורים המוקדמים.
- אימון מדורג (Tiered training) – המודל לומד להקצות תקציבי טוקנים בצורה חכמה, תוך בחירה בין נתיבי חשיבה קצרים (≈2k טוקנים) וארוכים (≈20k טוקנים) בהתאם לקושי הבעיה.
אימון מדורג הוא החלק הרלוונטי ביותר לייצור (production). בפריסות אמיתיות, כל טוקן נוסף מוסיף עלות חישוב. על ידי לימוד המודל לזהות מתי בעיה היא פשוטה מספיק לתשובה קצרה ומתי היא מצדיקה ניתוח עמוק ורב-שלבי, Ring-Zero קושרת ישירות בין איכות החשיבה לבין יעילות כלכלית.
שני שלבי למידה: גילוי וחידוד
המחברים מתארים את עקומת הלמידה כתהליך דו-שלבי:
- גילוי (Discovery) – שלבי למידת החיזוק המוקדמים הם רועשים; המודל מנסה מגוון רחב של אסטרטגיות, רבות מהן נכשלות. שונות (variance) זו חיונית לחשיפת נתיבי חשיבה חדשניים.
- חידוד (Sharpening) – ברגע שדפוס מבטיח עולה על פני השטח, שלבי RL מאוחרים יותר מהדקים את המדיניות, מפחיתים את השונות ומבססים את ההתנהגות.
ההתקדמות משקפת את האופן שבו בני אדם משתפרים: סיעור מוחות ראשוני ולאחריו תרגול ממוקד. התובנה המרכזית היא שיש לאמץ את השלב המוקדם ה"מבולגן" במקום לדכא אותו, כיוון שהוא מספק את חומר הגלם לזיקוק מאוחר יותר.
מה יכול להשתבש?
האופטימיות של המאמר נשענת על כמה הנחות שראויות לבחינה:
- עיצוב התגמול – המסגרת זקוקה לתגמול שהוא גם ניתן לאימות וגם עמיד בפני קיצורי דרך. עבור משימות רבות בעולם האמיתי, הגדרת תגמול כזה אינה מובנת מאליה ועשויה לדרוש צינורות (pipelines) של תיוג יקרים.
- צווארי בקבוק סביבתיים – המחברים מציינים כי ביצועי המודל מוגבלים לא על ידי גודלו אלא על ידי תשתית ההערכה הסובבת (ערכות בדיקה, לוגים, מדדים ברורים). בנייה ותחזוקה של תשתית כזו יכולות להוות מאמץ הנדסי משמעותי.
- עלות החישוב של האימון – אימון מודל בעל טריליון פרמטרים עם מספר שלבי RL הוא יקר. בעוד שאימון מדורג מפחית את עלויות ההסקה (inference), תקציב האימון הראשוני נותר גבוה, מה שעלול להגביל את הגישה למעבדות בעלות מימון גבוה.
מה לצפות בהמשך
תובנות מעשיות עבור אנשי מקצוע בתחום ה-AI
- אל תתייחסו לפרומפטים כמנוף היחיד – שאלו את עצמכם האם התנהגות שאתם מקודדים בתוך הפרומפטים יכולה במקום זאת להילמד באמצעות לולאת אימון מונעת-תגמול.
- הפכו את השימוש בטוקנים ליעד בעל עדיפות עליונה – הוסיפו אותות המודעים לתקציב בשלב מוקדם; המודל ילמד לאזן בין דיוק לעלות חישוב.
- סגרו את לולאת המשוב – הטמיעו מערכת המספקת משימות באופן אוטומטי, מודדת תוצאות מול תשובות ניתנות לאימות, ומזינה את התוצאות בחזרה לאימון. הלולאה היא המקום שבו המודל מגלה את זרימת העבודה שלו.
כאשר התגמול ברור והסביבה יכולה למדוד הצלחה באופן אמין, הרחבת המודל עושה יותר מאשר רק להוסיף קיבולת גולמית – היא מלמדת את המודל לבחור כיצד לחשוב. המעבר הזה מפיגומים שנכתבו ידנית לחשיבה מכוונת-עצמית עשוי לעצב מחדש את האופן שבו אנו בונים ומתמחרים סוכני AI.
