Nemotron 3 Nano 30B A3B, הקודם לו, כבר הוגדר כחלופה קומפקטית למודלי יסוד (foundation models) גדולים יותר. על ידי מעבר לארכיטקטורת Mamba-Transformer היברידית והפעלת 3.6 מיליארד פרמטרים בלבד בכל רגע נתון, Lightning דוחפת את גבולות היעילות תוך שהיא מספקת כוח הסקה הדומה למודלים גדולים בהרבה.
למה המהירות חשובה עכשיו
סוכני AI עוברים מהסקה (inference) בסגנון אצווה (batch) לאינטראקציה רציפה. צ'אטבוט שעוצר לכמה שניות מרגיש איטי; כלי להשלמת קוד שמתעכב אחרי הקלדת המפתח משבש את זרימת העבודה. בהקשרים אלו, קצב העברת הטוקנים לשנייה (token-per-second throughput) מתרגם ישירות לתחושת תגובתיות. הנתון של 670 טוקנים בשנייה הוא בערך כפול מה-386 טוקנים בשנייה שדווחו עבור Gemini 3.5 Flash-Lite של Google, והוא מקצץ את הזמן לסיום משימת Intelligence Index סטנדרטית לכמחצ דקה. לעומת זאת, Qwen 3.6 35B A3B זקוק ל-3.5 דקות ו-Gemma 4 31B זקוק ל-5.8 דקות עבור אותה משימה.
הפער הזה משמעותי עבור כל שירות שחייב לטפל בבקשות רבות בו-זמנית. שרת המעבד פי שניים יותר טוקנים על אותה חומרה יכול להוריד עלויות או להכפיל קיבולת, יתרון ברור עבור ספקי ענן וארגונים.
כיצד המודל משיג את המספרים הללו
הארכיטקטורה ההיברידית של Nemotron 3.5 Lightning משלבת את יכולות זיהוי התבניות לטווח ארוך של Transformers עם יעילות ה-state-space של בלוקי Mamba. העיצוב שומר על מספר פרמטרים כולל גבוה — 31.6 מיליארד — כדי לשמר יכולת מידול, אך רק 3.6 מיליארד פעילים עבור כל טוקן נתון. הפעלה דלילה (Sparse activation) מפחיתה את כוח המחשוב לכל טוקן, מה שמעלה את ה-throughput ללא אובדן יחסי של איכות.
Artificial Analysis מדדה ציון של 24 במדד ה-Intelligence Index עבור Lightning, קפיצה של תשע נקודות מהציון 15 שקיבל מודל ה-Nano הקודם. זה מציב אותו בדרגה דומה ל-gpt-oss-120b של OpenAI, למרות ש-Lightning משתמש בערך ברבע מכמות הפרמטרים. הוא עדיין מפגר אחרי המודלים המובילים — Muse Glimmer של Meta (35) ו-Qwen 3.6 35B A3B (32) — אך יחס האינטליגנציה לפרמטרים שלו מדורג בין הטובים ביותר.
מבחני ביצועים של סוכנים (Agentic benchmarks) מספרים סיפור דומה
עומסי עבודה של סוכנים (Agentic workloads) — תכנון, שימוש בכלים, הסקה רב-שלבית — הם המקום שבו Lightning זורח. במבחן GDPval-AA v2, המודל השיג דירוג Elo של 824, ועקף את ה-gpt-oss-120b בעל 120 מיליארד הפרמטרים (800) ואת Nemotron 3 Super הגדול יותר של Nvidia עצמה (698). במבחן Terminal-Bench v2.1, שיעור ההצלחה של Lightning עלה מ-7% ל-24.3%, כשהוא מתקרב ל-26.2% שנרשמו עבור gpt-oss-120b.
Nvidia ייחסה את שיתופי הפעולה שלאחר האימון (post-training) עם שותפים כמו CodeRabbit ו-Harvey לכיוונון המודל למשימות ספציפיות לתחום. שיפורים אלו שומרים על המודל מהיר תוך שמירה על תחרותיות בעומסי עבודה מתמחים.
זמינות ושיקולים מעשיים
המודל מופץ תחת רישיון OpenMDW-1.1 המקדם (permissive), עם משקולות בפורמטים BF16 ו-NVFP4. גרסת ה-NVFP4 דוחסת את המודל בצורה הדוקה יותר עם אובדן איכות מינימלי, אפשרות שימושית לפריסות קצה (edge deployments) או מופעי ענן רגישים לעלות. חלון הקשר (context window) של מיליון טוקנים מאפשר למודל לטפל בפרומפטים ארוכים מאוד ללא קיטוע, דבר בעל ערך לניתוח ברמת מסמך או לבסיסי קוד נרחבים.
הסקה ללא שרת (Serverless inference) כבר רצה אצל ספקים כגון DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius ו-Crusoe. מפתחים יכולים להתחיל להתנסות מבלי לבנות תשתית מותאמת אישית, אם כי כדאיות עלות אמיתית תלויה בתמחור של כל פלטפורמה.
בשורה התחתונה: Nemotron 3.5 Lightning מוכיח שמודל יכול להשתוות לרמת ההסקה של מערכות בעלות 120 מיליארד פרמטרים תוך אספקת כמעט פי שניים מקצב הטוקנים של המתחרים המובילים, מה שהופך אותו למועמד חזק עבור סוכני AI רגישים לשיהוי (latency).
