DeepMind این هفته از DiffusionGemma رونمایی کرد، یک مدل زبانی با وزن‌های باز (open-weight) که می‌تواند تقریباً ۱۵۰۰ توکن در ثانیه را روی یک پردازنده گرافیکی H100 تولید کند، در حالی که مدل استاندارد Gemma 4 حداکثر حدود ۳۰۳ توکن در ثانیه را ثبت می‌کند. این افزایش سرعت اهمیت دارد زیرا می‌تواند گلوگاه تأخیر (latency bottleneck) را که باعث کندی عامل‌های مبتنی بر هوش مصنوعی در کاربردهای بلادرنگ (real-time) می‌شود، کاهش دهد.

چگونه DiffusionGemma عادت تولید توکن‌به‌توکن را می‌شکند

اکثر مدل‌های زبانی مدرن متن را به صورت خودبازگشت (autoregressively) تولید می‌کنند: آن‌ها یک توکن را پیش‌بینی می‌کنند، آن را دوباره به مدل می‌دهند و سپس توکن بعدی را پیش‌بینی می‌کنند. این حلقه «از چپ به راست» باعث ایجاد یک پیوند تنگاتنگ بین محاسبات و حافظه می‌شود، زیرا وزن‌های مدل باید برای هر توکن به طور جداگانه فراخوانی شوند. DiffusionGemma این حلقه را با یک فرآیند انتشار گسسته (discrete diffusion process) جایگزین می‌کند که یک قطعه ۲۵۶ توکنی را به عنوان یک بلوک واحد از داده‌های نویزدار در نظر می‌گیرد. سپس مدل کل بلوک را به صورت موازی نویززدایی (denoise) می‌کند و بار کاری را از جستجوهای مکرر وزن‌ها به مقدار بیشتری از محاسبات در هر مرحله منتقل می‌کند. در سخت‌افزارهایی که در محاسبات موازی برتری دارند، مانند Nvidia H100، این سبک از موازنه (trade-off) سودآور است.

چرا سرعت برای عامل‌های هوش مصنوعی مهم است

عامل‌های خودمختار معمولاً چرخه‌ای از جستجو، خلاصه‌سازی و آزمایش را اجرا می‌کنند. هر مرحله ممکن است شامل چندین فراخوانی مدل باشد، بنابراین هرگونه تأخیر در هر توکن به سرعت انباشته می‌شود. وقتی یک مدل متوقف می‌شود، کل خط لوله (pipeline) عامل دچار پشت سر هم قرار گرفتن درخواست‌ها می‌شود که باعث افزایش هزینه‌ها و کاهش تجربه کاربری می‌گردد.

موازنه عملکرد

سرعت DiffusionGemma با هزینه‌ای قابل اندازه‌گیری در توانایی خام همراه است. در بنچمارک AIME — مجموعه‌ای که استدلال، واقع‌گرایی و درک زبان را می‌سنجد — DiffusionGemma امتیاز ۶۹.۱ را کسب می‌کند، در حالی که Gemma 4 به ۸۸.۳ می‌رسد. رویکرد انتشار همچنین نقاط ضعفی در خروجی‌های بسیار کوتاه و گاهی اوقات «تپق زدن» (stuttering) توکن‌ها نشان می‌دهد، که در آن متن تولید شده تکرار می‌شود یا دچار تردید می‌گردد. زمانی که بیش از حدود ۳۲ کاربر به طور همزمان از مدل پرس‌وجو می‌کنند، مزیت موازی بودن از بین می‌رود و روش خودبازگشت استاندارد در توان عملیاتی (throughput) کلی با آن برابری می‌کند.

کاربرد هر رویکرد

داده‌ها یک استراتژی استقرار ترکیبی را پیشنهاد می‌کنند:

  • مدل‌های انتشار (Diffusion models) برای وظایف با همزمانی (concurrency) پایین و حساس به تأخیر که نیازی به استدلال عمیق ندارند — مثلاً تولید پرامپت‌های کوتاه، پر کردن قالب‌ها یا تولید متن پیش‌نویس.
  • مدل‌های خودبازگشت (Autoregressive models) برای حجم کاری با همزمانی بالا، استدلال پیچیده یا تولید متن‌های طولانی که در آن‌ها دقت بر سرعت خام اولویت دارد.

این تغییر چه معنایی برای زیرساخت هوش مصنوعی دارد

اگر بتوان با بازنگری در الگوریتم تولید، به جای صرفاً افزایش اندازه مدل، به دستاوردهای سرعتی دست یافت، بزرگترین پیروزی‌های کارایی ممکن است از بهبودهای «زیرساختی» (plumbing) حاصل شود. این موازنه همچنین به این معناست که توسعه‌دهندگان باید کاهش اندک کیفیت را در برخی موارد استفاده بپذیرند.

دیدگاه مقابل: آیا انتشار برای استفاده گسترده آماده است؟

پیاده‌سازی انتشار با پرامپت‌های کوتاه مشکل دارد و می‌تواند خروجی‌های لرزان (jittery) تولید کند.

آنچه باید در آینده زیر نظر داشت

  • مطالعات مقیاس‌پذیری: آیا مدل‌های انتشار بزرگ‌تر می‌توانند شکاف توانایی را بدون از دست دادن سرعت پر کنند؟
  • بهینه‌سازی‌های سخت‌افزاری: با تکامل پردازنده‌های گرافیکی، تعادل بین مراحل انتشارِ محاسبات‌محور و خودبازگشتِ وزن‌محور می‌تواند دوباره تغییر کند.
  • الگوریتم‌های مسیریابی: نمونه‌های اولیه مسیریاب‌های مدلِ آگاه از وظیفه (task-aware model routers) نشان خواهند داد که با انتخاب پویا، چقدر می‌توان تأخیر کلی سیستم را کاهش داد.

نتیجه‌گیری

DiffusionGemma ثابت می‌کند که بازنگری در حلقه اصلی تولید می‌تواند بدون افزودن تراشه‌های بیشتر، تأخیر را به شدت کاهش دهد. این فناوری جایگزین کامل مدل‌های خودبازگشت نیست، اما ابزاری جذاب برای یک پشته (stack) هوش مصنوعی ترکیبی ارائه می‌دهد که در آن سرعت و دقت بر اساس هر وظیفه متعادل می‌شوند. موج بعدی زیرساخت‌های هوش مصنوعی احتمالاً نه تنها بر اساس اندازه مدل، بلکه بر اساس میزان هوشمندی در مسیریابی کارها از طریق موتور مناسب سنجیده خواهد شد.