DeepMind این هفته از DiffusionGemma رونمایی کرد، یک مدل زبانی با وزنهای باز (open-weight) که میتواند تقریباً ۱۵۰۰ توکن در ثانیه را روی یک پردازنده گرافیکی H100 تولید کند، در حالی که مدل استاندارد Gemma 4 حداکثر حدود ۳۰۳ توکن در ثانیه را ثبت میکند. این افزایش سرعت اهمیت دارد زیرا میتواند گلوگاه تأخیر (latency bottleneck) را که باعث کندی عاملهای مبتنی بر هوش مصنوعی در کاربردهای بلادرنگ (real-time) میشود، کاهش دهد.
چگونه DiffusionGemma عادت تولید توکنبهتوکن را میشکند
اکثر مدلهای زبانی مدرن متن را به صورت خودبازگشت (autoregressively) تولید میکنند: آنها یک توکن را پیشبینی میکنند، آن را دوباره به مدل میدهند و سپس توکن بعدی را پیشبینی میکنند. این حلقه «از چپ به راست» باعث ایجاد یک پیوند تنگاتنگ بین محاسبات و حافظه میشود، زیرا وزنهای مدل باید برای هر توکن به طور جداگانه فراخوانی شوند. DiffusionGemma این حلقه را با یک فرآیند انتشار گسسته (discrete diffusion process) جایگزین میکند که یک قطعه ۲۵۶ توکنی را به عنوان یک بلوک واحد از دادههای نویزدار در نظر میگیرد. سپس مدل کل بلوک را به صورت موازی نویززدایی (denoise) میکند و بار کاری را از جستجوهای مکرر وزنها به مقدار بیشتری از محاسبات در هر مرحله منتقل میکند. در سختافزارهایی که در محاسبات موازی برتری دارند، مانند Nvidia H100، این سبک از موازنه (trade-off) سودآور است.
چرا سرعت برای عاملهای هوش مصنوعی مهم است
عاملهای خودمختار معمولاً چرخهای از جستجو، خلاصهسازی و آزمایش را اجرا میکنند. هر مرحله ممکن است شامل چندین فراخوانی مدل باشد، بنابراین هرگونه تأخیر در هر توکن به سرعت انباشته میشود. وقتی یک مدل متوقف میشود، کل خط لوله (pipeline) عامل دچار پشت سر هم قرار گرفتن درخواستها میشود که باعث افزایش هزینهها و کاهش تجربه کاربری میگردد.
موازنه عملکرد
سرعت DiffusionGemma با هزینهای قابل اندازهگیری در توانایی خام همراه است. در بنچمارک AIME — مجموعهای که استدلال، واقعگرایی و درک زبان را میسنجد — DiffusionGemma امتیاز ۶۹.۱ را کسب میکند، در حالی که Gemma 4 به ۸۸.۳ میرسد. رویکرد انتشار همچنین نقاط ضعفی در خروجیهای بسیار کوتاه و گاهی اوقات «تپق زدن» (stuttering) توکنها نشان میدهد، که در آن متن تولید شده تکرار میشود یا دچار تردید میگردد. زمانی که بیش از حدود ۳۲ کاربر به طور همزمان از مدل پرسوجو میکنند، مزیت موازی بودن از بین میرود و روش خودبازگشت استاندارد در توان عملیاتی (throughput) کلی با آن برابری میکند.
کاربرد هر رویکرد
دادهها یک استراتژی استقرار ترکیبی را پیشنهاد میکنند:
- مدلهای انتشار (Diffusion models) برای وظایف با همزمانی (concurrency) پایین و حساس به تأخیر که نیازی به استدلال عمیق ندارند — مثلاً تولید پرامپتهای کوتاه، پر کردن قالبها یا تولید متن پیشنویس.
- مدلهای خودبازگشت (Autoregressive models) برای حجم کاری با همزمانی بالا، استدلال پیچیده یا تولید متنهای طولانی که در آنها دقت بر سرعت خام اولویت دارد.
این تغییر چه معنایی برای زیرساخت هوش مصنوعی دارد
اگر بتوان با بازنگری در الگوریتم تولید، به جای صرفاً افزایش اندازه مدل، به دستاوردهای سرعتی دست یافت، بزرگترین پیروزیهای کارایی ممکن است از بهبودهای «زیرساختی» (plumbing) حاصل شود. این موازنه همچنین به این معناست که توسعهدهندگان باید کاهش اندک کیفیت را در برخی موارد استفاده بپذیرند.
دیدگاه مقابل: آیا انتشار برای استفاده گسترده آماده است؟
پیادهسازی انتشار با پرامپتهای کوتاه مشکل دارد و میتواند خروجیهای لرزان (jittery) تولید کند.
آنچه باید در آینده زیر نظر داشت
- مطالعات مقیاسپذیری: آیا مدلهای انتشار بزرگتر میتوانند شکاف توانایی را بدون از دست دادن سرعت پر کنند؟
- بهینهسازیهای سختافزاری: با تکامل پردازندههای گرافیکی، تعادل بین مراحل انتشارِ محاسباتمحور و خودبازگشتِ وزنمحور میتواند دوباره تغییر کند.
- الگوریتمهای مسیریابی: نمونههای اولیه مسیریابهای مدلِ آگاه از وظیفه (task-aware model routers) نشان خواهند داد که با انتخاب پویا، چقدر میتوان تأخیر کلی سیستم را کاهش داد.
نتیجهگیری
DiffusionGemma ثابت میکند که بازنگری در حلقه اصلی تولید میتواند بدون افزودن تراشههای بیشتر، تأخیر را به شدت کاهش دهد. این فناوری جایگزین کامل مدلهای خودبازگشت نیست، اما ابزاری جذاب برای یک پشته (stack) هوش مصنوعی ترکیبی ارائه میدهد که در آن سرعت و دقت بر اساس هر وظیفه متعادل میشوند. موج بعدی زیرساختهای هوش مصنوعی احتمالاً نه تنها بر اساس اندازه مدل، بلکه بر اساس میزان هوشمندی در مسیریابی کارها از طریق موتور مناسب سنجیده خواهد شد.
