اجرای مدل‌های بزرگ هوش مصنوعی در مقیاس وسیع، بیش از آنکه یک دستاورد علمی باشد، به یک مسئله ریاضی دشوار درباره قبض‌های برق و اجاره مرکز داده تبدیل شده است. هر توکنی که Gemini تولید می‌کند، هزینه‌ای واقعی برای گوگل دارد: چرخه‌های سیلیکون، پهنای باند حافظه و وات‌های مصرفی از شبکه. با افزایش حجم پرس‌وجوها، کسری از یک سنت نیز به مبالغی تبدیل می‌شود که می‌تواند تمام حاشیه سود را ببلعد. همین فوریتِ خاموش، پشت پروژه Frozen v2 قرار دارد؛ یک پروژه داخلی برای ساخت تراشه سرور که اکنون در گوگل در حال شکل‌گیری است. شرکت به جای بهبود واحدهای پردازش تنسور (TPU) چندمنظوره خود برای نسل بعدی، در تلاش برای انجام کاری بسیار رادیکال‌تر است: ریخته‌گری اسکلت مدل Gemini مستقیماً در خودِ سیلیکون.

از شتاب‌دهنده‌های منعطف تا سیلیکونِ مختص به مدل

تراشه‌های TPU گوگل نزدیک به یک دهه، اسب‌های بارکش زیرساخت‌های این شرکت بوده‌اند. آن‌ها مدل‌ها را آموزش می‌دهند، به الگوریتم‌های رتبه‌بندی جستجو قدرت می‌بخشند و حتی به صورت ساعتی به مشتریان ابری از جمله Meta و دیگرانی که به دنبال جایگزینی برای GPUهای Nvidia هستند، اجاره داده می‌شوند. همین تطبیق‌پذیری دقیقاً همان چیزی است که یک TPU را به TPU تبدیل می‌کند. این تراشه زبان عمومی ضرب ماتریسی و جابجایی حافظه را می‌گوید که تقریباً برای هر شبکه عصبی که بتوانید در نرم‌افزار توصیف کنید، قابل استفاده است.

Frozen v2 آگاهانه آن انعطاف‌پذیری را فدا می‌کند. این تراشه به عنوان یک شتاب‌دهنده مختص به دامنه (domain-specific) طراحی شده است که مدارهای آن به طور فیزیکی بخش‌هایی از معماری خودِ Gemini را منعکس می‌کنند. در حالی که یک TPU دستورالعمل‌ها را فراخوانی کرده و آن‌ها را به عنوان عملیات نرم‌افزاری تفسیر می‌کند، Frozen v2 طرح اولیه ساختاری مدل — یعنی چیدمان لایه‌ها و مسیرهای داده — را مستقیماً در ساختار تراشه حک می‌کند. گوگل انتظار دارد این پیوند تنگاتنگ میان مدل و فلز، کارایی تراشه را در ارائه پاسخ‌های هوش مصنوعی، شش تا ده برابر نسبت به TPUهای فعلی افزایش دهد. مراحل محاسباتی کمتر در هر پرس‌وجو به معنای زمان کمتر برای ظاهر شدن یک توکن و انرژی بسیار کمتر برای تولید آن است.

این صرفاً نسخه سریع‌تر از همان ایده قبلی نیست؛ بلکه دسته‌ای متفاوت از تراشه‌هاست، نوعی که کلیت را فدای وفاداری به یک خانواده مدل خاص می‌کند.

چرا اولین نسخه «Frozen» ذوب شد؟

این رویکرد ریشه در مفهوم قدیمی‌تری دارد که به جف دین (Jeff Dean)، دانشمند ارشد در Google DeepMind نسبت داده می‌شود. پیشنهاد اولیه «Frozen» پیشنهاد می‌کرد که تخصص‌گرایی حتی فراتر از این برود؛ به طوری که نه تنها معماری، بلکه وزن‌های واقعی مدل — یعنی میلیاردها پارامتر تنظیم‌شده‌ای که رفتار آموخته‌شده Gemini را تشکیل می‌دهند — مستقیماً در خودِ تراشه کدگذاری شوند.

منطق آن درست بود. اگر دقیقاً می‌دانید مدل از چه اعدادی استفاده خواهد کرد، چرا باید آن‌ها را از حافظه خارجی فراخوانی کنید؟ می‌توانستید آن‌ها را در ترانزیستورها حک کنید و کل دسته‌های تأخیر را حذف کنید.

مشکل، دائمی بودن بود. مدل‌های هوش مصنوعی ثابت نمی‌مانند. گوگل Gemini را به طور مداوم به‌روزرسانی می‌کند، روی داده‌های جدید آموزش می‌دهد، پارامترها را تنظیم می‌کند و نسخه‌های بهبودیافته منتشر می‌کند. تراشه‌ای با وزن‌های منجمد شده در سیلیکون، به محض عرضه نسخه جدید مدل، به یک وزنه کاغذ تبدیل می‌شد. این عدم انعطاف‌پذیری، مفهوم اولیه را از بین برد.

معماری بدون لنگر

Frozen v2 با کدگذاری سخت‌افزاری معماری و آزاد گذاشتن وزن‌ها برای تغییر، تله‌ی قدیمی شدن را حل می‌کند. آن را مانند ریختن یک پیست مسابقه اختصاصی تصور کنید، به جای اینکه ماشین را به جاده جوش دهید. شکل مدار ثابت می‌ماند و برای الگوهای محاسباتی خاص Gemini بهینه شده است، اما محتوایی که از آن مدارها عبور می‌کند را می‌توان با بارگذاری وزن‌های جدید از حافظه، به‌روز کرد.

این تمایز در عمل اهمیت دارد. وقتی مهندسان یک چک‌پوینت (checkpoint) جدید از Gemini را آموزش می‌دهند، می‌توانند آن را بدون ساخت تراشه جدید، روی سخت‌افزار Frozen v2 مستقر کنند. میزان دقیق کدگذاری سخت‌افزاری هنوز یک سوال بی‌پاسخ در گوگل است؛ تیم‌ها باید دقیقاً تصمیم بگیرند که کدام عناصر ساختاری شایسته جاودانگی در سیلیکون هستند و کدام باید قابل تنظیم باقی بمانند. اما اصل موضوع مشخص شده است. با منجمد کردن شکل و جایگزینی سیال پارامترها، گوگل مزیت کارایی را حفظ می‌کند بدون اینکه توانایی تکرار و بهبود را فدا کند.

اقتصادِ نگه داشتن آن در داخل شرکت

دلیل دیگری هم وجود دارد که چرا نام Frozen v2 را در لیست قیمت‌های Google Cloud نخواهید دید. از آنجایی که این تراشه به شدت حول محور ساختار داخلی Gemini شکل گرفته است، استفاده از آن برای توسعه‌دهندگان خارجی که PyTorch یا انواع سفارشی Transformer را اجرا می‌کنند، منطقی نخواهد بود. گوگل برنامه‌ای برای فروش آن به عنوان یک محصول چندمنظوره ندارد. این تراشه به عنوان یک ابزار داخلی باقی خواهد ماند که مستقیماً تقاضای خردکننده برای ظرفیت استنتاج (inference) در مراکز داده خودِ گوگل را هدف قرار می‌دهد.

این انتخاب بازتاب‌دهنده یک واقعیت اقتصادی صریح است. در بازار فعلی هوش مصنوعی مولد، قابلیت‌های مدل‌ها به سرعت در حال همگرایی هستند. شکاف بین رقبا اغلب به این بستگی دارد که چه کسی می‌تواند بزرگ‌ترین مدل را با کمترین هزینه در هر توکن اجرا کند. استنتاج (Inference) دیگر موضوعی ثانویه پس از آموزش نیست؛ برای محصولی با کاربرد گسترده مانند Gemini، این بخش هزینه اصلی را به خود اختصاص می‌دهد. اگر Frozen v2 این هزینه را با ضریب ۶ یا بیشتر کاهش دهد، Google فضای مانور ایجاد می‌کند که رقبا به راحتی نمی‌توانند با آن برابری کنند. این شرکت می‌تواند یا این صرفه‌جویی را به عنوان سود (margin) برای خود نگه دارد یا آن را در قالب قیمت‌های پایین‌تر برای مصرف‌کنندگان API و ادغام‌های محصول ارائه دهد و بدین ترتیب فشار را بر OpenAI، Anthropic و دیگران افزایش دهد.

این موضوع چه سیگنالی برای صنعت دارد

حرکت Google همچنین نشان‌دهنده جهت‌گیری استراتژی گسترده‌تر سخت‌افزاری است. سال‌ها، رویکرد استاندارد این بود که منعطف‌ترین شتاب‌دهنده ممکن ساخته شود و تخصص‌یافتگی بر عهده نرم‌افزار گذاشته شود. GPUهای Nvidia بازار را در اختیار دارند زیرا همه چیز، از دینامیک مولکولی گرفته تا بازی‌های ویدئویی و مدل‌های زبانی بزرگ را اجرا می‌کنند. TPUهای خودِ Google نیز با همین روحیه کاربرد گسترده طراحی شده بودند.

Frozen v2 از این سنت فاصله می‌گیرد. این اعترافی است به اینکه وقتی یک خانواده مدل واحد، حجم درخواست (query) کافی ایجاد می‌کند، سیلیکون سفارشی‌سازی‌شده برای آن مدل می‌تواند چندین برابر هزینه خود را جبران کند. سایر ابرمقیاس‌داران (hyperscalers) نیز منطق مشابهی را دنبال کرده‌اند — برای مثال تراشه‌های Trainium و Inferentia شرکت Amazon — اما رویکرد Google با طراحی مشترک سخت‌افزار حول یک معماری مدل خاص، به جای یک کلاس عمومی از شبکه‌ها، عمیق‌تر است.

البته ریسک کار، صلب بودن (rigidity) است. اگر معماری Gemini در جهتی تکامل یابد که مدارهای سخت‌افزاری نتوانند آن را پوشش دهند، Google ممکن است با سیلیکون گران‌قیمتی مواجه شود که قادر به اجرای جدیدترین ایده‌های آن نیست. دقیقاً به همین دلیل است که مصالحه «فقط معماری» اهمیت دارد. این رویکرد یک راه میانه ارائه می‌دهد: تخصص کافی برای دستیابی به بهبودهای چشمگیر در کارایی، و انعطاف‌پذیری کافی برای جلوگیری از قرار دادن شرکت در بن‌بست.

نتیجه‌گیری اصلی

Frozen v2 را بهتر است نه به عنوان معرفی یک تراشه، بلکه به عنوان یک شرط‌بندی استراتژیک روی شکل آینده رقابت در هوش مصنوعی درک کرد. Google شرط می‌بندد که برندگان صرفاً بهترین مدل‌ها را نخواهند ساخت، بلکه مالک کل پشته (stack) خواهند بود؛ از نقشه مدل گرفته تا الکترون‌هایی که از ترانزیستور عبور می‌کنند. اگر این پروژه موفق شود، نتیجه آن در امتیازهای بنچمارک ظاهر نخواهد شد، بلکه در ستون هزینه‌های گزارش سود و زیان فصلی ظاهر خواهد شد، جایی که صرفه‌جویی چند سنتی در هر میلیون توکن می‌تواند مرزهای آنچه در هوش مصنوعی مولد از نظر تجاری امکان‌پذیر است را بازتعریف کند.