اجرای مدلهای بزرگ هوش مصنوعی در مقیاس وسیع، بیش از آنکه یک دستاورد علمی باشد، به یک مسئله ریاضی دشوار درباره قبضهای برق و اجاره مرکز داده تبدیل شده است. هر توکنی که Gemini تولید میکند، هزینهای واقعی برای گوگل دارد: چرخههای سیلیکون، پهنای باند حافظه و واتهای مصرفی از شبکه. با افزایش حجم پرسوجوها، کسری از یک سنت نیز به مبالغی تبدیل میشود که میتواند تمام حاشیه سود را ببلعد. همین فوریتِ خاموش، پشت پروژه Frozen v2 قرار دارد؛ یک پروژه داخلی برای ساخت تراشه سرور که اکنون در گوگل در حال شکلگیری است. شرکت به جای بهبود واحدهای پردازش تنسور (TPU) چندمنظوره خود برای نسل بعدی، در تلاش برای انجام کاری بسیار رادیکالتر است: ریختهگری اسکلت مدل Gemini مستقیماً در خودِ سیلیکون.
از شتابدهندههای منعطف تا سیلیکونِ مختص به مدل
تراشههای TPU گوگل نزدیک به یک دهه، اسبهای بارکش زیرساختهای این شرکت بودهاند. آنها مدلها را آموزش میدهند، به الگوریتمهای رتبهبندی جستجو قدرت میبخشند و حتی به صورت ساعتی به مشتریان ابری از جمله Meta و دیگرانی که به دنبال جایگزینی برای GPUهای Nvidia هستند، اجاره داده میشوند. همین تطبیقپذیری دقیقاً همان چیزی است که یک TPU را به TPU تبدیل میکند. این تراشه زبان عمومی ضرب ماتریسی و جابجایی حافظه را میگوید که تقریباً برای هر شبکه عصبی که بتوانید در نرمافزار توصیف کنید، قابل استفاده است.
Frozen v2 آگاهانه آن انعطافپذیری را فدا میکند. این تراشه به عنوان یک شتابدهنده مختص به دامنه (domain-specific) طراحی شده است که مدارهای آن به طور فیزیکی بخشهایی از معماری خودِ Gemini را منعکس میکنند. در حالی که یک TPU دستورالعملها را فراخوانی کرده و آنها را به عنوان عملیات نرمافزاری تفسیر میکند، Frozen v2 طرح اولیه ساختاری مدل — یعنی چیدمان لایهها و مسیرهای داده — را مستقیماً در ساختار تراشه حک میکند. گوگل انتظار دارد این پیوند تنگاتنگ میان مدل و فلز، کارایی تراشه را در ارائه پاسخهای هوش مصنوعی، شش تا ده برابر نسبت به TPUهای فعلی افزایش دهد. مراحل محاسباتی کمتر در هر پرسوجو به معنای زمان کمتر برای ظاهر شدن یک توکن و انرژی بسیار کمتر برای تولید آن است.
این صرفاً نسخه سریعتر از همان ایده قبلی نیست؛ بلکه دستهای متفاوت از تراشههاست، نوعی که کلیت را فدای وفاداری به یک خانواده مدل خاص میکند.
چرا اولین نسخه «Frozen» ذوب شد؟
این رویکرد ریشه در مفهوم قدیمیتری دارد که به جف دین (Jeff Dean)، دانشمند ارشد در Google DeepMind نسبت داده میشود. پیشنهاد اولیه «Frozen» پیشنهاد میکرد که تخصصگرایی حتی فراتر از این برود؛ به طوری که نه تنها معماری، بلکه وزنهای واقعی مدل — یعنی میلیاردها پارامتر تنظیمشدهای که رفتار آموختهشده Gemini را تشکیل میدهند — مستقیماً در خودِ تراشه کدگذاری شوند.
منطق آن درست بود. اگر دقیقاً میدانید مدل از چه اعدادی استفاده خواهد کرد، چرا باید آنها را از حافظه خارجی فراخوانی کنید؟ میتوانستید آنها را در ترانزیستورها حک کنید و کل دستههای تأخیر را حذف کنید.
مشکل، دائمی بودن بود. مدلهای هوش مصنوعی ثابت نمیمانند. گوگل Gemini را به طور مداوم بهروزرسانی میکند، روی دادههای جدید آموزش میدهد، پارامترها را تنظیم میکند و نسخههای بهبودیافته منتشر میکند. تراشهای با وزنهای منجمد شده در سیلیکون، به محض عرضه نسخه جدید مدل، به یک وزنه کاغذ تبدیل میشد. این عدم انعطافپذیری، مفهوم اولیه را از بین برد.
معماری بدون لنگر
Frozen v2 با کدگذاری سختافزاری معماری و آزاد گذاشتن وزنها برای تغییر، تلهی قدیمی شدن را حل میکند. آن را مانند ریختن یک پیست مسابقه اختصاصی تصور کنید، به جای اینکه ماشین را به جاده جوش دهید. شکل مدار ثابت میماند و برای الگوهای محاسباتی خاص Gemini بهینه شده است، اما محتوایی که از آن مدارها عبور میکند را میتوان با بارگذاری وزنهای جدید از حافظه، بهروز کرد.
این تمایز در عمل اهمیت دارد. وقتی مهندسان یک چکپوینت (checkpoint) جدید از Gemini را آموزش میدهند، میتوانند آن را بدون ساخت تراشه جدید، روی سختافزار Frozen v2 مستقر کنند. میزان دقیق کدگذاری سختافزاری هنوز یک سوال بیپاسخ در گوگل است؛ تیمها باید دقیقاً تصمیم بگیرند که کدام عناصر ساختاری شایسته جاودانگی در سیلیکون هستند و کدام باید قابل تنظیم باقی بمانند. اما اصل موضوع مشخص شده است. با منجمد کردن شکل و جایگزینی سیال پارامترها، گوگل مزیت کارایی را حفظ میکند بدون اینکه توانایی تکرار و بهبود را فدا کند.
اقتصادِ نگه داشتن آن در داخل شرکت
دلیل دیگری هم وجود دارد که چرا نام Frozen v2 را در لیست قیمتهای Google Cloud نخواهید دید. از آنجایی که این تراشه به شدت حول محور ساختار داخلی Gemini شکل گرفته است، استفاده از آن برای توسعهدهندگان خارجی که PyTorch یا انواع سفارشی Transformer را اجرا میکنند، منطقی نخواهد بود. گوگل برنامهای برای فروش آن به عنوان یک محصول چندمنظوره ندارد. این تراشه به عنوان یک ابزار داخلی باقی خواهد ماند که مستقیماً تقاضای خردکننده برای ظرفیت استنتاج (inference) در مراکز داده خودِ گوگل را هدف قرار میدهد.
این انتخاب بازتابدهنده یک واقعیت اقتصادی صریح است. در بازار فعلی هوش مصنوعی مولد، قابلیتهای مدلها به سرعت در حال همگرایی هستند. شکاف بین رقبا اغلب به این بستگی دارد که چه کسی میتواند بزرگترین مدل را با کمترین هزینه در هر توکن اجرا کند. استنتاج (Inference) دیگر موضوعی ثانویه پس از آموزش نیست؛ برای محصولی با کاربرد گسترده مانند Gemini، این بخش هزینه اصلی را به خود اختصاص میدهد. اگر Frozen v2 این هزینه را با ضریب ۶ یا بیشتر کاهش دهد، Google فضای مانور ایجاد میکند که رقبا به راحتی نمیتوانند با آن برابری کنند. این شرکت میتواند یا این صرفهجویی را به عنوان سود (margin) برای خود نگه دارد یا آن را در قالب قیمتهای پایینتر برای مصرفکنندگان API و ادغامهای محصول ارائه دهد و بدین ترتیب فشار را بر OpenAI، Anthropic و دیگران افزایش دهد.
این موضوع چه سیگنالی برای صنعت دارد
حرکت Google همچنین نشاندهنده جهتگیری استراتژی گستردهتر سختافزاری است. سالها، رویکرد استاندارد این بود که منعطفترین شتابدهنده ممکن ساخته شود و تخصصیافتگی بر عهده نرمافزار گذاشته شود. GPUهای Nvidia بازار را در اختیار دارند زیرا همه چیز، از دینامیک مولکولی گرفته تا بازیهای ویدئویی و مدلهای زبانی بزرگ را اجرا میکنند. TPUهای خودِ Google نیز با همین روحیه کاربرد گسترده طراحی شده بودند.
Frozen v2 از این سنت فاصله میگیرد. این اعترافی است به اینکه وقتی یک خانواده مدل واحد، حجم درخواست (query) کافی ایجاد میکند، سیلیکون سفارشیسازیشده برای آن مدل میتواند چندین برابر هزینه خود را جبران کند. سایر ابرمقیاسداران (hyperscalers) نیز منطق مشابهی را دنبال کردهاند — برای مثال تراشههای Trainium و Inferentia شرکت Amazon — اما رویکرد Google با طراحی مشترک سختافزار حول یک معماری مدل خاص، به جای یک کلاس عمومی از شبکهها، عمیقتر است.
البته ریسک کار، صلب بودن (rigidity) است. اگر معماری Gemini در جهتی تکامل یابد که مدارهای سختافزاری نتوانند آن را پوشش دهند، Google ممکن است با سیلیکون گرانقیمتی مواجه شود که قادر به اجرای جدیدترین ایدههای آن نیست. دقیقاً به همین دلیل است که مصالحه «فقط معماری» اهمیت دارد. این رویکرد یک راه میانه ارائه میدهد: تخصص کافی برای دستیابی به بهبودهای چشمگیر در کارایی، و انعطافپذیری کافی برای جلوگیری از قرار دادن شرکت در بنبست.
نتیجهگیری اصلی
Frozen v2 را بهتر است نه به عنوان معرفی یک تراشه، بلکه به عنوان یک شرطبندی استراتژیک روی شکل آینده رقابت در هوش مصنوعی درک کرد. Google شرط میبندد که برندگان صرفاً بهترین مدلها را نخواهند ساخت، بلکه مالک کل پشته (stack) خواهند بود؛ از نقشه مدل گرفته تا الکترونهایی که از ترانزیستور عبور میکنند. اگر این پروژه موفق شود، نتیجه آن در امتیازهای بنچمارک ظاهر نخواهد شد، بلکه در ستون هزینههای گزارش سود و زیان فصلی ظاهر خواهد شد، جایی که صرفهجویی چند سنتی در هر میلیون توکن میتواند مرزهای آنچه در هوش مصنوعی مولد از نظر تجاری امکانپذیر است را بازتعریف کند.
