گوگل در چند هفته گذشته با ارائه پیام واضحی، مجموعه Gemini خود را تکمیل کرده است: سرعت و تخصص به اندازه قدرت خام اهمیت دارند. این شرکت سه نسخه جدید Flash را عرضه کرد که هر کدام برای بخش متفاوتی از بازار توسعه‌دهندگان تنظیم شده‌اند. با این حال، با وجود این شتاب، هنوز یک جای خالی در این میز احساس می‌شود. مدل پرچم‌دار Gemini 3.5 Pro هنوز در دسترس عموم قرار نگرفته و رقبا منتظر نمانده‌اند.

Gemini 3.6 Flash: جایگزینی قدرت خام با صرفه‌جویی اقتصادی

محور اصلی این معرفی، Gemini 3.6 Flash است. گوگل این مدل را برای ایجاد تعادلی طراحی کرده است که بسیاری از توسعه‌دهندگان با کمال میل آن را می‌پذیرند. این مدل عملکرد خام در اوج را فدای بهبودهای چشمگیر در سرعت و هزینه می‌کند. برای تیم‌هایی که عامل‌های خودمختار (autonomous agents)، APIهای با توان عملیاتی بالا یا خطوط تولید محتوای مقیاس‌بزرگ را مدیریت می‌کنند، این سبک از تعادل اغلب مرز بین یک محصول سودآور و یک محصول آزمایشی است.

دستاوردهای بهره‌وری ملموس هستند. طبق شاخص Artificial Analysis، انتظار می‌رود 3.6 Flash تقریباً ۱۷ درصد توکن خروجی کمتری نسبت به نسخه قبلی خود، یعنی 3.5 Flash، مصرف کند. در بنچمارک‌های هدفمند مانند DeepSWE، گوگل ادعا می‌کند که صرفه‌جویی در توکن‌ها می‌تواند تا ۶۵ درصد افزایش یابد. وقتی برای هر توکن هزینه پرداخت می‌کنید و روزانه میلیون‌ها درخواست را پردازش می‌کنید، این درصدها مستقیماً به بودجه تبدیل می‌شوند.

قیمت‌گذاری نیز نشان‌دهنده این تمرکز بر دسترسی‌پذیری است. هزینه توکن‌های ورودی ۱.۵۰ دلار به ازای هر میلیون توکن و هزینه توکن‌های خروجی ۷.۵۰ دلار به ازای هر میلیون توکن است. یک عامل پشتیبانی مشتری یا یک دستیار بازبینی کد که در هر ساعت هزاران تعامل را انجام می‌دهد، در این سطح بسیار کمتر از یک مدل پرچم‌دار هزینه خواهد کرد. استارتاپ‌های کوچک‌تر و توسعه‌دهندگان مستقل شانس واقعی برای ساخت جریان‌های کاری مبتنی بر عامل (agentic workflows) بدون تمام کردن اعتبارهای ابری خود در عرض یک هفته را دارند.

این مدل صرفاً ارزان‌تر نیست؛ بلکه در کارهای مبتنی بر عامل (agentic work) نیز به وضوح هوشمندتر شده است. در MLE Bench، امتیازها از ۴۹.۷ درصد به ۶۳.۹ درصد رسید. امتیاز OSWorld-Verified نیز از ۷۸.۴ درصد به ۸۳ درصد جهش کرد. این‌ها پیشرفت‌های جزئی نیستند؛ بلکه نشان می‌دهند که 3.6 Flash می‌تواند وظایف چندمرحله‌ای را با قابلیت اطمینان بسیار بیشتری نسبت به نسخه قبلی خود برنامه‌ریزی، عیب‌یابی و اجرا کند. اگر در حال ساخت یک دستیار پژوهشی خودمختار یا یک عامل استقرار (deployment agent) هستید، این توانمندی اضافی بیش از قدرت تئوریک در سطح بالا اهمیت دارد.

متخصص‌ها: Flash-Lite و Flash Cyber

اگر 3.6 Flash یک مدل همه‌فن‌حریف جدید است، دو نسخه دیگر با تمرکزی دقیق، چالش‌های خاصی را هدف قرار می‌دهند.

Gemini 3.5 Flash-Lite برای سرعت خالص ساخته شده است. این مدل ۳۵۰ توکن خروجی در ثانیه تولید می‌کند و هزینه آن تنها ۰.۳۰ دلار به ازای هر میلیون توکن ورودی است. نمی‌توان از این قیمت چشم‌پوشی کرد. شما می‌توانید رابط‌های چت بلادرنگ، خطوط طبقه‌بندی یا وظایف استخراج داده با حجم بالا را بدون نگرانی از اینکه هزینه استنتاج (inference bill) از درآمدتان پیشی بگیرد، اجرا کنید.

آنچه Flash-Lite را به‌طور خاص جالب می‌کند این است که گاهی اوقات فراتر از توان انتظار خود ظاهر می‌شود. گوگل خاطرنشان می‌کند که این مدل در برخی وظایف مهندسی نرم‌افزار مبتنی بر عامل و استفاده از کامپیوتر، از مدل بزرگ‌تر Gemini 3 Flash پیشی می‌گیرد. صنعت سال‌ها بر این فرض بوده که بزرگ‌تر همیشه بهتر است. Flash-Lite با اثبات اینکه یک مدل کوچک‌تر و بهینه‌سازی شده می‌تواند در وظایف خاص از یک مدل عمومی بزرگ‌تر بهتر عمل کند، این ایده را به چالش می‌کشد. برای مهندسانی که مدلی را برای یک وظیفه تولیدی محدود انتخاب می‌کنند، این داستانِ بهینه‌سازی بسیار متقاعدکننده است.

سپس Gemini 3.5 Flash Cyber را داریم. این یک چت‌بات عمومی نیست؛ بلکه یک متخصص امنیت است که مستقیماً در عامل CodeMender گوگل ادغام شده و به‌طور ویژه برای جریان‌های کاری امنیت سایبری تنظیم شده است. در بنچمارک CyberGym، این مدل امتیاز ۸۳.۲ درصد را کسب کرد. این امتیاز آن را در فاصله بسیار نزدیکی از