گوگل در چند هفته گذشته با ارائه پیام واضحی، مجموعه Gemini خود را تکمیل کرده است: سرعت و تخصص به اندازه قدرت خام اهمیت دارند. این شرکت سه نسخه جدید Flash را عرضه کرد که هر کدام برای بخش متفاوتی از بازار توسعهدهندگان تنظیم شدهاند. با این حال، با وجود این شتاب، هنوز یک جای خالی در این میز احساس میشود. مدل پرچمدار Gemini 3.5 Pro هنوز در دسترس عموم قرار نگرفته و رقبا منتظر نماندهاند.
Gemini 3.6 Flash: جایگزینی قدرت خام با صرفهجویی اقتصادی
محور اصلی این معرفی، Gemini 3.6 Flash است. گوگل این مدل را برای ایجاد تعادلی طراحی کرده است که بسیاری از توسعهدهندگان با کمال میل آن را میپذیرند. این مدل عملکرد خام در اوج را فدای بهبودهای چشمگیر در سرعت و هزینه میکند. برای تیمهایی که عاملهای خودمختار (autonomous agents)، APIهای با توان عملیاتی بالا یا خطوط تولید محتوای مقیاسبزرگ را مدیریت میکنند، این سبک از تعادل اغلب مرز بین یک محصول سودآور و یک محصول آزمایشی است.
دستاوردهای بهرهوری ملموس هستند. طبق شاخص Artificial Analysis، انتظار میرود 3.6 Flash تقریباً ۱۷ درصد توکن خروجی کمتری نسبت به نسخه قبلی خود، یعنی 3.5 Flash، مصرف کند. در بنچمارکهای هدفمند مانند DeepSWE، گوگل ادعا میکند که صرفهجویی در توکنها میتواند تا ۶۵ درصد افزایش یابد. وقتی برای هر توکن هزینه پرداخت میکنید و روزانه میلیونها درخواست را پردازش میکنید، این درصدها مستقیماً به بودجه تبدیل میشوند.
قیمتگذاری نیز نشاندهنده این تمرکز بر دسترسیپذیری است. هزینه توکنهای ورودی ۱.۵۰ دلار به ازای هر میلیون توکن و هزینه توکنهای خروجی ۷.۵۰ دلار به ازای هر میلیون توکن است. یک عامل پشتیبانی مشتری یا یک دستیار بازبینی کد که در هر ساعت هزاران تعامل را انجام میدهد، در این سطح بسیار کمتر از یک مدل پرچمدار هزینه خواهد کرد. استارتاپهای کوچکتر و توسعهدهندگان مستقل شانس واقعی برای ساخت جریانهای کاری مبتنی بر عامل (agentic workflows) بدون تمام کردن اعتبارهای ابری خود در عرض یک هفته را دارند.
این مدل صرفاً ارزانتر نیست؛ بلکه در کارهای مبتنی بر عامل (agentic work) نیز به وضوح هوشمندتر شده است. در MLE Bench، امتیازها از ۴۹.۷ درصد به ۶۳.۹ درصد رسید. امتیاز OSWorld-Verified نیز از ۷۸.۴ درصد به ۸۳ درصد جهش کرد. اینها پیشرفتهای جزئی نیستند؛ بلکه نشان میدهند که 3.6 Flash میتواند وظایف چندمرحلهای را با قابلیت اطمینان بسیار بیشتری نسبت به نسخه قبلی خود برنامهریزی، عیبیابی و اجرا کند. اگر در حال ساخت یک دستیار پژوهشی خودمختار یا یک عامل استقرار (deployment agent) هستید، این توانمندی اضافی بیش از قدرت تئوریک در سطح بالا اهمیت دارد.
متخصصها: Flash-Lite و Flash Cyber
اگر 3.6 Flash یک مدل همهفنحریف جدید است، دو نسخه دیگر با تمرکزی دقیق، چالشهای خاصی را هدف قرار میدهند.
Gemini 3.5 Flash-Lite برای سرعت خالص ساخته شده است. این مدل ۳۵۰ توکن خروجی در ثانیه تولید میکند و هزینه آن تنها ۰.۳۰ دلار به ازای هر میلیون توکن ورودی است. نمیتوان از این قیمت چشمپوشی کرد. شما میتوانید رابطهای چت بلادرنگ، خطوط طبقهبندی یا وظایف استخراج داده با حجم بالا را بدون نگرانی از اینکه هزینه استنتاج (inference bill) از درآمدتان پیشی بگیرد، اجرا کنید.
آنچه Flash-Lite را بهطور خاص جالب میکند این است که گاهی اوقات فراتر از توان انتظار خود ظاهر میشود. گوگل خاطرنشان میکند که این مدل در برخی وظایف مهندسی نرمافزار مبتنی بر عامل و استفاده از کامپیوتر، از مدل بزرگتر Gemini 3 Flash پیشی میگیرد. صنعت سالها بر این فرض بوده که بزرگتر همیشه بهتر است. Flash-Lite با اثبات اینکه یک مدل کوچکتر و بهینهسازی شده میتواند در وظایف خاص از یک مدل عمومی بزرگتر بهتر عمل کند، این ایده را به چالش میکشد. برای مهندسانی که مدلی را برای یک وظیفه تولیدی محدود انتخاب میکنند، این داستانِ بهینهسازی بسیار متقاعدکننده است.
سپس Gemini 3.5 Flash Cyber را داریم. این یک چتبات عمومی نیست؛ بلکه یک متخصص امنیت است که مستقیماً در عامل CodeMender گوگل ادغام شده و بهطور ویژه برای جریانهای کاری امنیت سایبری تنظیم شده است. در بنچمارک CyberGym، این مدل امتیاز ۸۳.۲ درصد را کسب کرد. این امتیاز آن را در فاصله بسیار نزدیکی از
