قامت Google بتوسيع عائلة Gemini عبر ثلاثة طرازات جديدة، جميعها تُطرح اليوم. بدلاً من ترقية واحدة رائدة، تضاعف الشركة مراهنتها على التخصص. الرسالة واضحة: لا يمكن لنموذج واحد ضخم أن يخدم كل حالات الاستخدام بنفس الكفاءة. الطرازات الجديدة هي Gemini 3.6 Flash، وGemini 3.5 Flash-Lite، وGemini 3.5 Flash Cyber. تم ضبط كل منها ليعطي الأولوية لمتطلب تشغيلي مختلف: السرعة الخام، والكفاءة الرشيقة، وأعباء العمل التي تركز على الأمن، على التوالي. بالنسبة للمطورين وفرق المنتجات، يعني هذا تحكماً أدق في زمن الاستجابة والتكلفة والسلوك، ولكنه يطرح أيضاً سؤالاً جديداً: أي منها تحتاج فعلياً؟
ما تم إطلاقه للتو
أضاف إعلان Google اليوم ثلاثة طرازات متميزة إلى فئة Flash ضمن مجموعة Gemini:
- Gemini 3.6 Flash: صُمم من أجل السرعة المطلقة. يستهدف هذا الطراز التطبيقات التي يهم فيها وقت الاستجابة أكثر من الاستنتاج الشامل.
- Gemini 3.5 Flash-Lite: صُمم من أجل الكفاءة. وهو مخصص للتعامل مع المهام عالية الحجم أو البسيطة دون عبء الحوسبة الإضافي الذي تتطلبه الطرازات الأكبر.
- Gemini 3.5 Flash Cyber: موجه نحو المهام الأمنية. تم وضع هذا الإصدار لسير العمل الذي يتضمن اكتشاف التهديدات، وتحليل الثغرات الأمنية، وعمليات الأمن السيبراني الأخرى.
تندرج الطرازات الثلاثة تحت العلامة التجارية Flash، والتي تشير تاريخياً إلى التركيز على السرعة وفعالية التكلفة بدلاً من السعي وراء تحقيق أعلى درجات في اختبارات الأداء (benchmarks). ومن خلال تقسيم فئة Flash إلى ثلاثة مسارات متميزة، تقر Google بأن السرعة في حد ذاتها ليست متغيراً واحداً. فالنموذج السريع الذي تزيد تكلفة تشغيله على نطاق واسع يحل مشكلة مختلفة عن النموذج السريع الذي يتميز بتكلفة زهيدة ولكنه أقل قدرة.
لماذا يهم التخصص
قضت صناعة الذكاء الاصطناعي العامين الماضيين في السعي وراء أكبر نموذج ممكن. والآن، بدأ البندول في العودة إلى الاتجاه المعاكس. لقد تعلمت الفرق التي تدير تطبيقات حقيقية أن إرسال نموذج ضخم لكل مستخدم يشبه استخدام شاحنة نقل لتوصيل بطاقة بريدية؛ فهي تنجز المهمة، لكن فاتورة الوقود ستكون باهظة.
السرعة والكفاءة ليستا شيئاً واحداً. يمكن للنموذج أن يعطي إجابات بسرعة ومع ذلك يستهلك عدداً مفرطاً من الرموز (tokens) أو وقت وحدة معالجة الرسومات (GPU) أثناء عملية الاستدلال، مما يؤدي إلى زيادة التكاليف. وعلى العكس من ذلك، يمكن أن يكون النموذج غير مكلف في التشغيل ولكنه بطيء جداً بالنسبة لواجهات الاستخدام في الوقت الفعلي. ثم هناك مسألة الملاءمة للمجال؛ فالنموذج العام يمكنه تلخيص بريد إلكتروني أو كتابة مسودة بلغة Python، ولكن عندما توجهه نحو لوحة تحكم مركز عمليات أمنية مليئة بالسجلات والتنبيهات وتواقيع الثغرات، فغالباً ما ستحتاج إلى شيء يتحدث تلك اللغة بشكل أصيل.
يبدو أن ثلاثية Google مصممة لمعالجة نقاط الألم الثلاث هذه دون إجبار المستخدمين على اللجوء تلقائياً إلى الخيار الأكبر والأكثر تكلفة في القائمة.
تفصيل الطرازات
يتربع Gemini 3.6 Flash على قمة هذا التسلسل الهرمي الجديد للسرعة. إذا كنت تبني بوت دعم عملاء يحتاج إلى الشعور بالاستجابة الفورية، أو مساعد برمجة يعتمد فيه استكمال الكود التلقائي على زمن الاستجابة لتقرير ما إذا كان المطورون سيستمرون في استخدام الإضافة، فمن المرجح أن يكون هذا هو الطراز الذي يجب اختباره أولاً. التركيز هنا ينصب على معدل الإنتاجية والاستجابات السريعة. إنه نوع النماذج التي تلجأ إليها عندما يكون صبر المستخدم محدوداً وتكون المهمة معقدة بدرجة متوسطة. ستظل تحصل على مستوى استنتاج Gemini، ولكن البنية التحتية مضبوطة لتقليل الوقت المستغرق حتى ظهور أول رمز (time-to-first-token).
أما Gemini 3.5 Flash-Lite فيقوم بتقليص الزوائد. هذا الطراز مخصص لمجموعة واسعة من أعباء عمل الذكاء الاصطناعي التي لا تحتاج إلى استنتاج متطور ولكنها تحتاج تماماً للبقاء ضمن الميزانية. فكر في خطوط أنابيب الإشراف على المحتوى، أو استخراج البيانات الأساسية من النماذج، أو تصنيف تذاكر الدعم، أو تشغيل الميزات داخل تطبيقات الهاتف المحمول حيث تهم البطارية وعرض النطاق الترددي. Flash-Lite هو "خيل العمل" الذي تنشره عندما لا يبدو عدد الرموز (tokens) الشهري الخاص بك كمشروع جانبي، بل كفاتورة مرافق عامة. المقايضة واضحة: قدرة أضيق قليلاً مقابل استدلال أرخص بكثير.
Gemini 3.5 Flash Cyber is the most targeted of the three. Cybersecurity workflows have unique demands. Parsing raw network logs, comparing threat indicators against known vulnerabilities, summarizing incident reports, and flagging suspicious code patterns all benefit from a model that has been oriented around security semantics. Rather than shoehorning a generalist model into a SOC workflow, Flash Cyber offers a more purpose-built starting point. Security teams can potentially reduce false positives and spend less time prompting the model with extensive context about CVE formats or alert taxonomy. It will not replace your senior analyst, but it might remove the grunt work that currently slows them down.
Choosing the Right Tool
If you are deciding where to start, look at your constraints in this order: latency requirements, budget ceiling, and task complexity.
For real-time interfaces where a half-second delay kills engagement, start with Gemini 3.6 Flash. Run your heaviest user-facing queries against it and measure actual end-to-end response times under load. Do not trust benchmark tables alone; your routing layer, serialization, and prompt length all affect perceived speed.
If your project is cost-sensitive or processes large batches of documents overnight, Gemini 3.5 Flash-Lite is the logical candidate. Benchmark it against your current setup by tracking cost per thousand requests rather than just accuracy. Sometimes a small capability drop is worth a massive price cut, especially for internal tools where good enough is genuinely good enough.
If you work in application security, threat intelligence, or compliance auditing, Gemini 3.5 Flash Cyber deserves the first look. Evaluate whether its baseline understanding of security concepts reduces your prompt engineering burden. Less preamble in every prompt can translate to lower token usage and faster deployment. If you find yourself repeatedly explaining what a SQL injection looks like to your current model, this variant is worth testing.
What Builders Should Watch
A fragmented model lineup is powerful but can become a maintenance headache. When Google offers multiple variants of the same family, you need a clean routing strategy. The smartest approach is rarely to bet everything on a single model. Instead, use a gateway or router that sends simple queries to Flash-Lite, complex interactive tasks to Flash 3.6, and security-specific jobs to Flash Cyber. Over time you can log mismatches and adjust the routing rules.
Also pay attention to context window behavior across these variants. Just because they share the Gemini name does not mean they handle long documents identically. Test your typical input lengths before committing. A model that works beautifully on five-paragraph inputs may stumble when you feed it a fifty-page contract or a multi-megabyte log dump.
Finally, keep an eye on pricing tiers. Flash models are generally cheaper than Pro-tier counterparts, but the spread between Lite, standard Flash, and Cyber could still be significant at scale. Run a small production shadow test for a few days with real traffic before you announce the integration to your users. Real billable usage has a way of
