Google đã dành vài tuần qua để hoàn thiện dòng sản phẩm Gemini của mình với một thông điệp rõ ràng: tốc độ và sự chuyên biệt hóa cũng quan trọng không kém gì sức mạnh thô. Công ty đã tung ra ba biến thể Flash mới, mỗi loại được tinh chỉnh cho một phân khúc khác nhau của thị trường nhà phát triển. Tuy nhiên, bất chấp đà phát triển đó, một vị trí quan trọng vẫn còn trống. Phiên bản chủ lực Gemini 3.5 Pro vẫn chưa được phát hành công khai, và các đối thủ cạnh tranh thì không hề chờ đợi.
Gemini 3.6 Flash: Đánh đổi sức mạnh thô lấy tính kinh tế
Tâm điểm của thông báo là Gemini 3.6 Flash. Google thiết kế mô hình này để thực hiện một sự đánh đổi mà nhiều nhà phát triển sẽ sẵn lòng chấp nhận. Nó hy sinh hiệu suất thô tối đa để đổi lấy những cải tiến vượt bậc về tốc độ và chi phí. Đối với các đội ngũ đang vận hành các tác nhân tự hành (autonomous agents), các API có thông lượng cao hoặc các quy trình nội dung quy mô lớn, sự đánh đổi đó thường là ranh giới giữa một sản phẩm có lợi nhuận và một sản phẩm mang tính thử nghiệm.
Những cải thiện về hiệu quả là rất cụ thể. Theo Artificial Analysis Index, 3.6 Flash dự kiến sẽ sử dụng ít hơn khoảng 17% token đầu ra so với phiên bản tiền nhiệm, 3.5 Flash. Trong các bài kiểm tra (benchmark) mục tiêu như DeepSWE, Google tuyên bố mức tiết kiệm token có thể lên tới 65%. Khi bạn đang phải trả tiền trên mỗi token và xử lý hàng triệu yêu cầu mỗi ngày, những tỷ lệ phần trăm đó sẽ chuyển hóa trực tiếp thành ngân sách.
Mức giá phản ánh sự tập trung vào khả năng tiếp cận. Token đầu vào có giá 1,50 USD cho mỗi triệu token, trong khi token đầu ra là 7,50 USD cho mỗi triệu token. Một tác nhân hỗ trợ khách hàng hoặc một trợ lý đánh giá mã nguồn (code-review assistant) xử lý hàng nghìn tương tác mỗi giờ sẽ tiêu tốn ít tiền hơn nhiều ở phân khúc này so với mô hình chủ lực. Các startup nhỏ hơn và các nhà phát triển độc lập có cơ hội thực sự để xây dựng các quy trình tác nhân (agentic workflows) mà không làm cạn kiệt tín dụng đám mây của họ chỉ trong một tuần.
Mô hình này không chỉ rẻ hơn; nó còn thông minh hơn đáng kể trong các công việc mang tính tác nhân. Trên MLE Bench, điểm số đã tăng từ 49,7% lên 63,9%. OSWorld-Verified đã nhảy vọt từ 78,4% lên 83%. Đây không phải là những mức tăng nhỏ lẻ. Chúng cho thấy 3.6 Flash có thể lập kế hoạch, gỡ lỗi và thực hiện các tác vụ đa bước với độ tin cậy cao hơn đáng kể so với phiên bản tiền nhiệm. Nếu bạn đang xây dựng một trợ lý nghiên cứu tự hành hoặc một tác nhân triển khai, năng lực bổ sung đó quan trọng hơn sức mạnh lý thuyết thuần túy.
Các chuyên gia: Flash-Lite và Flash Cyber
Nếu 3.6 Flash là một "tay chơi" đa năng mới, thì hai bản phát hành còn lại nhắm vào các điểm yếu cụ thể với sự tập trung chính xác như phẫu thuật.
Gemini 3.5 Flash-Lite được xây dựng để đạt tốc độ thuần túy. Nó tạo ra 350 token đầu ra mỗi giây và chỉ tốn 0,30 USD cho mỗi triệu token đầu vào. Mức giá đó thật khó để phớt lờ. Bạn có thể vận hành các giao diện chat thời gian thực, các quy trình phân loại hoặc các tác vụ trích xuất dữ liệu khối lượng lớn mà không phải lo lắng về việc hóa đơn suy luận (inference bill) sẽ vượt quá doanh thu của mình.
Điều khiến Flash-Lite đặc biệt thú vị là đôi khi nó có thể vượt trội so với quy mô của mình. Google lưu ý rằng nó đánh bại mô hình Gemini 3 Flash lớn hơn trong một số tác vụ kỹ thuật phần mềm mang tính tác nhân và các tác vụ sử dụng máy tính. Ngành công nghiệp đã dành nhiều năm để giả định rằng lớn hơn luôn tốt hơn. Flash-Lite thách thức ý tưởng đó bằng cách chứng minh rằng một mô hình nhỏ hơn, được tối ưu hóa có thể vượt trội hơn một mô hình đa năng lớn hơn trong các công việc cụ thể. Đối với các kỹ sư đang chọn một mô hình cho một tác vụ sản xuất hẹp, câu chuyện tối ưu hóa này rất thuyết phục.
Tiếp theo là Gemini 3.5 Flash Cyber. Đây không phải là một chatbot thông thường. Nó là một chuyên gia bảo mật được tích hợp trực tiếp vào tác nhân CodeMender của Google và được tinh chỉnh dành riêng cho các quy trình làm việc về an ninh mạng. Trên bài kiểm tra CyberGym, nó đạt 83,2%. Điều đó đưa nó đến rất gần với
