Google은 지난 몇 주 동안 Gemini 라인업을 채우며 명확한 메시지를 전달해 왔습니다. 바로 속도와 전문화가 무차별적인 성능(brute force)만큼이나 중요하다는 것입니다. Google은 개발자 시장의 서로 다른 영역에 맞춰 조정된 세 가지 새로운 Flash 변형 모델을 출시했습니다. 하지만 이러한 모멘텀에도 불구하고, 여전히 비어 있는 자리가 하나 있습니다. 플래그십 모델인 Gemini 3.5 Pro는 아직 공개되지 않았으며, 경쟁사들은 마냥 기다려주지 않고 있습니다.

Gemini 3.6 Flash: 무차별적인 성능 대신 경제성을 선택하다

이번 발표의 핵심은 Gemini 3.6 Flash입니다. Google은 많은 개발자가 기꺼이 받아들일 만한 절충안을 제시하도록 이 모델을 설계했습니다. 이 모델은 속도와 비용의 획기적인 개선을 위해 최고 수준의 원시 성능(raw performance)을 일부 희생합니다. 자율 에이전트, 고처리량(high-throughput) API 또는 대규모 콘텐츠 파이프라인을 운영하는 팀에게 이러한 절충은 종종 수익성 있는 제품과 실험적인 제품을 가르는 결정적인 차이가 됩니다.

효율성 향상은 구체적입니다. Artificial Analysis Index에 따르면, 3.6 Flash는 이전 모델인 3.5 Flash보다 출력 토큰을 약 17% 적게 사용할 것으로 예상됩니다. DeepSWE와 같은 특정 벤치마크에서는 토큰 절감 효과가 최대 65%에 달할 수 있다고 Google은 주장합니다. 토큰당 비용을 지불하며 하루에 수백만 건의 요청을 처리하는 경우, 이러한 백분율은 곧바로 예산 절감으로 이어집니다.

가격 책정 또한 접근성에 초점을 맞추고 있습니다. 입력 토큰은 100만 개당 1.50달러, 출력 토큰은 100만 개당 7.50달러입니다. 시간당 수천 건의 상호작용을 처리하는 고객 지원 에이전트나 코드 리뷰 어시스턴트는 플래그십 모델을 사용할 때보다 이 티어에서 훨씬 적은 비용을 쓰게 될 것입니다. 규모가 작은 스타트업과 인디 개발자들도 일주일 만에 클라우드 크레딧을 다 써버리지 않고도 에이전트 기반 워크플로우를 구축할 수 있는 실질적인 기회를 얻게 되었습니다.

이 모델은 단순히 저렴하기만 한 것이 아니라, 에이전트 작업에서도 눈에 띄게 똑똑해졌습니다. MLE Bench에서 점수는 49.7%에서 63.9%로 상승했습니다. OSWorld-Verified 점수는 78.4%에서 83%로 뛰었습니다. 이는 미미한 향상이 아닙니다. 3.6 Flash가 이전 모델보다 훨씬 더 높은 신뢰성으로 다단계 작업을 계획, 디버깅 및 실행할 수 있음을 시사합니다. 자율 연구 어시스턴트나 배포 에이전트를 구축하고 있다면, 이론적인 최고 성능보다 이러한 추가적인 역량이 더 중요합니다.

전문가용 모델: Flash-Lite 및 Flash Cyber

3.6 Flash가 새로운 올라운더라면, 나머지 두 모델은 특정 문제점을 정밀하게 타격합니다.

Gemini 3.5 Flash-Lite는 순수한 속도를 위해 구축되었습니다. 초당 350개의 출력 토큰을 생성하며, 입력 토큰 100만 개당 비용은 단 0.30달러입니다. 이 가격은 무시하기 어렵습니다. 추론 비용이 수익을 초과하는 것을 걱정하지 않고도 실시간 채팅 인터페이스, 분류 파이프라인 또는 대량의 데이터 추출 작업을 실행할 수 있습니다.

Flash-Lite가 특히 흥미로운 점은 때때로 체급 이상의 성능을 보여준다는 것입니다. Google은 특정 에이전트 기반 소프트웨어 엔지니어링 및 컴퓨터 사용 작업에서 더 큰 모델인 Gemini 3 Flash를 능가한다고 언급했습니다. 업계는 수년 동안 '클수록 항상 좋다'고 가정해 왔습니다. Flash-Lite는 더 작고 최적화된 모델이 특정 작업에서 더 큰 범용 모델보다 뛰어난 성능을 발휘할 수 있음을 증명함으로써 이러한 관념에 도전합니다. 좁은 범위의 프로덕션 작업을 위해 모델을 선택하는 엔지니어에게 이러한 최적화 스토리는 매우 매력적입니다.

다음은 Gemini 3.5 Flash Cyber입니다. 이것은 일반적인 챗봇이 아닙니다. Google의 CodeMender 에이전트에 직접 통합되어 사이버 보안 워크플로우에 특화된 보안 전문가 모델입니다. CyberGym 벤치마크에서 83.2%를 기록했습니다. 이는 ~에 매우 근접한 수준입니다