Sakana AI의 Fugu Ultra v1.1, 최신 업데이트에서 Fable 5를 능가하다

Sakana AI가 지능형 모델 라우터인 Fugu Ultra v1.1의 중대한 업데이트를 발표하며, 주요 기술 벤치마크 전반에서 엄청난 성능 향상을 이루었다고 주장했습니다. 이번 업데이트는 우수한 추론 및 코딩 능력을 확보하기 위해 쿼리를 최상위 모델들에 어떻게 배분할지 정교화하려는 전략적 시도를 나타냅니다.

벤치마크 돌파: Fugu Ultra v1.1의 강점

Fugu Ultra v1.1의 핵심 혁신은 주어진 프롬프트에 대해 공개적으로 사용 가능한 LLM 풀에서 가장 적합한 모델을 선택하는 라우팅 지능에 있습니다. Sakana AI는 이번 버전이 초기 v1.0 출시 대비 최대 7.9포인트의 성능 향상을 제공한다고 보고했습니다.

특히 이 라우터는 전문적인 기술 평가, 구체적으로 ProgramBenchTerminalBench 2.1 벤치마크에서 상당한 도약을 보여주었습니다. Sakana는 Fable 5가 라우터의 선택 풀에 포함되어 있지 않음에도 불구하고, Fugu Ultra v1.1이 대부분의 벤치마크에서 Anthropic의 Fable 5를 능가한다고 주장하는 놀라운 성과를 내놓았습니다. 이러한 결과는 현재 독립적인 제3자 검증을 거치지 않았으나, 라우팅 로직이 기존 모델 아키텍처에서 최고 성능을 추출하는 데 매우 효율적으로 진화하고 있음을 시사합니다.

기술 아키텍처 및 개발자 통합

최첨단 모델 풀을 유지하기 위한 Sakana의 접근 방식은 매우 엄격합니다. 회사는 새로운 최상위 모델이 Fugu 생태계에 공식적으로 통합되기 전, 약 2주간의 전담 학습 및 평가 과정을 거친다고 밝혔습니다. 이를 통해 라우터의 의사 결정 프로세스가 시장의 최신 가중치(weights)와 기능에 최적화된 상태를 유지하도록 보장합니다.

개발자를 위해 이번 업데이트에서는 새로운 Claude Code 호환 엔드포인트가 도입되어, 사용자가 터미널에서 직접 Fugu를 호출할 수 있습니다. 이러한 통합은 높은 수준의 추론과 터미널 기반 자동화가 필요한 엔지니어들의 워크플로우를 간소화합니다. 이러한 기술적 진보에도 불구하고 가격은 이전 버전과 동일하게 유지됩니다: 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $30. Fugu는 현재 OpenRouterVercel을 포함한 주요 플랫폼을 통해 이용할 수 있습니다.

시장 과제 및 규제 대응

이번 출시는 초기 Fugu 출시 이후 겪었던 검증의 시기를 지나 이루어졌습니다. 초기 비판론자들은 높은 토큰 소비량, 지연 시간(latency), 그리고 일관성 없는 결과 등의 문제를 지적했습니다. v1.1을 통해 Sakana는 개발자의 신뢰를 다시 얻기 위해 효율성과 전문 작업 성능 강화에 박차를 가하고 있는 것으로 보입니다.

하지만 지리적 제한은 글로벌 도입의 걸림돌로 남아 있습니다. Sakana AI는 GDPR 및 기타 EU 특유의 규제 프레임워크와 관련된 복잡성을 이유로 현재 유럽 연합(EU) 또는 유럽 경제 지역(EEA) 내의 사용자에게는 서비스를 제공하지 않습니다. "모델 라우터" 카테고리가 성장함에 따라, 투명하고 검증 가능한 데이터를 통해 이러한 성능 주장을 입증할 수 있는지가 경쟁적인 AI 시장에서 Sakana의 생존 가능성을 결정짓는 궁극적인 시험대가 될 것입니다.

핵심 요약

  • 우수한 벤치마킹 성능: Fugu Ultra v1.1은 v1.0 대비 7.9포인트 향상된 성능을 보여주며, Fable 5가 라우터의 풀에 포함되어 있지 않음에도 불구하고 여러 지표에서 Anthropic의 Fable 5를 눈에 띄게 능가합니다.
  • 개발자 중심의 업데이트: 새 버전에는 Claude Code 호환 터미널 엔드포인트가 추가되어 코딩 워크플로우 통합이 더욱 용이해졌습니다.
  • 엄격한 큐레이션: Sakana는 높은 정확도와 성능을 유지하기 위해 라우터에 추가되는 모든 신규 모델에 대해 2주간의 평가 주기를 적용합니다.