도쿄에 본사를 둔 Sakana AI는 여러 모델을 동시에 동적으로 조정하여 최첨단 AI 모델의 성능을 제공하는 시스템인 Fugu를 출시했습니다. 하나의 거대한 신경망을 구축하는 대신 Fugu는 교환 가능한 "에이전트 풀"에서 다른 LLM을 호출하도록 훈련된 언어 모델로서 각 작업에 대한 전문 모델 팀을 구성하고 단일 OpenAI 호환 API를 통해 출력을 통합합니다.
THE DECODER, MarkTechPost 및 MIT Sloan Management Review에서 다룬 이번 출시는 AI 성능의 다음 도약이 원시 규모보다는 이미 존재하는 모델의 보다 스마트한 조정에서 나올 수 있음을 나타냅니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.
모든 것을 제어할 수 있는 하나의 모델
사용자에게 Fugu는 단일 모델처럼 동작합니다. 내부적으로는 요청을 자체적으로 처리하거나 전문 모델 팀을 모아 내부적으로 선택, 위임, 확인 및 합성을 관리합니다. Sakana AI는 이 접근 방식이 오케스트레이션 기술을 사용한 코딩 경쟁에서 인간 전문가 1,000명 중 21위를 차지한 ALE-Agent와 같은 이전 작업을 기반으로 한다고 말합니다.
이 회사는 두 가지 변형을 출시하고 있습니다. 기본 Fugu 모델은 코딩, 코드 검토 및 챗봇 사용 사례 전반에 걸쳐 낮은 대기 시간과 견고한 일상 성능을 목표로 하며 팀이 개인 정보 보호 또는 규정 준수를 위해 풀에서 특정 에이전트를 제외할 수 있도록 합니다. Fugu Ultra는 과학 논문 재현, 사이버 보안 분석, 특허 및 문헌 검색과 같은 복잡하고 다단계 문제에 대해 최고의 답변 품질을 제공하도록 제작되었습니다.
주목을 끄는 벤치마크 주장
Sakana AI가 게시한 벤치마크 결과에 따르면 Fugu Ultra는 다양한 코딩, 추론 및 과학 벤치마크에서 Anthropic의 Fable 5 및 Mythos Preview와 동등한 성능을 발휘합니다. 특히 Anthropic 모델은 공개적으로 사용할 수 없기 때문에 실제로 Fugu의 에이전트 풀에 포함되어 있지 않습니다. 이는 Fugu가 다른 모델을 사용하여 비슷한 점수에 도달했음을 의미합니다.
공개된 수치는 놀랍습니다. SWE-Bench Pro에서 Fugu Ultra는 73.7점을 기록하여 Opus 4.8(69.2점), Gemini 3.1 Pro(54.2점), GPT 5.5(58.6점)보다 앞섰습니다. TerminalBench 2.1에서는 Opus 4.8의 82.1에 비해 80.2점을 기록했습니다. LiveCodeBench에서는 GPT 5.5의 85.3에 비해 93.2를 기록했고 Humanity's Last Exam에서는 50.0을 기록하여 Opus 4.8의 49.8, GPT 5.5의 41.4를 넘어섰습니다.
실제 테스트를 통해 혼합된 그림 그리기
초기 실습 리뷰는 벤치마크보다 덜 열정적이었습니다. AI 연구원인 Ethan Mollick은 Fugu Ultra가 "엄청나게 느리다"고 X에 썼습니다. 일반적인 코딩 테스트에는 30분이 걸리고 결과는 "괜찮았지만" 실제로는 Fable에 미치지 못했습니다. 또 다른 사용자는 단일 프롬프트로 20달러 요금제의 5시간 할당량 전체를 날려버렸다고 보고한 반면, Hacker News의 개발자는 월 200달러 요금제의 사용 가능한 시간이 일주일에 3시간 미만이라고 불평했습니다.
코드 리뷰는 품질면에서 Opus 4.8 또는 GPT 5.5와 거의 일치하는 밝은 지점으로 나타났습니다. 한 정면 테스트에서는 Fugu Ultra가 $7.32에 22분 만에 코딩 작업을 완료한 것으로 나타났습니다. 이는 Opus 4.8의 79분 및 $37.85보다 훨씬 빠르고 저렴하지만 리뷰어는 Opus의 출력을 선호했습니다.
2023년 도쿄에서 설립되고 Nvidia의 지원을 받는 Sakana AI는 진화 알고리즘과 집단 지능 아이디어를 사용하여 기존 모델에서 더 많은 성능을 끌어내면서 자연에서 영감을 받은 AI 연구를 기반으로 정체성을 구축했습니다. Fugu는 이러한 철학을 상업 시장으로 확장하여 오케스트레이션 자체를 제품으로 전환합니다. 또한 이 회사는 개별 개발자와 기업 팀 모두를 대상으로 하는 이중 언어 사이트와 가격을 통해 미국 공급자에 대한 과도한 의존을 걱정하는 일본 사용자를 위한 시스템을 포지셔닝하고 있습니다.
공급업체 종속에 대한 헤지
원시 성능 외에도 Sakana AI는 단일 AI 제공자에 대한 의존성에 대한 보호 수단으로 Fugu를 제시하고 있습니다. 이 회사는 최고의 시스템에 대한 액세스가 하룻밤 사이에 사라질 수 있다는 증거로 Anthropic의 Fable 및 Mythos 모델을 해외 시장에서 철수한 최근 미국 수출 통제를 지적했습니다.
Sakana AI는 발표에서 "조직이나 국가의 경우 중요한 인프라, 금융 또는 거버넌스를 위해 단일 회사의 API에 의존하는 것은 중대한 취약점입니다."라고 썼습니다. Fugu의 모델 풀은 완전히 교체 가능하므로 한 제공업체가 중단되면 시스템은 다른 모델로 다시 라우팅할 수 있습니다.
분석가들은 이것이 진정한 주권과 동일하지 않다고 경고합니다. Fugu의 성능은 풀에 어떤 모델이 있는지에 따라 달라지며, 한 번에 액세스를 제한하는 여러 상위 제공업체는 여전히 옵션을 축소할 것입니다. 회사는 또한 오케스트레이션 레이어가 토큰 사용량과 비용을 얼마나 증가시키는지 아직 공개하지 않았습니다. 그럼에도 불구하고 프론티어 모델이 지정학적 자산이 되고 단일 공급업체 종속이 더욱 위험해짐에 따라 Fugu는 조정이 기능만큼 중요할 수 있는 AI 산업에 대한 미리보기를 제공합니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →



