Inception Labs는 화요일에 Mercury 2.5를 출시했습니다. Mercury 2.5는 회사가 시장에서 가장 유능한 확산 LLM이자 지금까지 훈련된 가장 큰 확산 언어 모델이라고 설명하는 상업용 확산 언어 모델의 새 버전입니다. 회사의 발표에 따르면, 이 모델은 이전 모델인 Mercury 2에 비해 40% 향상된 인텔리전스를 제공하는 동시에 확산 아키텍처를 대용량 워크로드에 매력적으로 만든 동일한 낮은 대기 시간, 저렴한 서비스 프로필을 유지합니다.
CEO Stefano Ermon이 이끄는 이 회사는 Mercury 2.5가 GPT-5.6 Luna(Low), Gemini 3.5 Flash-Lite 및 Claude Haiku 4.5를 포함한 비용 최적화된 개척 모델과 비슷하다고 주장합니다. 이러한 비교는 공급업체가 보고한 것이며 아직 독립적인 벤치마크에 의해 검증되지 않았습니다. 그러나 오랫동안 연구 호기심으로 여겨졌던 확산 모델을 자동 회귀 기존 기업의 생산 대안으로 자리매김했습니다. 최신 AI 모델 소식을 보려면 AI Buzz Wire의 지속적인 모델 보도를 팔로우하세요. 최신 AI 모델 소식
속도, 상황 및 가격
헤드라인 수치는 공격적입니다. Inception Labs에 따르면 Mercury 2.5는 널리 사용되는 NVIDIA GPU에서 초당 1,107개의 토큰을 생성하며 컨텍스트 창은 260,000개 토큰입니다. 가격은 입력 토큰 백만 개당 0.20달러, 출력 토큰 백만 개당 0.75달러로 설정되어 있으며, 출시 프로모션을 통해 모델을 백만 입력당 $0.04, 출력 토큰 백만 달러당 0.15달러로 80% 할인합니다.
기능 측면에서 모델은 구조화된 생성을 위한 병렬 도구 호출 및 스키마 정렬 JSON 출력과 함께 개발자가 요청별로 지연 시간을 깊이 교환할 수 있도록 조정 가능한 추론을 제공합니다. 회사는 이 릴리스를 생산 원격 측정에 의한 훈련 루프의 첫 번째 결과로 구성합니다. Mercury 2가 출시된 이후 수천 명의 개발자가 Mercury 2를 구축했고 수십 개의 기업이 이를 배포했으며 사용량이 10배 이상 증가했습니다.
확산 모델이 텍스트를 더 빠르게 생성하는 이유
OpenAI, Google 및 Anthropic의 주류 LLM은 자동 회귀적입니다. 즉, 한 번에 하나의 토큰으로 텍스트를 생성하고 각 토큰은 이전에 생성된 모든 것을 조건으로 합니다. 이러한 순차적 종속성으로 인해 생성 속도가 저하됩니다. 대신 확산 언어 모델은 노이즈 블록으로 시작하여 모든 토큰을 병렬로 반복적으로 개선합니다. 이를 통해 모델이 깔끔하게 수렴되도록 훈련되면 기존 GPU 하드웨어에서 훨씬 더 높은 처리량을 허용합니다.
역사적으로 균형은 품질이었습니다. 확산 모델은 추론 및 지시 따르기 벤치마크에서 자동 회귀 모델을 따라갔습니다. Inception Labs의 핵심 내기이자 Mercury 2.5의 기본 주장은 이러한 격차가 대부분의 고객이 실제로 느끼는 축(생산량에서의 대기 시간 및 비용)에서 확산이 승리하는 지점까지 좁아졌다는 것입니다.
초기 고객의 생산 요구
이번 발표는 벤치마크 테이블보다는 고객 배포에 크게 의존합니다. 실시간 고객 통화를 위한 AI 전화 에이전트를 구축하는 OpenCall은 Mercury로 이전하면서 모델 응답 지연 시간 중앙값이 대략 170밀리초로 늘어났다고 보고했습니다. OpenCall의 공동 창업자이자 CEO인 올리버 실버스타인(Oliver Silverstein)은 회사의 P99 응답 시간이 몇 분에서 1초로, 중앙값은 0.4초에서 0.2초 미만으로 떨어졌다고 말했습니다. 이는 추론 활성화를 포함하여 회사가 테스트한 다른 어떤 제공자보다 훨씬 빠른 수치라고 그는 설명했습니다.
AI 코딩 보조 제조업체인 Augment Code는 컨텍스트 압축, 모델 라우팅 및 MCP 도구 검색에 Mercury를 사용합니다. Inception Labs에 따르면 압축 워크로드를 Mercury로 이동하면 해당 단계의 대기 시간이 약 150초에서 27초로 82% 단축되고 품질을 유지하면서 비용이 90% 절감됩니다. 사용 사례는 경제성이 어느 부분에 영향을 미치는지 보여줍니다. 코딩 에이전트는 각 기본 세대에 대해 많은 소규모 지원 모델 호출을 수행하고 이러한 호출 전반에 걸쳐 지연 시간과 비용이 증가합니다.
해당 모델을 실행하는 하드웨어를 운영하는 NVIDIA도 이에 동참했습니다. NVIDIA Accelerated Computing Group의 제품 수석 관리자인 Shruti Koparkar는 Inception이 NVIDIA AI 인프라에서 확산 기반 언어 모델을 발전시켰으며, 지속적인 속도를 갖춘 Mercury 2.5의 품질 향상은 새로운 아키텍처가 얼마나 빨리 생산 준비 시스템으로 성숙될 수 있는지를 보여준다고 말했습니다.
Mercury Voice 및 Mercury Router 미리보기
모델과 함께 Inception Labs는 두 가지 신제품의 미리보기를 발표했습니다. Mercury Voice는 대기 시간 예산이 가장 짧은 음성 에이전트에 최적화된 확산 LLM으로 첫 번째 토큰 광고 시간이 170밀리초 미만입니다. Mercury Router는 확산 모델을 사용하여 들어오는 프롬프트를 이해하고 개방형 또는 폐쇄형 모델 중 품질, 속도 및 비용의 최상의 조합을 제공하는 모델로 라우팅하여 Inception을 경쟁사 및 그 중 하나보다 상위 계층으로 포지셔닝합니다.
Mercury 2.5는 Inception의 자체 API는 물론 Baseten 및 OpenRouter를 통해 사용할 수 있습니다. 엔터프라이즈 배포에는 전용 용량, 자동 확장, 규정 준수 제어 및 구성 가능한 데이터 보존 기능이 추가됩니다. 회사는 API를 시도하는 개발자에게 1억 개의 무료 토큰을 제공하고 있습니다.
회사는 또한 앞으로 몇 달 안에 출시될 예정인 아직 가장 큰 다음 모델 교육을 이미 시작했다고 밝혔습니다. 이는 확산 속도나 토큰 효율성을 포기하지 않는 기능의 도약이라고 설명합니다. 만약 그러한 주장이 유효하다면, 자동 회귀 기존 기업에 대한 압력은 가격과 지연 시간이 대부분의 계약을 결정하는 시장의 상품 계층에서 가장 먼저 느껴질 것입니다.
AI보다 앞서 나가세요
새로운 모델 아키텍처가 생산되기 시작하면서 최신 AI 개발과 최신 인공 지능 뉴스를 확인하세요.
AI 뉴스 자세히 보기 →