Alibaba의 Qwen 팀은 단일 100만 토큰 컨텍스트 창을 통해 텍스트, 이미지, 오디오 및 비디오 입력을 허용하는 차세대 기본 옴니모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 공식 Qwen 블로그에 자세히 설명된 이번 릴리스는 수동 입력의 오디오 및 비디오를 AI 에이전트가 세상을 인식하고 행동하는 기본 매체로 전환하려는 팀의 가장 공격적인 추진을 나타냅니다.

미디어 이해에서 실행까지

Qwen3.8-Omni-Flash의 명시된 목표는 단순히 미디어에 대한 이해를 높이는 것이 아닙니다. Qwen 팀에 따르면 이 모델은 "옴니모달 콘텐츠 이해"에서 "작업 계획, 도구 호출 및 창의적인 작업 완료"까지 옴니모달 시스템을 발전시키도록 설계되었습니다. 실제로 이는 모델이 비디오 편집, 뮤직 비디오 제작, 영화 제작 및 해설, 시청각 요약, 실시간 음성 대화와 같은 워크플로를 목표로 한다는 것을 의미합니다.

이 에이전트 프레임은 오디오 및 비디오를 기록하거나 설명할 입력으로 처리하는 이전 다중 모드 모델과 릴리스를 분리합니다. Qwen은 오디오와 비디오가 "에이전트가 자신의 환경, 이유를 이해하고 작업을 실행하는 핵심 미디어"로 진화하고 있다고 주장합니다. 이 회사는 일련의 에이전트 벤치마크 결과를 통해 이를 뒷받침합니다.

출시 뒤에 숨겨진 숫자

Qwen은 오디오 추론, 시청각 추론 및 시청각 에이전트 벤치마크를 포괄하는 29가지 평가를 통해 이 모델의 평균 점수가 이전 모델인 Qwen3.5-Omni-Plus에 비해 25% 이상 향상되었다고 말합니다. Qwen 블로그에 보고된 헤드라인 결과는 다음과 같습니다.

  • 시청각 에이전트에 대한 두 가지 벤치마크인 WildClawBench-MM에서 36.5점, AgenticVBench에서 22.3점, UniClawBench에서 69.6점을 얻었습니다.
  • 긴 형식의 오디오 및 비디오 이해를 위해 LongAudioSpan이 8.3포인트 향상되고 OmniVideoBench가 9.6포인트 향상되었습니다.
  • 다중 화자 회의 기록의 오류율이 크게 감소했습니다. 모델의 AliMeeting DER 및 cpWER이 각각 88.11 및 89.61에서 3.35 및 17.18로 감소했습니다.

경쟁 측면에서 Qwen은 Google의 제품과 직접 비교합니다. 회사는 Gemini 3.8 Flash에 가까운 시청각 성능과 이를 능가하는 전반적인 오디오 성능을 주장합니다. 이러한 비교에 대한 독립적인 검증에는 시간이 걸리겠지만, 벤치마크 주장의 특이성은 Qwen이 모델이 옴니모달 작업의 최전선에서 경쟁력이 있다고 간주한다는 신호입니다.

몇 시간의 미디어를 위한 100만 토큰 창

통합된 1백만 개의 토큰 컨텍스트 창은 아마도 이번 릴리스의 가장 실용적인 기능일 것입니다. 오디오와 비디오는 텍스트보다 훨씬 빠르게 토큰을 소비하기 때문에 생산 중인 대부분의 다중 모드 모델은 한 번에 몇 분의 미디어만 처리합니다. 7자리 컨텍스트 창을 통해 모델은 청크 없이 단일 세션에서 몇 시간 분량의 회의 녹화, 확장된 비디오 장면 또는 대규모 혼합 미디어 문서를 보관할 수 있습니다.

Qwen은 이 모델이 동일한 크기의 텍스트 전용 모델에 필적하는 텍스트 성능을 유지하여 옴니모달 훈련이 순수한 언어 능력을 저하시키는 일반적인 절충점을 해결한다고 지적합니다.

오디오 입력 가격 98% 인하

가격은 알리바바가 가장 큰 압박을 가하는 부분이다. 블로그에 따르면 오디오 입력의 시간당 API 가격은 Qwen3.5-Omni-Plus에 비해 98% 이상 하락했으며, 오디오-비주얼 입력의 시간당 가격은 93% 이상 하락했습니다. 회사의 방법론 노트에 따르면 시간당 가격은 2분 분량의 소스 자료 입력 비용의 30배로 추산되며 시청각 입력은 720p 및 초당 1프레임으로 계산됩니다.

음성 에이전트, 회의 요약자 또는 미디어 분석 파이프라인을 구축하는 개발자의 경우 입력 비용이 규모에 대한 구속력을 갖는 경우가 많습니다. 두 자릿수의 가격 하락은 경제적으로 실행 가능한 제품을 변화시킵니다. 이는 저렴한 텍스트 추론 API의 첫 번째 물결을 주도한 것과 동일한 역학입니다.

가용성 및 생태계

Qwen3.8-Omni-Flash는 현재 대화 사용 사례를 위한 전용 실시간 엔드포인트를 포함하여 Alibaba Cloud Model Studio를 통한 API 액세스를 통해 Qianwen AI 플랫폼에서 사용할 수 있습니다. 또한 팀은 Qwen-Live-Harness 평가 하네스 및 Qwen-MM-Plugins를 포함하여 GitHub에 오픈 소스 도구 지원을 게시하여 개발자가 모델 위에 미디어 네이티브 에이전트를 구축할 수 있는 출발점을 제공했습니다.

이번 출시는 주 초에 조용히 이루어졌지만 최근 개발자 커뮤니티에서 상당한 관심을 끌었으며 Hacker News에 대한 대규모 토론과 개방형 모델 생태계를 추적하는 기술 매체의 보도를 이끌어냈습니다.

옴니모달 경주의 의미

이번 출시는 전 세계적으로 가장 많이 다운로드된 개방형 모델 계보 중 하나인 Qwen 제품군 전반에 걸쳐 공격적인 가격과 경쟁력 있는 벤치마크를 결합하려는 Alibaba의 전략을 이어갑니다. Qwen3.8-Omni-Flash를 통해 회사는 다음 전장이 텍스트 채팅이 아니라 보고, 듣고, 행동할 수 있는 에이전트(영상 편집, 회의 요약, 실시간 음성 대화 개최)가 단일 통합 기능으로 될 것이라고 확신하고 있습니다.

Gemini 3.8 Flash를 비교 대상으로 삼고 있는 Google의 경우, 옴니모달 개척지는 더 이상 미국 연구실 간의 경쟁이 아니라는 메시지가 있습니다. 개발자의 경우 1M 토큰 다중 모달 창과 거의 무료인 오디오 입력의 조합은 불과 몇 달 전만 해도 규모에 맞게 서비스를 제공하는 것이 비실용적이었던 시청각 에이전트 제품 클래스에 대한 장벽을 낮춰줍니다.

Qwen의 벤치마크 주장이 독립적인 평가 하에서 유지되는지 여부에 따라 업계가 해당 베팅을 얼마나 심각하게 취급하는지가 결정됩니다. 그러나 이동 방향은 분명합니다. 프론티어 모델을 구축하는 팀은 이제 단순한 텍스트 상자가 아닌 귀와 눈을 AI 에이전트의 기본 인터페이스로 봅니다.

AI보다 앞서 나가세요

옴니모달 경주는 매주 가속화되고 있습니다. 더 많은 최신 AI 뉴스, 새로운 모델 출시에 대한 심층 분석, 업계를 형성하는 도구에 대한 내용을 보려면 AI 뉴스 더 읽기 →를 참조하세요.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →