엔가젯(Engadget)에 따르면 메타(Meta)는 여러 화자를 구별하고 실시간으로 여러 언어를 전사할 수 있는 새로운 오디오 AI 모델을 월요일 공개했습니다. 이는 점점 더 혼잡해지는 음성 AI 시장에 회사를 더 깊이 진출시키는 움직임입니다. The Information은 오디오 모델 발표를 처음으로 보도했으며, Mac에 실시간 음성 받아쓰기를 제공하는 동반 제품인 Muse Voice Transcribe에 대해 9to5Mac에서 자세히 설명했습니다.

쌍둥이는 Meta가 음성을 AI 스택의 일류 입력으로 처리하고 있다는 신호를 발표합니다. 겹치는 화자를 처리할 수 있는 실시간 전사, 대화 도중 언어 전환 및 시스템 전체 받아쓰기는 음성을 참신한 기능에서 일상적으로 사용되는 인터페이스로 바꾸는 기능입니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.

하나의 모델, 다양한 목소리, 다양한 언어

Engadget이 보고한 대로 헤드라인 기능은 여러 사용자와 여러 언어를 실시간으로 구별하는 모델의 능력입니다. 이 조합은 실제 전사에서 가장 어려운 두 가지 문제, 즉 누가 무엇을 말했는지 파악하는 화자 분할과 대화가 언어 간에 중단 없이 표류하는 다국어 인식을 동시에 해결합니다.

대부분의 기존 전사 파이프라인은 이를 별도의 단계로 처리합니다. 먼저 분할 모델이 화자를 분할한 다음 인식 모델이 각 세그먼트를 전사합니다. 이를 단일 실시간 모델에 융합하면 사후 처리를 기다리는 것이 목적을 달성할 수 없는 회의, 인터뷰, 고객 통화, 실시간 번역 오버레이 등의 실시간 사용 사례에 기술을 실행 가능하게 만드는 것입니다.

Muse Voice Transcribe는 모든 Mac 앱에 받아쓰기 기능을 제공합니다.

이 모델과 함께 Meta는 macOS용 Muse Voice Transcribe를 출시했습니다. 9to5Mac이 보고한 바와 같이 이 도구는 Mac 애플리케이션 전반에서 작동하는 실시간 음성 받아쓰기를 제공합니다. 이는 독립 실행형 앱이 아닌 사실상 시스템 전체 받아쓰기 레이어입니다. Gadget Review의 보도에서는 모든 Mac 앱에 실시간 받아쓰기를 제공한다고 설명했습니다.

그 디자인은 채택에 중요합니다. 받아쓰기 도구는 마찰에 따라 살거나 죽습니다. 사용자가 별도의 창에서 텍스트를 복사해야 하는 경우 사용을 중단합니다. 시스템 수준에서 작업한다는 것은 전자 메일, 코드 편집기, 메시징 앱, 문서 등 커서가 깜박이는 곳 어디에서나 음성 입력을 사용할 수 있음을 의미합니다. 이것이 바로 가장 성공적인 받아쓰기 도구가 청중을 사로잡은 방법입니다.

Mac 릴리스는 Meta의 주목할만한 영역이기도 합니다. 회사의 AI 노력은 모바일 앱, Meta AI 도우미, Llama 제품군 및 Muse 제품군 모델에 집중되어 있습니다. Apple 플랫폼을 위한 세련된 데스크톱 생산성 도구를 출시함으로써 Meta는 역사적으로 접근하기 어려웠던 전문 사용자 기반과 직접 접촉할 수 있게 되었으며 플랫폼의 기존 받아쓰기 및 전사 유틸리티와 경쟁하게 되었습니다.

점점 빨라지는 혼잡한 필드

Meta는 지난 2년 동안 가격이 재조정되고 재설계된 시장에 진입하고 있습니다. OpenAI의 Whisper 오픈 소스 모델은 접근 가능한 다국어 전사의 기준을 설정했으며, 회사의 유료 GPT Transcribe API는 가격면에서 상용 시장의 상당 부분을 약화시켰습니다. 한편 Google은 같은 방향으로 열심히 노력했습니다. Google이 85개 언어 실시간 음성 전사 모델을 출시했을 때 다루었던 것처럼 수십 개의 언어를 실시간으로 다루는 Gemini 기반 전사 모델이 개발자에게 출시되었습니다.

이러한 배경에서 차별화는 원시 정확도(표준 벤치마크에서 리더가 서로 밀집되어 있는 경우)에서 지연 시간, 화자 처리, 언어 간 코드 전환, 가격 책정 및 모델 실행 위치와 같은 실질적인 세부 사항으로 전환되었습니다. 동시 다중 화자 및 실시간 다중 언어 인식에 대한 Meta의 강조는 이러한 실제적인 세부 사항을 정확하게 목표로 합니다.

음성이 갑자기 전략적인 이유

타이밍은 우연이 아닙니다. 음성은 AI 에이전트의 기본 인터페이스가 되고 있으며 오디오 계층(캡처, 전사, 이해, 응답)을 소유한 회사는 어시스턴트 경험에 대한 가장 자연스러운 진입점을 제어합니다. Meta는 음성이 본질적으로 유일한 실용적인 입력인 AI 안경 및 웨어러블 장치에 대한 야망을 공개했습니다. 빠르고 정확한 이동 중 오디오 모델은 해당 로드맵의 인프라입니다.

기업 각도도 있습니다. 회의, 지원 통화, 현장 작업에서는 조직이 검색하고 실행 가능한 엄청난 양의 다중 스피커 오디오를 생성합니다. 대화가 진행되는 동안 안정적으로 기록하는 모델(수동 구성 없이 스피커에 라벨이 지정되고 언어가 처리됨)이 데모와 제품의 차이입니다.

실시간 전사는 편의성 이상의 이점도 제공합니다. 실시간 캡션을 사용하면 청각 장애가 있는 사용자가 회의, 강의실 및 방송에 액세스할 수 있으며, 즉각적인 다국어 캡션을 통해 국제 팀의 언어 장벽을 낮출 수 있습니다. 자연스러운 음성과 보조를 맞출 수 있을 만큼 빠른 전사가 가능하고 한 번에 여러 명의 화자를 추적할 수 있을 만큼 강력하다면 이러한 접근성 기능은 더 이상 특별한 편의 기능이 아니며 일상적인 도구에 기본으로 내장된 기본 기능이 됩니다.

Meta는 초기 적용 범위에서 가격이나 전체 가용성 세부 사항을 발표하지 않았습니다. 그러나 그 방향은 분명합니다. 오랫동안 상품으로 취급되었던 AI 스택의 오디오 레이어가 이제 플랫폼 전쟁의 최전선이 되었으며 Meta는 이에 맞서 싸우기로 결정했습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →