언어 모델이 텍스트를 이해하는 방식으로 비디오를 이해할 수 있는 인공 지능을 구축하는 스타트업인 Twelve Labs는 AI의 다음 개척지가 단어가 아닌 움직임에 있다고 확신하면서 시리즈 B 자금 조달 라운드에서 1억 달러를 모금했습니다.

회사는 2026년 7월 1일 블로그를 통해 자금 조달을 발표했습니다. 이번 라운드는 NEA와 NAVER Ventures가 주도했으며 Amazon은 Radical Ventures, 한국 투자 파트너스, Index Ventures, Quadrille Capital 및 Red Bull Ventures와 함께 참여했습니다. 벤처 자본이 어디로 흘러가는지 추적하는 더 넓은 AI 산업 보도를 위해 이번 거래는 비디오가 AI가 마스터해야 하는 차세대 주요 데이터 유형이라는 투자자들 사이의 확신이 커지고 있음을 강조합니다.

'세상은 텍스트로 이뤄지지 않는다'

공동 창립자이자 CEO인 Jae Lee는 회사의 사명을 명확하게 설명했습니다. "5년 전, 우리는 간단한 관찰로 시작했습니다. 세상은 텍스트로 일어나는 것이 아니라 움직이는 가운데 일어난다"고 그는 발표에서 썼습니다.

Bloomberg News와의 인터뷰에서 Lee는 비디오가 "인간으로서 세상에 대해 배우기 위해 수신하는 가장 유사한 신호 데이터"라고 주장하면서 아이디어를 확장했습니다. 그는 이를 현재의 지배적인 AI 아키텍처와 대조하면서 "아직 언어 모델인 Fable 5 및 Mythos와 같은 최신 프론티어 모델과도 다르다"고 지적했습니다.

이 주장은 현재 AI가 작동하는 방식의 격차에 달려 있습니다. Lee는 AI 개발의 지난 10년 동안 "텍스트를 프로그래밍 가능하게 만들었다"고 썼지만 비디오는 아직 동일한 대우를 받지 못했습니다. 그는 세계의 비디오가 기록 보관소, 드론, 위성 피드에 있는 "대부분 기계에 대한 암흑 물질"이라고 설명했으며 여전히 "파일 이름, 폴더, 캡션, 녹취록 및 인간 기억을 통해" 주로 액세스할 수 있습니다.

상담원이 비디오를 사용할 수 있도록 만들기

Twelve Labs의 명시된 목표는 이러한 격차를 줄이는 것입니다. Lee는 "우리의 목표는 비디오의 모든 순간을 에이전트가 주소 지정하고, 검색하고, 사용할 수 있도록 만드는 것입니다."라고 말하면서 수요의 주요 동인으로 추론하고 조치를 취할 수 있는 자율 시스템인 AI 에이전트의 등장을 지적했습니다.

언어 모델을 통해 문서를 검색 가능하게 만들고 코드 생성기를 통해 소프트웨어 구축 속도를 높일 수 있다면 비디오 이해 모델을 통해 자동화된 시스템에서 접근할 수 있는 거대하고 아직 개발되지 않은 녹화 비디오 아카이브를 만들 수 있습니다. 이는 미디어, 보안, 자율주행차, 기업 등 비디오 스트림 내에서 일어나는 일을 이해하는 데 결정이 좌우되는 모든 분야에 적용됩니다.

복잡하지만 뚜렷한 카테고리

Twelve Labs는 AI에서 가장 눈에 띄는 두 가지 범주 사이에 있는 틈새 시장을 차지하고 있습니다. 한쪽에는 텍스트 프롬프트에서 새 비디오를 생성하는 도구인 비디오 생성기가 있습니다. 다른 하나는 텍스트를 처리하는 대규모 언어 모델입니다. Twelve Labs는 대신 비디오 이해, 기존 비디오 해석에 중점을 두어 기계가 이를 검색하고 요약하고 조치를 취할 수 있도록 합니다.

PYMNTS는 비디오 생성기가 AI 동반자, 대화형 검색 및 프롬프트 기반 코딩 도구와 함께 AI를 중심으로 형성되는 차세대 소비자 소프트웨어 범주의 일부라고 언급했습니다. Twelve Labs의 접근 방식은 이러한 추세의 공급 측면을 목표로 하여 비디오를 기반으로 구축되는 에이전트 및 애플리케이션을 위한 일류 데이터 유형으로 비디오를 만들 수 있는 기본 모델을 구축합니다.

투자자들이 비디오 AI를 지지하는 이유

라운드의 후원자 명단은 전략적 관심 비디오 AI 명령을 가리킵니다. Amazon의 AWS 클라우드 사업부가 AI 인프라의 주요 제공업체이고 비디오 및 미디어 서비스에 대한 자체 투자를 하고 있다는 점을 고려할 때 Amazon의 참여는 주목할 만합니다. 한국 거대 인터넷 기업의 투자 계열사인 NAVER Ventures와 AI에 주력하는 기업인 Radical Ventures는 이 분야에 대한 세계적인 관심을 나타냅니다.

이번 라운드는 또한 투자자들이 텍스트 이상의 데이터 형식을 추구하는 스타트업에 자본을 집중하는 2026년 중반까지 AI 자금 조달의 광범위한 패턴을 반영합니다. 텍스트 기반 모델이 가장 큰 관심과 투자를 흡수한 반면, 비디오 및 기타 형태의 풍부한 실제 데이터는 의미 있는 혁신과 수익을 찾을 수 있는 다음 분야로 간주됩니다.

자금 지원으로 가능해지는 것

Twelve Labs는 구체적인 지출 계획을 자세히 밝히지 않았지만 단일 라운드에서 1억 달러라는 인상 규모는 컴퓨팅, 인재 및 모델 개발에 대한 상당한 투자를 시사합니다. 비디오 이해 모델을 훈련하는 것은 비디오 파일의 크기가 커서 진행 비용이 높아지기 때문에 텍스트 모델을 훈련하는 것보다 계산량이 훨씬 더 많습니다.

이씨에게는 보상이 그 비용을 정당화한다는 데 내기가 있습니다. 그가 말했듯이, "현실에 대한 가장 풍부한 기록은 여전히 ​​현대 AI 시스템이 사용하는 의미 계층 외부에 있습니다." Twelve Labs의 새로운 자금 지원은 비디오를 해당 레이어 내부로 가져오는 것이 향후 몇 년 동안 결정적인 AI 발전 중 하나가 될 것이라는 내기입니다.

출처: PYMNTS, Bloomberg News, Twelve Labs 회사 블로그.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →