Twelve Labs, một công ty khởi nghiệp xây dựng trí tuệ nhân tạo có thể hiểu video theo cách các mô hình ngôn ngữ hiểu văn bản, đã huy động được 100 triệu USD trong vòng tài trợ Series B khi đặt cược rằng biên giới tiếp theo của AI nằm ở chuyển động chứ không phải từ ngữ.
Công ty đã công bố khoản tài trợ trên blog của mình vào ngày 1 tháng 7 năm 2026. Vòng này được dẫn dắt bởi NEA và NAVER Ventures, với sự tham gia của Amazon cùng với Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital và Red Bull Ventures. Để theo dõi phạm vi ngành AI rộng hơn nơi dòng vốn mạo hiểm đang chảy, thỏa thuận này nhấn mạnh niềm tin ngày càng tăng của các nhà đầu tư rằng video là loại dữ liệu chính tiếp theo mà AI phải nắm vững.
'Thế giới không xảy ra trong văn bản'
Người đồng sáng lập và giám đốc điều hành Jae Lee đã trình bày sứ mệnh của công ty một cách rõ ràng. Ông viết trong thông báo: “Năm năm trước, chúng tôi bắt đầu với một quan sát đơn giản: Thế giới không diễn ra bằng văn bản. Nó diễn ra trong chuyển động”.
Trong một cuộc phỏng vấn với Bloomberg News, Lee đã mở rộng ý tưởng này, cho rằng video “là dữ liệu tín hiệu tương tự nhất mà chúng ta nhận được với tư cách là con người để tìm hiểu về thế giới”. Ông đối lập điều đó với các kiến trúc AI thống trị thời điểm hiện tại, lưu ý rằng "điều đó khác với ngay cả những mô hình biên giới mới nhất như Fable 5 và Mythos, vốn vẫn là mô hình ngôn ngữ."
Lập luận dựa trên lỗ hổng trong cách thức hoạt động của AI hiện nay. Lee viết, thập kỷ phát triển AI gần đây nhất đã "làm cho văn bản có thể lập trình được", nhưng video vẫn chưa nhận được cách xử lý tương tự. Ông mô tả video của thế giới là "chủ yếu là vật chất tối đối với máy móc", nằm trong kho lưu trữ, trên máy bay không người lái và trong nguồn cấp dữ liệu vệ tinh, phần lớn vẫn được truy cập "thông qua tên tệp, thư mục, chú thích, bản ghi và bộ nhớ con người".
Làm cho Video có thể sử dụng được bởi Đại lý
Mục tiêu đã nêu của Twelve Labs là thu hẹp khoảng cách đó. Lee viết: “Mục tiêu của chúng tôi là làm cho mỗi giây của video có thể được các tác nhân đánh địa chỉ, tìm kiếm và sử dụng được”, đồng thời chỉ ra sự gia tăng của các tác nhân AI, các hệ thống tự trị có thể suy luận và thực hiện hành động, đóng vai trò là động lực chính của nhu cầu.
Nếu các mô hình ngôn ngữ làm cho tài liệu có thể tìm kiếm được và các trình tạo mã giúp xây dựng phần mềm nhanh hơn, thì mô hình hiểu video có thể làm cho kho lưu trữ video đã ghi khổng lồ và phần lớn chưa được khai thác có thể truy cập được vào các hệ thống tự động. Điều đó có các ứng dụng trên các phương tiện truyền thông, an ninh, xe tự hành và doanh nghiệp, bất kỳ lĩnh vực nào mà các quyết định phụ thuộc vào việc hiểu những gì đang xảy ra bên trong luồng video.
Một danh mục đông đúc nhưng khác biệt
Mười hai phòng thí nghiệm chiếm một vị trí thích hợp nằm giữa hai danh mục dễ thấy nhất trong AI. Một bên là trình tạo video, công cụ tạo video mới từ lời nhắc văn bản. Mặt khác là các mô hình ngôn ngữ lớn xử lý văn bản. Thay vào đó, Twelve Labs tập trung vào việc hiểu video, diễn giải video hiện có để máy móc có thể tìm kiếm, tóm tắt và xử lý video đó.
PYMNTS lưu ý rằng trình tạo video là một phần của thế hệ danh mục phần mềm tiêu dùng mới hình thành xung quanh AI, cùng với các đối tác AI, tìm kiếm hội thoại và các công cụ mã hóa dựa trên lời nhắc. Cách tiếp cận của Twelve Labs nhắm vào phía cung của xu hướng đó, xây dựng các mô hình cơ bản có thể biến video thành loại dữ liệu hạng nhất cho các tác nhân và ứng dụng được xây dựng dựa trên nó.
Tại sao các nhà đầu tư lại ủng hộ AI video
Danh sách những người ủng hộ trong vòng này chỉ ra các lệnh AI video có lợi ích chiến lược. Sự tham gia của Amazon rất đáng chú ý vì bộ phận đám mây AWS của công ty là nhà cung cấp cơ sở hạ tầng AI chính và các khoản đầu tư của riêng họ vào các dịch vụ video và truyền thông. NAVER Ventures, chi nhánh đầu tư của gã khổng lồ internet Hàn Quốc và Radical Ventures, một công ty tập trung vào AI, báo hiệu sự quan tâm toàn cầu đối với danh mục này.
Vòng này cũng phản ánh mô hình rộng hơn trong tài trợ AI cho đến giữa năm 2026, nơi các nhà đầu tư đang hướng vốn vào các công ty khởi nghiệp theo đuổi các phương thức dữ liệu ngoài văn bản. Trong khi các mô hình dựa trên văn bản đã thu hút được sự chú ý và đầu tư lớn, thì video và các dạng dữ liệu thực tế, phong phú khác được coi là đấu trường tiếp theo, nơi có thể tìm thấy những đột phá và lợi nhuận có ý nghĩa.
Nguồn tài trợ mang lại điều gì
Twelve Labs không nêu chi tiết kế hoạch chi tiêu cụ thể, nhưng quy mô huy động vốn, 100 triệu USD trong một vòng, cho thấy sự đầu tư đáng kể vào phát triển máy tính, nhân tài và mô hình. Việc đào tạo các mô hình hiểu video đòi hỏi tính toán cao hơn nhiều so với các mô hình văn bản đào tạo, do kích thước khổng lồ của tệp video, điều này làm tăng chi phí tiến độ.
Đối với Lee, điều đặt cược là lợi nhuận thu được sẽ bù đắp cho chi phí đó. Như ông đã nói, “bản ghi phong phú nhất về thực tế phần lớn vẫn nằm ngoài lớp ngữ nghĩa mà các hệ thống AI hiện đại sử dụng”. Khoản tài trợ mới của Twelve Labs là sự đánh cược rằng việc đưa video vào bên trong lớp đó sẽ là một trong những tiến bộ rõ ràng về AI trong những năm tới.
Nguồn: PYMNTS, Bloomberg News, blog của công ty Twelve Labs.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →

