Twelve Labs สตาร์ทอัพที่สร้างปัญญาประดิษฐ์ที่สามารถเข้าใจวิดีโอในแบบที่โมเดลภาษาเข้าใจข้อความ ได้ระดมทุน 100 ล้านดอลลาร์ในการระดมทุน Series B เนื่องจากเดิมพันว่าขอบเขตถัดไปของ AI นั้นอยู่ที่การเคลื่อนไหวมากกว่าคำพูด
บริษัทประกาศการระดมทุนในบล็อกเมื่อวันที่ 1 กรกฎาคม 2026 รอบนี้นำโดย NEA และ NAVER Ventures โดยมีส่วนร่วมจาก Amazon ควบคู่ไปกับ Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital และ Red Bull Ventures เพื่อการติดตาม ความครอบคลุมของอุตสาหกรรม AI ในวงกว้างยิ่งขึ้น ข้อตกลงดังกล่าวตอกย้ำความเชื่อมั่นที่เพิ่มมากขึ้นในหมู่นักลงทุนว่าวิดีโอเป็นข้อมูลหลักประเภทถัดไปที่ AI จะต้องเชี่ยวชาญ
'โลกไม่ได้เกิดขึ้นในข้อความ'
ผู้ร่วมก่อตั้งและประธานเจ้าหน้าที่บริหาร Jae Lee วางกรอบภารกิจของบริษัทไว้อย่างชัดเจน “เมื่อห้าปีก่อน เราเริ่มต้นด้วยการสังเกตง่ายๆ ว่า โลกไม่ได้เกิดขึ้นในข้อความ แต่มันเกิดขึ้นในการเคลื่อนไหว” เขาเขียนในประกาศ
ในการให้สัมภาษณ์กับ Bloomberg News ลีได้ขยายแนวคิดนี้ โดยอ้างว่าวิดีโอ "เป็นข้อมูลสัญญาณที่คล้ายกันมากที่สุดที่เราได้รับในฐานะมนุษย์เพื่อเรียนรู้เกี่ยวกับโลก" เขาเปรียบเทียบสิ่งนั้นกับสถาปัตยกรรม AI ที่โดดเด่นในขณะนี้ โดยสังเกตว่า "นั่นแตกต่างจากแม้แต่โมเดลชายแดนล่าสุด เช่น Fable 5 และ Mythos ซึ่งยังคงเป็นโมเดลภาษา"
ข้อโต้แย้งนี้ขึ้นอยู่กับช่องว่างว่า AI ทำงานอย่างไรในปัจจุบัน ในช่วงทศวรรษที่ผ่านมาของการพัฒนา AI Lee เขียนว่า "ทำให้ข้อความตั้งโปรแกรมได้" แต่วิดีโอยังไม่ได้รับการปฏิบัติแบบเดียวกัน เขาบรรยายวิดีโอของโลกว่า "ส่วนใหญ่เป็นสสารมืดต่อเครื่องจักร" ซึ่งอยู่ในเอกสารสำคัญ บนโดรน และในฟีดดาวเทียม แต่ยังคงเข้าถึงได้ส่วนใหญ่ "ผ่านชื่อไฟล์ โฟลเดอร์ คำอธิบายภาพ ข้อความถอดเสียง และความทรงจำของมนุษย์"
ทำให้วิดีโอใช้งานได้โดยตัวแทน
เป้าหมายที่ระบุไว้ของ Twelve Labs คือการปิดช่องว่างนั้น “เป้าหมายของเราคือการทำให้ทุกวินาทีของวิดีโอสามารถระบุตำแหน่ง ค้นหาได้ และใช้งานได้โดยตัวแทน” Lee เขียน โดยชี้ไปที่การเพิ่มขึ้นของตัวแทน AI ระบบอัตโนมัติที่สามารถให้เหตุผลและดำเนินการได้ ในฐานะตัวขับเคลื่อนหลักความต้องการ
หากโมเดลภาษาทำให้เอกสารสามารถค้นหาได้ และเครื่องสร้างโค้ดทำให้ซอฟต์แวร์สร้างได้เร็วขึ้น โมเดลความเข้าใจวิดีโออาจทำให้ระบบอัตโนมัติเข้าถึงไฟล์วิดีโอที่บันทึกไว้จำนวนมหาศาลและยังไม่ได้ใช้ ซึ่งมีแอปพลิเคชันทั่วทั้งสื่อ ความปลอดภัย ยานพาหนะขับเคลื่อนอัตโนมัติ และองค์กร ทุกสาขาที่การตัดสินใจขึ้นอยู่กับความเข้าใจว่าเกิดอะไรขึ้นภายในสตรีมวิดีโอ
หมวดหมู่ที่แออัดแต่แตกต่าง
Twelve Labs ครองตำแหน่งเฉพาะที่อยู่ระหว่างสองหมวดหมู่ที่มองเห็นได้ชัดเจนที่สุดใน AI ด้านหนึ่งคือเครื่องมือสร้างวิดีโอ ซึ่งเป็นเครื่องมือที่สร้างวิดีโอใหม่จากข้อความแจ้ง อีกด้านคือโมเดลภาษาขนาดใหญ่ที่ประมวลผลข้อความ Twelve Labs มุ่งเน้นไปที่การทำความเข้าใจวิดีโอแทน การตีความวิดีโอที่มีอยู่ เพื่อให้เครื่องจักรสามารถค้นหา สรุป และดำเนินการกับวิดีโอได้
PYMNTS ตั้งข้อสังเกตว่าโปรแกรมสร้างวิดีโอเป็นส่วนหนึ่งของหมวดหมู่ซอฟต์แวร์สำหรับผู้บริโภคยุคใหม่ที่สร้างขึ้นเกี่ยวกับ AI ควบคู่ไปกับสหาย AI การค้นหาการสนทนา และเครื่องมือการเขียนโค้ดตามคำสั่ง แนวทางของ Twelve Labs มุ่งเป้าไปที่ด้านอุปทานของแนวโน้มนั้น โดยสร้างโมเดลพื้นฐานที่สามารถทำให้วิดีโอเป็นประเภทข้อมูลชั้นหนึ่งสำหรับเอเจนต์และแอปพลิเคชันที่ถูกสร้างขึ้นด้านบน
เหตุใดนักลงทุนจึงสนับสนุนวิดีโอ AI
รายชื่อผู้สนับสนุนในรอบนี้ชี้ไปที่คำสั่ง AI สำหรับวิดีโอที่น่าสนใจเชิงกลยุทธ์ การมีส่วนร่วมของ Amazon มีความโดดเด่นเนื่องจากแผนกคลาวด์ AWS ของบริษัทเป็นผู้ให้บริการโครงสร้างพื้นฐาน AI รายใหญ่และการลงทุนในบริการวิดีโอและสื่อของบริษัทเอง NAVER Ventures ซึ่งเป็นหน่วยงานด้านการลงทุนของบริษัทอินเทอร์เน็ตยักษ์ใหญ่ของเกาหลีใต้ และ Radical Ventures ซึ่งเป็นบริษัทที่มุ่งเน้นด้าน AI ส่งสัญญาณความสนใจทั่วโลกในหมวดหมู่นี้
รอบนี้ยังสะท้อนให้เห็นถึงรูปแบบที่กว้างขึ้นในการระดมทุนของ AI จนถึงกลางปี 2569 ซึ่งนักลงทุนกำลังมุ่งเงินทุนไปยังสตาร์ทอัพที่ดำเนินการตามรูปแบบข้อมูลนอกเหนือจากข้อความ แม้ว่าโมเดลแบบข้อความจะดูดซับความสนใจและการลงทุนไปแล้ว แต่วิดีโอและข้อมูลในโลกแห่งความเป็นจริงในรูปแบบอื่น ๆ จะถูกมองว่าเป็นเวทีถัดไปที่อาจพบความก้าวหน้าและการกลับมาที่มีความหมาย
สิ่งที่เงินทุนช่วยให้ได้
Twelve Labs ไม่ได้ให้รายละเอียดแผนการใช้จ่ายที่เฉพาะเจาะจง แต่ขนาดของการระดมทุน 100 ล้านดอลลาร์ในรอบเดียว แสดงให้เห็นการลงทุนที่สำคัญในด้านการประมวลผล ความสามารถ และการพัฒนาแบบจำลอง โมเดลการทำความเข้าใจวิดีโอการฝึกอบรมมีความต้องการในการคำนวณมากกว่าโมเดลข้อความการฝึกอบรม เนื่องจากขนาดไฟล์วิดีโอที่แท้จริง ซึ่งเพิ่มต้นทุนในการดำเนินการ
สำหรับ Lee เดิมพันก็คือผลตอบแทนจะเป็นตัวกำหนดต้นทุนนั้น ตามที่เขากล่าวไว้ "บันทึกความเป็นจริงที่สมบูรณ์ที่สุดยังคงอยู่นอกชั้นความหมายที่ระบบ AI สมัยใหม่ใช้เป็นส่วนใหญ่" เงินทุนใหม่ของ Twelve Labs เป็นการเดิมพันว่าการนำวิดีโอมาไว้ในเลเยอร์นั้นจะเป็นหนึ่งในความก้าวหน้าของ AI ที่กำหนดในปีต่อ ๆ ไป
ที่มา: PYMNTS, Bloomberg News, บล็อกของบริษัท Twelve Labs
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →

