Smallest.ai, một công ty khởi nghiệp được thành lập vào cuối năm 2024, đã huy động được 13 triệu đô la trong vòng Series A để xây dựng các mẫu giọng nói chuyên dụng được thiết kế để thực hiện các cuộc trò chuyện trong thời gian thực với trí tuệ nhân tạo không thể phân biệt được với cuộc trò chuyện với con người. Khoản tài trợ này được TechCrunch báo cáo lần đầu tiên vào ngày 31 tháng 7 năm 2026, do Seligman Ventures dẫn đầu với sự tham gia của Sierra Ventures và 3one4 Capital, nâng tổng số vốn tài trợ của công ty lên hơn 21 triệu USD.

Vòng này diễn ra khi thị trường AI giọng nói nóng lên và khi các nhà đầu tư săn lùng bước nhảy vọt tiếp theo ngoài chatbot dựa trên văn bản. Để liên tục đưa tin về các công ty khởi nghiệp đang định hình lại ngành trí tuệ nhân tạo, hãy theo dõi tin tức AI mới nhất của chúng tôi.

Đặt cược vào các mẫu giọng nói nhỏ, chuyên biệt

Luận điểm cốt lõi của Smallest.ai là bước đột phá tiếp theo trong tác nhân giọng nói sẽ không đến từ việc tạo ra các mô hình ngôn ngữ lớn nhanh hơn mà đến từ việc xây dựng các mô hình nhỏ hơn, có mục đích được thiết kế đặc biệt cho cuộc trò chuyện của con người. Giám đốc điều hành Sudarshan Kamath nói với TechCrunch rằng LLM ngày nay về cơ bản không phù hợp với nhịp điệu của lời nói: họ đợi một lời nhắc hoàn chỉnh trước khi bắt đầu "suy nghĩ", một sự chậm trễ có vẻ tự nhiên trong một cuộc trò chuyện bằng văn bản nhưng lại gây khó chịu khi gọi điện thoại.

Kamath giải thích: “Trong khi tôi đang nói chuyện với bạn, bạn đã suy nghĩ và bạn có thể ngắt lời tôi nếu tôi nói quá lâu”, Kamath giải thích, đồng thời mô tả bản chất chồng chéo, theo thời gian thực của cuộc đối thoại giữa con người với nhau mà mô hình khởi nghiệp của anh ấy được thiết kế để tái tạo. Mô hình này xử lý âm thanh bằng cách nghe, suy nghĩ và nói đồng thời, nhằm đạt được độ trễ phản hồi gần như bằng không.

Kiến trúc hai mô hình

Hệ thống của Smallest.ai dựa trên những gì Kamath dự đoán sẽ trở thành kiến trúc tiêu chuẩn cho các tác nhân AI: một mô hình giọng nói nhỏ, nhanh như chớp xử lý cuộc trò chuyện trực tiếp, trong khi một mô hình nền tảng lớn "ngoại tuyến" chỉ được triệu tập khi một truy vấn vượt quá cơ sở kiến thức của mô hình nhỏ hơn. Khi điều đó xảy ra, hệ thống sẽ tạm dừng người gọi trong thời gian ngắn để "nghiên cứu" vấn đề, giống như cách mà một nhân viên có thể làm.

Sự phân công lao động đó cho phép công ty khởi nghiệp tập trung nghiêm ngặt vào mô hình nhỏ của mình vào các thách thức dành riêng cho giọng nói, bao gồm xử lý các giọng khác nhau, hỗ trợ hàng chục ngôn ngữ và hoạt động trong môi trường ồn ào. Ngược lại, các đối thủ cạnh tranh áp dụng LLM có mục đích chung cho giọng nói phải đối mặt với độ trễ và chi phí tính toán cao hơn nhiều.

Khách hàng và sự cạnh tranh

Khách hàng hiện tại của Smallest.ai bao gồm các công ty trong lĩnh vực thoại và truyền thông, trong đó có RingCentral và Truecaller. Kamath lập luận rằng các công ty khởi nghiệp hỗ trợ khách hàng được tài trợ tốt có rất ít động lực để xây dựng mô hình giọng nói của riêng họ, vì việc trở thành "người có giọng nói cực kỳ giỏi sẽ khiến họ mất tập trung vào hoạt động kinh doanh cốt lõi của mình".

Công ty khởi nghiệp này cạnh tranh với công ty dẫn đầu về giọng nói AI ElevenLabs, cũng như Cartesia và những công ty trong khu vực như Sarvam tập trung vào ngôn ngữ địa phương. Trong khi một số đối thủ áp dụng AI giọng nói để lồng tiếng và podcasting, Smallest.ai chỉ tập trung vào các tác nhân đàm thoại theo thời gian thực cho khách hàng doanh nghiệp.

Bài kiểm tra Turing cho giọng nói

Tham vọng của Kamath là không rõ ràng. “Chúng tôi muốn các mô hình của mình phá vỡ bài kiểm tra Turing,” ông nói. "Bạn nên nói chuyện với mô hình của chúng tôi và không biết đó là AI hay con người. Đó là trọng tâm duy nhất của công ty."

Liệu mục tiêu đó có thể đạt được trong thời gian tới hay không vẫn là một câu hỏi mở. AI giọng nói đã được cải thiện đáng kể về độ tự nhiên trong hai năm qua, nhưng ngay cả những hệ thống tốt nhất vẫn phải vật lộn với những tín hiệu tinh tế — sự do dự, hài hước, cảm xúc — khiến cuộc trò chuyện của con người trở nên sống động. Smallest.ai đặt cược rằng một mô hình được xây dựng có mục đích cho lời nói, thay vì phỏng theo LLM được đào tạo bằng văn bản, có thể thu hẹp khoảng cách đó nhanh hơn mức mà ngành mong đợi.

Một thị trường đông đúc nhưng phát triển nhanh

Khoản tài trợ nhấn mạnh sự nhiệt tình của nhà đầu tư rộng rãi hơn đối với danh mục AI giọng nói. Giao diện giọng nói ngày càng được coi là cách tự nhiên nhất để người tiêu dùng tương tác với các tác nhân AI và các trung tâm cuộc gọi của doanh nghiệp đại diện cho một thị trường rộng lớn, có thể tiếp cận ngay lập tức, nơi ngay cả những cải thiện khiêm tốn về độ trễ và tính tự nhiên cũng có thể giúp tiết kiệm chi phí có thể đo lường được.

Với 21 triệu USD hiện có trong tay, Smallest.ai có kế hoạch mở rộng khả năng của mô hình và phát triển cơ sở khách hàng doanh nghiệp của mình. Tuy nhiên, bối cảnh cạnh tranh là không thể tha thứ: ElevenLabs chiếm thị phần đáng kể và những công ty lớn hơn tiếp tục tích hợp giọng nói vào các sản phẩm chủ lực của họ. Sự khác biệt của Smallest.ai dựa trên tiền đề rằng một mẫu giọng nói chuyên biệt, tập trung có thể hoạt động tốt hơn các hệ thống tổng quát về một chỉ số quan trọng nhất đối với cuộc trò chuyện trong thời gian thực — tốc độ mang lại cảm giác giống con người.

Đi trước AI

Từ tác nhân giọng nói đến mô hình biên giới, các giao dịch và đột phá đang diễn ra nhanh chóng. Đánh dấu trang AI Buzz Wire để biết tin tức liên tục về các công ty và nhà sáng lập đang xây dựng tương lai của trí tuệ nhân tạo.

Đọc thêm tin tức khởi nghiệp AI →