Smallest.ai، استارت آپی که در اواخر سال 2024 تأسیس شد، 13 میلیون دلار را در دور سری A جمع آوری کرده است تا مدل های صوتی تخصصی بسازد که به گونه ای طراحی شده اند که مکالمات بیدرنگ با هوش مصنوعی را از صحبت کردن با انسان متمایز کند. سرمایه گذاری که اولین بار توسط TechCrunch در 31 ژوئیه 2026 گزارش شد، توسط Seligman Ventures با مشارکت Sierra Ventures و 3one4 Capital هدایت شد و مجموع بودجه شرکت را به بیش از 21 میلیون دلار رساند.

با داغ شدن بازار هوش مصنوعی صوتی و زمانی که سرمایه گذاران به دنبال جهش بعدی فراتر از چت ربات های متنی هستند، این دور از راه می رسد. برای پوشش مداوم استارت‌آپ‌هایی که صنعت هوش مصنوعی را تغییر می‌دهند، [آخرین اخبار هوش مصنوعی] (https://aibuzzwire.news) ما را دنبال کنید.

شرط بندی روی مدل های صوتی کوچک و تخصصی

تز اصلی Smallest.ai این است که پیشرفت بعدی در عوامل صوتی از ساخت سریع‌تر مدل‌های زبان بزرگ حاصل نمی‌شود، بلکه از ساخت مدل‌های کوچک‌تر و هدفمندی که به‌طور خاص برای مکالمه انسانی مهندسی شده‌اند، حاصل خواهد شد. Sudarshan Kamath، مدیر اجرایی، به TechCrunch گفت که LLMهای امروزی اساساً با ریتم گفتار مطابقت ندارند: آنها قبل از شروع "فکر کردن" منتظر یک فرمان کامل هستند، تاخیری که در یک چت متنی طبیعی به نظر می رسد اما در یک تماس تلفنی ناراحت کننده است.

کامات با تشریح ماهیت همزمان و همپوشانی گفتگوی انسانی که مدل استارتاپ او برای تکرار آن طراحی شده است، توضیح داد: «هنگامی که من با شما صحبت می‌کنم، شما در حال فکر کردن هستید و ممکن است اگر طولانی صحبت کنم، حرف من را قطع کنید. این مدل صدا را با گوش دادن، فکر کردن، و صحبت کردن به طور همزمان پردازش می‌کند و هدف آن تاخیر در پاسخ تقریباً صفر است.

معماری دو مدل

سیستم Smallest.ai بر آنچه کامات پیش‌بینی می‌کند که به یک معماری استاندارد برای عوامل هوش مصنوعی تبدیل می‌شود متکی است: یک مدل صدای کوچک و سریع، مکالمه زنده را مدیریت می‌کند، در حالی که یک مدل بنیادی بزرگ «آفلاین» تنها زمانی فراخوانی می‌شود که یک پرسش از پایگاه دانش مدل کوچک‌تر فراتر رود. هنگامی که این اتفاق می افتد، سیستم به طور خلاصه تماس گیرنده را برای "تحقیق" در مورد موضوع، به همان اندازه که یک عامل انسانی ممکن است، به حالت تعلیق در می آورد.

این تقسیم کار به استارتاپ این امکان را می دهد که مدل کوچک خود را به شدت بر روی چالش های صوتی خاص متمرکز کند، از جمله مدیریت لهجه های مختلف، پشتیبانی از ده ها زبان و کار در محیط های پر سر و صدا. در مقابل، رقبایی که از LLM های همه منظوره برای صدا استفاده می کنند، باید با تأخیر و هزینه های محاسباتی بسیار بالاتری مقابله کنند.

مشتریان و رقابت

مشتریان فعلی Smallest.ai شامل شرکت‌هایی در حوزه صدا و ارتباطات هستند، از جمله RingCentral و Truecaller. کامات استدلال می‌کند که استارت‌آپ‌های پشتیبانی از مشتری که بودجه خوبی دارند، انگیزه کمی برای ساخت مدل‌های صوتی خود دارند، زیرا «بسیار خوب در انجام صدا، حواس‌پرتی را از کسب‌وکار اصلی آنها منحرف می‌کند».

این استارتاپ با رهبر هوش مصنوعی ElevenLabs و همچنین Cartesia و بازیگران منطقه ای مانند Sarvam که بر زبان های محلی تمرکز دارند رقابت می کند. در حالی که برخی از رقبا از هوش مصنوعی صوتی برای دوبله و پادکست استفاده می کنند، Smallest.ai به طور انحصاری بر روی عوامل مکالمه بلادرنگ برای مشتریان سازمانی متمرکز است.

تست تورینگ برای صدا

جاه طلبی کامات بدون ابهام است. او گفت: "ما می خواهیم مدل های ما تست تورینگ را بشکنند." "شما باید با مدل ما صحبت کنید و ندانید که هوش مصنوعی یا انسان است. این تنها تمرکز شرکت است."

اینکه آیا این نوار در کوتاه مدت قابل دستیابی است یا خیر، یک سوال باز باقی می ماند. هوش مصنوعی صوتی در طول دو سال گذشته به طور چشمگیری از نظر طبیعی بودن بهبود یافته است، اما حتی بهترین سیستم ها هنوز با نشانه های ظریف - تردید، شوخ طبعی، عطف عاطفی - دست و پنجه نرم می کنند که به مکالمه انسان احساس زنده بودن می دهد. شرط Smallest.ai این است که مدلی که برای گفتار ساخته شده است، به جای اقتباس از یک LLM آموزش‌دیده با متن، می‌تواند این شکاف را سریع‌تر از انتظار صنعت کاهش دهد.

بازار شلوغ اما با رشد سریع

این بودجه بر اشتیاق گسترده سرمایه گذاران برای مقوله هوش مصنوعی تاکید می کند. رابط های صوتی به طور فزاینده ای به عنوان طبیعی ترین راه برای تعامل مصرف کنندگان با عوامل هوش مصنوعی در نظر گرفته می شوند و مراکز تماس سازمانی بازاری عظیم و قابل آدرس دهی را نشان می دهند که حتی پیشرفت های اندک در تأخیر و طبیعی بودن می تواند به صرفه جویی در هزینه قابل اندازه گیری تبدیل شود.

Smallest.ai با در دست داشتن 21 میلیون دلار قصد دارد قابلیت های مدل خود را گسترش دهد و پایگاه مشتریان سازمانی خود را افزایش دهد. با این حال، چشم انداز رقابتی نابخشودنی است: ElevenLabs سهم قابل توجهی از بازار را در اختیار دارد و بازیکنان بزرگتر همچنان به ادغام صدا در محصولات شاخص خود ادامه می دهند. تمایز Smallest.ai به این فرض بستگی دارد که یک مدل صوتی متمرکز و تخصصی می‌تواند از سیستم‌های عمومی در معیاری که بیشترین اهمیت را برای مکالمه زمان واقعی دارد - سرعتی که احساس می‌کند انسانی است، بهتر عمل کند.

از هوش مصنوعی جلوتر بمانید

از عوامل صوتی گرفته تا مدل های مرزی، معاملات و پیشرفت ها به سرعت در حال انجام است. AI Buzz Wire را برای پوشش مداوم شرکت‌ها و بنیان‌گذاران سازنده آینده هوش مصنوعی نشانک‌گذاری کنید.

اخبار راه اندازی هوش مصنوعی را بیشتر بخوانید →