Inception Labs Mercury 2.5 را روز سه شنبه منتشر کرد، نسخه جدیدی از مدل زبان انتشار تجاری خود که این شرکت آن را به عنوان تواناترین LLM انتشار در بازار توصیف می کند و تا آنجا که می داند، بزرگترین مدل زبان انتشار آموزش دیده شده است. طبق اعلام این شرکت، این مدل نسبت به مدل قبلی خود، Mercury 2، 40 درصد افزایش هوش را ارائه می دهد، در حالی که همان مشخصات سرویس دهی کم تأخیر و کم هزینه را حفظ می کند که معماری انتشار را برای بارهای کاری با حجم بالا جذاب کرده است.

این شرکت به رهبری مدیرعامل استفانو ارمون ادعا می‌کند که مرکوری 2.5 با مدل‌های مرزی بهینه‌سازی شده از جمله GPT-5.6 Luna (پایین)، Gemini 3.5 Flash-Lite و Claude Haiku 4.5 قابل مقایسه است. این مقایسه‌ها توسط فروشنده گزارش شده‌اند و هنوز توسط معیارهای مستقل تأیید نشده‌اند، اما آنها یک مدل انتشار - مدت‌ها یک کنجکاوی تحقیقاتی - را به‌عنوان جایگزین تولید برای متصدیان اتورگرسیو قرار می‌دهند. برای اطلاع از آخرین اخبار مدل هوش مصنوعی، پوشش مداوم مدل AI Buzz Wire را دنبال کنید. [آخرین اخبار مدل هوش مصنوعی] (https://aibuzzwire.news)

سرعت، زمینه و قیمت

اعداد تیترها تهاجمی هستند. Inception Labs می گوید Mercury 2.5 1107 توکن در ثانیه بر روی پردازنده های گرافیکی انویدیا که به طور گسترده در دسترس هستند، با پنجره زمینه 260000 توکن تولید می کند. قیمت گذاری 0.20 دلار به ازای هر میلیون توکن ورودی و 0.75 دلار به ازای هر میلیون توکن خروجی تعیین شده است، با تبلیغات راه اندازی که مدل را 80٪ به 0.04 دلار در هر میلیون ورودی و 0.15 دلار در هر میلیون خروجی تخفیف می دهد.

از نظر قابلیت، مدل با استدلال قابل تنظیم ارائه می شود - به توسعه دهندگان اجازه می دهد تا تاخیر را با عمق بر اساس درخواست معامله کنند - همراه با فراخوانی ابزار موازی و خروجی JSON تراز طرحواره برای تولید ساختاریافته. این شرکت انتشار را به عنوان اولین نتیجه یک حلقه آموزشی که توسط تله‌متری تولید هدایت می‌شود، تعریف می‌کند: از زمان راه‌اندازی Mercury 2، هزاران توسعه‌دهنده با آن ساخته‌اند، ده‌ها شرکت آن را به کار گرفته‌اند، و استفاده بیش از یک مرتبه بزرگ‌تر شده است.

چرا مدل های Diffusion متن را سریعتر تولید می کنند

LLM های اصلی از OpenAI، Google و Anthropic خود رگرسیون هستند: آنها متنی را در یک زمان تولید می کنند و هر توکن مشروط به همه چیزهایی است که قبل از آن ایجاد شده است. این وابستگی متوالی سطح سختی را تحت سرعت تولید قرار می دهد. در عوض، مدل‌های زبان انتشار با یک بلوک نویز شروع می‌شوند و به طور مکرر همه توکن‌ها را به‌طور موازی اصلاح می‌کنند، که پس از آموزش مدل برای همگرایی تمیز، توان عملیاتی بسیار بالاتری را در سخت‌افزار GPU معمولی ممکن می‌سازد.

این مبادله از لحاظ تاریخی کیفیت بوده است: مدل‌های انتشار از مدل‌های خودبازگشتی در معیارهای استدلال و دستورالعمل پیروی کرده‌اند. شرط اصلی Inception Labs - و ادعای زیربنای Mercury 2.5 - این است که این شکاف تا جایی کاهش یافته است که انتشار در محوری که اکثر مشتریان واقعاً احساس می کنند برنده می شود: تأخیر و هزینه در حجم تولید.

ادعاهای تولید از مشتریان اولیه

این اعلامیه بیشتر بر روی استقرار مشتریان تکیه دارد تا جداول معیار. OpenCall، که عامل های تلفن هوش مصنوعی را برای تماس های مستقیم مشتری می سازد، گزارش داد که حرکت به Mercury، متوسط ​​تاخیر پاسخ مدل آن را به حدود 170 میلی ثانیه رساند. الیور سیلورستاین، بنیانگذار و مدیر عامل OpenCall، گفت که زمان پاسخگویی P99 شرکت از چند دقیقه به یک ثانیه و میانگین آن از 0.4 ثانیه به زیر 0.2 کاهش یافته است - ارقامی که او آنها را به طور قابل توجهی سریعتر از هر ارائه دهنده دیگری که شرکت آزمایش کرده بود توصیف کرد، از جمله با استدلال فعال.

Augment Code، یک سازنده دستیار کدنویسی هوش مصنوعی، از Mercury برای فشرده سازی زمینه، مسیریابی مدل و جستجوی ابزار MCP استفاده می کند. بر اساس آزمایشگاه Inception، انتقال بارهای کاری فشرده سازی به مرکوری، تأخیر آن مرحله را 82 درصد کاهش می دهد، از تقریباً 150 ثانیه به 27 ثانیه، و با حفظ کیفیت، هزینه آن را 90 درصد کاهش می دهد. مورد استفاده نشان می‌دهد که کجای اقتصاد چیست: عامل‌های کدگذاری فراخوانی‌های مدل پشتیبانی کوچک زیادی را در اطراف هر نسل اولیه انجام می‌دهند، و تأخیر و هزینه در آن تماس‌ها ترکیب می‌شوند.

انویدیا، که سخت افزار آن مدل را اجرا می کند، نیز به این موضوع توجه کرده است. Shruti Koparkar، مدیر ارشد محصول در گروه محاسبات شتاب دهنده NVIDIA، گفت که Inception مدل های زبان مبتنی بر انتشار پیشرفته ای را در زیرساخت هوش مصنوعی NVIDIA ارائه کرده است و اینکه کیفیت Mercury 2.5 با سرعت های معماری پایدار جدید نشان می دهد که چگونه به سرعت سیستم های تولیدی با سرعت پایدار رشد می کنند.

پیش نمایش صدای عطارد و مسیریاب مرکوری

در کنار این مدل، Inception Labs پیش نمایش دو محصول جدید را نیز اعلام کرد. Mercury Voice یک LLM انتشاری است که برای عوامل صوتی با کمترین بودجه تأخیر بهینه شده است و زمان تا اولین توکن تبلیغاتی کمتر از 170 میلی ثانیه دارد. مرکوری روتر از یک مدل انتشار برای درک اعلان های دریافتی و هدایت آنها به هر مدلی - باز یا بسته - استفاده می کند که بهترین ترکیب از کیفیت، سرعت و هزینه را ارائه می دهد و Inception را به عنوان یک لایه بالاتر از رقبای خود و همچنین یکی از آنها قرار می دهد.

Mercury 2.5 از طریق API خود Inception و همچنین از طریق Baseten و OpenRouter در دسترس است. استقرار سازمانی ظرفیت اختصاصی، مقیاس خودکار، کنترل‌های انطباق و نگهداری داده‌های قابل تنظیم را اضافه می‌کند. این شرکت 100 میلیون توکن رایگان به توسعه دهندگانی که API را امتحان می کنند ارائه می دهد.

این شرکت همچنین گفت که قبلاً آموزش مدل بعدی خود را آغاز کرده است - بزرگترین مدل آن که برای عرضه در ماه‌های آینده هدف گذاری شده است - که آن را به عنوان یک جهش در توانایی توصیف می‌کند که هیچ یک از سرعت انتشار یا کارایی نشانه را کاهش نمی‌دهد. اگر این ادعا برقرار باشد، فشار بر شرکت‌های متصدی خودرگرسیون ابتدا در ردیف‌های کالایی بازار احساس می‌شود، جایی که قیمت و تاخیر در بیشتر قراردادها تعیین می‌کنند.

[از هوش مصنوعی جلوتر بمانید] (https://aibuzzwire.news)

آخرین پیشرفت‌های هوش مصنوعی و اخبار هوش مصنوعی را دنبال کنید، زیرا معماری‌های مدل جدید وارد مرحله تولید می‌شوند.

اخبار هوش مصنوعی را بیشتر بخوانید →