Inception Labs Mercury 2.5 را روز سه شنبه منتشر کرد، نسخه جدیدی از مدل زبان انتشار تجاری خود که این شرکت آن را به عنوان تواناترین LLM انتشار در بازار توصیف می کند و تا آنجا که می داند، بزرگترین مدل زبان انتشار آموزش دیده شده است. طبق اعلام این شرکت، این مدل نسبت به مدل قبلی خود، Mercury 2، 40 درصد افزایش هوش را ارائه می دهد، در حالی که همان مشخصات سرویس دهی کم تأخیر و کم هزینه را حفظ می کند که معماری انتشار را برای بارهای کاری با حجم بالا جذاب کرده است.
این شرکت به رهبری مدیرعامل استفانو ارمون ادعا میکند که مرکوری 2.5 با مدلهای مرزی بهینهسازی شده از جمله GPT-5.6 Luna (پایین)، Gemini 3.5 Flash-Lite و Claude Haiku 4.5 قابل مقایسه است. این مقایسهها توسط فروشنده گزارش شدهاند و هنوز توسط معیارهای مستقل تأیید نشدهاند، اما آنها یک مدل انتشار - مدتها یک کنجکاوی تحقیقاتی - را بهعنوان جایگزین تولید برای متصدیان اتورگرسیو قرار میدهند. برای اطلاع از آخرین اخبار مدل هوش مصنوعی، پوشش مداوم مدل AI Buzz Wire را دنبال کنید. [آخرین اخبار مدل هوش مصنوعی] (https://aibuzzwire.news)
سرعت، زمینه و قیمت
اعداد تیترها تهاجمی هستند. Inception Labs می گوید Mercury 2.5 1107 توکن در ثانیه بر روی پردازنده های گرافیکی انویدیا که به طور گسترده در دسترس هستند، با پنجره زمینه 260000 توکن تولید می کند. قیمت گذاری 0.20 دلار به ازای هر میلیون توکن ورودی و 0.75 دلار به ازای هر میلیون توکن خروجی تعیین شده است، با تبلیغات راه اندازی که مدل را 80٪ به 0.04 دلار در هر میلیون ورودی و 0.15 دلار در هر میلیون خروجی تخفیف می دهد.
از نظر قابلیت، مدل با استدلال قابل تنظیم ارائه می شود - به توسعه دهندگان اجازه می دهد تا تاخیر را با عمق بر اساس درخواست معامله کنند - همراه با فراخوانی ابزار موازی و خروجی JSON تراز طرحواره برای تولید ساختاریافته. این شرکت انتشار را به عنوان اولین نتیجه یک حلقه آموزشی که توسط تلهمتری تولید هدایت میشود، تعریف میکند: از زمان راهاندازی Mercury 2، هزاران توسعهدهنده با آن ساختهاند، دهها شرکت آن را به کار گرفتهاند، و استفاده بیش از یک مرتبه بزرگتر شده است.
چرا مدل های Diffusion متن را سریعتر تولید می کنند
LLM های اصلی از OpenAI، Google و Anthropic خود رگرسیون هستند: آنها متنی را در یک زمان تولید می کنند و هر توکن مشروط به همه چیزهایی است که قبل از آن ایجاد شده است. این وابستگی متوالی سطح سختی را تحت سرعت تولید قرار می دهد. در عوض، مدلهای زبان انتشار با یک بلوک نویز شروع میشوند و به طور مکرر همه توکنها را بهطور موازی اصلاح میکنند، که پس از آموزش مدل برای همگرایی تمیز، توان عملیاتی بسیار بالاتری را در سختافزار GPU معمولی ممکن میسازد.
این مبادله از لحاظ تاریخی کیفیت بوده است: مدلهای انتشار از مدلهای خودبازگشتی در معیارهای استدلال و دستورالعمل پیروی کردهاند. شرط اصلی Inception Labs - و ادعای زیربنای Mercury 2.5 - این است که این شکاف تا جایی کاهش یافته است که انتشار در محوری که اکثر مشتریان واقعاً احساس می کنند برنده می شود: تأخیر و هزینه در حجم تولید.
ادعاهای تولید از مشتریان اولیه
این اعلامیه بیشتر بر روی استقرار مشتریان تکیه دارد تا جداول معیار. OpenCall، که عامل های تلفن هوش مصنوعی را برای تماس های مستقیم مشتری می سازد، گزارش داد که حرکت به Mercury، متوسط تاخیر پاسخ مدل آن را به حدود 170 میلی ثانیه رساند. الیور سیلورستاین، بنیانگذار و مدیر عامل OpenCall، گفت که زمان پاسخگویی P99 شرکت از چند دقیقه به یک ثانیه و میانگین آن از 0.4 ثانیه به زیر 0.2 کاهش یافته است - ارقامی که او آنها را به طور قابل توجهی سریعتر از هر ارائه دهنده دیگری که شرکت آزمایش کرده بود توصیف کرد، از جمله با استدلال فعال.
Augment Code، یک سازنده دستیار کدنویسی هوش مصنوعی، از Mercury برای فشرده سازی زمینه، مسیریابی مدل و جستجوی ابزار MCP استفاده می کند. بر اساس آزمایشگاه Inception، انتقال بارهای کاری فشرده سازی به مرکوری، تأخیر آن مرحله را 82 درصد کاهش می دهد، از تقریباً 150 ثانیه به 27 ثانیه، و با حفظ کیفیت، هزینه آن را 90 درصد کاهش می دهد. مورد استفاده نشان میدهد که کجای اقتصاد چیست: عاملهای کدگذاری فراخوانیهای مدل پشتیبانی کوچک زیادی را در اطراف هر نسل اولیه انجام میدهند، و تأخیر و هزینه در آن تماسها ترکیب میشوند.
انویدیا، که سخت افزار آن مدل را اجرا می کند، نیز به این موضوع توجه کرده است. Shruti Koparkar، مدیر ارشد محصول در گروه محاسبات شتاب دهنده NVIDIA، گفت که Inception مدل های زبان مبتنی بر انتشار پیشرفته ای را در زیرساخت هوش مصنوعی NVIDIA ارائه کرده است و اینکه کیفیت Mercury 2.5 با سرعت های معماری پایدار جدید نشان می دهد که چگونه به سرعت سیستم های تولیدی با سرعت پایدار رشد می کنند.
پیش نمایش صدای عطارد و مسیریاب مرکوری
در کنار این مدل، Inception Labs پیش نمایش دو محصول جدید را نیز اعلام کرد. Mercury Voice یک LLM انتشاری است که برای عوامل صوتی با کمترین بودجه تأخیر بهینه شده است و زمان تا اولین توکن تبلیغاتی کمتر از 170 میلی ثانیه دارد. مرکوری روتر از یک مدل انتشار برای درک اعلان های دریافتی و هدایت آنها به هر مدلی - باز یا بسته - استفاده می کند که بهترین ترکیب از کیفیت، سرعت و هزینه را ارائه می دهد و Inception را به عنوان یک لایه بالاتر از رقبای خود و همچنین یکی از آنها قرار می دهد.
Mercury 2.5 از طریق API خود Inception و همچنین از طریق Baseten و OpenRouter در دسترس است. استقرار سازمانی ظرفیت اختصاصی، مقیاس خودکار، کنترلهای انطباق و نگهداری دادههای قابل تنظیم را اضافه میکند. این شرکت 100 میلیون توکن رایگان به توسعه دهندگانی که API را امتحان می کنند ارائه می دهد.
این شرکت همچنین گفت که قبلاً آموزش مدل بعدی خود را آغاز کرده است - بزرگترین مدل آن که برای عرضه در ماههای آینده هدف گذاری شده است - که آن را به عنوان یک جهش در توانایی توصیف میکند که هیچ یک از سرعت انتشار یا کارایی نشانه را کاهش نمیدهد. اگر این ادعا برقرار باشد، فشار بر شرکتهای متصدی خودرگرسیون ابتدا در ردیفهای کالایی بازار احساس میشود، جایی که قیمت و تاخیر در بیشتر قراردادها تعیین میکنند.
[از هوش مصنوعی جلوتر بمانید] (https://aibuzzwire.news)
آخرین پیشرفتهای هوش مصنوعی و اخبار هوش مصنوعی را دنبال کنید، زیرا معماریهای مدل جدید وارد مرحله تولید میشوند.
اخبار هوش مصنوعی را بیشتر بخوانید →