Во вторник Inception Labs выпустила Mercury 2.5, новую версию своей коммерческой языковой модели распространения, которую компания описывает как наиболее эффективную диффузионную языковую модель LLM на рынке и, насколько ей известно, самую крупную модель диффузного языка, когда-либо обученную. Согласно заявлению компании, эта модель обеспечивает увеличение интеллекта на 40% по сравнению со своей предшественницей Mercury 2, сохраняя при этом тот же профиль обслуживания с низкой задержкой и низкой стоимостью, который сделал диффузионную архитектуру привлекательной для больших объемов рабочих нагрузок.
Компания, возглавляемая генеральным директором Стефано Эрмоном, утверждает, что Mercury 2.5 сопоставим с экономически оптимизированными моделями Frontier, включая GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5. Эти сравнения сообщаются поставщиками и еще не проверены независимыми тестами, но они позиционируют диффузионную модель — долгое время являвшуюся исследовательским любопытством — как производственную альтернативу традиционным авторегрессионным моделям. Чтобы быть в курсе последних новостей о моделях искусственного интеллекта, следите за текущими репортажами о моделях AI Buzz Wire. последние новости о моделях искусственного интеллекта
Скорость, контекст и цена
Цифры в заголовках агрессивны. Inception Labs сообщает, что Mercury 2.5 генерирует 1107 токенов в секунду на широко доступных графических процессорах NVIDIA с контекстным окном в 260 000 токенов. Цена установлена на уровне 0,20 доллара США за миллион входных токенов и 0,75 доллара США за миллион выходных токенов, при этом акция по запуску дает скидку на модель на 80% до 0,04 доллара США за миллион входных токенов и 0,15 долларов США за миллион выходных токенов.
Что касается возможностей, модель поставляется с настраиваемыми рассуждениями, позволяющими разработчикам обменивать задержку на глубину для каждого запроса, а также с параллельными вызовами инструментов и выровненным по схеме выводом JSON для структурированной генерации. Компания представляет этот выпуск как первый результат цикла обучения, основанного на производственной телеметрии: с момента запуска Mercury 2 тысячи разработчиков работали с его помощью, десятки предприятий развернули его, а использование выросло более чем на порядок.
Почему модели диффузии генерируют текст быстрее
Основные LLM от OpenAI, Google и Anthropic являются авторегрессионными: они генерируют текст по одному токену за раз, причем каждый токен обусловлен всем, сгенерированным до него. Эта последовательная зависимость затрудняет скорость генерации. Вместо этого модели языка диффузии начинаются с блока шума и параллельно итеративно уточняют все токены, что обеспечивает гораздо более высокую пропускную способность на обычном оборудовании графического процессора, как только модель научится четко сходиться.
Исторически компромиссом было качество: диффузионные модели отставали от авторегрессионных по критериям рассуждения и следования инструкциям. Основная ставка Inception Labs (и утверждение, лежащее в основе Mercury 2.5) заключается в том, что этот разрыв сократился до такой степени, что диффузия выигрывает по той оси, которую действительно ощущает большинство клиентов: задержка и стоимость при объеме производства.
Претензии к производству от первых клиентов
Это объявление в значительной степени опирается на развертывание клиентов, а не на таблицы эталонных показателей. Компания OpenCall, которая создает телефонные агенты с искусственным интеллектом для звонков клиентов в режиме реального времени, сообщила, что переход на Mercury увеличил среднюю задержку ответа ее модели примерно до 170 миллисекунд. Оливер Сильверстайн, соучредитель и генеральный директор OpenCall, сказал, что время отклика P99 компании сократилось с нескольких минут до одной секунды, а его медианное значение с 0,4 секунды до менее 0,2 — цифры, которые он назвал значительно более быстрыми, чем у любого другого провайдера, которого тестировала компания, в том числе с включенным рассуждением.
Augment Code, разработчик помощников по кодированию на базе искусственного интеллекта, использует Mercury для сжатия контекста, маршрутизации моделей и поиска инструментов MCP. По данным Inception Labs, перенос рабочих нагрузок по уплотнению на Mercury сократил задержку этого этапа на 82 %, примерно с 150 до 27 секунд, а также снизил его стоимость на 90 % при сохранении качества. Вариант использования иллюстрирует, в чем заключается проблема экономики: агенты кодирования делают множество небольших вызовов вспомогательной модели вокруг каждого первичного поколения, а задержка и стоимость этих вызовов усугубляются.
NVIDIA, на чьем оборудовании работает модель, также приняла участие. Шрути Копаркар, старший менеджер по продуктам группы ускоренных вычислений NVIDIA, сказал, что Inception имеет передовые языковые модели на основе диффузии в инфраструктуре NVIDIA AI, и что повышение качества Mercury 2.5 с устойчивыми скоростями показывает, как быстро новые архитектуры могут превратиться в готовые к производству системы.
Предварительные обзоры Mercury Voice и Mercury Router
Помимо модели, Inception Labs анонсировала анонсы двух новых продуктов. Mercury Voice — это диффузионный LLM, оптимизированный для голосовых агентов с минимальным бюджетом на задержку и временем появления первого токена рекламы менее 170 миллисекунд. Mercury Router использует модель распространения, чтобы понимать входящие запросы и перенаправлять их в ту модель — открытую или закрытую, — которая предлагает лучшее сочетание качества, скорости и стоимости, позиционируя Inception как уровень выше своих конкурентов, а также как один из них.
Mercury 2.5 доступен через собственный API Inception, а также через Baseten и OpenRouter. Корпоративные развертывания добавляют выделенную емкость, автоматическое масштабирование, средства контроля соответствия и настраиваемое хранение данных. Компания предлагает 100 миллионов бесплатных токенов разработчикам, пробующим API.
Компания также заявила, что уже начала обучение своей следующей модели — самой крупной из них, выпуск которой запланирован на ближайшие месяцы — которую она описывает как скачок в возможностях, который не уступает ни скорости распространения, ни эффективности токена. Если это утверждение подтвердится, давление на участников авторегрессии будет ощущаться в первую очередь на товарных уровнях рынка, где цена и задержка определяют большинство контрактов.
Будьте впереди ИИ
Следите за последними разработками в области искусственного интеллекта и последними новостями в области искусственного интеллекта по мере того, как в производство выходят новые модели архитектуры.
Читать больше новостей об искусственном интеллекте →