У вівторок Inception Labs випустила Mercury 2.5, нову версію своєї комерційної моделі мови дифузії, яку компанія описує як найефективнішу модель LLM дифузії на ринку та, наскільки їй відомо, найбільшу модель мови дифузії, яку коли-небудь навчали. Згідно з повідомленням компанії, модель забезпечує 40% збільшення інтелекту в порівнянні зі своїм попередником, Mercury 2, зберігаючи той самий недорогий профіль обслуговування з низькою затримкою, який зробив дифузійну архітектуру привабливою для великих робочих навантажень.
Компанія, очолювана генеральним директором Стефано Ермоном, стверджує, що Mercury 2.5 можна порівняти з оптимізованими за ціною передовими моделями, включаючи GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite і Claude Haiku 4.5. Про ці порівняння повідомляють постачальники, і вони ще не підтверджені незалежними тестами, але вони позиціонують дифузійну модель — давню дослідницьку цікавість — як виробничу альтернативу існуючим авторегресійним моделям. Щоб дізнатися про останні новини про моделі AI, слідкуйте за новинами про моделі AI Buzz Wire. останні новини про моделі ШІ
Швидкість, контекст і ціна
Цифри в заголовках агресивні. Inception Labs каже, що Mercury 2.5 генерує 1107 токенів на секунду на широко доступних графічних процесорах NVIDIA з контекстним вікном 260 000 токенів. Ціна встановлена на рівні 0,20 дол. США за мільйон вхідних токенів і 0,75 дол. США за мільйон виведених токенів, а рекламна акція надає знижку на модель на 80% до 0,04 дол. США за мільйон вхідних і 0,15 дол. США за мільйон виведених.
Що стосується можливостей, модель постачається з настроюваним міркуванням — дозволяючи розробникам міняти затримку на глибину на основі кожного запиту — разом із паралельними викликами інструментів і виводом JSON за схемою для структурованої генерації. Компанія розглядає випуск як перший результат циклу навчання, керованого виробничою телеметрією: з моменту запуску Mercury 2 тисячі розробників створювали його, десятки підприємств розгорнули його, і використання зросло більш ніж на порядок.
Чому дифузійні моделі генерують текст швидше
Основні LLM від OpenAI, Google і Anthropic є авторегресійними: вони генерують текст по одному токену за раз, причому кожен токен залежить від усього, що було згенеровано до нього. Ця послідовна залежність знижує швидкість генерації твердої підлоги. Натомість моделі дифузійних мов починаються з блоку шуму й ітеративно вдосконалюють усі лексеми паралельно, що забезпечує набагато вищу пропускну здатність на звичайному апаратному забезпеченні GPU після того, як модель навчена чітко конвергувати.
Історично компромісом була якість: дифузійні моделі відставали від авторегресійних за міркуваннями та контрольними показниками виконання інструкцій. Основна ставка Inception Labs — і твердження, що лежить в основі Mercury 2.5 — полягає в тому, що цей розрив скоротився до точки, де дифузія виграє на осі, яку насправді відчуває більшість клієнтів: затримка та вартість при обсязі виробництва.
Претензії щодо виробництва від перших клієнтів
Оголошення значною мірою спирається на розгортання клієнтів, а не на порівняльні таблиці. OpenCall, яка розробляє телефонних агентів зі штучним інтелектом для живих дзвінків клієнтів, повідомила, що перехід на Mercury збільшив середню затримку відповіді моделі до приблизно 170 мілісекунд. Олівер Сільверстейн, співзасновник і генеральний директор OpenCall, сказав, що час відгуку P99 компанії знизився з кількох хвилин до однієї секунди, а його медіана з 0,4 секунди до менше 0,2 — цифри, які він назвав значно швидшими, ніж будь-який інший провайдер, перевірений компанією, включно з увімкненим міркуванням.
Augment Code, виробник помічників кодування AI, використовує Mercury для ущільнення контексту, маршрутизації моделі та пошуку інструментів MCP. Згідно з даними Inception Labs, перенесення робочих навантажень ущільнення на Mercury скоротило затримку цього етапу на 82% із приблизно 150 секунд до 27 секунд і знизило вартість на 90%, зберігаючи якість. Випадок використання ілюструє, де є економічна проблема: агенти кодування роблять багато невеликих викликів допоміжної моделі навколо кожного основного покоління, а затримка та вартість цих викликів збільшуються.
NVIDIA, апаратне забезпечення якої запускає цю модель, також висловило свою вагу. Шруті Копаркар, старший менеджер із продуктів у групі прискорених обчислень NVIDIA, сказав, що Inception має передові мовні моделі на основі дифузії в інфраструктурі NVIDIA AI, і що підвищення якості Mercury 2.5 із постійними швидкостями показує, як швидко нові архітектури можуть розвиватися в готові до виробництва системи.
Попередній перегляд Mercury Voice і Mercury Router
Разом з моделлю Inception Labs анонсувала попередній перегляд двох нових продуктів. Mercury Voice — це дифузійний LLM, оптимізований для голосових агентів із мінімальними бюджетами затримки, час реклами до першого токена менше 170 мілісекунд. Mercury Router використовує модель розповсюдження, щоб розуміти вхідні підказки та направляти їх до будь-якої моделі — відкритої чи закритої — яка пропонує найкраще поєднання якості, швидкості та вартості, позиціонуючи Inception на рівень вище своїх конкурентів, а також одного з них.
Mercury 2.5 доступний через власний API Inception, а також через Baseten і OpenRouter. Корпоративні розгортання додають виділену ємність, автомасштабування, контроль відповідності та настроюване збереження даних. Компанія пропонує 100 мільйонів безкоштовних токенів розробникам, які пробують API.
Компанія також повідомила, що вже почала навчання своєї наступної моделі — найбільшої на сьогоднішній день, яка планується випустити в найближчі місяці — яку вона описує як стрибок у можливостях, який не поступається ні швидкістю дифузії, ні символічною ефективністю. Якщо це твердження справджується, тиск на авторегресивних постачальників буде відчуватися в першу чергу на товарних рівнях ринку, де ціна та затримка вирішують більшість контрактів.
Будьте попереду ШІ
Слідкуйте за останніми розробками штучного інтелекту та останніми новинами щодо штучного інтелекту, поки нові моделі архітектур стрімко починають працювати.
Читати більше новин AI →