AMD і Cerebras Systems оприлюднили технічне партнерство для створення нового виду інфраструктури штучного інтелекту, поєднуючи стійкову платформу Helios від AMD із Wafer-Scale Engine (WSE) від Cerebras у єдиному дезагрегованому робочому процесі. Співпраця, оголошена на заході AMD Advancing AI 2026 23 липня 2026 року, спрямована безпосередньо на усунення затримок і вузьких місць пропускної здатності, які зробили висновки однією з найдорожчих проблем в епоху генеративного ШІ. Слідкуйте за останніми новинами в цій індустрії, що швидко розвивається, найновішими новинами AI.

Основна ідея полягає в тому, щоб припинити змушувати один чіп робити все. У традиційному стеку висновків одне сімейство графічних процесорів виконує як важку роботу попереднього заповнення, пов’язану з переварюванням підказки, так і делікатну, послідовну роботу з генерування кожного нового маркера. Це компроміс, оскільки ці дві роботи мають дуже різні вимоги. AMD і Cerebras стверджують, що розподіл роботи, метод, відомий як дезагрегований висновок, дозволяє кожному двигуну робити те, що йому найкраще.

Як два двигуни розподіляють роботу

Згідно з офіційним оголошенням AMD, AMD Helios слугуватиме високопродуктивним механізмом масштабованої пропускної здатності, спираючись на графічні процесори AMD Instinct для швидкої обробки великих пакетів вхідних даних. Тим часом Cerebras Wafer-Scale Engine забезпечить надшвидке декодування та генерацію токенів із наднизькою затримкою. Мікросхеми Cerebras побудовані на цілих пластинах, а не нарізані на окремі матриці, що дає їм величезну пропускну здатність внутрішньої пам’яті, яка особливо добре підходить для потокової передачі токенів без зупинок.

Компанії кажуть, що завдяки поєднанню двох обчислювальних механізмів спільне рішення, як очікується, забезпечить до 5 разів більше токенів за секунду за ват, показник, який став центральною системою показників для економічного висновку, оскільки провайдери конкурують як за швидкість, так і за вартість енергії. Ця цифра була наведена в прес-релізі AMD і повідомлена в торгових точках, включаючи Tom's Hardware, Investing.com і Yahoo Tech.

Постріл у домінування Nvidia

Партнерство також є стратегічним сигналом. Екосистема CUDA Nvidia та лінійка графічних процесорів наразі домінують у навчанні та висновках зі штучного інтелекту, і претенденти все частіше приходять до висновку, що перемогти чинного лідера на одній архітектурі важко. Business Insider сформулював угоду як спробу AMD проти Nvidia, зробивши ставку на висновок, фазу обчислень штучного інтелекту, яка, як очікується, розвиватиметься найшвидше, коли моделі переходять від розробки до виробництва.

Для AMD поєднання з Cerebras розширює привабливість Instinct і Helios за межі навчання. Для Cerebras, яка торгує на Nasdaq під тикером CBRS разом із AMD (NASDAQ: AMD), інтеграція з головним постачальником прискорювачів дає її технології масштабування пластин більш чіткий шлях до великих підприємств і хмарних розгортань. Cerebras планує розгорнути AMD Helios у власних центрах обробки даних, і компанії очікують, що спільне рішення буде доступне спочатку через Cerebras Cloud у другій половині 2026 року.

Чому дезагрегація зараз важлива

Вартість висновків стала визначальною точкою тиску для індустрії ШІ. Оскільки моделі стають все більшими, а додатки вимагають відповідей у ​​реальному часі, витрати на генерацію кожного маркера та затримка, яку користувачі чекають на нього, можуть визначити, чи життєздатний продукт. Дезагрегований висновок розглядає попереднє заповнення та декодування як окремі робочі навантаження, які можна скеровувати на апаратне забезпечення, яке найкраще відповідає кожному з них. Це філософія дизайну, яку такі компанії, як Cerebras, відстоюють уже більше року.

Оголошення AMD-Cerebras свідчить про те, що цей підхід переходить від повстанської ідеї до схваленої промисловістю архітектури. Об’єднавши фахівця з пропускної здатності та фахівця з затримок, дві компанії роблять ставку на те, що майбутнє висновків — це не один чіп, який керуватиме всіма, а скоординована система спеціалізованих механізмів.

What to watch

Залишається кілька питань. Значення 5x токенів за секунду на ват є очікуванням, а не стороннім еталонним показником, і реальна продуктивність залежатиме від конкретних моделей і робочих навантажень, які використовують клієнти. Деталі ціни та доступності після запуску Cerebras Cloud не розголошуються, і незрозуміло, коли рішення може охопити інших хмарних провайдерів.

Still, the deal underscores a broader shift in AI hardware: the assumption that a single GPU architecture will serve every stage of the AI pipeline is fraying. If AMD and Cerebras can deliver on their efficiency claims, disaggregated inference could become a standard part of how the largest AI systems are built.

Будьте попереду ШІ

Ландшафт обладнання штучного інтелекту розпадається на спеціалізовані табори, і наслідки для вартості, швидкості та конкуренції є величезними. Читайте більше новин AI на AI Buzz Wire, щоб бути в курсі всіх великих угод, випусків і тестів.