Китайська лабораторія штучного інтелекту StepFun запустила Step 5 Preview, нову флагманську мовну модель, яка привертає увагу не домінуванням у базових тестах, а більше тим, де вона знаходиться на кривій ціна-продуктивність. Цю модель, розріджену суміш експертів (MoE) із 600 мільярдами параметрів і вікном контексту в 1 мільйон токенів, уже називають найдешевшою моделлю прикордонного класу Китаю в технологічній пресі, яка висвітлює випуск.
Характеристики: велика модель, великий контекст
Відповідно до Pandaily, яка повідомила про запуск, Step 5 Preview побудовано на 600B розрідженій архітектурі MoE — дизайні, в якому лише частина параметрів моделі активується для будь-якого даного токена, зберігаючи витрати на висновки керованими, незважаючи на величезну загальну кількість параметрів. Сімейство архітектур стало домінуючою парадигмою для моделей передового масштабу, якими користуються всі, від DeepSeek до Mistral.
Контекстне вікно не менш помітне: 1 мільйон токенів, які Artificial Analysis описує приблизно як 1500 сторінок A4 тексту. Ця здатність дозволяє моделі обробляти цілі кодові бази, довгі юридичні документи або розширений аналіз кількох документів за один прохід. Модель приймає як текст, так і зображення, введення та виведення тексту, і вона працює в режимі міркування, генеруючи проміжні міркування перед отриманням остаточних відповідей.
Можливо, найуважніша деталь для розробників: StepFun планує випустити відкриті ваги моделі 15 жовтня, повідомляє Pandaili. Період попереднього перегляду API, а потім відкриті ваги, стає звичним ритмом для китайських лабораторій, що дає спільноті час для оцінки моделі, перш ніж вона потрапить на місцеве обладнання.
Еталонна позиція: сильна, не домінуюча
Згідно з незалежним індексом штучного аналізу інтелекту, Step 5 Preview отримав 44 бали, помістивши його на 24-е місце серед 200 моделей, які відстежуються на платформі — значно вище медіани 24 для свого класу, хоча й не на самій вершині кордону. Artificial Analysis характеризує цю модель як «одну з провідних моделей за рівнем інтелекту та має хорошу ціну в порівнянні з іншими моделями подібної ціни».
Показники швидкості також хороші. Згідно з оцінкою платформи, модель видає приблизно 99,8 токенів на секунду, що є вищим за середнє значення приблизно 70 токенів на секунду для відстежуваних моделей.
Одне застереження, яке варто зауважити: етап 5 попереднього перегляду надзвичайно багатослівний. Artificial Analysis виміряв, що він генерує близько 160 мільйонів токенів за допомогою свого індексу інтелекту, у порівнянні з середнім показником у 92 мільйони для порівнянних моделей. Багатослівність має значення на практиці — більше згенерованих токенів означає повільніше сприймання відповідей і вищі рахунки за вихідні токени, що може звести нанівець певну цінову перевагу залежно від завдання.
Історія ціноутворення
Крок 5 Preview робить свій найагресивніший крок у ціноутворенні. За даними Artificial Analysis, модель коштує 1,00 дол. США за мільйон вхідних токенів і 2,70 дол. США за мільйон вихідних токенів через API — проти середніх 1,88 і 10,00 дол. США відповідно для моделей цього класу. У заголовку «Східного вісника» це було чітко сформульовано: китайська модель штучного інтелекту 600B за ціною 1 долар за мільйон токенів.
Для чутливих до витрат робочих навантажень — обробка великого обсягу документів, пакетне підсумовування, агентські системи, які обробляють мільйони токенів на день — комерційно значущим варіантом є прикордонна модель, ціна якої нижча за середню ціну класу як на вході, так і на виході. Випуск відкритих ваг, запланований на жовтень, може ще знизити фактичні витрати для організацій, які можуть самостійно розміщувати.
Переповнений китайський кордон
Попередній перегляд кроку 5 з’являється на тлі інтенсивної серії випусків китайських лабораторій штучного інтелекту, а сімейство Qwen від Alibaba, DeepSeek, Z.ai та інші швидко постачають нові моделі. Технологічні видання в Китаї описали поточний період як повну спринтну випробування базових моделей, причому, як повідомляється, лабораторії працюють у періоди, які зазвичай є святковими періодами, щоб не відставати від конкурентів.
Конкретно для StepFun можна зробити ставку на те, що поєднання суміжного інтелекту, контекстного вікна токена розміром 1 млн, мультимодального вводу та агресивного ціноутворення приверне увагу розробників до жовтневого випуску відкритих ваг. Обговорення на Hacker News, де запуск моделі отримав більше ста балів, свідчить про те, що спільнота розробників приділяє увагу.
Що подивитися
Три запитання будуть формувати сприйняття Step 5 Preview протягом наступних тижнів. По-перше, як він працює в реальному кодуванні, міркуванні та агентських тестах за межами стандартизованих індексних оцінок? По-друге, чи буде вирішена проблема багатослівності до випуску відкритих ваг і як виглядатимуть системні вимоги для локального розгортання? По-третє, чи може інфраструктура API StepFun впоратися з попитом у масштабі — проблема, яка раніше спотикала дешевших учасників?
Відповіді швидко надійдуть на ринок, який вимірює прогрес днями. Щоб продовжувати висвітлювати StepFun, китайську екосистему штучного інтелекту та глобальну конкуренцію щодо ціноутворення на моделі, стежте за останніми розробками штучного інтелекту.
Будьте попереду ШІ
Подібні запуски моделей змінюють вартість інфраструктури ШІ. Будьте в курсі кожного випуску на AI Buzz Wire, вашому джерелі новин щодо моделей, досліджень і бізнесу.
Читати більше новин AI →