Новий стартап штучного інтелекту, заснований колишнім дослідником OpenAI, запустив те, що він називає абсолютно новим класом моделі — таким, який не може написати вам есе, і каже, що це саме суть.

TypeSafe AI оголосив у вівторок про випуск своєї першої «моделі System One» під назвою Jev, доступної негайно в ранньому доступі. Компанію заснував Діого Алмейда, який каже, що дослідження інструкцій ChatGPT виросли з його роботи в OpenAI. Після двох років скритності він стверджує, що фіксація індустрії на чаті приховала, де автоматизація насправді не працює. For more context on this story, see our ongoing AI industry coverage.

«Роками моделі були надлюдьми в чаті, тож де вся автоматизація?» — написав Алмейда в повідомленні про запуск. «Це було моє запитання про водіння протягом останніх чотирьох років».

Що таке модель «Перша система».

Назва запозичена з психологічного розрізнення між швидким, інстинктивним мисленням і повільним, навмисним міркуванням. Там, де великі мовні моделі генерують текст маркер за маркером — гнучкий, загальний і схильний до випадкових впевнених нісенітниць — Jev від TypeSafe створений для чогось вужчого: приймати неструктурований стан як вхідні дані та повертати введені, структуровані рішення з доданими каліброваними ймовірностями.

Компанія описує Jev як «виклик прикордонної розвідувальної функції: неструктурований стан, введені ймовірнісні рішення». Оскільки можливі результати визначені заздалегідь, а модель ніколи не генерує рядки довільної форми, TypeSafe стверджує, що не може створювати помилки типу — властивість, за словами компанії, є математично гарантованою, а не статистично ймовірною — і не може галюцинувати так, як це можуть зробити моделі, що генерують текст.

Архітектура відрізняється від загальноприйнятої практики трьома способами, згідно з повідомленням про запуск: нова архітектура моделі, паралельний вибірник, який створює всі результати в одному запиті, а не послідовно, і метод навчання, який компанія називає Reinforcement Learning for Calibrated Decisions (RLCD), який оптимізує для епістемічно чесних ймовірностей замість людських уподобань або програмно перевірених результатів.

Твердження: у 100 разів швидше, невелика частка вартості

Цифри, які публікує TypeSafe, є агресивними. У компанії стверджують, що Jev надає інтелектуальні дані, які можна порівняти з існуючими передовими LLM-ами для завдань, які вона називає «у формі System One» — класифікація, маршрутизація, підрахунок балів, вилучення та рішення про розгалуження — при цьому реагує за 70–500 мілісекунд проти часу наскрізної відповіді від 3 до 329 секунд для передових моделей. За словами компанії, це працює в 40-200 разів швидше.

Ціноутворення так само нетрадиційне: 0,042 долара за мільйон вхідних токенів, вихідні токени безкоштовні, оскільки виходи обчислюються паралельно, а не генеруються токен за токеном. У своїй публікації компанія визнала, що поки що не може довести, що ціноутворення є стабільним у масштабі.

«Надзвичайні претензії вимагають надзвичайних доказів», — йдеться в публікації, перш ніж запропонувати, які докази вона має.

Квитанції — і що говорять скептики

TypeSafe опублікував паралельну демонстрацію, у якій порівнював Jev із GPT-5.6 Terra, яку він описує як найбільш порівнянну передову модель із подібним інтелектом, і каже, що єдина розбіжність у записаному циклі включала справді неоднозначне судження. Він також представив нову методологію «оцінки робочого процесу», яка порівнює моделі з консенсусом найбільших зовнішніх моделей — Astra від OpenAI і Fable від Anthropic — у фіксованому обчислювальному графіку, і стверджує, що Джев «володіє межею Парето майже на 2 порядки».

Примітно, що компанія опублікувала супровідний пост під назвою «antibenchmaxxing», пояснюючи, чому вона уникає традиційних тестів, стверджуючи, що модель, розроблена для структурованих рішень у робочих процесах програмного забезпечення, протистоїть значущому глобальному порівнянні.

Реакція на Hacker News, де запуск привернув сотні балів за кілька годин, коливалася від щирого хвилювання до гострого скептицизму. Декілька коментаторів відзначили, що публічні докази складаються здебільшого з демонстраційних відео, у тому числі відео, яке показує модель, що запускає ігровий цикл Doom, а не відтворювані оцінки третьої сторони. Інші стверджували, що цей підхід найкраще розуміти як надзвичайно швидкий класифікатор найвищої якості, корисний для частини робочих навантажень, а не як заміну LLM.

Навіть співчутливі спостерігачі чітко сформулювали тягар доведення. «Так, вони говорять як скептики, але не пропонують масу доказів, окрім кількох відео з демонстраціями», — написав один із коментаторів. «Жива демонстрація була б набагато переконливішою».

Чому це все одно може мати значення

Подача приземляється на справжню больову точку. Велика частка робочих викликів LLM у комерційному програмному забезпеченні взагалі не є генеративною — це двійкові судження, призначення категорій і рішення про маршрутизацію, загорнуті в прозу. Якщо модель може здійснювати ці дзвінки з каліброваною впевненістю за 70 мілісекунд і фактично з нульовими вихідними витратами, економіка програмного забезпечення на основі штучного інтелекту суттєво змінюється: користувацькі інтерфейси в реальному часі стають практичними, а кроки конвеєра, які були надто дорогими для автоматизації за допомогою LLM, стають достатньо дешевими, щоб працювати всюди.

Запропоновані сценарії використання TypeSafe включають класифікацію та маршрутизацію даних, перевірку та захист виходів LLM, виявлення втеч із в’язниці та аналіз скорочення карт у великих наборах даних — робочі навантаження, де оточуючий код може обмежувати свободу моделі та виявляти помилки.

Компанія відверта щодо відкритих питань: її опубліковані оцінки були проведені з ноутбуків на західному узбережжі США, а довгострокова стійкість цін залишається недоведеною. Від того, чи виживуть твердження Джева про інтелект після контакту з незалежним тестуванням, залежатиме, чи стануть «моделі System One» категорією чи цікавістю.

Зараз відкритий ранній доступ через сайт компанії.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →