Новый стартап в области искусственного интеллекта, основанный бывшим исследователем OpenAI, запустил то, что он называет совершенно новым классом моделей — тот, который не может написать вам эссе, и говорит, что именно в этом вся суть.
TypeSafe AI объявила во вторник о выпуске своей первой модели System One под названием Jev, которая уже доступна в раннем доступе. Компанию основал Диого Алмейда, который говорит, что исследование, лежащее в основе следования инструкциям ChatGPT, выросло из работы, в которой он участвовал в OpenAI. После двух лет скрытности он утверждает, что зацикленность отрасли на чате не позволяет понять, где автоматизация на самом деле терпит неудачу. Подробнее об этой истории — в нашем тенденции ИИ.
«Модели уже много лет ведут себя в чате как сверхчеловеки, так где же вся автоматизация?» Алмейда написал в стартовом посте. «Это был мой главный вопрос последние четыре года».
Что на самом деле представляет собой модель «System One»
Название заимствовано из психологического различия между быстрым, инстинктивным мышлением и медленным, преднамеренным рассуждением. В то время как большие языковые модели генерируют текст токен за токеном — гибкие, общие и склонные к случайной бессмыслице, — Jev TypeSafe создан для чего-то более узкого: принимать неструктурированное состояние в качестве входных данных и возвращать типизированные структурированные решения с прикрепленными калиброванными вероятностями.
Компания описывает Jev как «функциональный вызов передовой разведки: ввод неструктурированного состояния, вывод вероятностных решений». Поскольку возможные выходные данные определяются заранее, а модель никогда не генерирует строки произвольной формы, TypeSafe утверждает, что она не может выдавать ошибки типа (свойство, которое, по словам компании, скорее математически гарантировано, чем статистически вероятно), и не может галлюцинировать, как это могут делать модели, генерирующие текст.
Согласно стартовому сообщению, эта архитектура отличается от основной практики по трем направлениям: новая модельная архитектура, параллельный сэмплер, который выдает все выходные данные в одном запросе, а не последовательно, и метод обучения, который компания называет «Обучение с подкреплением для калиброванных решений» (RLCD), который оптимизируется для эпистемически честных вероятностей вместо человеческих предпочтений или программно проверяемых результатов.
Заявления: в 100 раз быстрее, за небольшую часть затрат
Цифры, которые публикует TypeSafe, агрессивны. Компания утверждает, что Jev обеспечивает интеллект, сравнимый с существующими передовыми LLM, при решении задач, которые она называет «в форме System One» — классификация, маршрутизация, оценка, извлечение и решения о разветвлении — при этом отвечая за 70–500 миллисекунд, тогда как сквозное время ответа для передовых моделей составляет от 3 до 329 секунд. По словам компании, это работает в 40–200 раз быстрее.
Цены также нетрадиционны: 0,042 доллара США за миллион входных токенов, при этом выходные токены бесплатны, поскольку выходные данные вычисляются параллельно, а не генерируются токен за токеном. В своем сообщении компания признала, что пока не может доказать, что цены являются устойчивыми в масштабе.
«Чрезвычайные утверждения требуют чрезвычайных доказательств», — говорится в сообщении, прежде чем перечислить имеющиеся у него доказательства.
Квитанции — и что говорят скептики
TypeSafe опубликовала параллельную демонстрацию, сравнивающую Jev с GPT-5.6 Terra, которую она описывает как наиболее сопоставимую пограничную модель с аналогичным интеллектом, и говорит, что единственное разногласие в записанном запуске было связано с действительно двусмысленным суждением. Он также представил новую методологию «оценки рабочего процесса», которая измеряет модели на основе консенсуса крупнейших внешних моделей — Astra OpenAI и Fable Anthropic — внутри фиксированного вычислительного графа, и утверждает, что Джев «владеет границей Парето почти на два порядка».
Примечательно, что компания опубликовала сопроводительный пост под названием «antibenchmaxxing», объясняя, почему она избегает традиционных тестов, утверждая, что модель, разработанная для структурированных решений внутри рабочих процессов программного обеспечения, не поддается значимому глобальному сравнению.
Реакция на Hacker News, где запуск набрал сотни баллов за считанные часы, варьировалась от искреннего восторга до подчеркнутого скептицизма. Несколько комментаторов отметили, что публичные доказательства состоят в основном из демонстрационных видеороликов, в том числе одного, показывающего модель, обеспечивающую игровой цикл Doom, а не воспроизводимых сторонних оценок. Другие утверждали, что этот подход лучше всего понимать как чрезвычайно быстрый классификатор высочайшего качества, полезный для части рабочих нагрузок, а не как замена LLM.
Даже сочувствующие наблюдатели четко сформулировали бремя доказывания. «Да, они говорят как скептики, но не предоставляют тонны доказательств, кроме пары видеороликов с демонстрациями», — написал один из комментаторов. «Живая демонстрация была бы гораздо более убедительной».
Почему это может иметь значение
Подача попадает в очень болезненную точку. Большая часть производственных вызовов LLM в коммерческом программном обеспечении вообще не является генеративной — это бинарные суждения, присвоение категорий и решения о маршрутизации, обернутые прозой. Если модель может совершать эти вызовы с калиброванной уверенностью за 70 миллисекунд и фактически с нулевыми затратами на выходе, экономика программного обеспечения на основе искусственного интеллекта значительно меняется: пользовательские интерфейсы в реальном времени становятся практичными, а этапы конвейера, которые были слишком дорогими для автоматизации с помощью LLM, становятся достаточно дешевыми, чтобы работать повсюду.
Предлагаемые варианты использования TypeSafe включают классификацию и маршрутизацию данных, проверку и защиту выходных данных LLM, обнаружение джейлбрейков и анализ сокращения карт больших наборов данных — рабочие нагрузки, при которых окружающий код может ограничивать свободу модели и выявлять ошибки.
Компания откровенна в отношении открытых вопросов: ее опубликованные оценки проводились с ноутбуков на западном побережье США, а долгосрочная устойчивость цен остается недоказанной. От того, выдержат ли утверждения разведки Джева результаты независимых испытаний, будет зависеть, станут ли «Модели System One» категорией или диковинкой.
Ранний доступ уже открыт через сайт компании.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →