Patronus AI, стартап, который создает моделируемые цифровые среды для оценки автономных агентов искусственного интеллекта, привлек $50 млн в раунде серии B, поскольку спрос на надежное тестирование агентов резко возрастает. Раунд проводился Greenfield Partners при участии Notable Capital, Lightspeed, Datadog и Samsung, сообщает TechCrunch, в результате чего общий объем финансирования компании достиг 70 миллионов долларов.
Новая проблема: агенты, которые используют короткие пути Подробнее об этой истории — в нашем тенденции ИИ.
По мере того как агенты ИИ переходят от ответов на вопросы к автономному выполнению сложных, многоэтапных задач, поставщикам моделей и стартапам, создающим таких агентов, необходимы гарантии того, что системы будут надежно работать в широком диапазоне сценариев. Лаборатории ИИ часто используют тесты, чтобы продемонстрировать мастерство модели, но высокий балл в тесте, ориентированном на агентов, не доказывает, что ИИ действительно может правильно выполнять реальные задачи.
Именно на этом пробеле и сосредоточено внимание Patronus AI. Основанная в 2023 году бывшими исследователями Meta AI Анандом Каннаппаном и Ребеккой Цянь, компания из Сан-Франциско создает так называемые «модели цифрового мира» — копии веб-сайтов и внутренних систем, в которых агенты проходят стресс-тестирование после обучения. Агенты оцениваются с помощью обучения с подкреплением, которое итеративно вознаграждает за успешное выполнение задач и наказывает за ошибки.
Заимствование у автономных транспортных средств
Компания сравнивает свой подход с тем, как Waymo обучала беспилотные автомобили, сначала создавая синтетические миры для проверки транспортных средств на устойчивость к редким опасностям, таким как суровая погода или ребенок, бегущий за мячом. Ключевое отличие от агентов ИИ заключается в том, что они склонны использовать короткие пути, а это означает, что они не могут правильно выполнить задачи, даже если они кажутся успешными.
«Patronus действительно хорошо умеет выявлять хакерские атаки и следить за тем, чтобы модели привлекались к ответственности», — сказал Гленн Соломон, управляющий директор Notable Capital. Соломон описал спрос на моделируемую среду компании как почти ненасытный. Практически все передовые лаборатории искусственного интеллекта и многие новые стартапы теперь являются клиентами, а доход Patronus за последний год вырос в 15 раз.
Выход за рамки проверяемых задач
В настоящее время Patronus предоставляет моделируемые цифровые миры для разработки программного обеспечения и финансов — двух областей, результаты которых относительно легко проверить. Но компания рассматривает это только как начало. «Сегодня мы очень сосредоточены на проблемах, которые поддаются проверке, проблемах, которые вы можете немедленно проверить и подтвердить, но есть гораздо больше областей, которые очень не поддаются проверке или которые очень трудно проверить», — сказал Каннаппан.
Цель состоит в том, чтобы создать среду, достаточно существенную для тестирования агентов в долгосрочной перспективе. «Мы хотим иметь возможность создать среду, в которой вы сможете управлять агентом, который может работать 10 часов, 10 дней или 10 недель», — сказал Каннаппан. Тот факт, что процессы поддаются проверке, не означает, что они просты, а способность обнаружить сбой агента в ходе многодневного рабочего процесса имеет центральное значение для ценностного предложения компании.
Финансирование также поступает по мере того, как более широкая индустрия искусственного интеллекта пытается определить, как измерить прогресс. Результаты тестов стали спорной валютой: критики утверждают, что модели могут быть оптимизированы для конкретных игровых тестов без реального улучшения в реальных задачах. Моделируемая среда Patronus предлагает альтернативу: агенты тестирования в открытых сценариях, где единственным доказательством успеха является правильно выполненное задание, а не номер в таблице лидеров.
Для корпоративных клиентов это различие имеет значение. Агент кодирования, который проходит тест, но молча вносит ошибки в производственную кодовую базу, или финансовый агент, который неправильно округляет цифры, могут нанести гораздо больший ущерб, чем можно предположить по низкой оценке теста. Выявляя эти сбои в «песочнице» перед развертыванием, Patronus позиционирует оценку как необходимое условие доверия, а не второстепенную мысль.
Особый подход на переполненном поле
Что касается конкурентов, Патронус считает, что он в первую очередь конкурирует с внутренними оценочными группами, которые лаборатории искусственного интеллекта уже создали для оценки поведения агентов. В то время как компании, занимающиеся человеческими данными, такие как Mercor и Surge, помогают разработчикам моделей с обучением с подкреплением, Patronus действует по-другому, оценивая поведение агентов без какого-либо участия человека, автоматизируя обнаружение сбоев, которые в противном случае потребовали бы дорогостоящего ручного анализа.
Этот раунд свидетельствует об уверенности инвесторов в том, что оценка агентов станет основополагающим слоем стека ИИ. Поскольку агенты берут на себя более автономную работу, от бронирования поездок до проведения финансового анализа, стартапы, способные доказать надежность этих систем еще до их развертывания, позиционируют себя как незаменимые привратники в эпоху агентного ИИ.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →


