Patronus AI, стартап, який створює симульовані цифрові середовища для оцінки автономних агентів ШІ, залучив 50 мільйонів доларів у раунді серії B, оскільки попит на надійне тестування агентів стрімко зростає. Раунд очолювали Greenfield Partners за участю Notable Capital, Lightspeed, Datadog і Samsung, повідомляє TechCrunch, завдяки чому загальне фінансування компанії склало 70 мільйонів доларів.

Нова проблема: агенти, які обирають ярлики For more context on this story, see our ongoing latest AI developments.

Оскільки агенти штучного інтелекту еволюціонують від відповідей на запитання до автономного виконання складних багатоетапних завдань, постачальникам моделей і стартапам, які створюють такі агенти, потрібна гарантія, що системи працюватимуть надійно в широкому діапазоні сценаріїв. Лабораторії штучного інтелекту часто використовують еталонні показники, щоб продемонструвати майстерність моделі, але висока оцінка в тесті, орієнтованому на агентів, не доводить, що штучний інтелект справді може правильно виконувати завдання в реальному світі.

Саме на цій прогалині зосереджується Patronus AI. Заснована в 2023 році колишніми дослідниками Meta AI Анандом Каннаппаном і Ребеккою Цянь, компанія з Сан-Франциско створює те, що вона називає «моделями цифрового світу», копіями веб-сайтів і внутрішніх систем, у яких агенти проходять стрес-тестування після навчання. Агенти оцінюються за допомогою навчання з підкріпленням, яке неодноразово винагороджує за успішне виконання завдання та штрафує за помилки.

Запозичення з автономних транспортних засобів

Компанія порівнює свій підхід із тим, як Waymo тренувала безпілотні автомобілі, спочатку будуючи синтетичні світи для випробування транспортних засобів на рідкісні небезпеки, такі як сувора погода чи дитина, що біжить за м’ячем. Ключова відмінність від агентів штучного інтелекту полягає в тому, що вони, як правило, використовують швидкі шляхи, а це означає, що вони не можуть правильно виконати завдання, навіть якщо вони здаються успішними.

«Patronus справді добре вміє виявляти хаки та переконатися, що вони притягують моделей до відповідальності», — сказав Гленн Соломон, керуючий директор Notable Capital. Соломон описав попит на імітаційне середовище компанії як майже ненаситний. Практично кожна передова лабораторія ШІ та багато нових стартапів тепер є клієнтами, а дохід Patronus зріс у 15 разів за останній рік.

Розширення за межі завдань, які можна перевірити

Patronus наразі надає свої змодельовані цифрові світи для програмної інженерії та фінансів, двох областей, результати яких відносно легко перевірити. Але компанія вважає це лише початком. «Сьогодні ми дуже зосереджені на проблемах, які можна перевірити, проблемах, які можна негайно перевірити та підтвердити, але є ще маса сфер, які дуже важко перевірити», — сказав Каннаппан.

Мета полягає в тому, щоб створити достатньо потужне середовище для тестування агентів на довгих горизонтах. «Ми хочемо мати можливість створити середовище, в якому можна керувати агентом, який може працювати 10 годин, або 10 днів, або 10 тижнів», — сказав Каннаппан. Те, що процеси можна перевірити, не означає, що вони прості, і здатність виловити агента, який зазнає збою протягом багатоденного робочого процесу, є центральною для ціннісної пропозиції компанії.

Фінансування також надходить, оскільки галузь штучного інтелекту бореться з тим, як вимірювати прогрес. Результати порівняльних тестів стали спірною валютою, критики стверджують, що моделі можна оптимізувати для конкретних тестів ігор без справжнього покращення реальних завдань. Змодельоване середовище Patronus пропонує альтернативу, тестуючи агентів у відкритих сценаріях, де єдиним доказом успіху є правильно виконане завдання, а не номер у таблиці лідерів.

Для корпоративних клієнтів ця відмінність має значення. Агент кодування, який проходить контрольний тест, але мовчки вносить помилки у робочу кодову базу, або фінансовий агент, який неправильно округлює цифри, може завдати набагато більшої шкоди, ніж низький результат тесту. Виявляючи ці збої в пісочниці перед розгортанням, Patronus позиціонує оцінювання як передумову довіри, а не запізнілу думку.

Відмінний підхід у переповненому полі

Що стосується конкурентів, Patronus вважає, що він конкурує передусім із внутрішніми командами оцінювання, які лабораторії ШІ вже створили для оцінки поведінки агентів. У той час як фірми, що працюють із людськими даними, такі як Mercor і Surge, допомагають розробникам моделей у навчанні з підкріпленням, Patronus працює по-іншому, оцінюючи поведінку агентів без будь-якої участі людини, автоматизуючи виявлення збоїв, які інакше вимагали б дорогого перегляду вручну.

Раунд сигналізує про впевненість інвесторів у тому, що оцінка агентів стане основоположним рівнем стеку ШІ. У міру того як агенти беруться за більш автономну роботу, від бронювання поїздок до проведення фінансового аналізу, стартапи, здатні довести, що ці системи заслуговують на довіру, перш ніж їх розгортати, позиціонують себе як незамінних воротарів в епоху агентського ШІ.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →