자율 AI 에이전트를 평가하기 위해 시뮬레이션된 디지털 환경을 구축하는 스타트업 Patronus AI는 신뢰할 수 있는 에이전트 테스트에 대한 수요가 급증함에 따라 시리즈 B 라운드에서 5천만 달러를 모금했습니다. 이번 라운드는 Notable Capital, Lightspeed, Datadog 및 Samsung이 참여한 Greenfield Partners가 주도했으며 회사의 총 자금이 7천만 달러에 이르렀다고 TechCrunch가 보도했습니다.
새로운 문제: 지름길을 택하는 상담원 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
AI 에이전트가 질문에 답하는 것에서 복잡한 다단계 작업을 자율적으로 실행하는 것으로 발전함에 따라 모델 제공업체와 이러한 에이전트를 구축하는 스타트업은 시스템이 광범위한 시나리오에서 안정적으로 작동할 것이라는 확신이 필요합니다. AI 연구실에서는 벤치마크를 사용하여 모델의 성능을 과시하는 경우가 많지만, 에이전트 중심 벤치마크에서 높은 점수를 얻었다고 해서 AI가 실제로 실제 작업을 올바르게 수행할 수 있음을 증명하는 것은 아닙니다.
Patronus AI가 집중하는 부분이 바로 그 격차입니다. 전 Meta AI 연구원인 Anand Kannappan과 Rebecca Qian이 2023년에 설립한 샌프란시스코에 본사를 둔 이 회사는 에이전트가 훈련 후 스트레스 테스트를 받는 웹사이트 및 내부 시스템의 복제본인 '디지털 세계 모델'을 구축합니다. 에이전트는 성공적인 작업 완료를 반복적으로 보상하고 오류에 불이익을 주는 강화 학습을 사용하여 평가됩니다.
자율주행자동차에서 차용
이 회사는 악천후나 공을 쫓는 어린이와 같은 드문 위험에 대해 차량을 테스트하기 위해 먼저 합성 세계를 구축하여 Waymo가 자율 주행 자동차를 훈련한 방법과 자사의 접근 방식을 비교합니다. AI 에이전트와의 주요 차이점은 지름길을 택하는 경향이 있다는 것입니다. 즉, 성공하는 것처럼 보이더라도 작업을 올바르게 완료하지 못한다는 의미입니다.
Notable Capital의 상무이사인 Glenn Solomon은 "Patronus는 해킹을 찾아내고 모델에 책임을 묻는 데 정말 능숙합니다."라고 말했습니다. 솔로몬은 회사의 시뮬레이션 환경에 대한 수요가 거의 만족스럽지 않다고 설명했습니다. 거의 모든 최첨단 AI 연구소와 많은 신흥 스타트업이 이제 고객이 되었으며 Patronus의 수익은 지난 한 해 동안 15배 증가했습니다.
검증 가능한 작업을 넘어 확장
Patronus는 현재 결과를 비교적 쉽게 확인할 수 있는 두 가지 영역인 소프트웨어 엔지니어링 및 금융을 위한 시뮬레이션된 디지털 세계를 제공합니다. 하지만 회사에서는 이를 시작에 불과하다고 보고 있습니다. Kannappan은 "오늘날 우리는 검증 가능한 문제, 즉시 확인하고 확인할 수 있는 문제에 중점을 두고 있습니다. 하지만 검증할 수 없거나 검증하기 어려운 영역이 훨씬 더 많습니다"라고 말했습니다.
목표는 장기적으로 에이전트를 테스트할 수 있을 만큼 충분한 환경을 구축하는 것입니다. Kannappan은 "우리는 실제로 10시간, 10일 또는 10주 동안 실행할 수 있는 에이전트를 운영할 수 있는 환경을 만들고 싶습니다."라고 말했습니다. 프로세스를 검증할 수 있다고 해서 프로세스가 단순하다는 의미는 아니며, 며칠 동안 진행되는 작업 흐름 도중에 에이전트가 실패하는 것을 포착하는 능력이 회사 가치 제안의 핵심입니다.
또한 광범위한 AI 산업이 진행 상황을 측정하는 방법을 놓고 고군분투하는 동안에도 자금이 도착했습니다. 벤치마크 점수는 실제 작업에서 실제로 개선하지 않고도 모델이 게임별 테스트에 최적화될 수 있다고 주장하는 비평가들과 함께 논쟁의 여지가 있는 화폐가 되었습니다. Patronus의 시뮬레이션 환경은 성공의 유일한 증거가 리더보드의 숫자가 아니라 올바르게 완료된 작업인 개방형 시나리오에서 대체 테스트 에이전트를 제공합니다.
기업 고객에게는 이러한 구별이 중요합니다. 벤치마크를 통과했지만 프로덕션 코드베이스에 버그를 조용히 도입하는 코딩 에이전트나 숫자를 잘못 반올림하는 금융 에이전트는 낮은 테스트 점수가 제안하는 것보다 훨씬 더 큰 피해를 입힐 수 있습니다. 배포 전에 샌드박스에서 이러한 오류를 포착함으로써 Patronus는 평가를 나중에 고려하는 것이 아니라 신뢰의 전제 조건으로 지정합니다.
혼잡한 현장에서의 차별화된 접근 방식
라이벌의 경우, Patronus는 AI 연구소가 에이전트 행동을 평가하기 위해 이미 구축한 내부 평가 팀과 주로 경쟁하고 있다고 믿습니다. Mercor 및 Surge와 같은 인간 데이터 회사는 모델 제작자에게 강화 학습을 지원하는 반면, Patronus는 인간의 개입 없이 에이전트가 어떻게 행동하는지 평가하여 비용이 많이 드는 수동 검토가 필요한 오류 감지를 자동화함으로써 다르게 작동합니다.
이번 라운드는 에이전트 평가가 AI 스택의 기본 계층이 될 것이라는 투자자의 확신을 나타냅니다. 에이전트가 여행 예약부터 재무 분석 수행까지 보다 자율적인 작업을 수행함에 따라 시스템을 배포하기 전에 해당 시스템의 신뢰성을 입증할 수 있는 스타트업은 에이전트 AI 시대에 없어서는 안 될 문지기로 자리매김하고 있습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →


