Business Insider의 보고에 따르면 Google은 컴퓨터 작업을 자동화할 수 있는 AI 에이전트를 교육하기 위해 시뮬레이션 환경을 구축하는 스타트업인 Mechanize와 15억 달러 이상의 거래를 논의 중입니다. 이번 계약은 상대적으로 젊은 회사를 AI 인프라 거래의 최상위 계층으로 끌어올릴 것이며 업계가 다음 혁신이 어디에서 나올 것이라고 생각하는지 알려줄 것입니다. 이는 최신 AI 산업 보도에서 매일 추적되는 부문을 재편하는 몇 가지 주요 움직임 중 하나입니다.
Seeking Alpha가 보도한 이번 회담에서는 더 유능한 AI의 핵심은 단지 더 큰 모델이 아니라 더 나은 훈련장, 즉 에이전트가 올바른 작업을 수행할 때까지 실제 작업을 연습할 수 있는 시뮬레이션된 작업장이라는 Mechanize의 확신에 중점을 두고 있습니다.
AI를 위한 '디지털 오피스' 구축
Mechanize의 접근 방식은 연구자들이 강화 학습 환경이라고 부르는 환경을 기반으로 구축되었습니다. The Decoder가 설명했듯이 이 스타트업은 "디지털 오피스"를 구축하고 있습니다. 즉, AI 에이전트에게 브라우저를 탐색하여 항목을 구매하는 등의 작업이 주어지고 성공 여부에 따라 등급이 매겨지는 시뮬레이션된 소프트웨어 환경입니다. 에이전트는 올바른 결과에 대한 보상 신호를 받은 다음 반복합니다.
TechCrunch는 이러한 환경을 "실제 소프트웨어 애플리케이션에서 AI 에이전트가 수행하는 작업을 시뮬레이션하는 훈련장"이라고 설명하면서 작업을 "매우 지루한 비디오 게임 만들기"에 비유했습니다. 요점은 에이전트를 혼란스럽게 만드는 드롭다운 메뉴, 잘못된 입력을 거부하는 양식, 수십 단계의 워크플로 등 현실 세계에서 직면하게 될 지저분하고 예측할 수 없는 상황에 에이전트를 노출시키고 복구 방법을 가르치는 것입니다.
이전 AI 훈련 시대를 지배했던 정적 데이터 세트와 달리 이러한 환경은 대화형입니다. 방향을 잘못 잡은 에이전트는 다시 시도할 수 있어야 하며, 예상치 못한 동작이 무엇이든 포착하고 유용한 피드백을 제공할 수 있을 만큼 환경이 탄탄해야 합니다.
RL 환경에 대한 새로운 골드러시
기계화는 혼자가 아닙니다. TechCrunch에 따르면 강화 학습 환경에 대한 추진으로 Mechanize 및 Prime Intellect를 포함하여 자금이 풍부한 새로운 종류의 스타트업이 탄생했으며 Mercor 및 Surge와 같은 기존 데이터 라벨링 회사는 이에 발맞추기 위해 많은 투자를 하고 있습니다. 한 소식통은 모든 사람이 "이 공간을 보고 있다"고 말했습니다.
붐을 주도하는 야망은 놀라운 비교로 포착됩니다. 투자자들은 이러한 회사 중 하나가 챗봇 시대를 도운 데이터 라벨링 강국을 가리키는 "환경을 위한 확장 AI"가 되기를 바랍니다. 강화 학습 환경이 AI 기능의 다음 도약을 위한 기반으로 입증된다면 이를 공급하는 회사는 엄청난 가치를 얻을 수 있습니다.
주요 연구소들이 주목하고 있다. TechCrunch는 The Information을 인용하여 Anthropic의 리더들이 내년에 강화 학습 환경에 10억 달러 이상을 지출하는 것에 대해 논의했다고 보고했습니다. 이는 Google이 보고한 Mechanize 회담의 맥락을 고려한 수치입니다.
논란이 많은 임무
Mechanize는 기술뿐만 아니라 명시된 야망으로도 주목을 받았습니다. 회사는 자신의 목표를 "모든 작업의 완전 자동화"라고 공개적으로 설명했으며, 이는 격렬한 논쟁을 불러일으켰습니다. New York Times, Fortune 및 TechCrunch는 모두 스타트업의 도발적인 사명을 조사했으며, 비평가들은 인간 노동 자동화가 사회적으로 미치는 영향에 대해 의문을 제기하고 지지자들은 그러한 자동화가 불가피하고 궁극적으로 유익하다고 주장했습니다.
그 논란은 투자자들을 단념시키지 못했습니다. 보고된 Google 강연에 따르면 적어도 하나의 하이퍼스케일러는 수십억 달러를 투자할 만큼 충분한 기술적 가능성과 충분한 경쟁적 긴급성을 보고 있습니다.
Google이 참여를 원하는 이유
Google의 경우 선도적인 환경 스타트업과의 긴밀한 파트너십을 통해 여러 가지 전략적 목표를 달성할 수 있습니다. 더 잘 훈련된 에이전트는 Google의 자체 코딩 및 생산성 도구를 강화하고, 타사 교육 데이터에 대한 의존도를 줄이며, 사용자를 대신하여 소프트웨어를 작동할 수 있는 AI 에이전트의 신흥 시장에서 우위를 점할 수 있습니다.
또한 이는 Google이 동일한 영역에 자원을 쏟아 붓는 경쟁업체와 보조를 맞추는 데 도움이 될 것입니다. 상담원이 코드 작성, 받은 편지함 관리, 구매 완료 등 실제 업무를 수행할 수 있게 되면 최고의 교육 환경을 갖춘 회사가 결정적인 이점을 가질 수 있습니다.
앞으로 나아갈 길
보고된 회담은 아직 확정된 거래가 아니며, 그러한 협상의 수치는 종종 변경됩니다. 그러나 시뮬레이션된 작업 환경에 초점을 맞춘 스타트업의 총액이 15억 달러에 달하는 규모만으로도 AI의 무게 중심이 원시 모델 크기에서 모델을 실제로 유용하게 만드는 데 필요한 인프라로 얼마나 빨리 이동하고 있는지를 보여줍니다.
계약이 종료되면 Mechanize는 AI 구축의 다음 단계를 정립하는 소규모 회사 그룹, 즉 모델을 구축하는 실험실이 아니라 작업 방법을 가르치는 공급업체에 합류하게 됩니다.
챗봇에서 행동하는 상담원까지
Mechanize에 대한 관심은 해당 분야의 더 넓은 변곡점을 반영합니다. 지난 2년은 질문에 답하고 텍스트를 생성하는 시스템인 챗봇의 시대였습니다. 현재의 흐름은 에이전트, 즉 목표 달성을 위해 종종 여러 단계에 걸쳐 조치를 취하는 시스템으로 정의됩니다. 상담원은 제한된 사람의 감독 하에 웹에서 주제를 조사하고, 보고서 초안을 작성하고, 파일을 제출할 수 있습니다.
수동적 대응자에서 능동적 운영자로의 도약은 어렵습니다. 이를 위해서는 계획하고, 오류를 복구하고, 도구를 사용하고, 장기적으로 지속할 수 있는 모델이 필요합니다. 이는 정적 데이터 세트가 가르치기에 적합하지 않은 기능입니다. 강화 학습 환경은 이러한 격차를 정확하게 해결하므로 많은 자본과 관심의 초점이 되었습니다. 유능한 에이전트를 안정적으로 생산할 수 있는 회사는 지식 작업의 큰 범주를 재정의할 수 있습니다.
위험 및 미해결 질문
이 약속에는 아직 해결되지 않은 중요한 과제가 수반됩니다. 실제 소프트웨어를 작동하도록 에이전트를 교육하는 환경에서는 해당 에이전트가 나중에 라이브 시스템에 액세스할 수 있게 되면 새로운 안전 위험이 발생할 수 있습니다. 연구원들은 AI 에이전트가 테스트를 받았을 때 예상치 못한 행동, 때로는 기만적인 행동을 취한 사례를 문서화했습니다. 이는 자율성과 신뢰성이 동시에 발전하지 않는다는 점을 상기시켜 줍니다.
기술이 사회가 대답할 수 있는 것보다 더 빨리 제기하는 경제적, 사회적 질문도 있습니다. 단일 스타트업이 사무 업무의 상당 부분을 자동화하는 데 성공하면 고용, 교육, 생산성 향상 분배에 미치는 파급 효과는 엄청날 것입니다. Mechanize의 공개적 사명은 이러한 질문이 오랫동안 가설에 머물지 않도록 보장합니다. 그리고 Google이 보고한 관심의 규모를 보면 업계가 이를 속도를 늦출 이유가 아니라 해결해야 할 문제로 취급하고 있음을 알 수 있습니다.
