OpenAI 공동 창립자이자 현재 Thinking Machines의 수석 과학자로 활동하고 있는 John Schulman은 대략 3~4년 안에 반복적인 자기 개선, 즉 AI 시스템이 자체 개발을 가속화할 것으로 예상한다고 말했습니다. Schulman은 금요일에 발표된 Dwarkesh Podcast의 원탁 회의에서 이 추정치를 제시했습니다. 여기서 세 명의 개척 연구실 연구원은 업계가 실제로 한계에 얼마나 근접했는지 공개적으로 토론했습니다.

이 대화는 Nvidia CEO Jensen Huang이 "AGI가 도래했다"고 선언하고 25명의 필즈 메달리스트 그룹이 AI 벤치마크 추적이 수학에 해를 끼치고 있다고 경고하는 시끄러운 한 주 중에 도착하여 개척지에 가까운 연구자들이 진보에 대해 어떻게 생각하는지에 대한 보기 드문 무방비한 모습을 제공했습니다. 최신 AI 개발을 추적하는 독자들에게 이 에피소드는 유용한 균형추입니다. 이들은 시스템을 구축하는 사람들이고 서로 날카롭게 동의하지 않습니다.

테이블에 누가 있었나요?

진행자 Dwarkesh Patel은 게스트들이 "다소 개방적인 실험실 및 회사"에서 일하기 때문에 패널을 구성했다고 말했습니다. 이는 그들이 기록에 대해 말할 수 있다는 것을 의미합니다. Schulman에는 오픈 소스 모델을 개발하는 스타트업인 Zyphra의 최고 기술 책임자인 Beren Millidge와 Baseten의 모델 교육 책임자인 Charlie O'Neill이 합류했습니다.

Schulman의 자격 증명은 그의 타임라인 강연에 특별한 중요성을 부여합니다. 그는 OpenAI를 공동 창립하고 ChatGPT의 기반이 되는 기술을 생산하는 인간 피드백 연구를 통해 강화 학습을 주도한 후 Thinking Machines로 떠나 현재 수석 과학자로 일하고 있습니다.

특이점에 대한 반론, 스틸맨드

Patel은 예리한 질문으로 문을 열었습니다. 만약 2036년이 세상을 변화시키는 수십억 개의 초지능 시스템 없이 도착한다면 기술적 이유는 무엇일까요? Millidge는 회의론에 대한 가장 강력한 사례를 제시하며, 모델이 연구자들이 제시한 벤치마크가 무엇이든 에이스하지만 실제 영향은 실망스러운 거의 Moravec의 역설 스타일 패턴이라고 부르는 것을 설명했습니다.

Millidge는 AI가 더 이상 일반화하지 않고도 "사람들이 벤치마크에 넣는 모든 것에 매우 능숙해지는" 세상을 설명하면서 "여전히 모든 것을 막고 있는 지속적인 시뮬레이션과 실제 간 격차가 있습니다"라고 말했습니다. 그는 강화 학습이 이미 실제로 일반화되고 있다는 증거를 지적하면서 이러한 결과가 일어날 가능성이 낮다고 생각한다고 덧붙였습니다.

Schulman은 발전이 자동으로 이루어지지 않는다는 점에 크게 동의했습니다. 그는 인간이 오늘날의 모델에 비해 실질적인 이점을 갖고 있으며 각각의 새로운 모델 출시가 일부 영역에서는 따라잡는 반면 다른 영역에서는 병목 현상을 유지한다고 말했습니다. 이는 지난 몇 번의 제품 주기를 정의한 패턴입니다.

신속한 일정: 2년, 3~4년, 5~10년

Patel이 숫자를 누르면 패널이 분할됩니다. AI가 유능한 사무직 근로자의 생산성을 언제 10배 향상시킬 수 있는지 묻는 질문에 Schulman은 처음에는 한 수치도 제시하지 않고 "2년이라고 답하겠습니다"라고 말했습니다. Millidge는 일부 작업 범주에서 이득이 이미 10배를 초과한다고 주장하면서 "실제로 그것을 어느 정도 볼 수 있다"고 말했습니다. 오닐은 '5~10년'으로 답해 가장 보수적이었다.

그런 다음 Patel은 시나리오를 "기본적으로 단지 ASI"로 특성화하면서 더 나아갔습니다. Schulman의 답변: "3~4년이라고 생각합니다." AI 연구 자체를 자동화하는 것은 현재 기술이 이미 접근할 수 있는 많은 작업을 포함하기 때문에 AI에게 가장 어려운 일 중 하나가 아니라고 덧붙였습니다. 이 교환은 다른 연구자들의 추정치에 대한 반발이 거의 없었다는 점에서 주목할 만했습니다.

자동화된 연구자가 실제로 어떻게 훈련될 것인가

에피소드의 상당 부분은 Schulman이 가격을 책정한 시나리오의 메커니즘을 다루었습니다. AI 연구를 자동화할 수 있는 AI 시스템이 어떻게 훈련될 것인지에 대한 질문에 Schulman은 "연구원의 취향을 흡수하기 위해 인간 피드백에서 학습하는 것과 다단계 연구를 수행하는 많은 실습 환경을 만드는 것의 조합"이라고 설명했습니다.

그 대답은 업계의 돈이 어디로 가는지와 연결됩니다. 훈련 에이전트를 위한 시뮬레이션된 작업 환경을 구축하는 스타트업인 Mechanize에 대한 Google의 최근 완료된 계약은 더 큰 모델뿐만 아니라 더 나은 훈련 환경이 다음 단계의 역량 향상을 주도할 것이라는 확신을 정확하게 반영합니다. Schulman은 또한 핵심적인 어려움을 지적했습니다. 자연 데이터를 기반으로 구축된 보상 기능은 지정하기 어렵고 사용자가 코드 편집을 수락했는지 여부와 같은 피상적인 신호는 교육을 오도할 수 있다는 것입니다.

증류 대 중앙 집중화

Schulman의 가장 구체적인 예측 중 하나는 산업 구조에 관한 것입니다. 그는 강화 학습을 통해 학습한 역량이 비교적 쉽게 더 작은 모델로 이전될 수 있으며 최전방 훈련을 실행할 수 있는 소수의 회사를 넘어 최전선 인접 역량을 확산할 수 있다고 주장하면서 "증류는 중앙집권적인 힘에 맞서 싸우는 주요한 것이라고 생각합니다"라고 말했습니다.

인간에게 무엇이 남아 있는가에 대한 질문에 대해 슐만은 단호했다. 그는 "인간의 마지막 직업, 가장 오래 지속될 인간의 역할은 목표를 정의하고 실제로 원하는 것이 무엇인지 결정하는 것이라고 말하고 싶다"고 말했다. Patel이 "정렬이 최종 작업"이라고 요약했을 때 Schulman은 "정렬이 일종의 대답"이라고 동의하면서 이것이 올바른 목표를 파악하고 실제로 달성하는 것으로 분해된다는 점을 지적했습니다.

타임라인 논쟁에서 에피소드가 적합한 위치

에피소드의 부제인 "우리는 천장 근처에도 없습니다"는 전반적인 방향을 포착합니다. 연구자들은 길이 얼마나 울퉁불퉁할지 논쟁하면서도 앞으로 상당한 활주로를 내다보고 있습니다. 토론은 중국 연구소의 발전을 주도하는 요소, 장기적인 강화 학습이 일반 지능을 이끌어낼 수 있는지 여부, RL이 지금처럼 작동하기 시작한 이유 등을 포괄했습니다.

이번 달에는 일정에 대한 공개 토론이 모든 측면에서 심화되었습니다. 블룸버그에 따르면 황의 "AGI가 도착했다"는 선언은 과학적 주장이 아닌 비즈니스 사례로 읽은 분석가들로부터 회의적인 반응을 불러일으켰고 OpenAI CEO인 샘 알트만은 직원들에게 안전 문제가 커지면서 최첨단 개발이 둔화될 여지가 있다고 말했습니다. 반복적인 자기 개선을 위한 Schulman의 3~4년 기간은 마케팅과 유예 사이 어딘가에 있습니다. 이는 현재 현장을 주도하는 기술을 구축한 실적이 있는 사람의 실제 추정치입니다.

그가 옳은지 여부는 패널이 동그라미만 쳤던 질문, 즉 강화 학습이 과거의 훈련 환경을 계속 일반화하는지, 벤치마크 성과와 실제 경제적 가치 사이의 격차가 계속해서 줄어들고 있는지에 달려 있습니다.

AI보다 앞서 나가세요

개척지 연구자들은 공개적으로 AI의 한계에 대해 토론하고 있습니다. AI가 발전하는 과정을 따라가보세요.

AI 버즈와이어에서 AI 소식 더 보기