OpenAI의 GPT-6 Astra는 코딩 측면에서 사용자 신뢰 문제로 어려움을 겪고 있을 수 있지만 새로운 로봇 벤치마크에서는 연구자들이 질적 도약에 대해 이야기하는 수치를 게시하고 있습니다. 일반 책상 개체를 중심으로 구축된 테스트인 StationeryBench에서 Astra는 100개 작업 중 7개 작업을 완전히 완료한 반면, 상대 모델인 Ai2의 MolmoAct2는 0개를 완료했습니다.

The Decoder가 설명하는 벤치마크는 마커 뚜껑 열기, 종이 클립 쏟아내기, 두 로봇 팔 사이에 눈금자 통과 등 5가지 책상 개체 작업에 걸쳐 두 모델을 서로 대결합니다. 두 모델 모두 200번의 시험에서 동일한 이중 팔 YAM 로봇을 제어했습니다. 제어 설계는 하드웨어 차이로부터 모델 기능을 분리하기 위한 것입니다. 모든 결과, 비디오 및 코드는 GitHub에 게시되었습니다. 이와 같은 더 많은 연구 보도를 보려면 AI 뉴스 허브를 확인하세요.

연구자들이 말하는 '단계적 변화'

Cornell과 Google DeepMind의 AI 연구원인 Yoav Artzi는 Astra의 성능을 "공간 추론의 단계적 변화"라고 불렀습니다. 이는 언어 벤치마크 결과가 거의 얻을 수 없는 종류입니다. REMAP이라는 아직 게시되지 않은 벤치마크에서 Astra는 인간 수준에 가까운 정확도에 도달했지만 Artzi는 "Astra조차도 다른 시나리오에서 인간이 수행하는 작업을 수행하지 못한다"고 언급했습니다.

Astra의 중간 진행 점수는 100점 만점에 46점을 기록했는데, 이는 MolmoAct2의 12점과 비교됩니다. 이는 헤드라인 완료 수치가 시사하는 것보다 더 중요한 격차입니다. 로봇 작업은 부분적인 진행과 완전한 성공에 따라 등급이 매겨지며, 라이벌의 중간 점수가 3배가 된다는 것은 모델이 몇 번의 시도에서 운에 따라 성공하기보다는 조작 시퀀스를 통해 지속적으로 더 발전하고 있음을 나타냅니다.

공간 추론이 갑자기 중요한 이유

결과는 Astra가 어떻게 훈련되었는지를 암시합니다. Artzi는 OpenAI가 Blender 장면과 같은 대량의 3D 데이터에 대해 모델을 훈련한 것으로 의심하며, 이는 3D 작업에 대한 모델의 특별한 강점과 일치합니다. 만약 그 해석이 맞다면, 실제 데이터 수집보다 저렴하고 안전한 합성 3D 환경이 로봇공학에서 가장 오랫동안 지속된 병목 현상 중 하나인 물리적 세계 역량을 향한 실행 가능한 경로가 되고 있음을 시사합니다.

벤치마크의 설계는 로봇 공학 평가가 어디로 향하고 있는지에 대해서도 알려줍니다. StationeryBench의 작업은 마커 뚜껑 열기, 종이 클립 쏟아내기, 자 전달 등 의도적으로 평범합니다. 왜냐하면 영화적 위업이 아닌 일상적인 조작이 실험실 데모와 유용한 기계를 구분하기 때문입니다. 200번의 시험을 통해 동일한 듀얼 암 YAM 하드웨어에서 두 모델을 모두 평가하고 모든 비디오를 게시하는 것은 개척 연구실의 주력 제품과 관련된 기능 주장에 대해 유난히 투명한 설정입니다.

Allen Institute for AI(Ai2)의 비교 모델인 MolmoAct2는 어떤 작업도 완료하지 않은 것이 그 자체의 데이터입니다. 이는 범용 프론티어 모델과 특수 제작 로봇 모델 사이의 격차가 더 이상 닫히지 않고 적어도 추론이 많은 조작에 있어서 반전되고 있음을 시사합니다.

The Decoder가 인용한 보도에 따르면 OpenAI는 자체 소비자 로봇을 구축하려는 장기 계획을 가지고 있습니다. 물체, 손, 궤적을 추론할 수 있는 개척 언어 모델은 그 부분의 소프트웨어 절반입니다. 하드웨어 절반은 아직 해결되지 않은 상태로 남아 있지만 StationeryBench와 같은 벤치마크는 해당 이야기를 측정하는 방법입니다.

맥락: 일주일이 복잡한 모델

그 결과 OpenAI에 대한 이상한 뉴스 사이클이 시작되었습니다. 이 벤치마크의 중심에 있는 동일한 모델은 출시 이후 더 멍청해졌다는 사용자 불만에 직면하는 데 일주일을 보냈습니다. OpenAI는 Codex 사용 제한을 재설정하기 전에 오발격 기술부터 오작동하는 컨텍스트 실험에 이르기까지 세 가지 명명된 결함을 추적했습니다. 실험실에 단계 변경 결과를 게시하는 동안 생산 단계에서 비틀거리는 모델은 현재 AI 산업의 요령입니다. 기능과 신뢰성은 서로 다른 시계에서 발전하고 있습니다.

또한 OpenAI의 자체 리더십이 참여한 안전 논쟁 중에도 발생했습니다. 회사의 수석 과학자는 점점 더 자율화되는 시스템의 제어를 해결한 실험실이 없다고 경고했으며 Anthropic의 CEO는 업계가 개척 개발을 완전히 늦추도록 촉구했습니다. 물리적 세계를 조작하는 모델을 보여주는 벤치마크는 비록 세계가 문구류로 뒤덮인 책상에 불과하더라도 발전 속도가 감독을 앞지르고 있다고 주장할 때 두 경영진이 인용하는 결과와 정확히 같습니다.

결론

100개 중 7개의 완전히 완료된 작업은 내일 책상 위에 로봇을 놓지 않을 것입니다. 그러나 라이벌의 0점에서 7점으로 올라가고 중간 진행 점수가 3배 더 높은 것은 2년 전 언어 이해 능력 차트를 다시 작성한 일종의 불연속성입니다. 공개 질문은 동일한 모델이 개발자가 지불할 의사가 있는 가격으로 벤치마크 외부에서 해당 역량을 안정적으로 제공할 수 있는지 여부입니다.

AI보다 앞서 나가세요

벤치마크, 혁신, 작동하는 기계를 향한 경쟁이 매일 이어졌습니다.

AI 뉴스 자세히 보기 →