프랑스 AI 회사인 Mistral AI는 로봇이 단 하나의 일반 RGB 카메라만 사용하여 복잡한 환경을 자율적으로 탐색할 수 있게 해주는 80억 매개변수 모델인 Robostral Navigate를 통해 로봇 공학 분야에 진출했습니다. 2026년 7월 8일에 발표된 이 모델은 구현된 AI 및 물리적 로봇 공학에 대한 Mistral의 첫 번째 움직임을 나타냅니다.
Robostral Navigate는 RGB 이미지와 일반 언어 지침을 가져와 사무실, 주거용 건물 또는 실외 공간과 같은 환경을 통해 로봇을 이동합니다. 차별화되는 점은 하드웨어 미니멀리즘입니다. 경쟁 모델은 일반적으로 깊이 센서, LiDAR 또는 동시에 작동하는 여러 카메라에 의존하는 반면 Robostral Navigate는 하나의 표준 RGB 카메라만 사용하고 깊이 센서는 전혀 사용하지 않습니다. 새로운 AI 모델 출시에 대한 포괄적인 내용을 보려면 독자들이 당사 홈페이지에서 최신 AI 개발을 따라갈 수 있습니다.
R2R-CE의 최첨단 성능
단일 카메라 접근 방식에도 불구하고 Robostral Navigate는 교육 중에 진행된 환경에서 탐색 지침을 따르기 위한 표준 테스트인 R2R-CE(연속 환경의 Room-to-Room) 검증 보이지 않는 벤치마크에서 76.6%의 성공률을 달성했습니다. 이 결과는 이전 최고의 단일 카메라 접근 방식을 9.7% 포인트 앞섰고, 깊이 센서나 다중 카메라를 사용하는 최고의 시스템을 4.5% 포인트 앞섰습니다. 둘 다 사용하지 않았음에도 불구하고 말이죠.
확인된 검증에서 모델은 79.4%의 성공률에 도달했습니다. Mistral에 따르면 이 모델은 바퀴 달린 로봇, 다리 달린 로봇, 심지어 비행 로봇까지 실행하는 로봇 유형 전반에 걸쳐 일반화되며 재교육 없이 로봇 크기에 적응합니다.
전적으로 시뮬레이션으로 구축
Robostral Navigate의 가장 주목할만한 측면 중 하나는 완전히 자체적으로 구축되었으며 시뮬레이션만을 대상으로 교육을 받았다는 것입니다. Mistral은 6,000개의 시뮬레이션 장면에서 수집된 약 400,000개의 궤적 데이터 세트를 생성하는 효율적인 데이터 생성 파이프라인을 구축했습니다. 이러한 시뮬레이션 우선 접근 방식은 실제 데이터 수집에 따른 비용 및 물류 문제 없이 신속한 반복을 가능하게 했습니다.
모델은 포인팅, 계산, 객체 위치 파악과 같은 기초 작업에 특화된 Mistral의 자체 비전 언어 모델에서 초기화됩니다. 내비게이션은 이러한 기능의 자연스러운 확장으로 나타납니다. 모델이 이미지에서 사물의 위치를 이해하면 해당 사물을 향해 이동하는 방법을 학습합니다. 특히 Robostral Navigate는 기존 오픈 소스 비전 언어 모델에 의존하지 않습니다.
포인팅 기반 탐색 및 강화 학습
Robostral Navigate는 포인팅 기반 탐색 메커니즘을 사용합니다. 작업과 관찰 기록이 주어지면 모델은 로봇의 현재 카메라 보기에서 대상 위치의 이미지 좌표와 도착 시 원하는 방향을 추론하여 로봇이 다음에 이동할 위치를 예측합니다. 이러한 포인팅 접근 방식을 사용하면 미터법 변위에 의존하는 명령과 달리 카메라 내장 및 세계 규모의 변화에 대해 정책이 자연스럽게 견고해집니다.
대상 위치가 현재 시야 외부에 있고 포인팅이 적용되지 않는 경우 모델은 로봇의 로컬 좌표계의 변위로 대체됩니다. 지도 학습 후 Mistral은 CISPO 알고리즘을 사용하여 온라인 강화 학습을 적용했습니다. 이를 통해 모델은 시행착오를 통해 학습하고, 실패를 복구하고 탐색적 동작을 획득할 수 있었습니다. 이 강화 학습 단계만으로도 성공률이 3.2% 포인트 향상되었으며 Mistral은 성과가 정체 기미 없이 여전히 상승하고 있다고 보고합니다.
접두사 캐싱을 통한 효율적인 교육
핵심 기술 혁신은 접두사 캐싱을 기반으로 한 효율적인 훈련 알고리즘입니다. 트리 기반 주의 마스킹 전략을 사용하는 Mistral의 방법은 전체 에피소드를 단일 시퀀스로 압축하여 단일 정방향 패스에서 모든 시간 단계에 대한 훈련을 가능하게 하는 동시에 시간 단계 사이의 정보 누출을 방지합니다. 시간 단계당 하나의 샘플을 사용하여 훈련하는 것과 비교하여 이 접근 방식은 모든 학습 신호를 보존하면서 훈련 토큰 수를 22배로 줄입니다. 실제로 이 회사는 이를 통해 몇 달이 걸리는 훈련 실행을 며칠 만에 완료되는 실행으로 전환한다고 말합니다.
애플리케이션 및 향후 계획
Mistral은 Robostral Navigate를 오늘날 고객에게 가장 수요가 많은 기능 중 하나로 간주합니다. 이 기술은 제조, 배송, 물류, 숙박업 전반에 걸쳐 애플리케이션을 활용합니다. 모델에게 한 가지 지시를 내리면 전체 작업을 자율적으로 완료하고, 훈련 중에는 한 번도 보여주지 않았던 사람과 장애물로 가득 찬 실제 공간을 통과합니다.
회사는 이번 릴리스를 통합된 구체화된 에이전트를 향한 첫 번째 단계일 뿐이라고 설명합니다. Mistral은 로봇 팀을 적극적으로 확장하고 연구 과학자 및 엔지니어를 찾고 있습니다. 이번 출시는 파리에 본사를 둔 스타트업의 중요한 전략적 확장을 의미합니다. 이 스타트업은 주로 대규모 언어 모델로 알려져 왔으며 이제는 물리적 AI 및 로봇 공학에 대한 진지한 의지를 나타냈습니다.
로봇 공학으로의 전환은 AI 산업이 구체화된 AI에 점점 더 많이 투자하고 기업들이 언어 모델 기능을 물리적 세계 상호 작용으로 확장할 수 있는 방법을 모색함에 따라 이루어졌습니다. Mistral의 시뮬레이션 우선 단일 카메라 접근 방식은 특히 다중 센서 설정이 실용적이지 않은 비용에 민감한 상업용 응용 분야에서 자율 내비게이션 시스템 배포에 대한 장벽을 낮출 수 있습니다.
AI보다 앞서 나가세요
이제 Mistral의 고객이 Robostral Navigate를 사용할 수 있습니다. 더 많은 최신 AI 뉴스와 분석을 보려면 AI Buzz Wire를 방문하세요.
AI 뉴스 자세히 보기 →


