法国人工智能公司 Mistral AI 凭借 Robostral Navigate 进入机器人领域,这是一个拥有 80 亿参数的模型,使机器人只需使用一个普通 RGB 摄像头即可在复杂的环境中自主导航。该模型于 2026 年 7 月 8 日发布,代表 Mistral 首次进军实体人工智能和物理机器人领域。
Robostral Navigate 拍摄 RGB 图像和简单语言指令,并在办公室、住宅楼或室外空间等环境中移动机器人。它的与众不同之处在于其硬件极简主义:虽然竞争模型通常依赖于深度传感器、激光雷达或协同工作的多个摄像头,但 Robostral Navigate 仅使用一个标准 RGB 摄像头,并且没有任何深度传感器。为了全面报道新兴人工智能模型的发布,读者可以在我们的主页关注最新的人工智能发展。
R2R-CE 上最先进的性能
尽管采用单摄像头方法,Robostral Navigate 在 R2R-CE(连续环境中的房间到房间)验证未见基准(训练期间在环境中遵循导航指令的标准测试)上仍取得了 76.6% 的成功率。这一结果比之前最好的单摄像头方法高出 9.7 个百分点,并且比使用深度传感器或多摄像头的最佳系统高出 4.5 个百分点,尽管两者都没有使用。
经验证,该模型的成功率达到 79.4%。根据米斯特拉尔的说法,该模型适用于各种机器人类型,可以在轮式、腿式甚至飞行机器人上运行,并且无需重新训练即可适应机器人尺寸。
完全模拟构建
Robostral Navigate 最值得注意的方面之一是它完全是内部构建的,并且专门进行了模拟训练。 Mistral 构建了一个高效的数据生成管道,生成了包含 6,000 个模拟场景中收集的约 400,000 条轨迹的数据集。这种模拟优先的方法可以实现快速迭代,而无需面临现实世界数据收集的成本和后勤挑战。
该模型是从 Mistral 自己的视觉语言模型初始化的,该模型专门用于定位、计数和对象定位等基础任务。导航是这些功能的自然延伸:一旦模型了解了图像中物体的位置,它就会学会如何向它们移动。值得注意的是,Robostral Navigate 不依赖任何现有的开源视觉语言模型。
基于指向的导航和强化学习
Robostral Navigate 使用基于指向的导航机制。给定任务和观察历史,该模型通过推断机器人当前摄像机视图中目标位置的图像坐标以及到达时所需的方向来预测机器人接下来应该移动的位置。与依赖公制位移的命令不同,这种指向方法使策略自然地对相机内在特性和世界尺度的变化具有鲁棒性。
当目标位置位于当前视野之外并且指向不适用时,模型会回退到机器人局部坐标系中的位移。经过监督训练后,Mistral 使用 CISPO 算法应用了在线强化学习,使模型能够从试错中学习、从失败中恢复并获得探索行为。仅这个强化学习阶段就将成功率提高了 3.2 个百分点,Mistral 报告称,性能仍在攀升,没有停滞的迹象。
通过前缀缓存进行高效训练
一项关键的技术创新是基于前缀缓存的高效训练算法。 Mistral 的方法使用基于树的注意力屏蔽策略,将整个情节压缩为单个序列,从而能够在单个前向传递中对所有时间步进行训练,同时防止时间步之间的信息泄漏。与每个时间步使用一个样本进行训练相比,这种方法将训练标记的数量减少了 22 倍,同时保留了所有学习信号。该公司表示,在实践中,这将需要数月时间的训练转变为几天内完成的训练。
应用程序和下一步发展
Mistral 将 Robostral Navigate 定位为解决当今客户最需要的功能之一。该技术解锁了制造、交付、物流和酒店业的应用。给模型一个指令,它就会自主完成整个任务,穿过充满人和障碍的生活空间,这是训练期间从未出现过的。
该公司将此次发布描述为迈向统一实体代理的第一步。米斯特拉尔正在积极扩大其机器人团队,并寻找研究科学家和工程师。此次发布标志着这家总部位于巴黎的初创公司的重大战略扩张,该公司主要以其大型语言模型而闻名,现在标志着对物理人工智能和机器人技术的认真承诺。
随着更广泛的人工智能行业越来越多地投资于实体人工智能,企业开始探索如何将语言模型功能扩展到物理世界交互,从而进入机器人技术领域。 Mistral 的模拟优先、单摄像头方法可以降低部署自主导航系统的障碍,特别是在多传感器设置不切实际的成本敏感的商业应用中。
保持人工智能领先地位
Robostral Navigate 现已可供 Mistral 的客户使用。如需了解更多 AI 重大新闻和分析,请访问 AI Buzz Wire。
阅读更多人工智能新闻 →


