小米开发了一款拥有47亿参数的人工智能模型,结合视觉感知、语音和机器人控制。
小米进军机器人技术市场
中国移动设备和智能家居巨头小米宣布了新的举措:开发自有的机器人人工智能模型。公司推出了 Xiaomi‑Robotics‑0,这是一套开源系统,集成了视觉识别、语言理解与实时动作控制。该模型拥有 4.7 亿参数,并已在模拟和实际操作中打破多项记录。
模型工作原理
机器人通常遵循“感知 → 决策 → 行动”的循环。Xiaomi‑Robotics‑0 在广泛情境理解与精确运动控制之间取得平衡,采用 Mixture‑of‑Transformers(MoT)架构。
1. 视觉语言模型(VLM)– 系统“大脑”。
* 能解释模糊指令(如“请把毛巾折叠起来”)。
* 基于高质量图像理解空间关系。
* 任务包括目标检测、视觉问答和逻辑推理。
2. 动作专家(Action Expert)– 运动生成器。
* 基于扩散变换器(DiT)。
* 不一次生成单一动作,而是通过流匹配形成连续动作序列,保证平滑与精度。
保持理解的无损学习
传统 VLM 在训练物理任务时会丢失部分感知能力。小米通过同时使用多模态数据(图像+文本)和动作数据解决了这一问题。训练过程分为若干阶段:
1. 动作建议 – VLM 预测图像对应的可能动作分布,将内部表征与真实操作同步。
2. 随后 VLM “关闭”,DiT 单独学习从噪声生成精确序列,依赖关键特征而非语言标记。
延迟最小化
为消除模型预测与机器人实际运动之间的停顿,采用异步输出:AI 计算和机器人动作分离。即使需要额外计算,也能让机器人连续移动。
* Clean Action Prefix – 回溯先前预测动作的方法,确保平滑无抖动。
* 注意力掩码聚焦当前视觉序列,忽略过去状态,使机器人对环境突变更具响应性。
实验结果
在 LIBERO、CALVIN 和 SimplerEnv 等仿真环境中,Xiaomi‑Robotics‑0 超越约 30 名竞争者。在配备双臂的真实机器人上,该模型成功完成了折叠毛巾、拆解拼装玩具等复杂任务。机器人展示出手眼协调稳定,在不同场景下同样高效地操作物体。
因此,小米不仅扩展了产品组合,也为机器人“物理智能”领域的进一步研究奠定了基础。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论