小米开发了一款拥有47亿参数的人工智能模型,结合视觉感知、语音和机器人控制。

小米开发了一款拥有47亿参数的人工智能模型,结合视觉感知、语音和机器人控制。

41 hardware

小米进军机器人技术市场

中国移动设备和智能家居巨头小米宣布了新的举措:开发自有的机器人人工智能模型。公司推出了 Xiaomi‑Robotics‑0,这是一套开源系统,集成了视觉识别、语言理解与实时动作控制。该模型拥有 4.7 亿参数,并已在模拟和实际操作中打破多项记录。

模型工作原理
机器人通常遵循“感知 → 决策 → 行动”的循环。Xiaomi‑Robotics‑0 在广泛情境理解与精确运动控制之间取得平衡,采用 Mixture‑of‑Transformers(MoT)架构。

1. 视觉语言模型(VLM)– 系统“大脑”。

* 能解释模糊指令(如“请把毛巾折叠起来”)。

* 基于高质量图像理解空间关系。

* 任务包括目标检测、视觉问答和逻辑推理。

2. 动作专家(Action Expert)– 运动生成器。

* 基于扩散变换器(DiT)。

* 不一次生成单一动作,而是通过流匹配形成连续动作序列,保证平滑与精度。

保持理解的无损学习
传统 VLM 在训练物理任务时会丢失部分感知能力。小米通过同时使用多模态数据(图像+文本)和动作数据解决了这一问题。训练过程分为若干阶段:

1. 动作建议 – VLM 预测图像对应的可能动作分布,将内部表征与真实操作同步。

2. 随后 VLM “关闭”,DiT 单独学习从噪声生成精确序列,依赖关键特征而非语言标记。

延迟最小化
为消除模型预测与机器人实际运动之间的停顿,采用异步输出:AI 计算和机器人动作分离。即使需要额外计算,也能让机器人连续移动。

* Clean Action Prefix – 回溯先前预测动作的方法,确保平滑无抖动。

* 注意力掩码聚焦当前视觉序列,忽略过去状态,使机器人对环境突变更具响应性。

实验结果
在 LIBERO、CALVIN 和 SimplerEnv 等仿真环境中,Xiaomi‑Robotics‑0 超越约 30 名竞争者。在配备双臂的真实机器人上,该模型成功完成了折叠毛巾、拆解拼装玩具等复杂任务。机器人展示出手眼协调稳定,在不同场景下同样高效地操作物体。

因此,小米不仅扩展了产品组合,也为机器人“物理智能”领域的进一步研究奠定了基础。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论