小米于2026年8月5日开源具身AI基础模型Xiaomi-Robotics-1,预训练使用超10万小时UMI数据,后训练融合逾1万小时跨具身数据,涵盖从训练到部署的全流程工具与基准评测代码[23],[24]。同日,MiniMax宣布其新一代多模态模型H3在Artificial Analysis视频编辑榜和Arena图生视频榜均位列全球第一[25],支持统一处理文本、图像、视频、音频输入,输出原生双声道音视频,最高达15秒2K分辨率,推理成本低于主流模型50%以上。
这两项进展凸显AI正加速向物理世界延伸。Xiaomi-Robotics-1的开源将推动机器人感知-决策-动作闭环的技术 democratization,加速服务机器人、工业自动化等场景落地。而H3在视频生成领域的领先地位,则展示了中国公司在多模态内容创作方面的创新能力。两者共同指向AI发展主赛道之一——物理AI与Agent将成为连接虚拟智能与现实世界的桥梁[26]。随着端侧AI设备普及(预计2026年中国AI手机出货达1.47亿台)[27],此类模型将在智能家居、车载系统、可穿戴设备中实现广泛部署,真正实现"AI无处不在"。