分享
从一句话到一个动作:MiniCPM-Robot 如何让机器人真正执行指令
输入“/”快速插入内容
从一句话到一个动作:MiniCPM-Robot 如何让机器人真正执行指令
用户4242
用户4242
7月20日修改
🔗 原文链接:
https://mp.weixin.qq.com/s/VWgcTjhp...
原创 CY CHENYUE CY CHENYUE AI街溜子
2026年7月20日 12:11 广东
MINICPM-ROBOT · AI HARDWARE
文字答错了,可以重新生成;动作一旦发生,环境已经被改变。
大家好啊,我是 CY。
先来看下面一句话:
“把绿色积木放进右边的盒子。”
如果这句话是对屏幕里的 AI 说的,一次误解最多带来一个错误答案;但当接收指令的是机器人,模型的判断会直接变成机械臂和电机的动作,并随之改变下一秒的环境。
因此,对机器人来说,理解语言只是开始。它还要从摄像头画面中找到目标,结合自身状态判断位置,生成连续动作,并在物体移动或环境变化后继续观测和修正。人只用一句话描述的任务,机器却要走完一整条从感知到行动的链路。
2026 年 7 月 19 日,面壁智能正式发布并开源首个具身智能模型系列 MiniCPM-Robot。首批模型包括面向通用机器人操作的 MiniCPM-RobotManip,以及面向自然语言目标跟踪的 MiniCPM-RobotTrack。与它们一同进入这套系统的,还有面向物理 AI(Physical AI)低时延推理的 PhyAI 框架。
[1]
我们正在做 AI 硬件,所以看这次发布时,最先注意到的不只是机器人又学会了什么,还有另一件更实际的事:模型原有的理解能力,进入设备以后还能保留多少,又能否及时、稳定地转化成动作。
MiniCPM-Robot 还不是通用机器人的完整答案,但它提供了一个很具体的样本:当多模态模型不再只负责解释世界,而是开始驱动真实设备,模型能力、硬件约束和控制系统会怎样连接起来。
01
从“会回答”到“会行动”
MiniCPM-Robot 中的两款模型都属于 VLA,也就是视觉—语言—动作模型。如果只看缩写,它很像又一个需要记住的技术名词;真正的变化其实在输出端。
普通的视觉语言模型可以看懂一张图片,再用文字告诉我们画面里有什么。VLA 则要把视觉观察、人类指令和机器自身状态结合起来,输出可以交给机器人执行的动作。
简单来说,
传统多模态模型负责回答“接下来应该做什么”,VLA 还要继续回答“具体要怎样动”。
表格里的“机器人状态”,可以理解为机器此刻的关节位置、姿态等自身信息。
模型
主要任务
参数规模
典型输入
主要输出
MiniCPM-RobotManip
通用机器人操作
1.5B(约 15 亿参数)
单视角或多视角图像、语言指令、机器人状态
连续动作序列
MiniCPM-RobotTrack
自然语言目标跟踪
0.9B(约 9 亿参数)
视觉画面、目标描述
移动航点,随后由控制链路执行
两个模型解决的是不同类型的行动问题:RobotManip 关注机器人如何与物体交互,RobotTrack 关注移动机器人如何识别并持续跟随目标。PhyAI 则不是第三个模型,而是负责让这些模型更高效运行的推理框架。
02
MiniCPM-RobotManip:让机器人完成连续操作
MiniCPM-RobotManip 是一个基于 MiniCPM-V 4.6 构建的 1.5B(约 15 亿参数)视觉—语言—动作模型。
这一部分最值得记住的,不是 1.5B 这个数字本身,而是它想让机器人保留更长的任务过程,同时避免每一步都越算越重。
它接收摄像头画面、文字指令和可选的机器人状态,输出一段连续动作。模型既支持单视角输入,也支持多视角输入,因此可以同时接收主摄像头和腕部摄像头等不同位置的观察画面。
更重要的是,它采用一套通用权重覆盖多种下游操作任务。对于机器人开发者来说,这意味着不必从一开始就为每一种操作单独维护一套完全不同的模型,而是可以在同一个通用策略上进行适配。
这里的“通用”有明确边界:它指的是在官方评测覆盖的多项任务中使用同一套权重。换到不同结构、传感器和动作空间的机器人上,依然需要具体适配。
连续任务为什么需要上下文
机器人操作不是根据一张照片做一次判断,而是在持续变化的环境中不断决策。
例如,机器人接到“把桌上的零件依次放入对应料盒”这样的任务后,需要知道哪些零件已经处理、下一步应该抓取哪个,以及刚才的动作有没有成功。如果模型每走一步都重新计算此前的全部画面,历史信息越多,计算和显存压力就越大。
RobotManip 的一个重点能力,是把历史观测以流式方式纳入上下文。可以把它理解成:模型不必反复从头观看此前的全部录像,而是持续吸收新的观测,并在已有任务上下文上继续判断。
根据项目方公布的数据,在保留 60 帧历史观测时,传统重新计算方式每个决策步需要 125 TFLOPs,流式推理将其降至 3.3 TFLOPs;模型最多可支持约一分钟的视觉上下文。同时,它继承了 MiniCPM-V 4.6 的视觉压缩能力,将单帧视觉 Token 从 256 个压缩至 64 个。
[2]
60 帧历史观测下,每个决策步的理论计算量对比。