人形机器人 AI 软件与模型产业链:从任务大脑到数据闭环
梳理人形机器人 AI 软件与模型产业链,拆解多模态感知、VLA、运动小脑、机器人 OS、仿真世界模型、数据闭环和技能库的产业逻辑。
前面几篇笔记主要拆了人形机器人的硬件侧,包括整机 BOM、计算控制芯片、感知系统和执行器系统。这一篇转向软件和模型。相比硬件零部件,AI 软件与模型更难研究,因为它既不像丝杠、减速器、传感器那样有清晰的物理形态,也不像芯片那样可以用算力、制程和封装来做初步比较。
更重要的是,人形机器人的 AI 软件不能简单理解成“装一个大模型”。一个真正可用的人形机器人,需要把感知、语言理解、任务规划、运动控制、实时通信、仿真训练、数据回流、安全约束和远程运维放在同一个系统里。也就是说,它不是单点模型,而是“任务大脑 + 运动小脑 + 软件底座 + 数据闭环”的系统工程。
一、AI 软件产业链不能只看大模型
人形机器人 AI 软件与模型产业链可以先拆成七层:多模态感知层、任务大脑层、运动小脑层、机器人 OS 与中间件层、仿真与世界模型层、数据闭环平台层、技能库与应用平台层。
| 层级 | 对应系统 | 在人形机器人中的作用 | 商业化状态 |
|---|---|---|---|
| 多模态感知层 | 视觉、语音、触觉、力觉、3D 感知、SLAM、场景理解 | 让机器人理解外部环境和交互对象 | 短期更容易形成算法、模组、SDK 和项目收入 |
| 任务大脑层 | LLM、VLM、VLA、多模态大模型、任务规划模型 | 把自然语言、图像和场景信息转成任务计划 | 仍以研发和示范为主,长期可能形成模型授权和订阅 |
| 运动小脑层 | 全身控制、步态控制、灵巧手控制、模仿学习、强化学习、扩散策略 | 把任务意图转成稳定、连续、安全的动作 | 与本体和执行器强耦合,短期多由整机厂自研 |
| 机器人 OS 与中间件 | ROS 2、实时 OS、设备抽象、通信协议、大小脑调度、OTA | 连接传感器、执行器、模型、控制器和云端 | 有平台化潜力,但需要装机量和生态验证 |
| 仿真与世界模型 | Isaac Sim、MuJoCo、Gazebo、Cosmos、数字孪生、合成数据 | 降低训练、测试和安全验证成本 | 海外生态领先,国内仍在补工具链和资产库 |
| 数据闭环平台 | 遥操作、真机数据采集、标注、失败样本、人工接管、训练场 | 形成“部署-采集-训练-升级”的飞轮 | 长期壁垒最高,短期依赖真实部署和场景 |
| 技能库与应用平台 | 抓取、分拣、巡检、接待、搬运、清洁、装配等技能包 | 让机器人从“会动”变成“会干活” | 需要机器人保有量、任务标准化和可复用模块 |
这个分层的好处,是能避免把所有泛 AI 公司都放进人形机器人产业链。真正与人形机器人 AI 软件相关的公司,至少要占据其中一个明确位置:要么有机器人专用模型,要么有机器人 OS 和中间件,要么有仿真与数据工具链,要么有真实机器人数据入口,要么有可复用的技能平台。
二、任务大脑:VLA 是核心方向,但还不是成熟商业模式
人形机器人需要理解“把桌上的杯子拿给我”这类自然语言指令,也要从视觉中识别杯子的位置、形状、遮挡关系和可抓取区域,还要把这些理解转成手臂、手腕和手指的连续动作。这就是 VLA,也就是 Vision-Language-Action 模型试图解决的问题。
目前国际上比较重要的方向包括 NVIDIA Isaac GR00T、Google DeepMind Gemini Robotics、Figure Helix、Physical Intelligence 的 π0 等。它们的共同点是:不再把视觉理解、语言理解和机器人动作完全割裂,而是尝试把“看见什么、听懂什么、怎么行动”放进统一框架。
不过,VLA 不能被过早理解成一个已经成熟的软件订阅生意。当前很多进展仍处在研究、示范、受限测试和早期部署阶段。真正要进入商业化,还需要解决几个问题:真实任务成功率是否足够高,长任务能否中途纠错,未见过物体和未见过场景能否泛化,动作输出是否足够低时延,安全边界是否可验证,模型是否能在本地或边缘设备上稳定运行。
因此,任务大脑的研究重点不是“谁的模型名字更响”,而是看模型能否在真实机器人、真实场景和真实客户任务里降低人工接管率。单次 demo 很重要,但更重要的是连续运行、失败恢复和跨场景复用。
三、运动小脑:决定机器人能否稳定地干活
如果任务大脑回答“要做什么”,运动小脑回答的是“怎么稳定地做出来”。它负责步态、平衡、全身协调、手臂轨迹、灵巧手控制、力控、碰撞恢复和能耗管理。没有可靠小脑,大模型再强,也只能停留在“会说不会干”。
运动小脑与硬件本体高度耦合。不同身高、不同自由度、不同执行器路线、不同灵巧手结构,都会影响控制策略。因此,短期内这一层很难完全独立成通用软件公司。整机厂通常会把小脑控制作为核心能力自研,外部供应商更多在运动控制器、低压伺服、实时系统、算法工具链和工程交付中参与。
研究运动小脑时,不能只看动作视频是否流畅,还要看几个指标:控制频率、关节响应、推搡恢复、上下坡和台阶能力、负载变化表现、灵巧操作成功率、力控稳定性、单位距离能耗、连续运行时长和跨本体迁移能力。
国内整机厂的优势是硬件迭代快、供应链响应快、场景试点多;短板则在长时间稳定运行、复杂接触、灵巧手操作、力触觉融合和跨本体泛化。软件能力最终还是要回到真实部署中验证。
四、机器人 OS 与中间件:从实验代码走向批量部署
机器人 OS 不是普通意义上的操作系统,而是连接传感器、执行器、控制器、AI 模型、云平台、安全模块和远程运维系统的中间层。它决定机器人能否从实验室样机走向批量部署。
机器人 OS 与中间件需要解决六类问题:第一是实时性,控制链路不能有不可控抖动;第二是硬件兼容,要支持不同传感器、执行器和工业总线;第三是开发生态,要兼容 ROS 2、仿真接口、调试工具和软件包;第四是安全机制,要支持急停、限力、越界保护和故障隔离;第五是 OTA 与运维,要能批量升级、回滚、诊断和日志回传;第六是端云协同,要能把任务、数据、模型和状态在机器人与云端之间打通。
这一层是国内公司相对有机会追赶的方向。软通动力、东土科技、中科创达、诚迈科技等公司都有嵌入式 OS、实时控制、边缘 AI、工业网络或机器人软件平台相关积累。但机器人 OS 的壁垒不是发布会参数,而是装机量、开发者生态、整机厂适配、安全可靠性和长期运维能力。
短期看,国内机器人 OS 更可能先在国产化、工业现场、特定整机厂、特定行业场景和端云生态中形成局部优势。要成为真正的平台,还需要足够多的机器人运行在同一底座上,并持续产生数据和应用。
五、仿真与世界模型:降低试错成本,但不能替代真机数据
人形机器人训练成本很高,因为真实世界里有摩擦、碰撞、遮挡、柔性物体、传感器噪声、力控误差和长尾异常。仿真系统的价值,是在真实机器人试错之前,先用虚拟场景生成数据、测试策略、验证安全边界和训练模型。
NVIDIA Isaac Sim 是这一层的代表性工具之一,它面向机器人仿真、测试和合成数据生成;MuJoCo 是机器人和机器学习研究中常用的开源物理引擎;Gazebo 也是机器人研发中长期使用的仿真器。世界模型则更进一步,希望模型不仅“看见世界”,还理解物理世界的动态变化。
但仿真不能完全替代真机数据。尤其是人形机器人中的接触、摩擦、柔性物体、灵巧手、力控和复杂长任务,很容易出现 Sim-to-Real 差距。仿真真正的价值不是制造一个完美虚拟世界,而是帮助公司更快地产生候选策略、暴露安全风险、扩充长尾场景,并通过真机部署不断校正。
国内在这一层还有明显差距。索辰科技等国产仿真软件公司具备多学科仿真基础,智元机器人、北京人形机器人创新中心等也在做训练平台和数据平台,但整体上仍需要补资产库、开发者生态、插件体系、物理真实性和真实机器人闭环验证。
六、数据闭环:软件价值的真正壁垒
具身智能与传统 AI 最大的差异之一,是数据形态不同。聊天大模型主要吃文本、图像、音频和视频;机器人模型还需要动作轨迹、关节状态、末端力、触觉、夹爪状态、任务结果、失败样本、人工接管记录和环境上下文。
公开数据集正在快速扩大。DROID 数据集披露了约 7.6 万条示教轨迹、350 小时交互数据、564 个场景和 84 个任务;智元机器人 AgiBot World 披露了超过 100 万条轨迹、217 个任务和五类部署场景。这说明行业已经意识到,数据不是训练的副产品,而是模型能力和商业壁垒的核心资产。
但数据竞争不能只比条数。高价值数据至少要满足几类条件:有成功样本,也有失败样本;有人工接管,也有自动执行;有视觉,也有力觉、触觉和关节状态;有单步任务,也有长任务;有标准场景,也有长尾异常;有数据采集,也有标注、训练、仿真、部署和回流。
未来真正有壁垒的公司,可能不是单纯模型公司,也不是单纯整机公司,而是能把“真实部署 + 遥操作 + 训练场 + 仿真平台 + 合成数据 + 模型升级”串起来的公司。数据闭环会决定模型能否持续变好,也会决定软件收费有没有长期基础。
七、商业化节奏:短期项目交付,中期平台工具,长期技能订阅
人形机器人 AI 软件的商业化不会一步到位。短期最现实的收入,仍然来自项目制交付、算法授权、视觉方案、机器人 OS 适配、仿真工具、训练场建设、数据采集和行业解决方案。这个阶段的软件价值通常嵌在整机、系统集成或场景项目里,不一定单独体现为高毛利订阅收入。
中期看,如果某些场景开始规模化部署,比如工厂上下料、仓储搬运、巡检、商用服务或家庭清洁,机器人会持续产生任务数据。此时,数据平台、远程运维、OTA、模型更新和技能复用会更有价值。
长期看,才可能出现真正的软件利润池:模型订阅、技能包收费、按任务计费、数据服务、云端调度、机器人应用商店等。但这些商业模式成立的前提,是机器人保有量足够大、任务足够标准化、技能模块足够可复用,并且客户愿意为成功率提升和人工接管率下降持续付费。
所以,AI 软件与模型产业链的研究不能只看技术想象空间,还要看收入兑现路径。没有装机量和数据回流,软件订阅很难成立;没有真实任务成功率,技能包也只是概念。
八、国内外差距:不是有没有模型,而是有没有闭环
从全球格局看,国际领先公司正在把模型、数据、仿真、芯片、整机和开发者生态放在一起推进。NVIDIA 的优势在算力、仿真、合成数据和开发者生态;Google DeepMind 的优势在多模态模型、VLA 和安全研究;Figure、Tesla、Physical Intelligence 等更强调机器人本体、真实数据和端到端控制闭环。
国内进展也很快。智元机器人、宇树科技、优必选、星海图、北京人形机器人创新中心等在整机、本体控制、数据平台和具身模型上持续推进;科大讯飞、软通动力、东土科技、中科创达、凌云光、奥比中光、索辰科技等上市公司则分别处在多模态交互、机器人 OS、实时控制、嵌入式软件、数据采集、视觉感知和仿真工具链等位置。
差距主要不在“有没有 demo”,而在五个方面:第一,跨场景泛化是否真实;第二,跨本体迁移是否稳定;第三,是否有足够高质量的真实机器人数据;第四,是否有开发者生态和工具链;第五,是否已经形成可复制的商业收入。
对 A 股研究来说,最容易犯的错误是把泛 AI、大模型、工业软件、机器视觉公司全部归入“人形机器人 AI 软件链”。更稳妥的方式,是先看它处在哪一层,再看有没有机器人专用产品、真实数据入口、可复用平台、客户验证和收入拆分。
九、后续跟踪框架
后续跟踪人形机器人 AI 软件与模型产业链,可以围绕六个问题展开。
第一,看是否有机器人专用软件产品。泛大模型、泛 AI 平台和工业软件概念,不等于人形机器人模型能力。机器人超脑、机器人 OS、VLA、仿真平台、数据平台和技能库,相关性更高。
第二,看是否有真实机器人数据入口。整机部署、训练场、遥操作、动捕、视觉数据、工业场景数据和失败样本,都会影响模型长期能力。
第三,看是否有可复用平台。一次性项目收入并不差,但壁垒有限;机器人 OS、仿真平台、数据闭环、技能库和端云协议更可能沉淀长期价值。
第四,看是否进入真实客户验证。样机展示、合作协议和概念发布只能作为起点,后续要看订单、装机量、续费、活跃机器人数量、人工接管率和任务成功率。
第五,看软件收入能否独立体现。很多公司短期收入会嵌在硬件和项目里,只有当软件模块能持续收费,产业链价值才会更清晰。
第六,看安全与责任机制。人形机器人进入工厂、家庭和公共空间后,软件不仅要能完成任务,还要能控制风险,包括碰撞、误操作、越权指令、隐私数据和远程控制安全。
总体看,人形机器人 AI 软件与模型产业链仍处在“技术快速突破、商业模式尚未完全兑现”的阶段。短期更现实的是工具链和项目交付,中期看数据闭环和平台化软件,长期才看模型、技能库和应用生态成为利润池。研究这条产业链,最重要的不是追逐每一个新模型名字,而是判断谁能把真实机器人、真实数据和真实任务持续串起来。
十、代表性公司观察表
下表仅用于产业链位置梳理,不代表完整名单,也不代表相关公司已经形成稳定的人形机器人 AI 软件收入。后续仍需要结合具体产品、客户验证、订单质量、收入占比和持续投入来跟踪。
| 产业链层级 | 海外/全球代表 | 中国/国内代表与观察公司 | 观察重点 |
|---|---|---|---|
| 机器人基础模型 / VLA / 任务大脑 | NVIDIA、Google DeepMind、Figure、Physical Intelligence、Tesla、OpenVLA、Octo | 智元机器人、北京人形机器人创新中心、星海图、宇树科技、优必选、科大讯飞 | 任务成功率、跨场景泛化、长任务能力、本地推理、安全约束和真实部署 |
| 运动小脑 / 全身控制 / 灵巧操作 | Boston Dynamics、Tesla、Figure、Agility Robotics、Apptronik、Physical Intelligence | 宇树科技、智元机器人、优必选、星海图、小鹏系机器人团队、汇川技术、禾川科技 | 步态稳定、力控、灵巧手、复杂接触、低延迟控制和跨本体迁移 |
| 机器人 OS / 中间件 / 大小脑调度 | ROS 2 生态、NVIDIA Isaac、RTI、Wind River、QNX | 软通动力、东土科技、中科创达、诚迈科技、华为云 R2C 生态 | 实时性、硬件适配、ROS 2 兼容、OTA、日志诊断、端云协同和装机量 |
| 仿真 / 世界模型 / 合成数据 | NVIDIA Isaac Sim、Cosmos、MuJoCo、Gazebo、Unity、Unreal Engine | 索辰科技、中联重科/中科云谷、智元机器人、北京人形机器人创新中心 | 物理真实性、资产库、Sim-to-Real、合成数据有效性和开发者生态 |
| 数据闭环 / 训练场 / 遥操作 | DROID、Open X-Embodiment、Physical Intelligence、Figure、Tesla | 智元 AgiBot World、凌云光、中联重科、北京人形机器人创新中心、奥比中光 | 轨迹规模、数据质量、失败样本、动作粒度、格式标准和训练闭环 |
| 多模态感知 / 视觉 AI / 语音交互 | Google、NVIDIA、Meta、Cognex、Keyence、Intel RealSense | 奥比中光、虹软科技、凌云光、云从科技、格灵深瞳、科大讯飞、科沃斯 | 3D 感知、SLAM、视觉语言理解、语音交互、传感器同步和数据接口 |
| 技能库 / 应用平台 / 云端运营 | Figure、Tesla、NVIDIA、Google DeepMind、Apptronik | 科沃斯、优必选、软通动力、中联重科、亿嘉和、上纬新材/智元系 | 技能复用率、部署周期、任务成功率、远程运维、收费模式和数据回流 |
上述内容仅为个人学习和研究目的,不构成任何投资建议,也不保证信息完整、准确或及时。 涉及公司、行业、市场和策略的内容,都应被视为阶段性观察,而不是确定性结论。
Newsletter
订阅后续文章
如果这篇笔记对你有帮助,可以留下邮箱。新文章发布时,我会把研究笔记直接发给你。