具身智能(Embodied AI)指拥有物理身体、能与真实世界直接交互的智能体——机器人是它的终极形态。与"云端的大模型"不同,具身智能强调"身体+智能"一体:通过视觉、触觉、力觉感知环境,用机械臂、轮式底盘或双足行走执行动作,在真实反馈中持续学习。2025-2026 年人形机器人的爆发(宇树春晚扭秧歌、Figure 与 OpenAI 合作、特斯拉 Optimus 量产爬坡)让具身智能成为继大语言模型之后最具确定性的下一波技术浪潮。
一、为什么需要"身体"
纯软件大模型虽然能力强大,却严重依赖预设接口——只能处理"被结构化好的文本/图像",对物理世界的连续状态、力反馈、空间几何几乎无感。人类智能则深深植根于身体:婴儿通过伸手抓握学习因果,工人通过触觉判断零件是否合格,外科医生通过手感理解组织张力。具身假设(Embodied Hypothesis)是认知科学的经典观点——智能的形状由身体的形状决定。这也是为什么业内普遍认为:下一代 AI 突破不只来自更大的模型,而来自模型与物理世界的实时交互闭环。
二、技术栈:大模型 + 控制 + 硬件的三体合一
一套完整的具身智能系统由四层组成:
- 大脑:多模态大模型负责理解指令、推理任务、规划步骤。当前主流方案是 VLA(Vision-Language-Action)模型,将视觉、语言与机器人动作 token 在同一序列中联合训练,代表如 Google RT-2、智元 GO-1、字节 GR-1
- 小脑:运动控制层,处理步态平衡、机械臂轨迹、阻抗控制等技术,传统控制论与现代强化学习结合
- 身体:灵巧手(触觉传感器阵列 + 12 自由度关节)、关节电机(谐波减速器 + 力矩传感器)、电池续航;硬件成本仍是行业最大挑战
- 训练场:世界模型仿真(NVIDIA Isaac Sim、MuJoCo)+ 真机遥操作数据采集(宇树、Figure 用人类穿戴设备示范收集)
三、代表玩家与产品
- 国内:宇树科技(春晚《秧 BOT》让公众认识人形机器人,H1/G1 量产爬坡)、智元机器人(创始人"稚晖君"、A2 灵动机器人)、优必选(Walker S 在比亚迪工厂实训)、银河通用、星动纪元
- 海外:特斯拉 Optimus(马斯克 2026 年量产目标万台)、Figure AI(与 OpenAI 深度合作、Figure 02 已进 BMW 工厂)、1X Technologies(背靠 OpenAI 投资)、波士顿动力(液压 Atlas 退役转电动 Atlas)
- 上游供应链:绿的谐波(谐波减速器)、鸣志电器(伺服电机)、奥比中光(3D 视觉)、柯力传感(六维力矩)
四、落地时间表:场景分级是关键
- 已落地:工厂搬运、分拣、上下料(结构化环境、固定路线、低风险)
- 2026-2027 试点:商超导购、酒店配送、餐厅传菜、医院物流(半结构化环境、需要避障与人交互)
- 3-5 年:家庭服务、护理陪伴(开放环境、任务多样、需要长程任务规划)
- 5-10 年:家庭保姆级通用机器人(业内共识还远)
技术演进的瓶颈主要集中在三方面:数据稀缺(真实机器人交互数据远少于互联网文本数据)、硬件成本(整机目前 10-50 万元,与消费电子相差 1-2 个数量级)、安全性(家用机器人在人群中行动的安全标准远高于工厂机器人)。
五、与人形机器人的关系
人形只是具身智能的一种形态,轮式、四足、软体等都有价值。选人形是因为人类世界是为人形设计的(门把手、楼梯、桌椅高度),人形机器人可直接复用既有基础设施而不需要"机器人专用环境"。但并不意味着所有场景都必须人形——工厂内自主移动机器人(AMR/AGV)用轮式效率更高;医疗手术机器人更适合机械臂+主从控制。具身智能的核心是自主感知-决策-行动的闭环,与具体形态解耦。
六、常见问答
Q:具身智能和机器人是一回事吗?——机器人是硬件载体,具身智能是让机器人真正会干活的 AI 技术。传统机器人按预设程序执行固定任务,具身智能机器人能理解自然语言指令、自主应变、跨任务泛化。
Q:会取代哪些工作?——最先受冲击的是高度重复的体力劳动(搬运、分拣、装配);需要精细操作与人际关怀的工作(护理、教育)短期内不会替代,而是人机协作。
Q:如何关注?:关注头部厂商的工厂落地案例而非 demo 视频;硬件成本下降曲线(减速器、电机价格)比人形 demo 更具投资参考价值。
词条信息基于 2026 年 8 月公开资料整理,由 AI智库(ai-zhiku.com)编辑团队维护。
辽公网安备21021102001760号