机器人技术

机器人技术路线全景分析

全面梳理机器人核心技术路线:从传统工业机器人、基于模型的最优控制(MPC/WBC/iLQR),到强化学习、模仿学习、人形机器人、具身智能 VLA 大模型和世界模型。深入分析每种方案的框架原理、代表工作和未来趋势。

🤖 1. 概述

机器人技术历经数十年发展,从工业流水线上的固定程序机械臂,到如今能够自由行走、灵巧操作、与人类协作的智能体,其背后是技术路线的持续演进与范式变革。不同时代、不同应用场景催生了多条并行发展的技术路径,各路线在系统架构、算法范式、传感器配置、学习方式等方面存在根本性差异。

当前机器人核心技术路线可归纳为以下六大类:

🏭

传统工业机器人

示教再现、位置控制、刚性执行器,追求重复精度与速度

🏗️

基于模型的最优控制

MPC、WBC、iLQR 等基于动力学的轨迹优化与控制框架

🧠

强化学习

深度强化学习在机器人控制中的端到端或混合应用

📹

模仿学习

从人类示教数据中学习策略,行为克隆与逆强化学习

🧑‍🦳

人形机器人

双足/轮式人形机器人的全身控制与运动规划

📦

具身智能与VLA

视觉-语言-行动大模型驱动的泛化机器人智能

💡
关键洞察:各路线并非线性替代关系,而是面向不同场景、不同层级的互补方案。工业制造仍以传统路线为主,服务/家庭机器人更多依赖学习路线,而人形机器人正处于多种路线激烈交汇的爆发前夜。

机器人技术路线演进时间线

机器人核心技术路线演进时间线 1961 Unimate 首台工业机器人 1996 ASIMO 人形机器人起步 2013 DRL 突破 DQN/PPO 等 2020 Sim-to-Real 大规模仿真训练 2025+ 具身智能时代 VLA/Foundation Models 传统工业机器人(示教再现/位置控制) 基于模型的控制(MPC/WBC/iLQR) RL/学习驱动(DRL / Imitation / Foundation Models) 人形机器人 + 具身智能爆发期 通用机器人基础模型 技术路线存续期 进入主要活跃期

🏭 2. 传统工业机器人路线

2.1 技术框架与原理

传统工业机器人技术路线以示教再现(Teach-and-Repeat)位置控制为核心范式。工程师通过示教器手动引导机器人末端执行器走过目标轨迹,系统记录关键点位姿,之后机器人按照预编程的路径循环执行。

经典工业机器人控制架构

工业机器人控制架构 示教编程 手动引导 / 离线编程 记录关键点位姿 轨迹规划 关节空间 / 笛卡尔空间插值 PTP / Line / Circle / Spline 运动学求解 正/逆运动学计算 IK 数值/解析解 伺服控制 PID 位置/速度环 前馈 + 重力补偿 编码器反馈(位置/速度闭环) 典型控制频率 轨迹规划: 1-10 Hz | 运动学: 100-1000 Hz | 伺服环: 1k-10k Hz | 电流环: 10k-100k Hz

2.2 运动学与动力学

正逆运动学

运动学是工业机器人的理论基础,描述关节空间与笛卡尔空间之间的映射关系。

$$\text{正运动学: } \quad T = f(\theta_1, \theta_2, ..., \theta_n) = \prod_{i=1}^n {}^{i-1}T_i(\theta_i)$$

其中 \(T \in SE(3)\) 是末端执行器的位姿变换矩阵,\(\theta_i\) 是第 \(i\) 个关节角度。使用 DH (Denavit-Hartenberg) 参数法建立连杆坐标系变换:

$${}^{i-1}T_i = \begin{bmatrix} \cos\theta_i & -\sin\theta_i\cos\alpha_i & \sin\theta_i\sin\alpha_i & a_i\cos\theta_i \\ \sin\theta_i & \cos\theta_i\cos\alpha_i & -\cos\theta_i\sin\alpha_i & a_i\sin\theta_i \\ 0 & \sin\alpha_i & \cos\alpha_i & d_i \\ 0 & 0 & 0 & 1 \end{bmatrix}$$

逆运动学(IK)求解更为复杂,对于 6 轴串联机器人,存在解析解(如 Pieper 准则)和数值解(如 Jacobian 伪逆法):

$$\dot{\theta} = J^{\dagger}(\theta) \dot{x}, \quad J_{ij} = \frac{\partial x_i}{\partial \theta_j}$$
动力学模型

机器人动力学描述力矩与运动之间的关系,标准形式为:

$$M(\theta)\ddot{\theta} + C(\theta, \dot{\theta})\dot{\theta} + G(\theta) + \tau_f = \tau$$

其中:

  • \(M(\theta)\) —— 质量/惯性矩阵,描述各关节的惯性耦合
  • \(C(\theta, \dot{\theta})\) —— 科里奥利力和离心力矩阵
  • \(G(\theta)\) —— 重力项
  • \(\tau_f\) —— 摩擦力(库仑摩擦 + 粘滞摩擦)
  • \(\tau\) —— 关节驱动力矩

动力学模型在工业机器人中主要用于前馈控制:先计算期望运动所需的理论力矩,叠加反馈修正,大幅提高跟踪精度。

轨迹插值方法

工业机器人的轨迹插值分为关节空间和笛卡尔空间两类:

方法空间特点适用场景
PTP (Point-to-Point)关节空间各关节独立运动到目标角度点焊、搬运
线性插值笛卡尔空间末端走直线涂胶、切割
圆弧插值笛卡尔空间末端走圆弧圆弧焊接
Spline 插值笛卡尔/关节平滑连续曲线曲面加工

工业机器人路径常采用 S 形速度规划(梯形加速度曲线)来平衡速度和冲击:

$$v(t) = \begin{cases} \frac{1}{2}Jt^2, & 0 \leq t < t_a \\ v_{max}, & t_a \leq t < t_d \\ v_{max} - \frac{1}{2}J(t-t_d)^2, & t_d \leq t \leq T \end{cases}$$

2.3 局限性

缺乏环境感知

纯位置控制对外界力/位置偏差无自适应能力,需要精确定位工装

编程成本高

每更换产品需重新示教,停机时间长,柔性差

不可预见场景

无法处理工件变形、装配误差、环境变化等意外

安全隔离

高速重载机器人需安全围栏隔离,人机协作困难

当前地位:尽管有诸多局限,传统工业机器人仍是全球制造业的绝对主力(约 400 万台存量)。其高可靠性(MTBF > 50000 小时)、高重复精度(±0.02mm)、成熟生态使其在汽车、3C 等大批量生产中不可替代。

🏗️ 3. 基于模型的最优控制路线

3.1 核心理念

基于模型的控制(Model-Based Control)利用机器人的动力学模型预测系统行为,在线或离线优化控制输入,使机器人沿最优轨迹运动。与传统工业机器人的 PID 位置控制相比,其核心优势在于考虑系统约束、预测未来行为、实时优化

3.2 模型预测控制 (MPC)

MPC 是当前机器人控制领域最前沿的优化控制方法之一,广泛应用于双足行走、四足运动、机械臂操作等场景。

MPC 基本原理

$$\min_{u_{t:t+N}} \sum_{k=0}^{N-1} \left( \|x_{t+k} - x_{t+k}^{ref}\|_Q^2 + \|u_{t+k}\|_R^2 \right) + \|x_{t+N} - x_{t+N}^{ref}\|_P^2$$

约束条件:

$$\begin{aligned} x_{t+k+1} &= f(x_{t+k}, u_{t+k}) \quad \text{(动力学约束)} \\ u_{min} &\leq u_{t+k} \leq u_{max} \quad \text{(执行器限幅)} \\ g(x_{t+k}) &\leq 0 \quad \text{(安全约束, 如碰撞规避)} \end{aligned}$$

MPC 的工作流程

Step 1: 动力学预测

以当前状态 \(x_t\) 为初值,利用机器人动力学模型 \(x_{t+1} = f(x_t, u_t)\) 预测未来 \(N\) 步的状态轨迹

Step 2: 在线优化求解

求解带约束的二次规划(QP)或非线性规划(NLP)问题,得到最优控制序列 \(u_{t:t+N}^*\)

Step 3: 执行第一步

将最优控制序列的第一个控制量 \(u_t^*\) 作用于机器人

Step 4: 滚动时域

在下一时刻 \(t+1\),以新状态重新构建优化问题,重复 Step 1-3

MPC 分类与特点

类型模型优化问题计算量适用场景
线性 MPC (LMPC)线性化模型凸 QP低 (ms 级)四足机器人平衡控制
非线性 MPC (NMPC)完整非线性模型非凸 NLP高 (10-100ms)人形机器人全身运动
鲁棒 MPC (RMPC)带不确定性的模型鲁棒优化环境不确定性大的场景
线性时变 MPC (LTV-MPC)在轨迹点逐点线性化序列 QP中 (5-30ms)动态行走控制

3.3 全身控制 (Whole-Body Control, WBC)

全身控制是多自由度机器人(尤其是人形和四足机器人)的经典控制框架,将机器人的多个控制任务按照优先级进行层次化求解。

WBC 层次化优化框架

$$\min_{q, \tau} \sum_i w_i \|J_i(q)\ddot{q} + \dot{J}_i(q, \dot{q})\dot{q} - \ddot{x}_i^{des}\|^2$$

约束条件:

$$\begin{aligned} M(q)\ddot{q} + C(q, \dot{q})\dot{q} + G(q) &= S\tau + J_c^T(q) \lambda \quad \text{(动力学)} \\ J_c(q)\ddot{q} + \dot{J}_c(q, \dot{q})\dot{q} &= 0 \quad \text{(接触约束)} \\ \lambda_z &\geq 0, \quad |\lambda_x| \leq \mu \lambda_z \quad \text{(摩擦锥)} \\ \tau_{min} &\leq \tau \leq \tau_{max} \quad \text{(力矩限幅)} \end{aligned}$$

WBC 的核心组件

任务优先级管理

通过零空间投影实现任务层级:

$$a_{i}^{proj} = a_i + N_i \cdot a_i^{opt}$$

高级别任务优先满足,低级别任务在高级别任务的零空间中优化,确保行走稳定性等高优先级目标不被干扰。

接触力优化

同时优化关节力矩和接触力 \(\lambda\),利用摩擦锥约束保证足端不打滑,通过接触力的合理分配实现动态平衡。

3.4 迭代 LQR (iLQR / DDP)

iLQR (Iterative Linear Quadratic Regulator) 和 DDP (Differential Dynamic Programming) 是针对非线性系统的最优控制方法,常用于机械臂运动规划全身轨迹优化

$$\begin{aligned} \text{Value Function: } &V(x_N) = \phi(x_N) \\ \text{Backward Pass: } &Q(\delta x, \delta u) = \frac{1}{2} \begin{bmatrix} 1 \\ \delta x \\ \delta u \end{bmatrix}^T \begin{bmatrix} 0 & Q_x^T & Q_u^T \\ Q_x & Q_{xx} & Q_{xu} \\ Q_u & Q_{ux} & Q_{uu} \end{bmatrix} \begin{bmatrix} 1 \\ \delta x \\ \delta u \end{bmatrix} \\ \text{Optimal Control: } &\delta u^* = -Q_{uu}^{-1}(Q_u + Q_{ux}\delta x) \end{aligned}$$

iLQR vs DDP 对比

维度iLQRDDP
展开阶数一阶展开动力学二阶展开动力学
收敛速度线性收敛二次收敛(靠近最优解时更快)
计算复杂度低,\(\mathcal{O}(N n^3)\)高,需计算二阶导数
数值稳定性较高需正则化处理

3.5 典型应用场景

🐻 四足机器人动态行走(MIT Cheetah / ANYmal)

四足机器人是 MPC 控制最成功的应用场景之一:

  • MPC 控制器:基于单刚体简化模型(SRBM),以 1-5ms 周期求解 QP,规划足端接触力和躯干轨迹
  • WBC 控制器:将 MPC 规划的接触力映射到各关节力矩,同时处理摆动腿轨迹跟踪
  • 结果:MIT Cheetah 3 实现 14.5 km/h 奔跑、跳跃跨越障碍、后空翻等动态动作
四足机器人 MPC 使用单刚体模型简化动力学,将问题转化为凸优化,使得 QP 求解器可以在嵌入式硬件上以 kHz 频率运行。
🧍 人形机器人全身控制(Atlas / Optimus / H1)

人形机器人需要 WBC + MPC 联合控制全身几十个自由度:

  • 任务层:质心高度、躯干姿态、足部位姿、手臂末端位姿等
  • 优化层:WBC 在任务零空间中优化关节力矩,同时满足接触力约束
  • 执行层:关节力矩控制器接受 WBC 输出的力矩指令
  • 关键挑战:双足支撑相与单足支撑相之间的瞬态切换、全身动量调节
🖼 机械臂力位混合控制

在装配、打磨、抛光等力控场景中,MPC 可以处理力/位置的混合约束:

$$\min_{u} \sum_{k=0}^{N-1} \left( \|x_{t+k} - x^{ref}\|_{Q_x}^2 + \|f_{t+k} - f^{ref}\|_{Q_f}^2 \right) + \|u_{t+k}\|_R^2$$

位置控制方向和力控制方向通过选择矩阵 \(S\) 解耦:

$$\text{自然约束(运动方向): } S \cdot (\ddot{x} - \ddot{x}^{des}) = 0$$
💡
关键洞察:基于模型的控制路线正在经历从"精确物理模型"到"数据增强模型"的转变。传统 MPC 依赖精确标定的物理参数(惯量、摩擦、质心),而最新研究表明学习残差模型(用神经网络补偿物理模型误差)可以显著提高控制性能。

🧠 4. 强化学习路线

4.1 基本原理

强化学习(Reinforcement Learning, RL)将机器人控制建模为序列决策问题:智能体(机器人)通过与环境(物理世界或仿真器)交互,学习最大化累积奖励的策略。与基于模型的控制相比,RL 不需要精确的物理模型,通过大量试错自动发现最优行为。

$$\text{目标: } \max_{\pi} \mathbb{E}_{\tau \sim p(\tau|\pi)} \left[ \sum_{t=0}^{T} \gamma^t r(s_t, a_t) \right]$$

无模型 RL (Model-Free RL)

不显式学习环境模型,直接优化策略或值函数:

  • PPO (Proximal Policy Optimization):最稳定的策略梯度方法,广泛用于机器人控制
  • SAC (Soft Actor-Critic):最大熵 RL,探索性好,适合连续控制
  • TD3 (Twin Delayed DDPG):解决了 DDPG 的 Q 值高估问题

基于模型的 RL (Model-Based RL)

学习环境的动力学模型,在模型中进行规划或策略优化:

  • Dreamer 系列:在学习的隐空间世界模型中进行想象 Rollout
  • PETs (Probabilistic Ensembles with Trajectory Sampling):概率集成模型 + MPC
  • MOReL / TDM:学习模型并用模型修正策略训练

4.2 Sim-to-Real 迁移

强化学习在机器人领域面临的最大挑战是样本效率——在真实物理世界中收集数百万次交互不切实际。Sim-to-Real 通过在仿真环境中训练策略,然后迁移到真实机器人,是当前最成功的技术路线。

Sim-to-Real 的核心技术

Sim-to-Real 迁移训练框架 大规模仿真训练 Isaac Gym / MuJoCo PPO/SAC 并行训练 域随机化 (Domain Randomization) 随机化物理参数 质量/摩擦/延迟/噪声 策略导出 ONNX / TensorRT 轻量化推理 真实部署 零样本迁移 或少量微调 教师-学生 (Teacher-Student) 训练范式 教师策略: 在仿真中获得完整状态信息(含噪声免费),训练高性能"特权策略" 学生策略: 仅使用传感器观测(IMU/关节编码器/相机),模仿教师策略的输出 Domain Randomization + Teacher-Student 是当前实现四足/双足 Sim-to-Real 迁移的标准方法

域随机化 (Domain Randomization)

域随机化是 Sim-to-Real 迁移中最关键的技术,通过在仿真中随机化各种物理参数,使策略学会鲁棒的行为:

$$\pi_{\theta}: \underbrace{(s, \phi)}_{\text{带随机参数的状态}} \rightarrow a, \quad \phi \sim p(\phi)$$

典型随机化参数

参数类别随机化范围作用
质量/惯量±30%适应不同负载和动力学偏差
摩擦系数0.2 - 1.5适应不同地面材质
关节阻尼/摩擦力±50%适应不同关节摩擦特性
传感器噪声高斯噪声 (0, 0.01-0.05)提高策略对噪声的鲁棒性
控制延迟1-3 步 (步长 0.001-0.005s)适应通信/计算延迟
电机推力/力矩±20%适应电机性能差异

4.3 机器人 RL 代表性应用

🐻 四足机器人全地形行走(ANYmal / Spot)

基于 RL 的四足控制已在产业界落地:

  • ANYmal (ETH Zurich / ANYbotics):使用 RL 策略在工业巡检中穿越楼梯、碎石、水坑等复杂地形,成功率超过 90%
  • Spot (Boston Dynamics):RL 训练的行走技能实现多地形自适应
  • 训练方式:Isaac Gym 中大规模并行训练(4096 个并行环境),2-4 小时完成训练
  • 策略架构:MLP 策略网络 (256x128) + 循坏记忆 (GRU) 处理部分可观测性
🖐 灵巧手操作(D'Claw / D'Manus / DexNet)

RL 在灵巧操作领域取得了显著进展:

  • 物体重定向:学习在手指之间旋转和移动物体(如转笔、翻硬币)
  • Sim-to-Real 灵巧抓取:在仿真中训练抓取策略,迁移到真实灵巧手
  • 代表性工作:OpenAI Dactyl(Shadow Hand 魔方操作)、QT-Opt(Google 机器人抓取)
  • 挑战:高维动作空间、接触动力学模拟精度、触觉传感的仿真与真实差距
🛫 无人机特技飞行(AlphaPilot / Swift)

RL 在四旋翼无人机的高动态飞行中超越人类专家:

  • Swift (Zürich):世界首次 RL 无人机在真实赛道中击败人类冠军(2023)
  • 训练方法:在高度逼真的仿真器中训练,域随机化后零样本迁移到真实无人机
  • 策略输出:直接输出电机 PWM 信号,控制频率 > 200 Hz

4.4 当前挑战与前沿方向

⚠️

Sim-to-Real 残留差距

仿真器无法完全模拟真实物理(如接触摩擦、柔性体),域随机化不能解决所有问题

⚠️

奖励设计难度

复杂任务(如装配、插拔)的奖励函数设计极其困难,容易导致次优行为

⚠️

安全探索问题

探索过程中的碰撞/跌落可能导致机器人损坏,安全约束 RL 是活跃研究领域

⚠️

泛化能力

训练过的策略在新环境(新物体、新地形)中的泛化能力有限

当前共识:在四足机器人领域,RL + Sim-to-Real 已经达到甚至超越经典 MPC 控制器的性能,特别是在复杂地形适应性方面。但在高精度操作(如装配)和安全关键场景中,基于模型的控制仍是更可靠的选择。两者的融合——RL 生成参考轨迹 + MPC 精细化跟踪——是当前最流行的混合路线。

📹 5. 模仿学习与示教学习路线

5.1 基本原理

模仿学习(Imitation Learning, IL)的核心思想是:从人类专家演示中学习机器人的行为策略。与强化学习从零开始试错不同,模仿学习直接利用高质量示教数据加速学习过程,非常适合机器人操作等难以手工设计奖励函数的任务。

行为克隆 (Behavioral Cloning, BC)

最直接的模仿学习方法,将示教数据视为监督学习问题:

$$\max_{\theta} \sum_{i=1}^N \sum_{t=1}^{T_i} \log \pi_{\theta}(a_{i,t} | o_{i,t})$$

优点:简单、训练快、收敛稳定
缺点:分布漂移(covariate shift)——策略在遇到与示教数据略微不同的状态时性能急剧下降

逆强化学习 (Inverse RL, IRL)

从示教数据中推断隐式的奖励函数,然后基于奖励函数学习策略:

$$\max_{r} \mathbb{E}_{\pi_E}[\sum r(s_t, a_t)] - \mathbb{E}_{\pi}[\sum r(s_t, a_t)]$$

代表方法:最大熵 IRL、GAIL (Generative Adversarial Imitation Learning)

5.2 遥操作与示教数据采集

模仿学习的核心瓶颈在于高质量示教数据的获取。当前主流的示教数据采集方法包括:

方法描述精度成本代表系统
直接遥操作操作者用手柄/主手直接控制机器人Omega.7 + KUKA LBR
动作捕捉穿戴动捕设备记录人体运动并映射到机器人Vicon / Xsens
VR 遥操作使用 VR 手柄进行示教,提供沉浸式反馈Apple Vision Pro + 机械臂
外骨骼遥操作穿戴外骨骼记录人体全身运动极高极高Shadow Robot 遥操作系统
示教器拖动直接拖动机械臂末端进行示教(重力补偿模式)UR 机械臂拖动示教
镜像式遥操作使用小型双手机器人模仿操作者双手动作Mobile ALOHA / ANYmal D

5.3 扩散策略 (Diffusion Policy)

扩散策略是 2023 年以来模仿学习领域的重大突破,它将扩散模型(Diffusion Model)引入机器人策略学习,显著提高了复杂操作任务的成功率。

扩散策略原理

扩散策略结构 视觉编码器 ResNet / ViT 条件扩散模型 噪声预测器 \(\epsilon_{\theta}(a_t^k, c_t, k)\) 从噪声逐步去噪得到动作 DDIM / DDPM 反向过程 动作生成 轨迹序列输出 去噪过程: \(a_t^0 \leftarrow a_t^1 \leftarrow ... \leftarrow a_t^K \sim \mathcal{N}(0, I)\) 训练损失: \(\mathcal{L} = \mathbb{E}_{k, a_0, \epsilon} \left[ \|\epsilon - \epsilon_{\theta}(\sqrt{\bar{\alpha}_k} a_0 + \sqrt{1 - \bar{\alpha}_k} \epsilon, c, k)\|^2 \right]\) 其中 \(c\) 为观测条件(视觉 + 关节状态),\(a_0\) 为真实动作

扩散策略的核心优势

5.4 Mobile ALOHA 与柔性示教

Mobile ALOHA 是 2024 年斯坦福大学提出的低成本双臂移动操作系统,展示了模仿学习在复杂操作任务中的巨大潜力:

💡
关键趋势:模仿学习正在成为机器人学习领域最热门的路线。2024 年以来,扩散策略+高质量遥操作数据采集的组合在多个操作任务上取得了接近人类水平的表现。与 RL 相比,模仿学习不需要设计奖励函数,数据效率更高;与 MPC 相比,不需要精确的物理模型。但其性能天花板受限于示教数据的质量和多样性。

🧑‍🦳 6. 人形机器人技术路线

6.1 人形机器人复兴

人形机器人(Humanoid Robot)是机器人技术的"终极挑战"之一。2022 年以来,以 Tesla Optimus、Figure 01/02、宇树 H1、小米 CyberOne 等为代表的新一代人形机器人引发了全球范围的第二次人形机器人浪潮。与 2000 年代 ASIMO 时代的纯"展示型"不同,本轮浪潮的核心驱动力来自产业化——旨在替代人类在制造业、物流、家庭服务等领域的重复性劳动。

人形机器人技术架构

新一代人形机器人技术架构 执行器硬件 直线/旋转电机 高力矩密度 + 弹性驱动 全身控制系统 MPC + WBC 力矩控制 接触力优化 感知与定位 IMU + 足底力传感器 RGB-D 相机 + LiDAR 上层任务规划 VLA / 大模型推理 任务分解 + 运动规划 两条并行的控制路线 路线 A:基于模型的控制 精确动力学模型 + MPC/WBC 优化 优点: 可解释、可分析、可安全验证 缺点: 模型标定复杂、适应性有限 代表: Atlas (Boston Dynamics) 路线 B:端到端学习控制 大规模仿真 RL + Sim-to-Real 迁移 优点: 无需精确模型、灵活性高 缺点: Sim-to-Real 差距、安全不可证 代表: 宇树 H1/G1 (RL 训练)

6.2 硬件架构

人形机器人的硬件架构直接影响其运动能力和应用场景,当前主流设计呈现以下趋势:

品牌型号自由度驱动方式身高/体重特色
TeslaOptimus Gen 2~50无框电机 + 行星滚柱丝杠172cm / 57kgFSD 感知复用、低成本量产设计
Figure AIFigure 02~40定制电机 + 丝杠168cm / 60kgOpenAI VLM 集成、续航 > 5h
Boston DynamicsAtlas (电动版)~60液压 → 全电动~150cm / ~80kg极端动态性能、后空翻/跑酷
宇树科技H1 / G1~28高力矩密度电机180cm / 47kgRL 端到端行走、高性价比
1X TechnologiesNEO~30串联弹性驱动器 (SEA)~165cm / ~30kg柔顺-安全交互、双足
小米CyberOne~21电机 + 减速器177cm / 52kg环境感知 + 情感交互

6.3 控制方法对比

基于模型控制(波士顿动力路线)

波士顿动力 Atas 代表着基于模型控制的最高水平:

  • 模型预测控制 (MPC):基于单刚体模型(SRBM)或全身模型,以 kHz 级频率求解优化问题
  • 全身控制 (WBC):将 MPC 输出的躯体力/力矩分配到各关节,同时保持平衡约束
  • 关键方程(线性倒立摆 + 角动量调节)
$$\begin{aligned} \ddot{x}_{CoM} &= \frac{\lambda_x}{m} + g + \frac{\dot{L}_y}{m \cdot z_{CoM}} \quad \text{(线性倒立摆 + 角动量)} \\ \text{Foot Placement: } &x_{foot}^{des} = \frac{v_{CoM}}{2} \sqrt{\frac{z_0}{g}} + \text{feedback term} \end{aligned}$$

优势:可预测、可分析、安全可验证;
劣势:模型标定极其复杂(每个部件动/动力学参数需精确测量),对非结构环境的适应性有限。

端到端 RL 控制(宇树 H1 路线)

宇树 H1 和 G1 展示了端到端 RL 控制的最新成果:

  • 训练方法:在 Isaac Gym 中使用大规模并行 RL 训练,单次训练使用数千个并行环境
  • Teacher-Student:特权训练 → 传感器蒸馏部署
  • Domain Randomization:广泛的参数随机化保证迁移成功
  • 策略架构:PPO + LSTM + MLP,输出各关节位置/力矩指令

优势:无需精确模型、对地形变化高度鲁棒、开发迭代快;
劣势:安全验证困难、"黑盒"策略在极端情况下的行为不可预测。

6.4 核心技术挑战

动态平衡

双足行走本质不稳定,需要 ms 级的快速响应。在推搡、滑倒、碰撞等干扰下保持平衡仍是最核心的难题

🔋

能量效率

电驱人形机器人续航普遍不到 2 小时。低阻抗电机、能量回收、轻量化结构是突破方向

📋

全身协调

多自由度的冗余运动链需要协调全身运动(手、躯干、腿)以实现有效的操作和移动平衡

💰

成本控制

人形机器人量产的目标单价为 $10k-$30k,需大幅降低执行器、传感器、减速器成本

💡
当前判断:人形机器人正处于"技术验证 → 产业落地"的关键拐点。Tesla Optimus 的量产路线图(2025-2027 年数千台部署)将考验整个产业链的成熟度。短期内最可行的落地场景是工业制造中的危险/重复性岗位替代物流仓储搬运

📦 7. 具身智能与 VLA 大模型路线

7.1 具身智能 (Embodied Intelligence)

具身智能(Embodied AI)是 2023 年以来人工智能领域最热门的方向之一,核心理念是:智能不能脱离身体和环境存在——真正的通用智能必须通过与物理世界的交互来学习和展现。在机器人领域,具身智能试图将大语言模型(LLM)、视觉语言模型(VLM)等"脑"与机器人的"身体"相结合,实现理解、推理、行动的统一。

传统机器人范式

感知 → 规划 → 控制,每步独立设计。规划需要手工编写规则或代价函数,难以泛化到新任务。

具身智能范式

"看到场景 → 语言理解/推理 → 生成行动指令" — 利用大模型的常识推理和泛化能力,一句话就能让机器人执行复杂的操作。

7.2 VLA 架构

VLA(Vision-Language-Action Model)是当前具身智能的主流技术框架,将视觉感知、语言推理、行动生成融合在同一个大模型中。

VLA 模型架构

具身智能 VLA 模型架构 视觉编码器 SigLIP / DINOv2 / ViT 多视角图像 → tokens 多模态大语言模型 LLaMA / PaLM / Qwen 等 视觉 token + 文本 token 统一建模 CoT 推理 + 任务分解 行动解码器 动作 token → 连续动作 关节角 / 末端位姿 输入: "把桌上的苹果拿给我" 输出: 抓取轨迹指令 代表模型: RT-2 (Google) / Octo / OpenVLA / RDT-1B

7.3 代表性 VLA 模型

📦 RT-2 (Google DeepMind, 2023)

RT-2 (Robotic Transformer 2) 是首个将大语言模型与机器人控制深度融合的 VLA 模型,被《Time》评为 2023 年最佳发明之一。

核心思想:将机器人动作表示为文本 token,在大规模互联网图文数据 + 机器人数据上联合训练。

$$\text{训练数据: } \underbrace{\text{互联网图文数据}}_{\text{10B+ tokens}} + \underbrace{\text{机器人示教数据}}_{\text{100K+ episodes}}$$

关键技术细节

  • 动作 Tokenization:将 6/7 自由度末端执行器位姿离散化为 256 个 bin,每个 bin 映射为一个 token
  • 模型基础:PaLM-E / PaLI-X 多模态大模型,520 亿参数
  • 训练方式:联合训练——在互联网数据上学习语义知识,在机器人数据上学习动作映射
  • 泛化能力:可以执行未在训练中见过的物体操作任务(如"把香蕉放到红色碗里")
RT-2 证明了"互联网知识可以迁移到机器人操作"——模型见过大量图片中的苹果和盘子,即使机器人训练数据中没有这个组合,也能正确执行"把苹果放到盘子里"。
🖥 Octo / OpenVLA (2024)

Octo 和 OpenVLA 是开源 VLA 模型的代表,降低了 VLA 研究的门槛:

  • Octo (UC Berkeley / CMU / Google):
    • 基于 Transformer 的通用机器人操作模型
    • 在 Open X-Embodiment 数据集的 80 万条轨迹上训练
    • 支持多种机器人形态(单臂、双臂、移动操作)
    • 80M / 650M / 2.5B 参数版本
  • OpenVLA
    • 基于 LLaMA-2 / LLaMA-3 的 7B 参数 VLA 模型
    • Prism 视觉编码器 + LLM + 动作解码器
    • 支持微调到新任务/新机器人
🧠 RDT-1B (Robotics Diffusion Transformer, 2024)

RDT-1B 是阿里巴巴提出的1.1B 参数基于扩散的机器人基础模型

  • 架构:将扩散模型与 Transformer 结合,统一建模多模态动作输出
  • 特点:支持双臂协调操作,处理高维动作空间(>30 自由度)
  • 数据:在多样化机器人数据集上预训练,可微调到具体任务
  • 性能:在 ALOHA 双臂操作任务上超过专有模型

7.4 机器人基础模型的 Scaling Law

具身智能领域正在探索类似 NLP 领域的 Scaling Law——增加模型规模和数据量是否能持续提升机器人性能?

模型参数量训练数据机器人形态训练方法泛化能力
RT-255B互联网 + 10万轨迹单臂LLM 微调
Octo (Large)2.5B80万轨迹多种从零训练中-高
OpenVLA7B互联网 + 100万轨迹单臂LLM 微调
RDT-1B1.1B多源机器人数据双臂扩散模型
GR-2 (Google)3.7B5000+ 小时单臂视频预训练
⚠️
关键挑战:(1) 数据稀缺——机器人数据远少于文本/图像数据;(2) 异构性——不同机器人形态的感知-动作空间不同;(3) 实时性——大模型推理延迟(100ms-1s)远高于传统控制器(1-10ms);(4) 安全性——大模型的"幻觉"在物理世界中可能导致危险行为。

7.5 当前前沿方向

🏀

机器人操作基准

建立统一的跨机器人、跨场景操作基准,如 CALVIN、LIBERO、Open X-Embodiment

📹

视频预训练

利用大规模人类操作视频进行预训练,学习通用的视觉运动和物理理解能力

📡

多机器人共享策略

一个策略同时控制多种不同形态的机器人,实现"一次训练,到处部署"

🧩

具身世界模型

融合世界模型的预测能力与 VLA 的推理能力,在"想象空间"中规划行动

🌍 8. 世界模型与机器人基础模型

8.1 世界模型在机器人中的应用

世界模型(World Model)在机器人领域的重要性日益凸显。与自动驾驶类似,机器人世界模型学习对物理世界演变的预测能力,使机器人能够在内心推演不同行动方案的结果,选择最优策略。

世界模型用于机器人规划的框架

世界模型驱动的机器人规划 观测编码器 RGB-D / 触觉 / 关节编码器 → 隐状态 \(z_t\) 隐空间动力学模型 \(p(z_{t+1} | z_t, a_t)\) 支持多步 Rollout 预测 不确定性建模: 概率预测 策略/规划器 在隐空间中选择最优动作 MPC / Actor-Critic 隐空间 Rollout: 在想象中规划 代表工作: DreamerV3 (DeepMind) / TD-MPC2 / DayDreamer (迁移到真实机器人)

机器人世界模型代表性工作

🧩 DreamerV3 (DeepMind, 2023)

DreamerV3 是隐空间世界模型的最先进版本,在机器人控制领域表现突出:

  • RSSM (Recurrent State-Space Model):循环状态空间模型,同时建模随机和确定性隐状态
  • Symlog 变换:对奖励和目标值进行对称对数变换,解决大范围值问题
  • 无调参训练:一组超参数在不同任务上通用(从 Atari 到机器人操控)
  • DayDreamer 迁移:将 DreamerV3 部署到真实机器人(四足、无人机、机械臂),训练 1-5 小时即可学会运动
📊 TD-MPC2 (Qin & Hansen, 2024)

TD-MPC2 是一种结合时序差分学习和 MPC 的世界模型方法:

  • 联合学习隐空间动力学模型、奖励模型、值函数
  • 在隐空间中使用 MPPI (Model Predictive Path Integral) 进行规划
  • 在多样化机器人任务(80+ 任务)上优于 DreamerV3 和传统 MBRL
  • 支持视觉观察直接学习,无需状态估计

8.2 机器人基础模型 (Robot Foundation Models)

机器人基础模型是当前最具前瞻性的方向之一——训练一个通用模型,能够控制不同形态的机器人完成各种任务。这个思路类似 NLP 中的基础模型(GPT、LLaMA),但在机器人领域面临更多挑战。

代表性基础模型

模型机构核心思路适用形态
RT-X / Open X-EmbodimentX-Embodiment 合作跨机构、跨机器人联合训练22 种机器人
GATO (DeepMind)DeepMind单一 Transformer 玩 Atari、对话、控制机器人多种
UniPi (Google)Google文本→视频→动作的视频生成式规划机械臂
π0 (Physical Intelligence)Physical Intelligence基础模型直接输出低频力矩指令多种操作机器人
GR-2 / GR-1Google DeepMind视频预训练 → 动作微调单臂
💡
重要趋势:机器人基础模型正从"单机器人单任务"向"多机器人多任务"演进。关键路径为:大规模互联网预训练 → 机器人适配微调 → Sim-to-Real 迁移。参考 NLP 领域的成功经验,下一步的关键突破可能来自更大规模的机器人操作数据集和更有效的跨形态迁移方法。

🖐 9. 灵巧操作技术路线

9.1 灵巧操作的核心问题

灵巧操作(Dexterous Manipulation)是机器人技术中最具挑战性的方向之一,目标是让机器人像人类一样灵活地使用手和手指操纵物体。其核心难度在于:

9.2 主要技术路线

基于模型的操作

经典方法,利用力觉/力矩传感器实现力位混合控制:

  • 抓取规划:计算摩擦锥内的力闭合/形闭合抓取
  • 操作规划:手指步态规划、物体重定向轨迹优化
  • 代表系统:DLR Hand + 力控、Shadow Hand + 力矩控制

基于学习的操作

利用 RL 和模仿学习学习操作技能:

  • Sim-to-Real 灵巧操作:仿真中训练抓取和操作策略
  • 扩散策略操作:扩散模型生成多模态操作动作
  • 触觉学习:利用触觉传感器(GelSight 等)学习精细操作

灵巧操作的代表性成果

工作时间方法任务关键亮点
OpenAI Dactyl2018RL + LSTM + ADRShadow Hand 魔方操作首次实现灵巧手自主操作魔方
TossingBot2019RL + 视觉物体抛掷抓取学习抛掷和抓取未见物体
ISAACS (NVIDIA)2023物理仿真 + RL灵巧手转笔/翻硬币仿真到真实迁移灵巧技能
Diffusion Policy (视觉版)2023扩散模型多类精细操作高成功率多模态操作
AnyHand (清华)2024仿真预训练 + 域随机化灵巧手通用操作19 种技能零样本迁移
当前认知:灵巧操作正处于从"抓取"到"操作"的质变期。基于学习的路线已显著超越传统基于模型的方法,但高精度操作(如针线活、微装配)仍需突破。触觉传感器技术的发展(GelSight Mini、Digit 等)将是灵巧操作走向实用的关键推动力。

📊 10. 技术路线对比与趋势

10.1 多维度对比

维度传统工业机器人基于模型控制强化学习模仿学习人形机器人具身智能/VLA
成熟度⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
可解释性
泛化能力极低中-高
数据需求中(模型标定)极高高(互联网+机器人)
实时性kHz 级100Hz-kHz100Hz-1kHz10-100Hz100Hz-kHz1-50Hz(受推理延迟限制)
安全验证容易较容易困难困难困难极困难
产业应用400 万台存量MIT Cheetah, AtlasSpot, ANYmalALOHA, 实验室Optimus, H1实验室/演示
场景适应性固定工位结构化环境结构化-半结构化半结构化半结构化开放环境

10.2 混合架构——实际落地方案

实际机器人系统几乎都采用混合架构,取各路线之长:

实用机器人系统的混合架构 (2025-2027) 主流程: 分层混合控制 VLA 大模型 (高层任务规划) 任务分解 / 场景理解 RL/模仿学习策略 运动生成 / 操作技能 MPC/WBC 精细控制 力矩优化 / 跟踪控制 伺服执行层 电机/液压驱动 VLA 云端推理 (延迟 100ms-1s) 学习策略 GPU 推理 (5-20ms) MPC QP 求解器 (1-5ms) 伺服环 (0.1-1ms) 混合架构设计原则 上层用大模型理解场景和规划任务 (泛化、灵活) | 中层用学习策略生成运动 (自适应、鲁棒) | 下层用最优控制精确跟踪 (安全、稳定) 各层通过频率解耦: 上层 1-10Hz → 中层 50-200Hz → 下层 1k-10kHz

短期 (2025-2027): 混合架构全面推广

传统工业机器人逐步融入力控和视觉引导;四足/人形机器人在工业巡检、物流搬运中试点部署;VLA 大模型以云端辅助决策的方式融入机器人系统;Sim-to-Real 成为机器人控制的标准开发流程。

中期 (2027-2030): 基础模型驱动

机器人基础模型(VLA + 世界模型)在通用操作任务上超越专门训练的模型;跨形态迁移成熟,一个基础模型适配多种机器人;人形机器人进入初阶产业化,在制造、物流、服务等场景部署数万台。

长期 (2030+): 通用机器人智能

融合世界模型、VLA、RL 的统一通用机器人智能体成为研究目标;机器人能够像人类一样在开放环境中自主学习和适应新技能;安全和伦理框架成为产业化落地的关键瓶颈而非技术本身。

核心技术收敛预测

技术路线收敛趋势 传统工业机器人 2025 主力 模型+学习混合 2027 主力 学习驱动主导 2030 主力 通用机器人大模型 2035+ 展望 关键收敛趋势: 1. 控制层: 从 PID → MPC → 学习型 MPC → 端到端神经网络 2. 规划层: 从手工规则 → 优化求解 → 数据驱动策略 → VLA 推理 3. 感知层: 从无感知 → 视觉辅助 → 多模态融合 → 统一场景理解 4. 系统架构: 从感知-规划-控制分离 → 端到端统一模型 → 多层级大模型混合

10.4 核心瓶颈与挑战

🛑

安全与可靠性

学习系统的行为无法穷举验证,物理世界中的安全性论证需要新方法论

🏊

算力与功耗

大模型车端/机载部署面临算力、功耗、散热的物理约束,边缘 AI 芯片是关键

📋

数据飞轮

高质量机器人示教数据获取成本高,数据标准化和共享机制尚未建立

⚙️

物理世界泛化

机器人面临的环境多样性远超仿真覆盖,零样本泛化仍是重大挑战

💡
总结:机器人技术正站在从"专用自动化"到"通用智能"的历史性跨越节点。未来的终极方案几乎必然是一个融合了最优控制精度、RL 自适应能力、模仿学习数据效率、VLA 常识推理、世界模型预测能力的综合系统。而安全验证、算力成本和数据基础设施,将是决定这一进程速度的关键因素。

🏁 11. 总结与展望

机器人技术正处于第三次浪潮的加速期。第一次浪潮(1960-2000)实现了工业自动化,第二次浪潮(2000-2020)让机器人走进服务场景,而第三次浪潮(2020+)正在以AI 大模型 + 人形机器人 + 具身智能为核心,推动机器人从专用工具向通用智能体进化。

各路线核心趋势总结:

🏭 传统工业机器人:仍是制造业基石,逐步融入力控/视觉/协作功能,存量市场 + 渐进式升级

🏗️ 基于模型的最优控制:MPC/WBC 在动态运动中不可替代,与学习路线融合形成"模型+学习"混合控制

🧠 强化学习:Sim-to-Real 使 RL 走出实验室,四足/灵巧手的产业应用已成熟,但安全验证仍是瓶颈

📹 模仿学习:扩散策略带来质变,低成本遥操作数据采集 + 模仿学习成为机器人操作技能获取的标准范式

🧑‍🦳 人形机器人:2025-2027 年进入产业化验证期,最可行的落地场景是工业危险岗位替代

📦 具身智能/VLA:最前沿的探索方向,互联网知识 + 机器人基础模型的组合将推动通用机器人智能的最终实现

最终建议

对机器人工程团队的建议
1. 以基于模型的控制为基础确保系统安全和稳定性,这是所有上层策略的"底线"
2. 在操作技能层面引入模仿学习 + 扩散策略,降低复杂任务的编程成本
3. 在四足/双足等动态平台部署 Sim-to-Real RL,实现全地形自适应行走能力
4. 探索 VLA 大模型的高层任务规划和场景理解能力,逐步替代规则引擎
5. 建立数据飞轮——遥操作采集 → 策略训练 → 部署验证 → 增量数据采集的闭环

—— 机器人技术的下一个十年,将是从"让机器学会动"到"让机器学会想"的跨越 ——

目录