机器人是如何学习的?

在我们深入之前,先做个简单的回顾和背景介绍。你一定听过“机器学习”这个词,嗯,如今它就像个流行词。回顾一下,机器学习是人工智能的一种方法,你教模型从数据中的模式中学习,然后用它来做预测或分析。从高层次来看,就是这么简单。

你获取一堆相关数据,传递给机器学习模型,模型找出规律,然后就可以进行推理。

令人惊讶的是:许多我们称为自主的机器人并不会从经验中学习或改进,它们通常是明确编程的。一个常见的例子是无人机执行路径规划,这仅仅使用了路径规划算法。

机器人并没有改变。而是现在有了新的、更好的方法来改进机器人学(主要在智能方面)。以前,机器人以遵循固定的、预编程的规则而闻名。

1、简介

机器人学习是机器学习和机器人学交叉的一个领域。它关注的是允许机器人通过经验学习和改进其行为,并适应其环境的技术和方法。 这是你能得到的最简单的定义。

与其在每种情况下都被明确告知该做什么,一个学习型机器人:

  • 通过传感器观察世界
  • 采取行动
  • 评估结果
  • 调整未来的行为 这类似于人类如何从试错中学习。

2、机器人学习的结构

在我们探讨为什么机器人需要学习之前,我们必须定义术语。我们有一个智能体,它观察其环境,并采取行动来改变其状态,目标是最大化随时间累积的奖励。

智能体是学习者,是感知世界、处理信息并做出决策以实现特定目标的实体。

环境是智能体决策过程之外的一切。它是机器人生活的世界。

3、框架:马尔可夫决策过程(MDP)

在机器人学习和强化学习中,我们将机器人视为与环境交互的智能体。

这种交互被正式描述为马尔可夫决策过程(MDP)。MDP 为建模决策提供了一个框架,其中结果部分是随机的,部分由机器人控制。

​要将物理机器人转化为数学模型,我们将其世界分解为四个变量:

  • ​状态(S):机器人当前的“快照”。这包括其自身的关节位置和传感器数据(如 LIDAR 或相机帧)。
  • ​动作(A):机器人可以采取的所有可能动作的集合,例如“旋转电机 15 度”或“关闭夹爪”。
  • ​转移函数(P):在状态 S 下采取动作 A 导致新状态 S' 的概率。在机器人学中,这通常被称为动态模型。
  • ​奖励(R):一个数值信号(成功为 +1,碰撞为 -1),告诉机器人它表现如何。

4、机器人如何“决策”:策略和价值

策略(π)

策略是机器人的策略,就像一条规则,告诉机器人根据其当前状态应该执行什么动作。

π(s) → a

策略:状态 → 动作

例如:

  • 机器人臂看到夹爪未对齐 → 稍微旋转
  • 移动机器人检测到障碍物 → 左转。
  • 行走机器人感到不平衡 → 转移重量。

现在,理解策略可以有两种形式:确定性或随机性。

确定性策略告诉机器人——在某个状态下总是选择相同的动作。

随机性策略以概率选择动作,这在不确定性下很有用。

现在我们了解了策略是什么,让我们继续。如果策略告诉机器人该做什么,我们仍然需要一种方法来评估:

  • 动作的好坏
  • 状态是否理想或有风险
  • 决策是否会导致长期成功。

这就是价值函数的作用。价值函数是一种数学工具,估计智能体从给定状态或状态-动作对中可获得的预期累积奖励。主要有两种类型的价值函数:状态价值函数和动作价值函数。

  • 状态价值函数(V(s)):此函数返回一个值,告诉智能体处于特定状态有多好。
  • 动作价值函数(Q(s,a)):此函数估计在某个状态下采取特定动作的回报。

例如,在一个智能体导航到目标的网格世界游戏中,V(s) 可能会给更接近目标的状态分配更高的值,而 Q(s,a) 会在特定单元格中将“向上”或“向右”移动评为更好的动作。

5、策略和价值如何协同工作

机器人学习决策有两种主要方式。

  1. 基于价值的学习:在这种方法中,智能体首先学习价值函数,然后策略间接地从中派生。
  2. 基于策略的学习:在这里,智能体直接学习最优策略,不依赖价值函数。它是这样工作的:机器人完成整个任务或情节,查看结束时的总奖励,然后可以说——“我在这个情节中所做的一切都很好,让我们多做那样的事”或者“整个运行都很糟糕,让我们改变一切。”这里的问题是,由于机器人只在结束时学习其整体动作是好是坏,很难判断哪个具体动作是错误的。

现代方法找到了一种将两者结合的方法,称为 Actor-Critic。它将大脑分成两个神经网络。

  • Actor(策略):决定采取什么动作。
  • Critic(价值函数):不移动机器人。它观察 Actor 并预测 Actor 从当前状态将获得多少奖励。

6、为什么机器人需要学习?

传统机器人在结构化环境(如工厂)中工作良好。但现实世界是不可预测的、嘈杂的且充满变化。学习使机器人能够适应新环境、处理不确定性、随时间改进并执行复杂任务(行走、抓取、驾驶)。

示例:

  • 机器人学习不摔倒地行走。
  • 机器人臂学习抓取不同形状的物体。
  • 自动驾驶汽车学习更安全的驾驶策略。

现在,有很多方法可以教机器人适应,我们将介绍最常用的方法:

1) 从演示中学习

又称模仿学习。这种技术允许智能体通过观察和模仿演示来学习如何执行任务或获取新技能。演示是由专家或另一个知道如何执行任务的机器人提供的数据。

实际上有两种主要方法用于实现模仿学习。第一种是行为克隆,第二种是逆强化学习。

  • 行为克隆将机器人学习简化为监督学习:机器人不是发现如何行动——它复制专家的行动。没有奖励。没有试错。只有模仿。
  • DAgger(数据集聚合):要理解为什么我们需要它,你首先必须看到行为克隆(BC)在哪里失败。BC 就像学生记忆专业司机的视频。只要保持在完美的路线上,学生就知道该做什么。但一旦他们碰到一个小颠簸,偏离轨道两英寸,他们就会惊慌,因为视频从未告诉他们“如何回到中心”。他们以前从未见过那种状态,所以他们会犯另一个错误,再一个错误,直到崩溃。它迭代地查询学习者访问过的状态的专家。
  • 逆强化学习:经典强化学习假设奖励函数是已知的。你有没有想过——给定一个试图移动一杯水的机器人臂,你如何奖励确保杯子始终直立?你如何用数学定义那个。逆强化学习颠倒了这个问题,它不是从奖励中学习策略,而是从专家行为中学习奖励函数。

2) 强化学习(试错)

这种方法通过与环境的直接交互来训练机器人,其中行为基于成功或失败而不是明确的指令得到改进。这种方法假设智能体没有被告知该采取什么动作。

3) 模型学习

或世界建模,是一种机器人学习技术,机器人学习世界如何行为的内部模型,并使用该模型进行推理、规划和改进其动作。 机器人不是仅从现实环境中的试错中学习,而是学习其动作如何改变世界状态,这使其能够在行动前思考。

7、通过交互学习:探索和反馈

到目前为止,我们已经讨论了很多内容,包括基础和构建块:策略(机器人在任何情况下应该做什么)、价值函数(告诉动作的好坏)以及核心学习技术。

但现实世界的机器人学习不是孤立发生的。机器人必须与环境交互,涉及两个新元素:探索(尝试新事物以发现什么有效)和反馈(告诉机器人它是好是坏的信号)。

在强化学习中,机器人作为智能体通过试错基于其当前状态采取动作,经过多次交互,目标是最大化其随时间累积的奖励。

探索至关重要,因为重复相同模式的机器人永远无法改进或找到更好的策略。

反馈可以来自环境本身(稀疏奖励,如完成任务时的 +1)或来自人类。在涉及人类的情况下,人类可以更有效和安全地引导探索,防止危险的尝试。

这个循环使机器人学习变得强大,但也昂贵且有风险,这就是为什么严重依赖仿真的原因。

8、为什么使用仿真以及它为什么失败

仿真允许机器人训练比现实快数百万倍且更安全。在虚拟环境中训练可以轻松生成大量数据,这使得机器人能够学习复杂技能,如操作和运动,这些技能在物理机器人上通常需要数月或数年才能实现。

有一些工具可以做到这一点,如 MujoCo 和 Isaac Sim,它们利用并行化使用 GPU 运行仿真,进一步加速学习。学到的策略可以转移到真实机器人上(sim-to-real)。

Sim-to-real 也不总是有效。原因是仿真常常过度简化,这可能是变形、信号、传感器噪声——在仿真中运行良好的策略在转移到现实世界时可能会失败。这种差距主要源于不完美的建模。

但在实践中,纯仿真或纯真实世界训练很少见。大多数成功来自混合方法。

9、机器人学习的当前趋势

截至 2025 年 12 月,机器人学习正在因基础模型而爆发——大型预训练模型,像 LLM,但用于机器人学。

其他关键趋势包括:

  • 多模态基础模型,如 π0(Pi zero),一个视觉-语言-动作模型,旨在作为通用机器人大脑——由 Physical Intelligence 开发。
  • 人形和快速学习机器人:像 Tesla(Optimus)、Figure(叠毛巾机器人)和 Agility 这样的公司推动用大量数据训练的通用人形机器人。

原文链接: How do Robots learn? A Comprehensive Introduction to Robot Learning

汇智网翻译整理,转载请标明出处