大模型后训练权威指南

后训练(Post-training)如今承载了大语言模型大部分可用能力的创造。这是本文分析的核心发现,对任何构建、部署或寻求 AI 职业生涯的人来说都有深远影响。从原始基座模型到 ChatGPT、Claude 或 Gemini 的转变,并非发生在预训练阶段,而是发生在后训练阶段。

然而,尽管后训练的重要性如此突出,它仍然是 LLM 开发流程中最不被理解的环节之一。大多数公开讨论聚焦于预训练——庞大的计算集群、数万亿的 token、缩放定律。相比之下,后训练相对默默无闻,尽管这里开创的技术——监督微调(SFT)、人类反馈强化学习(RLHF)、直接偏好优化(DPO)和群体相对策略优化(GRPO)——正是将一个研究产物与数百万人每天使用的产品区分开来的关键。

本指南提供了全面的、面向实践者的后训练流程深度解析。无论你是希望专业化的 ML 工程师、评估对齐技术的研究人员,还是为前沿 AI 实验室面试做准备的转行者,本文都涵盖了掌握后训练的技术基础、战略格局和职业影响。

1、什么是后训练?定义模型质量的隐藏阶

1.1 后训练 vs. 微调

应用 AI 中最常见的混淆来源之一是将"后训练"与"微调"混为一谈。它们不是同义词。这种区别是结构性的,而非语义性的,理解它对技术从业者和职业战略家都至关重要。

后训练是指 OpenAI、Anthropic 和 Google DeepMind 等模型提供商对基座模型执行的通用对齐和指令微调过程,以创建作为产品发布的 instruct 或 chat 变体。它通常涉及超过一百万个示例的数据集,跨越多个训练阶段(SFT、偏好对齐,以及越来越多的强化学习),旨在产生一个在用户查询的完整分布上广泛有用、无害且诚实的模型。

微调则不同,它是下游用户或企业执行的任务特定或领域特定适配。它使用较小的数据集——通常是一万到一百万个示例——并将模型优化用于狭窄的用例:法律文档分类器、医疗编码助手、特定产品线的客户支持聊天机器人。微调是在已经后训练的模型基础上进一步锐化它。

实际含义很明确:如果你在 GPT-4 或 Claude 之上构建产品,你是在做微调。如果你在前沿实验室工作,创造这些模型的下一个版本,你是在做后训练。两者都需要对相同底层技术的深入了解——SFT、LoRA、偏好优化——但规模、数据集策展挑战和评估框架有显著差异。

1.2 三阶段流程:SFT、偏好对齐和强化学习

现代后训练流程,正如三大前沿实验室的出版物所证实的,遵循三阶段架构:

阶段 1 - 监督微调(SFT):基座模型在高质量指令-响应对上训练,以学习有帮助对话的格式、语气和结构。这个阶段将一个自动补全引擎转变为能够遵循指令的系统。

阶段 2 - 偏好对齐(DPO 或 RLHF):SFT 模型使用人类偏好数据进一步精炼——成对的响应,其中一个被判断为优于另一个。这个阶段教会模型不仅说什么,而且在多个合理响应中哪个最有帮助、最准确、最安全。这个阶段的输出是"instruct 模型"——大多数用户交互的产品。

阶段 3 - 带可验证奖励的强化学习(GRPO、DAPO、RLVR):这是最新、发展最快的阶段,由 DeepSeek 的 R1 模型在 2025 年初开创。在这里,模型使用强化学习在具有客观可验证答案的任务上训练——数学证明、代码执行、逻辑推理链。输出是一个"思考模型"或"推理模型",展示扩展的思维链推理能力。

这个三阶段流程代表了相对于 2022-2024 年定义的两阶段流程(SFT + RLHF)的重大演进。第三阶段——带可验证奖励的 RL——的加入,正是使 DeepSeek-R1、OpenAI 的 o1 和 o3、以及 Anthropic 的 Claude Opus 4 等模型与前代相比推理能力快速提升的原因。

1.3 为什么后训练如今占据模型可用能力的大部分

这方面的数据令人瞩目。Liquid AI 在其 LFM 2.5 模型上的基准测试表明,仅后训练就能在标准评估中将基准性能提高 20-40%——这种改进幅度如果仅通过缩放预训练计算来实现,需要数量级更多的计算资源。Meta 的 Llama 团队的研究显示了类似结果:Llama 3.1 基座和 Llama 3.1 instruct 在面向用户任务上的差距不是增量性的;而是变革性的。

这不是生产力提升;这是 AI 开发流程中价值创造位置的结构性转变。对于工程师和研究人员来说,含义是后训练专业知识不再是一个专业化方向——它是一项核心能力。对于公司来说,这意味着竞争优势越来越不在于谁能预训练最大的模型,而在于谁能后训练出最有能力的模型。

2、监督微调(SFT):教会模型遵循指令

2.1 全参数微调、LoRA 和 QLoRA——选择你的方法

监督微调是后训练流程的基础,这里的技术选择对计算成本、模型质量和实际部署有重大影响。三种方法主导了这个领域,每种都有实践者需要深入理解的独特权衡。

全参数微调(FP16)使用 16 位浮点精度更新模型中的每个参数。这是质量的黄金标准——它允许模型调整其整个权重空间以适应新的数据分布。然而,计算和内存需求是巨大的。在 FP16 中微调一个 70B 参数模型需要多个高端 GPU(通常是 4-8 个 A100 80GB 或 H100 GPU),即使在现代硬件上,训练过程也可能需要数天。全参数微调是前沿实验室的默认选择,那里计算资源充足,最高质量不可妥协。

LoRA(低秩适应)代表了参数高效微调的范式转变。LoRA 不是更新所有参数,而是冻结基座模型并在每个 Transformer 层注入小型可训练矩阵,通常将可训练参数数量减少 90-99%。在 16 位精度下运行,LoRA 以全参数微调计算成本的一小部分达到 85-95% 的质量。一个 70B 模型可以在单个 A100 GPU 上进行 LoRA 微调。这项研究最初由 Microsoft 的 Hu 等人于 2021 年发表,此后被 Meta、Google 和数十家构建生产微调流程的初创公司大规模验证。

QLoRA(量化低秩适应)通过在应用 LoRA 适配器之前将基座模型量化到 4 位精度,进一步提高了效率。由 Dettmers 等人于 2023 年引入,QLoRA 使得在单个具有 24GB VRAM 的消费级 GPU 上微调 70B 模型成为可能——这种民主化推动了开源模型的爆发。质量权衡是真实存在的,但通常可以接受:QLoRA 通常达到全参数微调质量的 80-90%,这对许多生产应用来说已经足够。

决策框架很直接。当你有计算资源且需要最高质量时使用全参数微调(前沿实验室后训练)。当你需要质量和效率的强平衡时使用 LoRA(企业微调、研究原型)。当计算受限或你需要快速迭代数据集实验时使用 QLoRA(初创公司、个人研究人员、学术实验室)。

2.2 数据集质量:准确性-多样性-复杂性三元组

从事大规模 SFT 的实践者最重要的洞察是:数据集质量主导数据集数量。在 10,000 个精心策展的示例上微调的模型将始终优于在 100,000 个噪声示例上微调的模型。这一发现已在多项研究中得到复现,包括 Meta 的 LIMA 论文(2023),该论文仅用 1,000 个精心选择的指令-响应对就展示了接近 GPT-4 的质量。

每个实践者必须优化的数据集质量有三个支柱:

1 准确性是最明显的要求,但也是最危险的。每个指令-响应对必须在事实上正确且格式恰当。单一类别的系统性错误——比如学术风格响应中持续的幻觉引用——可以通过整个模型的行为分布传播。大规模质量保证需要自动化验证(检查代码示例正确执行、验证数学推导)和人工审查(评估响应的帮助性、语气和安全性)的结合。

2 多样性确保模型发展广泛的能力,而不是过拟合到狭窄的分布。后训练数据集必须跨越广泛的指令类型(开放式问题、分步任务、创意写作、代码生成、多轮对话)、领域(科学、法律、医学、日常对话)和难度级别。研究表明,即使少量未充分代表的指令类型也可能在 SFT 期间导致这些领域的灾难性遗忘。

3 复杂性也许是最被低估的维度。在简单的单步指令上训练会产生一个在多步推理、细致分析和组合任务上挣扎的模型。最有效的 SFT 数据集有意包含复杂的、多轮的交互,要求模型维护上下文、处理歧义,并综合多个步骤的信息。

2.3 数据集组成蓝图

成功的后训练 SFT 数据集的经验分布,如 SmolLM2 数据集组成的分析所示,遵循一个对任何构建过生产 ML 数据集的人来说都很熟悉的模式:数学(39.4%)、代码(38.9%)、聊天/对话(17.6%)和指令遵循(4.1%)。

向数学和代码的倾斜并非偶然。这些领域提供了最清晰的训练信号——有客观正确的答案,模型可以据此评估。聊天和指令遵循虽然对用户体验至关重要,但带有更嘈杂的奖励信号,受益于较小但更高质量的数据集。这种组成反映了关于后训练的一个更广泛的事实:最容易训练的领域是有可验证真实答案的领域,最难的是需要主观判断的领域。平衡这种关系既是科学也是艺术,它代表了前沿实验室最严密保守的秘密之一。

3、偏好对齐:让模型有用、无害且诚实

3.1 RLHF——最初的突破

人类反馈强化学习(RLHF)是弥合"能够遵循指令的模型"与"用户真正想要交互的模型"之间差距的技术。由 OpenAI 和 Anthropic 在 2020 年至 2022 年间开创,RLHF 是使 ChatGPT 得以发布的关键创新,将 AI 从研究好奇心转变为数百万人使用的消费产品。

RLHF 流程涉及三个组件:一个监督微调模型(策略)、一个在人类偏好数据上训练的奖励模型,以及一个强化学习算法(通常是 PPO——近端策略优化),该算法优化策略以最大化奖励模型的分数,同时保持接近原始 SFT 模型的分布。人类标注者比较成对的模型响应并选择更好的一个,生成训练奖励模型的偏好数据。

这项技术强大但昂贵。收集高质量人类偏好数据每次比较成本在 1 美元到 5 美元之间,典型的 RLHF 训练运行需要数十万次比较。在大规模下,这仅标注成本就达到数百万美元,还不包括 RL 训练循环所需的计算。奖励模型本身引入了一层复杂性——它必须足够大以捕捉细致的质量区分,但又要足够高效以在 RL 训练期间作为实时评分函数。

尽管存在这些挑战,RLHF 仍然是大多数前沿实验室后训练的支柱。OpenAI 的 GPT-4 和 GPT-5 都使用结合人类偏好数据和模型生成比较的混合 RLHF 方法。Google DeepMind 的 Gemini 模型使用 PPO 进行广泛的 RLHF,保持了原始流程最传统的实现。这项技术是有效的,其结果已在大规模下得到实证验证。

3.2 DPO——消除奖励模型

直接偏好优化(DPO),由 Stanford 的 Rafailov 等人于 2023 年引入,代表了一个重塑对齐格局的数学洞察:你不需要单独的奖励模型。DPO 将 RLHF 目标重新表述为一个简单的分类损失,可以直接应用于语言模型,使用相同的偏好数据。DPO 不是训练奖励模型、运行 RL 循环并仔细管理 KL 散度约束,而是通过单个监督训练步骤实现等效的对齐质量。

实际优势是显著的。DPO 消除了 RLHF 流程中最不稳定的组件——使用 PPO 的 RL 训练循环,它对超参数极其敏感且容易发生奖励作弊。与完整 RLHF 相比,它将计算需求减少约 50%,因为没有单独的奖励模型需要训练或服务。它还简化了所需的工程基础设施,使偏好对齐对缺乏 RLHF 所要求的专业 RL 工程专业知识的团队来说变得可行。

DPO 有效性的研究证据如今已经很广泛。Stanford 的原始论文证明 DPO 在标准对齐基准上匹配或超过 RLHF 质量。Meta、Mistral 和开源社区团队的后续工作已在大规模下确认了这些发现。DPO 已成为开源模型开发的默认对齐技术,并越来越多地与 RLHF 一起在前沿实验室使用。

对实践者来说的核心问题不是 DPO 是否有效——数据清楚地表明它确实有效——而是何时选择它而不是 RLHF。新兴共识是,DPO 在标准指令遵循对齐方面表现出色,但对于最复杂的安全关键行为,可能不如 RLHF,其中专门奖励模型捕捉的细微差别提供了额外价值。大多数前沿实验室现在两者都使用:DPO 用于初始对齐,针对性的 RLHF 用于安全关键领域。

3.3 RLAIF 和宪法 AI——Anthropic 的可扩展替代方案

Anthropic 开创了一种根本不同的偏好对齐方法,用 AI 反馈取代人类标注者——这种技术被称为 RLAIF(AI 反馈强化学习),并通过他们的宪法 AI 框架进行操作化。

这种方法的经济学是变革性的。虽然人类反馈每次比较成本为 1 到 5 美元,但 AI 生成的反馈每次比较成本不到 0.01 美元——成本降低了两到三个数量级。Anthropic 的宪法 AI 框架定义了一组原则("宪法"——最近在 2025 年更新为一份 80 页的文档)来指导 AI 对响应的评估。模型根据这些原则批评自己的输出,生成合成偏好数据,然后用于 DPO 或 RLHF 训练。

质量问题是微妙的。Anthropic 在 2023-2024 年发表的研究表明,RLAIF 在大多数对齐维度上达到与人类 RLHF 相当的质量,在一致性方面特别强大——AI 评估者统一应用相同的标准,而人类标注者表现出显著的评分者间变异性。RLAIF 的不足之处在于捕捉新颖的边缘情况和需要人类亲身经验的文化背景化判断。Anthropic 通过混合方法解决这一差距:RLAIF 用于大部分偏好数据生成,辅以针对安全关键类别的针对性人工标注。

这种方法对竞争格局有重大影响。它表明对齐质量将越来越多地由谁能设计最有效的宪法原则和 AI 评估框架来决定,而不是由谁能负担最多的人类标注者来决定。正如我在 生产级 AI 系统的上下文工程分析中讨论的,系统架构的质量——在这里是宪法和评估流程——比任何单个组件的暴力缩放更重要。

4、强化学习:推理模型的前沿

4.1 GRPO——DeepSeek 的范式转变

群体相对策略优化(GRPO),由 DeepSeek 在其 2025 年 1 月的 R1 论文中引入,是自最初 RLHF 突破以来后训练中最重要的创新。GRPO 消除了奖励模型和评论家网络——传统 RL 流程中计算成本最高、最不稳定的两个组件——并用一个非常优雅的机制取代它们:群体相对评分。

机制如下工作。对于每个提示,模型生成一组多个响应(通常是 8-16 个)。这些响应根据可验证的奖励函数进行评分——对于数学问题,答案是否正确;对于编码任务,代码是否通过测试用例。每个响应的优势根据群体均值计算,策略被更新以增加高于平均响应的概率并降低低于平均响应的概率。没有可学习的奖励模型可以过拟合,没有评论家网络需要训练,也没有复杂的 PPO 式裁剪需要管理。

结果是非凡的。主要使用 GRPO 训练的 DeepSeek-R1 以训练成本的一小部分达到了与 OpenAI 的 o1 模型相当的推理性能。开源社区的独立复现已证实 GRPO 可以诱导思维链推理、自我纠正和多步问题解决能力,这些能力以前被认为需要大规模 RLHF 流程。这项技术已被迅速采用:在 R1 论文发布后的几个月内,GRPO 实现出现在 Hugging Face 的 TRL 库中,多家初创公司和学术实验室报告了成功的复现。

战略影响是显著的。GRPO 大幅降低了训练推理模型的计算门槛,将竞争优势从计算访问转移到数据集设计和奖励函数工程。这与我在 Nvidia 的 AI 护城河分析中探讨的一个主题直接相关——随着算法效率的提高,护城河从原始硬件转移到训练流程的质量和运营它的团队的隐性知识。

4.2 DAPO 和 RLVR——推理的可验证奖励

GRPO 打开了大门,随后是一系列快速的创新。DAPO(解耦对齐和策略优化)通过将对齐目标与策略优化步骤分离来扩展 GRPO,允许实践者在积极优化推理能力的同时保持安全约束。早期结果表明 DAPO 在安全敏感推理任务上比标准 GRPO 实现更好的对齐-能力权衡。

RLVR(带可验证奖励的强化学习)代表了 GRPO 所体现的更广泛范式:使用强化学习训练语言模型,其中奖励信号来自客观可验证的结果而不是学习的奖励模型。关键洞察是,对于令人惊讶的大量有价值任务——数学、形式逻辑、代码生成、结构化数据提取、约束满足——输出的正确性可以被程序化验证。这完全消除了奖励模型,并提供了比人类偏好数据更便宜、更可靠训练信号。

研究前沿正在快速移动。OpenAI、Google DeepMind 和多个学术实验室的团队正在探索 RLVR 在纯推理之外的领域——包括工具使用(代理是否实现了目标?)、代码生成(程序是否通过所有测试?)和结构化输出(JSON 是否符合架构?)。核心问题是可验证奖励能扩展多远,才会触及需要真正主观评估的任务边界。

4.3 OpenAI/Anthropic/DeepMind 如何以不同方式运用RL

每个前沿实验室都发展了关于后训练中强化学习的独特哲学,反映了他们更广泛的组织文化和技术赌注。

OpenAI 追求最激进的 RL 缩放策略。他们的 o1 和 o3 推理模型代表了 RL 训练语言模型的最新水平,使用据报道结合 RLHF、过程奖励模型(在每个推理步骤而不仅仅是最终答案提供反馈)和大规模 RL 训练运行的专有流程。GPT-5 采用混合方法,在前所未有的规模上将 RLHF 与模型生成的偏好数据集成。OpenAI 的赌注是 RL 随着规模扩大将继续产生回报,他们相应地投资于基础设施和人类标注劳动力来支持这一点。

Anthropic 采取了典型的不同方法,强调 AI 反馈和宪法约束而不是暴力 RL 缩放。他们的 Claude 模型使用宪法 AI 训练,将 RLAIF 与精心设计的原则而不是原始人类偏好数据相结合。Anthropic 2025 年代的宪法约有 80 页,编码了指导 AI 评估过程的细致安全性和有用性标准。这种方法以一些原始性能换取更高的一致性和可控性——这种权衡反映了 Anthropic 使命驱动的对安全的强调。

Google DeepMind 保持了最具研究导向的方法,广泛发表关于新颖 RL 技术的论文,并与学术 RL 社区保持更紧密的联系。他们的 Gemini 模型使用 SFT 然后使用 PPO 的 RLHF——原始流程最传统的实现——但辅以关于奖励模型鲁棒性、多目标优化和基于过程反馈的前沿研究。DeepMind 的优势是研究能力的广度和与 Google 基础设施的紧密集成;他们的约束是使研究时间表与产品部署周期保持一致的复杂性。

理解这些差异不仅仅是学术性的——它直接指导面试准备。OpenAI 会测试你快速实现和调试 RL 训练循环的能力。Anthropic 会探究你对对齐权衡和宪法原则的理解。DeepMind 会期望你讨论 RL 算法的理论基础,并以品味和严谨性评估研究方向。特别是对于研究科学家候选人,提出新颖的后训练研究方向的能力——而不仅仅是实现现有技术——是将录用与拒绝区分开来的关键因素。

5、后训练工具包:库、基础设施和计算

5.1 Unsloth vs. TRL——初学者友好 vs. 研究级

两个库主导了后训练领域,在它们之间选择是任何实践者必须做出的第一个实际决策之一。

Unsloth 已成为需要快速高效运行微调的实践者的首选库。它提供 SFT、LoRA 和 QLoRA 的优化实现,具有自动内存管理、预配置的训练配方,以及通过自定义 CUDA 内核比基线 Hugging Face Transformers 训练快 2-5 倍的速度。Unsloth 的文档刻意对初学者友好,并开箱即用地支持最受欢迎的模型架构(Llama、Mistral、Phi、Gemma)。对于企业微调、快速原型和教育用途,Unsloth 是正确的起点。

TRL(Transformer 强化学习) 是 Hugging Face 的研究级库,提供完整后训练流程的实现:SFT、DPO、PPO、GRPO 和更多实验性技术。TRL 提供比 Unsloth 显著更多的灵活性和可配置性,代价是更陡峭的学习曲线和更多手动配置。如果你需要实现新颖的奖励函数、实验 GRPO 变体,或复现特定论文的训练流程,TRL 是必要的工具。

实际建议是两者都使用。从 Unsloth 开始进行初始 SFT 和数据集实验,迭代速度最重要。当你需要 DPO、GRPO 或自定义 RL 训练循环时转向 TRL。为了面试准备,你应该对两者都精通——Unsloth 展示实践工程素养,而 TRL 展示研究深度。

52 计算需求和成本考虑

后训练的计算格局已快速发展,实践者需要更新的心理模型来了解在每个价格点上可以实现什么。

对于 7-8B 参数模型的 QLoRA SFT,单个 A100 40GB 或 H100 GPU 就足够了,对于典型的 50,000-100,000 示例数据集,训练在 2-6 小时内完成。云成本:在 Lambda Labs 或 RunPod 上每次训练运行约 10-30 美元。对于 70B 模型的 LoRA SFT,你需要 1-2 个 A100 80GB 或 H100 GPU,训练需要 12-48 小时。云成本:每次运行约 100-500 美元。70B 模型的全参数微调需要 4-8 个 H100,可能需要数天。云成本:每次运行 1,000-5,000 美元。

DPO 增加约 30-50% 的 SFT 计算成本,因为它需要通过两个模型(策略和参考模型)的前向传递。GRPO 更昂贵——在训练时为每个提示生成多个响应将推理成本乘以群体大小(8-16 倍),尽管奖励模型的消除部分抵消了这一点。 对有职业头脑的实践者来说的要点:你可以使用 QLoRA 和开源模型,在不到 500 美元的云计算成本内构建一系列引人注目的后训练项目。进入门槛从未如此之低。

6、后训练职业:角色、薪资和如何进入

6.1 后训练专家需求的爆发式增长

对具有后训练专业知识的工程师和研究人员的需求加速速度超过几乎所有其他 AI 专业化方向。根据 2025 年 Dice 技术薪资报告,AI 工程师在美国平均年薪为 206,000 美元,同比增长 4.5%。但这些平均值掩盖了后训练专家的真实溢价:专门专注于 RLHF、对齐和模型微调的前沿实验室职位,个人贡献者的薪酬包为 200,000 到 312,000 美元,在 OpenAI、Anthropic 和 Google DeepMind 的高级和资深职位超过 400,000 美元。

职位名称因组织而异——"后训练工程师"、"对齐研究员"、"RLHF 科学家"、"微调工程师"、"模型行为专家"——但核心能力是一致的:对 SFT、偏好优化,以及越来越多的基于 RL 的训练技术的深入熟练。对主要招聘网站的搜索显示,2025 年 1 月至 2026 年 3 月间提到"后训练"或"RLHF"的职位列表增加了 3 倍,超过了同期通用 ML 工程师职位的增长。

6.2 你应该预期的面试问题

根据我指导候选人在所有主要前沿实验室面试的经验,以下是出现最频繁的后训练问题:

技术深度问题:

  • 解释 RLHF 流程端到端。它可能在哪里失败,你将如何调试每种失败模式?
  • 比较 DPO 和基于 PPO 的 RLHF。你何时会选择其中一个而不是另一个?
  • 什么是 GRPO,为什么 DeepSeek 的方法以更低成本达到了有竞争力的结果?
  • LoRA 在数学上是如何工作的?什么决定了秩的选择?
  • 描述 RLHF 中的 KL 散度约束。为什么它是必要的,没有它会发生什么?

系统设计问题:

  • 为需要有用、无害且具备多步推理能力的 70B 模型设计后训练流程。你会包含哪些阶段,按什么顺序?
  • 你将如何为 RLHF 偏好数据构建可扩展的人工标注流程?你会实施哪些质量控制机制?
  • 为代码生成模型设计奖励函数。你将如何处理代码正确但效率低下的边缘情况?

研究品味问题:

  • DPO 与 RLHF 相比有哪些局限性?该领域是否正在收敛到一种方法?
  • 你将如何将 GRPO 扩展到没有可验证奖励的任务?
  • 宪法 AI 在对齐中的作用是什么?与 RLHF 相比,它的优势和劣势是什么?

7、完整的后训练准备路线图

7.1 第 1-4 周:基础

前四周应该建立你的理论和实践基础。从彻底学习 SFT 流程开始:阅读原始 LoRA 论文(Hu 等人,2021)、QLoRA 论文(Dettmers 等人,2023)和 Maxime Labonne 的后训练入门。使用 Unsloth 在 7B 模型上使用 QLoRA 实现 SFT——选择像 OpenHermes 或 SlimOrca 这样的开放数据集,训练一个你可以交互并进行定性评估的模型。

同时,建立你对偏好对齐格局的理解。阅读原始 RLHF 论文(Christiano 等人,2017)、InstructGPT 论文(Ouyang 等人,2022)和 DPO 论文(Rafailov 等人,2023)。理解 RLHF 和 DPO 之间的数学关系——它们在不同表述下优化相同的目标,理解这种等价性经常在面试中被测试。

7.2 第 5-8 周:实施

从阅读转向构建。使用 TRL 在偏好数据集上实现 DPO 训练(UltraFeedback 是一个很好的起点)。将结果与你的纯 SFT 模型进行定性和定量比较。记录有用性、安全性和响应质量的差异——这种比较成为一个强大的作品集资产。

然后攻克前沿:在数学推理任务上实现 GRPO。使用 TRL 的 GRPO 训练器和简单的可验证奖励函数(数学正确性)。这比 SFT 或 DPO 更难——你将需要管理群体生成、优势计算和仔细的学习率调度。调试 GRPO 训练运行的经验对面试和真实世界后训练工作都是无价的准备。

7.3 第 9-12 周:高级技术和作品集构建

最后四周应该专注于深度和差异化。选择一个领域深入:宪法 AI 和 RLAIF(实现一个简单的宪法并评估其对模型行为的影响)、过程奖励模型(实现数学推理的分步评估)或多目标对齐(使用 DPO 和针对性 RLHF 的组合训练一个平衡有用性、安全性和诚实性的模型)。

构建一个展示广度和深度的作品集。强大的后训练作品集包括:一个展示数据集策展和训练卫生的 SFT 项目、一个展示偏好对齐的 DPO/RLHF 项目、一个展示推理增强的 GRPO/RLVR 项目,以及一篇带有定量评估的比较方法的文章。在 Hugging Face 上托管你的模型并撰写详细的技术博客文章记录你的过程——这些资产正是前沿实验室招聘经理正在寻找的实践能力。

8、结束语:AI 能力在后训练中被赢得

从基座模型到产品级 AI 系统的转变发生在后训练期间,涉及的技术——SFT、DPO、RLHF、GRPO、宪法 AI——代表了应用 AI 研究中最具活力和影响力的领域之一。

格局正在快速发展。GRPO 和可验证奖励方法正在扩展 RL 训练模型所能实现的前沿。DPO 民主化了偏好对齐。RLAIF 正在重塑人类反馈的经济学。而后训练职业轨道的出现——具有薪酬溢价和每家主要 AI 公司的专门职位——反映了日益增长的认识:后训练不是支持功能,而是模型能力的主要驱动力。

对于实践者来说,前进的道路很明确:在整个流程中建立基础熟练度,在至少一个前沿技术(GRPO、宪法 AI 或过程奖励模型)中发展深度,并创建展示理论理解和实际实施技能的作品集资产。进入门槛从未如此之低——QLoRA 和开源模型使任何拥有云 GPU 和学习动力的人都能进行生产级后训练实验。

本文分析的核心发现值得重复:使 AI 模型有用的大部分能力是在后训练期间创造的。掌握这些技术,你不仅仅是在学习一个专业化方向——你正在将自己定位于 AI 能力被赢得的确切位置。


原文链接: The Complete Guide to Post-Training LLMs: How SFT, RLHF, DPO, and GRPO Shape LLMs

汇智网翻译整理,转载请标明出处