🧊 前沿科技知识库
全部 / 人工智能(AI)

后训练与对齐方法

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·基础原理 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

后训练(Post-training)指预训练之后、使模型具备指令遵循、偏好对齐与推理能力的一系列方法。一份 2025 年的后训练综述把 SFT、RLHF、DPO、GRPO 等技术放入统一脉络,指出 DPO(2023)通过直接依据人类偏好优化模型输出、绕过中间奖励建模来简化 RLHF,而 GRPO 最初是在其团队此前的 DeepSeekMath 工作中提出的(A Survey on Post-training of Large Language Models)。经典 RLHF(Reinforcement Learning from Human Feedback)建立在对齐 LLM 与人类偏好的基础范式上,把模糊的伦理准则转化为可微的优化信号,通常包含监督微调(SFT)、奖励模型训练与强化学习优化三个阶段(A Technical Survey of Reinforcement Learning Techniques for Large Language Models)。该框架是 InstructGPT 等指令遵循模型成功的关键(Towards Efficient Online Exploration for RLHF)。

最新进展(2025–2026)

2025–2026 年的重心从"对齐偏好"转向"训练推理":

核心技术与关键概念

RLHF 三阶段

  1. SFT:在人类示范数据上监督微调,得到基线指令模型(A Technical Survey of RL Techniques for LLMs、Towards Efficient Online Exploration for RLHF)。
  2. 奖励模型(Reward Model):基于成对偏好数据(Bradley-Terry 假设)训练,预测人类偏好(Towards Efficient Online Exploration for RLHF)。RLHF 将 MDP 扩展为包含成对偏好三元组 (p, y_A, y_B) 的数据(Reinforcement Learning for Large Model: A Survey)。
  3. RL 优化:以 RL 优化器(如 PPO)对模型采样并用奖励模型打分进行优化(RLHF: A short introduction)。

直接偏好优化家族(DPO/IPO/KTO/SimPO/ORPO)

DPO 类方法绕过显式奖励模型与 RL,直接在偏好数据上优化策略。DPO 把 RLHF 对齐问题重述为一个分类任务:在静态的人类排序答案集合上直接微调策略,把整个流程化为一次离线损失最小化(RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods)。2023–2024 年出现多个变体:

方法作者/年份核心创新
DPORafailov 等用偏好对直接优化,无需独立奖励模型
IPO(Identity Preference Optimization)Azar 等,2023去掉 Bradley-Terry 假设,使用基于成对偏好概率的通用目标(ΨPO);用平方损失替代 log-sigmoid,缓解 DPO 在确定性偏好下的过拟合
KTO(Kahneman-Tversky Optimization)Ethayarajh 等,ICML 2024使用非成对的二元反馈(可取/不可取),基于前景理论
SimPO(Simple Preference Optimization)Meng 等,2024目标为 −log σ(β·log πθ(yw,x) − β·log πθ(yl,x) − γ)
ORPO(Odds Ratio Preference Optimization)Hong 等,2024无参考模型的单体式偏好优化,在 SFT 损失上叠加 odds ratio 惩罚项,对不受青睐的生成风格施加小的惩罚即可实现对齐

前四行来自 Direct Preference Optimization (DPO)、From RLHF to Direct Alignment: A Theoretical Unification 与 The Differences Between Direct Alignment Algorithms are a Blur。ORPO 一行来自其原始论文,该文强调 SFT 本身在偏好对齐中的作用,认为对不受青睐的生成风格施加一个小的惩罚项即可,因而无需额外的偏好对齐阶段(ORPO: Monolithic Preference Optimization without Reference Model)。

一项跨任务评测发现,标准对齐流程中 KTO 在除多任务理解外的所有任务上优于其他方法;各方法在推理任务上的表现则较为接近,说明无 RL 的算法对推理能力影响有限(Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks)。需注意该结论基于特定实验设置,尚不能推广为普适排序。

一份 2026 年的微调实践指南给出的选型建议是:有成对偏好数据、希望单次监督式训练且不引入奖励模型时用 DPO;需要显式奖励模型、在线采样与奖励塑形(通常用于安全关键的对齐)时,用带 PPO 的完整 RLHF;DPO 在 Hugging Face TRL 上更易实现、收敛更快,已成为多数微调栈中的默认偏好微调方法(Fine-Tuning LLMs in 2026: LoRA, QLoRA, DPO, GRPO Compared)。

RLAIF

RLAIF(Reinforcement Learning from AI Feedback)在 Constitutional AI 中被提出,用 AI 生成的反馈替代人类对有害性的标注,以一套"宪法"原则指导自我批判与修订,使模型在人类与 AI 偏好的混合信号上学习无害行为([Awesome LLM Post-training [2025 Update]](https://congchan.github.io/posts/awesome-large-language-model-llm-post-training-2025-update/))。

GRPO 与 RLVR

GRPO 对每个问题 q 采样一组输出 {o1, o2, …, oG},用组内得分估计基线,从而省去 critic 模型、降低 RL 训练成本(DeepSeek-R1)。在 DeepSeek 的实践中,推理数据使用基于规则的奖励,通用数据则使用奖励模型以捕捉人类偏好(DeepSeek-R1 讲解)。

拒绝采样

拒绝采样(Rejection Sampling)从模型中为每个 prompt 采样 K 个输出,选取奖励最高的候选用于微调(LLM 中的意图对齐)。实践上常用温度 0.7–1.0,每个 prompt 生成 10 至 30 个以上补全,补全过少会使训练有偏或噪声过大(Rejection Sampling (RLHF Book))。典型流程为:采样多个响应 → 用奖励模型打分 → 仅用高质量响应微调(Xwin-LM: Strong and Scalable Alignment Practice for LLMs)。

关键数据与评测结果

趋势与争议

参考来源

← 开放权重(开源)模型生态预训练与缩放定律 →