过去两年,对齐技术像被按下快进键:RLHF 让模型首次听懂“好坏”,DPO 把训练成本打五折,RLAIF 把标注员换成 GPT-4,Constitutional AI 甚至给模型立了一部“宪法”。
本篇,带你沿着这条演进脉络,看看大模型如何从“能说”走向“可信”。闲话少叙,开冲!!
人类调大模型通常包含三步:

这就是: RLHF(Reinforcement Learning from Human Feedback)

RLHF 把“好不好”量化成可微分奖励,首次使大模型能按人类偏好系统化迭代。然而实践发现:
23 年提出的 Direct Preference Optimization(DPO) 把 RLHF 的三步简化为“一步微调”:

在 Hugging Face TRL 库中,一行代码即可把标准 RLHF Trainer 换成 DPOTrainer,大幅降低显卡时长和超参调参痛点。对资源有限的团队,DPO 已成为“首选入门姿势”。
简而概括就是:比较谁更好?
然后,又演变成:
RLAIF(Reinforcement Learning from AI Feedback) 用强大基座模型(如 GPT-4)代替人工打分员:
研究表明,RLAIF 在开放域对话上与 RLHF 质量接近,同时成本和数据吞吐显著更优。
实践提示:AI 评审更快,却可能偏向“表面”指标(语法、礼貌)而忽视事实正确性;在关键信息场景应混入少量“黄金人工偏好”作校准。
现在,Anthropic 提出 Constitutional AI(CAI) :
25 年 2 月,Anthropic 进一步发布 Constitutional Classifiers,通过专门判别器抵御大规模越狱攻击,拒答率仅增加 0.38 个百分点,安全性却显著提升。

CAI 的核心价值在于 最小化人工介入 仍保持高安全标准,特别适合对安全敏感、数据保密要求高的企业场景。
一线模型团队常采用以下组合拳:
这种层层递进模式能在 算力 × 标注成本 与 安全 × 质量 之间取得平衡。
from trl import AutoModelForCausalLM, DPOTrainer
import openai, torch
# 1. 加载 SFT 后模型
model = AutoModelForCausalLM.from_pretrained("mistralai/Mistral-7B-Instruct", torch_dtype=torch.bfloat16)
# 2. 准备偏好对(win, lose)
def generate_preference_pairs(prompt):
# 基于宪法原则自我批改,返回优/劣回答
# 为简洁起见,此处伪代码
pass
pairs = [generate_preference_pairs(p) for p in prompts]
# 3. 训练
trainer = DPOTrainer(
model,
beta=0.1,
train_pairs=pairs,
generate_during_eval=True,
)
trainer.train()
model.save_pretrained("./dpo_cai_model")如果想完全省掉人类偏好,可用 GPT-4 调用 openai.chat.completions.create 作为裁判,在 generate_preference_pairs 中直接返回胜负标签。
症状 | 成因 | 解法 |
|---|---|---|
模型回答变短、频繁拒答 | 奖励模型过度惩罚“风险” | 适当调低安全条款权重,或混入多样性奖励 |
出现幻觉或自信满满的错误 | 偏好数据侧重语气而忽略事实核验 | 在评审 prompt 中加入 “fact-check” 维度或混入检索增强 |
收敛缓慢 / 奖励飘忽 | PPO 超参不稳或奖励信号噪声大 | 尝试 DPO / ODPO;或用 RMSNorm + KL 控制奖励分布 |
对于想在 成本、安全、体验 三维度取得均衡的开发者, “SFT → 自对齐 → DPO/RLAIF → 小规模 RLHF” 是当下最务实、最可落地的组合。
希望本文能让你在飞速迭代的对齐技术浪潮里,既看清路线图,也踩稳每一步。