跳转到正文

18.3 生成式 PRM 路线

上一节我们看到判别式 PRM 的核心瓶颈——标注成本爆炸。PRM800K 用了 12 人年的标注,对每个新领域都要重新标注。这让 PRM 的工业化推广几乎不可行。

2025 年 4 月,ThinkPRM 提出了一个根本不同的思路:让 LLM 用自然语言"评价"推理步骤,而不是训练一个分类器。这种思路叫生成式 PRM(Generative PRM)。

ThinkPRM 报告了一个让人震惊的结果:用比 PRM800K 少 100 倍的标签,生成式 PRM 在 MATH 上达到了更好的效果。这是怎么做到的?

11.3.1 生成式 PRM 的核心思想

判别式 vs 生成式

判别式 PRM(OpenAI PRM800K):

text
输入:prompt + 第 i 步推理
输出:good / bad / neutral(三分类)

模型结构:encoder + 分类头(最后一层是 softmax 输出三个类别的概率)。

生成式 PRM(ThinkPRM):

text
输入:prompt + 第 i 步推理 + "请评价这一步"
输出:自然语言的评价 + 最终判断

模型结构:标准 LLM(decoder-only),输出是文本。

为什么生成式更高效?

生成式 PRM 的核心优势来自两点:

优势一:复用 LLM 的预训练知识

判别式 PRM 是从零训练一个分类器——分类头是从随机初始化开始的,需要大量标注数据学习"什么是好的推理步骤"。

生成式 PRM 直接用 LLM——LLM 在预训练时已经见过海量数学、代码、逻辑推理的文本,它已经"知道"什么是好的推理。生成式 PRM 只需要少量 fine-tune(甚至 zero-shot prompting)就能工作。

优势二:自然语言推理的灵活性

判别式 PRM 只能输出 good / bad / neutral 三个标签——这是一个强约束。如果某一步推理"逻辑正确但表达不清"或"使用了一个不常见的技巧",判别式 PRM 难以表达。

生成式 PRM 可以输出:"这一步使用了因子分解,逻辑正确。但 x² - 1 = (x-1)(x+1) 这个分解的右边写成了 (x-1)(x-2),是笔误。所以这步有错。"——这种细粒度的评价对模型学习更有帮助。

11.3.2 ThinkPRM 的具体设计

ThinkPRM(2025.04)是生成式 PRM 的代表作。它的设计有几个关键点:

生成分步评价

ThinkPRM 不是简单问"这步对吗",而是让模型生成分步评价:

text
Prompt: 评估以下推理的第 3 步:
问题:求方程 x² - 5x + 6 = 0 的解
推理:
  Step 1: 这是二次方程,可以用求根公式
  Step 2: 求根公式:x = (-b ± √(b²-4ac)) / 2a
  Step 3: 代入 a=1, b=-5, c=6,x = (5 ± √(25-24)) / 2 = (5 ± 1) / 2
  Step 4: x = 3 或 x = 2
请评估 Step 3。

ThinkPRM 输出:
让我检查 Step 3:
- a = 1, b = -5, c = 6 ✓(与原方程一致)
- 求根公式:x = (-b ± √(b²-4ac)) / 2a ✓
- 代入:x = (5 ± √((-5)² - 4·1·6)) / (2·1)
       = (5 ± √(25 - 24)) / 2
       = (5 ± √1) / 2
       = (5 ± 1) / 2 ✓
Step 3 是正确的。
判断:CORRECT

分步生成 vs 整体生成

ThinkPRM 有两种推理模式:

模式一:分步生成(Step-by-Step)

对每个步骤单独调用 ThinkPRM。N 个步骤需要 N 次 LLM 调用。慢但精确。

模式二:整体生成(All-at-Once)

一次性把整条推理交给 ThinkPRM,让它输出每步的评价。1 次 LLM 调用。快但可能漏掉细节。

ThinkPRM 论文显示,分步生成效果更好,但整体生成速度快 5-10 倍。工业上常根据任务难度选择。

训练数据极小

ThinkPRM 的训练只需要 <8K 步骤级评价(相比 PRM800K 的 800K)。这怎么做到的?

关键洞察:LLM 已经知道怎么评价推理,只需要少量示例让它"激活"这个能力

ThinkPRM 用了三种数据:

  1. 种子示例(~1K):高质量的步骤评价,告诉模型"评价应该长什么样"
  2. 自动生成(~5K):用 GPT-4 / Claude 自动生成更多评价,带噪声
  3. 拒绝采样(~2K):从自动生成中筛选高质量样本

总计 <8K 标注——比 PRM800K 少 100 倍。

11.3.3 生成式 PRM 的实验结果

ThinkPRM 在几个 benchmark 上的表现:

MATH 数据集(PRM800K 测试集)

Verifier标注量Best-of-64 准确率
ORM0(只用最终答案)53.9%
OpenAI PRM(判别式)800K78.2%
ThinkPRM(生成式)<8K79.4%

这是一个惊人的结果——用 1% 的标注量,ThinkPRM 打败了判别式 PRM

Qwen32B-MATH(更大 base)

在更大的 base model 上,ThinkPRM 的优势更明显:

VerifierBest-of-64
ORM65.3%
判别式 PRM81.2%
ThinkPRM84.7%

跨领域泛化

ThinkPRM 在数学任务上训练,用在代码生成任务上:

Verifier代码生成准确率
判别式 PRM(数学训练)32.1%(明显下降)
ThinkPRM(数学训练)54.6%(保持高水平)

这证实了 ThinkPRM 的跨领域泛化能力——自然语言评价比分类标签更具通用性。

11.3.4 Verifier Compute Scaling

ThinkPRM 还报告了一个重要发现:Verifier 自己也有 test-time compute scaling

具体做法:对同一个推理步骤,多次调用 ThinkPRM(每次随机采样),用 majority vote 聚合结果。

Verifier 调用次数准确率
1 次79.4%
4 次81.2%
16 次82.5%
64 次83.1%

这说明生成式 PRM 也是 test-time compute scalable——多算几次能进一步提升精度。

这个发现的工程价值在于:

  • 训练阶段可以省算力(用更少标签)
  • 推理阶段可以加算力(多采样几次)
  • 总算力分配更灵活

11.3.5 生成式 vs 判别式 与 系统对比

维度判别式 PRM生成式 PRM
模型分类器(encoder + head)LLM(decoder-only)
输出离散标签(good/bad/neutral)自然语言评价 + 判断
标注需求高(PRM800K 规模)低(<8K 种子)
跨领域泛化
解释性弱(只有标签)强(自然语言理由)
推理速度快(单次前向)慢(生成文本)
Test-time scaling不适用可用(多次采样)
训练成本高(要从零学分类)低(fine-tune)
推理成本低(小模型)高(大模型)

何时用判别式?何时用生成式?

适合判别式 PRM 的场景

  • 大规模 RL 训练(需要快速 PRM 调用)
  • 单一领域(数学、代码),不需要泛化
  • 算力充足,可以承担标注成本

适合生成式 PRM 的场景

  • 多领域应用(需要泛化)
  • 算力有限,无法承担大量标注
  • 需要可解释性(科研、教育)
  • Test-time compute scaling 可用(推理算力充足)

11.3.6 生成式 PRM 的工业实践

到 2026 年中,生成式 PRM 在工业上已经成为主流:

  • OpenAI o1/o3(推测):内部 verifier 可能是生成式
  • DeepSeek V3.2 Speciale:自验证 RLVR 思路与生成式 PRM 一致
  • Anthropic Claude:内部 verifier(推测)
  • 阿里 Qwen3-Thinking:用 LLM-as-Judge 思路
  • Moonshot Kimi K2:自验证 + best-of-N

工业上的趋势:

  1. PRM 和 ORM 混合:用 PRM 评估过程,用 ORM 评估结果,加权求和
  2. 生成式 + 判别式混合:生成式 PRM 提供高质量评价,蒸馏到判别式 PRM 用于大规模训练
  3. Self-PRM:让模型自己评估自己的推理(与 Self-Rewarding Language Models 思路一致)

11.3.7 一个反思 与 PRM 还是 RLVR?

PRM 的核心价值是提供密集的过程信号。但 DeepSeek-R1 报告了一个反直觉的现象:纯 outcome reward(RLVR)也能让模型学会自我验证

R1-Zero 的训练只用 0/1 outcome reward,但训练后期模型涌现出 self-verification 行为——它会在推理过程中检查自己的步骤,发现错误就回退。这种自我验证行为不是 PRM 训练的,而是 outcome reward 下自然涌现的。

这个发现引出一个深刻的问题:PRM 是必要的吗?还是 outcome reward 在足够大规模下也能 implicitly 学到过程信号?

目前的共识是:

  • 小规模训练(<100B 参数 × 训练 token):PRM 显著优于 ORM
  • 大规模训练(R1-Zero 规模):ORM 也能涌现出过程感知,但 PRM 仍然能加速收敛
  • 跨领域应用:ORM 的涌现行为不保证,PRM 更可靠

所以 PRM 不是"必须",但对于资源有限或需要快速收敛的应用,PRM 仍然不可替代

小结

生成式 PRM 通过让 LLM 用自然语言评价推理步骤,用 1% 的标签量达到了判别式 PRM 的水平,并在跨领域泛化和可解释性上有显著优势。

ThinkPRM 是这一路线的代表作,开启了 PRM 研究的新方向——用 LLM 的内在推理能力替代人工标注。这与 LLM 时代"生成优于判别"的整体趋势一致。

但生成式 PRM 仍然有一个根本局限:它依赖 LLM 自己的判断——如果 LLM 自己对某类推理不擅长,PRM 也会出错。下一节的形式化 PRM 通过引入外部验证器(Lean4),从根本上解决了这个问题。

现代强化学习实战课程