18.3 生成式 PRM 路线
上一节我们看到判别式 PRM 的核心瓶颈——标注成本爆炸。PRM800K 用了 12 人年的标注,对每个新领域都要重新标注。这让 PRM 的工业化推广几乎不可行。
2025 年 4 月,ThinkPRM 提出了一个根本不同的思路:让 LLM 用自然语言"评价"推理步骤,而不是训练一个分类器。这种思路叫生成式 PRM(Generative PRM)。
ThinkPRM 报告了一个让人震惊的结果:用比 PRM800K 少 100 倍的标签,生成式 PRM 在 MATH 上达到了更好的效果。这是怎么做到的?
11.3.1 生成式 PRM 的核心思想
判别式 vs 生成式
判别式 PRM(OpenAI PRM800K):
输入:prompt + 第 i 步推理
输出:good / bad / neutral(三分类)模型结构:encoder + 分类头(最后一层是 softmax 输出三个类别的概率)。
生成式 PRM(ThinkPRM):
输入:prompt + 第 i 步推理 + "请评价这一步"
输出:自然语言的评价 + 最终判断模型结构:标准 LLM(decoder-only),输出是文本。
为什么生成式更高效?
生成式 PRM 的核心优势来自两点:
优势一:复用 LLM 的预训练知识
判别式 PRM 是从零训练一个分类器——分类头是从随机初始化开始的,需要大量标注数据学习"什么是好的推理步骤"。
生成式 PRM 直接用 LLM——LLM 在预训练时已经见过海量数学、代码、逻辑推理的文本,它已经"知道"什么是好的推理。生成式 PRM 只需要少量 fine-tune(甚至 zero-shot prompting)就能工作。
优势二:自然语言推理的灵活性
判别式 PRM 只能输出 good / bad / neutral 三个标签——这是一个强约束。如果某一步推理"逻辑正确但表达不清"或"使用了一个不常见的技巧",判别式 PRM 难以表达。
生成式 PRM 可以输出:"这一步使用了因子分解,逻辑正确。但 x² - 1 = (x-1)(x+1) 这个分解的右边写成了 (x-1)(x-2),是笔误。所以这步有错。"——这种细粒度的评价对模型学习更有帮助。
11.3.2 ThinkPRM 的具体设计
ThinkPRM(2025.04)是生成式 PRM 的代表作。它的设计有几个关键点:
生成分步评价
ThinkPRM 不是简单问"这步对吗",而是让模型生成分步评价:
Prompt: 评估以下推理的第 3 步:
问题:求方程 x² - 5x + 6 = 0 的解
推理:
Step 1: 这是二次方程,可以用求根公式
Step 2: 求根公式:x = (-b ± √(b²-4ac)) / 2a
Step 3: 代入 a=1, b=-5, c=6,x = (5 ± √(25-24)) / 2 = (5 ± 1) / 2
Step 4: x = 3 或 x = 2
请评估 Step 3。
ThinkPRM 输出:
让我检查 Step 3:
- a = 1, b = -5, c = 6 ✓(与原方程一致)
- 求根公式:x = (-b ± √(b²-4ac)) / 2a ✓
- 代入:x = (5 ± √((-5)² - 4·1·6)) / (2·1)
= (5 ± √(25 - 24)) / 2
= (5 ± √1) / 2
= (5 ± 1) / 2 ✓
Step 3 是正确的。
判断:CORRECT分步生成 vs 整体生成
ThinkPRM 有两种推理模式:
模式一:分步生成(Step-by-Step)
对每个步骤单独调用 ThinkPRM。N 个步骤需要 N 次 LLM 调用。慢但精确。
模式二:整体生成(All-at-Once)
一次性把整条推理交给 ThinkPRM,让它输出每步的评价。1 次 LLM 调用。快但可能漏掉细节。
ThinkPRM 论文显示,分步生成效果更好,但整体生成速度快 5-10 倍。工业上常根据任务难度选择。
训练数据极小
ThinkPRM 的训练只需要 <8K 步骤级评价(相比 PRM800K 的 800K)。这怎么做到的?
关键洞察:LLM 已经知道怎么评价推理,只需要少量示例让它"激活"这个能力。
ThinkPRM 用了三种数据:
- 种子示例(~1K):高质量的步骤评价,告诉模型"评价应该长什么样"
- 自动生成(~5K):用 GPT-4 / Claude 自动生成更多评价,带噪声
- 拒绝采样(~2K):从自动生成中筛选高质量样本
总计 <8K 标注——比 PRM800K 少 100 倍。
11.3.3 生成式 PRM 的实验结果
ThinkPRM 在几个 benchmark 上的表现:
MATH 数据集(PRM800K 测试集)
| Verifier | 标注量 | Best-of-64 准确率 |
|---|---|---|
| ORM | 0(只用最终答案) | 53.9% |
| OpenAI PRM(判别式) | 800K | 78.2% |
| ThinkPRM(生成式) | <8K | 79.4% |
这是一个惊人的结果——用 1% 的标注量,ThinkPRM 打败了判别式 PRM。
Qwen32B-MATH(更大 base)
在更大的 base model 上,ThinkPRM 的优势更明显:
| Verifier | Best-of-64 |
|---|---|
| ORM | 65.3% |
| 判别式 PRM | 81.2% |
| ThinkPRM | 84.7% |
跨领域泛化
ThinkPRM 在数学任务上训练,用在代码生成任务上:
| Verifier | 代码生成准确率 |
|---|---|
| 判别式 PRM(数学训练) | 32.1%(明显下降) |
| ThinkPRM(数学训练) | 54.6%(保持高水平) |
这证实了 ThinkPRM 的跨领域泛化能力——自然语言评价比分类标签更具通用性。
11.3.4 Verifier Compute Scaling
ThinkPRM 还报告了一个重要发现:Verifier 自己也有 test-time compute scaling。
具体做法:对同一个推理步骤,多次调用 ThinkPRM(每次随机采样),用 majority vote 聚合结果。
| Verifier 调用次数 | 准确率 |
|---|---|
| 1 次 | 79.4% |
| 4 次 | 81.2% |
| 16 次 | 82.5% |
| 64 次 | 83.1% |
这说明生成式 PRM 也是 test-time compute scalable——多算几次能进一步提升精度。
这个发现的工程价值在于:
- 训练阶段可以省算力(用更少标签)
- 推理阶段可以加算力(多采样几次)
- 总算力分配更灵活
11.3.5 生成式 vs 判别式 与 系统对比
| 维度 | 判别式 PRM | 生成式 PRM |
|---|---|---|
| 模型 | 分类器(encoder + head) | LLM(decoder-only) |
| 输出 | 离散标签(good/bad/neutral) | 自然语言评价 + 判断 |
| 标注需求 | 高(PRM800K 规模) | 低(<8K 种子) |
| 跨领域泛化 | 弱 | 强 |
| 解释性 | 弱(只有标签) | 强(自然语言理由) |
| 推理速度 | 快(单次前向) | 慢(生成文本) |
| Test-time scaling | 不适用 | 可用(多次采样) |
| 训练成本 | 高(要从零学分类) | 低(fine-tune) |
| 推理成本 | 低(小模型) | 高(大模型) |
何时用判别式?何时用生成式?
适合判别式 PRM 的场景:
- 大规模 RL 训练(需要快速 PRM 调用)
- 单一领域(数学、代码),不需要泛化
- 算力充足,可以承担标注成本
适合生成式 PRM 的场景:
- 多领域应用(需要泛化)
- 算力有限,无法承担大量标注
- 需要可解释性(科研、教育)
- Test-time compute scaling 可用(推理算力充足)
11.3.6 生成式 PRM 的工业实践
到 2026 年中,生成式 PRM 在工业上已经成为主流:
- OpenAI o1/o3(推测):内部 verifier 可能是生成式
- DeepSeek V3.2 Speciale:自验证 RLVR 思路与生成式 PRM 一致
- Anthropic Claude:内部 verifier(推测)
- 阿里 Qwen3-Thinking:用 LLM-as-Judge 思路
- Moonshot Kimi K2:自验证 + best-of-N
工业上的趋势:
- PRM 和 ORM 混合:用 PRM 评估过程,用 ORM 评估结果,加权求和
- 生成式 + 判别式混合:生成式 PRM 提供高质量评价,蒸馏到判别式 PRM 用于大规模训练
- Self-PRM:让模型自己评估自己的推理(与 Self-Rewarding Language Models 思路一致)
11.3.7 一个反思 与 PRM 还是 RLVR?
PRM 的核心价值是提供密集的过程信号。但 DeepSeek-R1 报告了一个反直觉的现象:纯 outcome reward(RLVR)也能让模型学会自我验证。
R1-Zero 的训练只用 0/1 outcome reward,但训练后期模型涌现出 self-verification 行为——它会在推理过程中检查自己的步骤,发现错误就回退。这种自我验证行为不是 PRM 训练的,而是 outcome reward 下自然涌现的。
这个发现引出一个深刻的问题:PRM 是必要的吗?还是 outcome reward 在足够大规模下也能 implicitly 学到过程信号?
目前的共识是:
- 小规模训练(<100B 参数 × 训练 token):PRM 显著优于 ORM
- 大规模训练(R1-Zero 规模):ORM 也能涌现出过程感知,但 PRM 仍然能加速收敛
- 跨领域应用:ORM 的涌现行为不保证,PRM 更可靠
所以 PRM 不是"必须",但对于资源有限或需要快速收敛的应用,PRM 仍然不可替代。
小结
生成式 PRM 通过让 LLM 用自然语言评价推理步骤,用 1% 的标签量达到了判别式 PRM 的水平,并在跨领域泛化和可解释性上有显著优势。
ThinkPRM 是这一路线的代表作,开启了 PRM 研究的新方向——用 LLM 的内在推理能力替代人工标注。这与 LLM 时代"生成优于判别"的整体趋势一致。
但生成式 PRM 仍然有一个根本局限:它依赖 LLM 自己的判断——如果 LLM 自己对某类推理不擅长,PRM 也会出错。下一节的形式化 PRM 通过引入外部验证器(Lean4),从根本上解决了这个问题。