29.4 进化式 LLM 搜索与科学发现
前面几节 我们讨论了 RL 的传统前沿——embodied intelligence、self-play、multi-agent。这一节我们看一个全新的方向:LLM 驱动的科学发现。
这个方向的特点是:
- LLM 不只是 actor——它是 idea generator、code writer、experiment designer
- RL 不只是 policy optimization——它是搜索、是进化、是自我改进
- 目标不是"打游戏"或"对话"——是发现新算法、新数学、新科学
2024-2026 年的几个代表工作:
- AlphaEvolve(DeepMind, 2024.05):LLM + 进化算法发现新数学
- Genie 3(DeepMind, 2025.08):生成式 world model
- Titans(Google, 2024.12):长期记忆架构
- MIRAS(2025.07):多智能体推理与搜索
这些工作代表了 RL 与 LLM 结合的"下一代范式"——从"训练一个 policy"到"训练一个研究系统"。
29.4.1 AlphaEvolve 与 LLM + 进化的数学发现
AlphaEvolve(DeepMind, 2024.05 公开,2025 完整版)是 LLM 驱动科学发现的旗舰案例。
AlphaEvolve 的核心思想
把数学发现建模为进化搜索 + LLM 代码生成:
┌─────────────────────────────────────────────────────────────┐
│ 1. 种群初始化:已有的算法/证明 │
│ (例如:矩阵乘法的 Strassen 算法) │
├─────────────────────────────────────────────────────────────┤
│ 2. LLM 变异:让 Gemini 生成分支 │
│ "请改进这个算法" / "尝试不同的方法" │
│ 输出:新代码 │
├─────────────────────────────────────────────────────────────┤
│ 3. 自动评估:运行代码,测量效果 │
│ (例如:矩阵乘法的乘法次数) │
├─────────────────────────────────────────────────────────────┤
│ 4. 选择:保留效果好的,淘汰效果差的 │
├─────────────────────────────────────────────────────────────┤
│ 5. 迭代:返回步骤 2 │
└─────────────────────────────────────────────────────────────┘这个流程与 经典遗传算法(GA) 几乎完全一样——区别只是变异操作从"随机改动"变成"LLM 智能生成"。
AlphaEvolve 的关键创新
创新一:LLM 作为智能变异算子
传统 GA 的变异是随机改动——成功率低。LLM 变异是"理解当前代码 + 提出有意义的改进"——成功率高。
创新二:代码作为基因
不是用 bit string 作为基因,而是用可执行的代码。这让 fitness 可以自动测量——运行代码就知道效果。
创新三:Gemini 作为 LLM 后端
AlphaEvolve 用 Gemini Pro/Ultra 作为 LLM 后端——强 LLM 让变异质量大幅提升。
AlphaEvolve 的发现
AlphaEvolve 在多个领域做出了真正的新发现:
发现 1:矩阵乘法新算法
1969 年 Strassen 发现 矩阵乘法可以用 49 次乘法(之前认为是 64 次)。AlphaEvolve 发现了一个新算法,用 48 次——超越了人类 50 多年的研究。
发现 2:组合数学新界
在 tensor decomposition、sorting networks 等组合问题上,AlphaEvolve 发现了多个新界限,超越了已知最优。
发现 3:谷歌基础设施优化
DeepMind 内部用 AlphaEvolve 优化了:
- 数据中心调度算法(节省 0.7% 全球计算资源)
- TPU 矩阵乘法硬件设计
- 机器学习 kernel 优化
AlphaEvolve 的意义
AlphaEvolve 证明了:
- LLM 可以做真正的科学研究——不只是"回答问题",是"发现新知识"
- 进化 + LLM 是强大的组合——LLM 提供智能,进化提供探索
- 自动评估是关键——只有可自动评估的领域才适合这种范式
29.4.2 Genie 3 与 生成式 World Model
Genie 3(DeepMind, 2025.08)是生成式 world model 的代表作。
什么是 World Model?
World model 是一个能预测环境动态的模型:
输入:当前状态 s_t + 动作 a_t
输出:下一状态 s_{t+1}在 RL 中,world model 可以替代真实环境——policy 在 world model 上训练,避免昂贵的真实环境交互。
Genie 系列的演化
Genie 1(2024.02):从视频学习世界模型
- 输入:互联网视频
- 输出:可以生成可控的"游戏"环境
- 关键:没有显式动作标签,模型自己学到"什么是动作"
Genie 2(2024.12):3D world model
- 输入:一张图片
- 输出:可以生成可交互的 3D 环境
- 关键:环境可以维持几分钟的一致性
Genie 3(2025.08):大规模、可控、长 horizon
- 输入:自然语言描述
- 输出:完全可控的、长 horizon 的 3D 环境
- 关键:可用于训练 embodied agent
Genie 3 的训练
┌─────────────────────────────────────────────────────────┐
│ Phase 1: 视频预训练 │
│ - 大量无标签视频 │
│ - 学习"世界如何运作" │
├─────────────────────────────────────────────────────────┤
│ Phase 2: 动作标注 │
│ - 让 LLM 给视频中的动作打标签 │
│ - 学会"什么动作导致什么变化" │
├─────────────────────────────────────────────────────────┤
│ Phase 3: World Model 训练 │
│ - (s_t, a_t, s_{t+1}) 三元组 │
│ - 训练一个能预测 s_{t+1} 的模型 │
├─────────────────────────────────────────────────────────┤
│ Phase 4: RL 训练 │
│ - Policy 在 world model 上训练 │
│ - 避免昂贵的真实环境交互 │
└─────────────────────────────────────────────────────────┘Genie 3 的应用
应用 1:Embodied agent 训练
机器人在 world model 中学习走路、抓取、操作——避免在真实机器人上试错(昂贵且危险)。
应用 2:游戏生成
用 Genie 3 自动生成可玩游戏——玩家描述想要的游戏,Genie 3 生成完整环境。
应用 3:模拟训练
自动驾驶、工业控制、医疗手术等高风险场景——在 world model 中训练,部署到真实环境。
Genie 3 的局限
- 准确性:world model 不是 100% 准确——长期预测会漂移
- 泛化:训练分布外的环境难以模拟
- 计算成本:高质量 world model 推理成本高
29.4.3 Titans 与 长期记忆架构
Titans(Google, 2024.12 公开,2025 修改版)是 LLM 架构的新方向——长期记忆。
Titans 的动机
Transformer 有一个根本限制:context window。即使扩展到 1M token,也无法处理"无限长"的输入。Titans 试图解决这个问题。
Titans 的设计
Titans 引入神经长期记忆:
┌──────────────────────────────────────────────────────────┐
│ 短期记忆:attention(标准 Transformer) │
│ - 处理最近的 token │
│ - 容量有限(context window) │
├──────────────────────────────────────────────────────────┤
│ 长期记忆:神经记忆模块(新) │
│ - 持续学习 + 存储 │
│ - 容量无限 │
├──────────────────────────────────────────────────────────┤
│ 持久记忆:任务相关知识(系统 prompt、知识库) │
│ - 不变 │
└──────────────────────────────────────────────────────────┘三层记忆让 Titans 能处理无限长输入——长期记忆持续存储历史信息。
Titans 与 RL 的关系
Titans 的核心是学习如何记忆——这本身就是一个 RL 问题:
- 状态:当前输入 + 当前记忆
- 动作:怎么更新记忆(write / forget / update)
- 奖励:未来任务表现(如果记忆了有用的信息,任务表现好)
Titans 用惊喜度(surprise)作为内部 reward——当输入"令人惊讶"时,加强记忆;当输入"重复"时,减弱记忆。这是一种自监督 RL——模型自己生成 reward。
Titans 的实验结果
在长 horizon 任务上,Titans 显著优于 Transformer:
| 任务 | Transformer | Titans |
|---|---|---|
| Language modeling(10M context) | OOM | 67% perplexity 改进 |
| 长文档 QA | 55% | 78% |
| 时序预测 | 65% | 82% |
Titans 证明了长期记忆是 scaling 的下一个方向——不只是"更宽、更深",还要"更记得"。
29.4.4 MIRAS 与 多智能体推理与搜索
MIRAS(2025.07)是 multi-agent reasoning + search 的框架。
MIRAS 的设计
把复杂推理任务分解给多个 agent:
┌─────────────────────────────────────────────────────────┐
│ Coordinator Agent: 总指挥 │
│ - 接收任务 │
│ - 分解为子任务 │
│ - 协调子 agents │
├─────────────────────────────────────────────────────────┤
│ Worker Agents: 子任务执行 │
│ - 每个 worker 处理一个子任务 │
│ - 可以是不同类型(LLM、tool-using agent) │
├─────────────────────────────────────────────────────────┤
│ Critic Agent: 评估 │
│ - 检查 worker 的输出 │
│ - 反馈给 coordinator │
├─────────────────────────────────────────────────────────┤
│ Memory Agent: 记忆管理 │
│ - 维护任务历史 │
│ - 提供上下文 │
└─────────────────────────────────────────────────────────┘MIRAS 的搜索算法
MIRAS 集成了多种搜索方法:
- Beam Search:探索多个候选解
- MCTS:用 value function 引导搜索
- A* Search:启发式搜索
这让 MIRAS 能处理NP-hard 问题——比如复杂的规划、调度、组合优化。
MIRAS 与 AlphaEvolve 的关系
两者都用 LLM + 搜索,但角度不同:
- AlphaEvolve:进化搜索(无梯度,population-based)
- MIRAS:树搜索(gradient-free,single-agent + multi-agent)
它们是 LLM-driven discovery 的两个互补范式。
29.4.5 递归自我改进
递归自我改进(Recursive Self-Improvement, RSI) 是 LLM-driven discovery 的终极形态——模型自己改进自己。
RSI 的核心循环
┌─────────────────────────────────────────────────────┐
│ 1. 当前模型 M_t 评估自己的能力 │
│ - 在哪些任务上表现好?在哪些任务上差? │
├─────────────────────────────────────────────────────┤
│ 2. 生成改进方案 │
│ - 设计新的训练数据 │
│ - 调整训练超参 │
│ - 改进算法 │
├─────────────────────────────────────────────────────┤
│ 3. 执行改进 │
│ - 用方案训练新模型 M_{t+1} │
├─────────────────────────────────────────────────────┤
│ 4. 评估新模型 │
│ - M_{t+1} 比 M_t 好吗? │
│ - 如果好,保留 M_{t+1};如果差,回退 │
├─────────────────────────────────────────────────────┤
│ 5. 返回步骤 1 │
└─────────────────────────────────────────────────────┘RSI 的当前状态
到 2026 年中,RSI 仍然是研究概念,没有工业级实现。原因:
挑战 1:自我评估的不准确性
模型很难准确评估自己的能力——容易高估(Dunning-Kruger 效应)。
挑战 2:改进方案的搜索空间爆炸
可能的训练数据、超参、算法组合是天文数字。
挑战 3:安全风险
如果模型可以无限改进自己,可能突破人类控制——这是 AI safety 的核心担忧。
RSI 的部分实现
虽然没有完整 RSI,但有几个部分实现:
- AutoGPT(2023):早期尝试,效果有限
- Meta's Self-Improving LLMs(arXiv:2404.08898):用 LLM 生成自己的训练数据
- Voyager(arXiv:2305.16291):Minecraft agent 自主学习新技能
- DeepMind 的自我博弈系统:模型与自己对弈提升
这些是 RSI 的早期形态——证明了部分可行性,但离真正的"递归自我改进"还很远。
29.4.6 LLM-driven Discovery 的共同模式
这些工作(AlphaEvolve、Genie 3、Titans、MIRAS、RSI)的共同模式:
LLM 作为搜索的智能指导
传统搜索(MCTS、Beam Search)需要人为设计 heuristic。LLM 可以自动生成 heuristic——让搜索更智能。
自动评估是关键
AlphaEvolve 之所以能发现新算法,是因为算法的效果可以自动测量(运行代码就知道)。这是 LLM-driven discovery 的前提——只有可自动评估的领域才适合。
组合 > 单一
- AlphaEvolve = LLM + 进化
- Genie 3 = LLM + world model
- Titans = LLM + 长期记忆
- MIRAS = LLM + multi-agent + search
组合多种方法比单一方法更强——这是 RL 在 LLM 时代的新形态。
从"训 policy"到"训系统"
传统 RL 训一个 policy。LLM-driven discovery 训一个完整的研究系统——多个 agent + memory + search + tools。
29.4.7 未来方向
科学发现
把 AlphaEvolve 思路扩展到:
- 生物学:蛋白质设计、药物发现
- 化学:新分子合成路径
- 物理:新实验设计、新理论验证
教育
用 LLM-driven discovery 个性化教育——发现每个学生最适合的学习路径。
AGI
递归自我改进是 AGI 的潜在路径之一——如果模型能持续改进自己,可能在某个时间点超越人类能力。
但这伴随严重的安全风险——这也是 Alignment 研究 的核心议题。
小结
LLM-driven discovery 是 RL 在 2025-2026 年的新前沿:
- AlphaEvolve:LLM + 进化,发现新数学
- Genie 3:生成式 world model,用于 embodied agent
- Titans:长期记忆架构,扩展 context
- MIRAS:multi-agent + search 框架
- RSI:递归自我改进(部分实现)
这些工作共同指向一个新范式——从训练 policy 到训练研究系统。这是 RL 与 LLM 深度结合的下一代方向,也是 AGI 研究的最前沿。