ARIS 推理模型速查指南:从 o1 / R1 到 Test-Time Compute、GRPO 与 PRM 的完整技术图谱
ARIS 推理模型速查指南:从 o1 / R1 到 Test-Time Compute、GRPO 与 PRM 的完整技术图谱
本指南源自 ARIS 仓库中经跨模型审查的面试速查文档 docs/tutorials/reasoning_models_tutorial_en.md,以 2024–2026 年 LLM 领域"从训练期扩展转向推理期扩展(test-time scaling)"这一范式转移为主线,系统梳理了 OpenAI o1/o3、DeepSeek-R1/R1-Zero、s1、rStar-Math 等代表工作的技术脉络,并给出 GRPO、PRM、Best-of-N、MCTS 等核心算法的推导、可运行代码与工程陷阱。读完本文,你将掌握推理模型的完整技术地图、25 个高频面试问题(L1/L2/L3 分级)的可靠回答口径,以及如何用仓库中的 interview-cheatsheet 技能和 render-html 渲染流水线自己复现这类教程的生产流程。
§1 为什么这是 2024–2026 年最大的范式转移
1.1 从训练期扩展走向推理期扩展
2020–2023 年的扩展定律(Kaplan、Hoffmann/Chinchilla)指出 性能 ∝ log(params × data × FLOPs),但这里统计的只是训练期计算。模型一旦训练完毕,推理计算量就被固定为一次前向传播。2024 年出现的两个异常现象打破了这一假设:
- OpenAI o1:投入更多推理 token 让模型"多想",性能持续提升,呈现出对数线性扩展(OpenAI 公开图表显示"准确率 vs 推理计算量"近似一条直线)。
- Snell et al. 2024(arXiv 2408.03314):在固定的推理/测试期计算预算下,采用计算最优的扩展策略(best-of-N + PRM beam search + 顺序修订的混合方案),可以让小模型在 FLOPs 对齐的设置中匹配甚至超过 14× 更大的模型——前提是基座模型在该任务上已有非平凡的成功率。
💡 范式心智模型——把推理视为对推理路径的搜索:
- System 1(快):一次贪心解码 = 一条路径
- System 2(慢):多条路径 + 验证器 + 回溯 = 树搜索(Tree-of-Thought)或长 CoT(o1)
可以把 LLM 视为 policy + value 的组合(类似 AlphaZero),推理就是一次类似 MCTS 的搜索过程。
1.2 推理模型的核心组件
problem prompt
│
↓
┌───────────────────────────┐
│ Policy LLM (sampler) │ ← generate candidate reasoning traces
│ - greedy / temperature │
│ - long CoT (o1, R1) │
│ - tree expansion (ToT) │
└───────────────────────────┘
│ N traces
↓
┌───────────────────────────┐
│ Verifier / Reward Model │
│ - ORM (outcome only) │
│ - PRM (per-step) │
│ - rule-based (math/code) │
└───────────────────────────┘
│
↓
┌───────────────────────────┐
│ Aggregator │
│ - majority vote (SC) │
│ - best-of-N (verifier) │
│ - beam search (PRM) │
│ - MCTS (rStar) │
└───────────────────────────┘
│
↓
final answer
不同推理模型路线本质上就是在三个组件之间做选择:
- o1 / R1:把搜索内化进 policy(单次长 CoT 生成,policy 自我反思)
- ToT / rStar:外部显式搜索(MCTS / BFS / beam)
- Best-of-N + PRM:采样 + 验证器(最朴素的测试期扩展)
§2 CoT 的演进:从 Wei 2022 到 o1
2.1 Chain-of-Thought(Wei et al., NeurIPS 2022, arXiv 2201.11903)
核心发现:用 few-shot 提示示范"逐步推理",可以在大模型(>62B PaLM)上触发涌现式推理能力;GSM8K 从 18% 跃升至 57%。
Q: Roger has 5 tennis balls. He buys 2 more cans of tennis balls. Each can has 3 tennis balls. How many tennis balls does he have now?
A: Roger started with 5 balls. 2 cans of 3 balls each is 6 balls. 5 + 6 = 11.
The answer is 11.
关键点:
- 不是微调——纯粹是提示工程,能力本来就存在于基座模型中
- 涌现性:在小模型上 CoT 反而退化(噪声超过信号)
- Kojima et al. 2022 "Let's think step by step" 后来证明 zero-shot CoT 也有效
2.2 Self-Consistency(Wang et al. 2022, arXiv 2203.11171)
观察:CoT 解码是随机的(temperature > 0);对同一问题采样多次会得到不同的推理路径,但**正确答