ARIS 推理模型速查指南:从 o1 / R1 到 Test-Time Compute、GRPO 与 PRM 的完整技术图谱

原创2026-09-22 15:24:2130 阅读
文章标签:AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin

ARIS 推理模型速查指南:从 o1 / R1 到 Test-Time Compute、GRPO 与 PRM 的完整技术图谱

本指南源自 ARIS 仓库中经跨模型审查的面试速查文档 docs/tutorials/reasoning_models_tutorial_en.md,以 2024–2026 年 LLM 领域"从训练期扩展转向推理期扩展(test-time scaling)"这一范式转移为主线,系统梳理了 OpenAI o1/o3、DeepSeek-R1/R1-Zero、s1、rStar-Math 等代表工作的技术脉络,并给出 GRPO、PRM、Best-of-N、MCTS 等核心算法的推导、可运行代码与工程陷阱。读完本文,你将掌握推理模型的完整技术地图、25 个高频面试问题(L1/L2/L3 分级)的可靠回答口径,以及如何用仓库中的 interview-cheatsheet 技能和 render-html 渲染流水线自己复现这类教程的生产流程。

§1 为什么这是 2024–2026 年最大的范式转移

1.1 从训练期扩展走向推理期扩展

2020–2023 年的扩展定律(Kaplan、Hoffmann/Chinchilla)指出 性能 ∝ log(params × data × FLOPs),但这里统计的只是训练期计算。模型一旦训练完毕,推理计算量就被固定为一次前向传播。2024 年出现的两个异常现象打破了这一假设:

  • OpenAI o1:投入更多推理 token 让模型"多想",性能持续提升,呈现出对数线性扩展(OpenAI 公开图表显示"准确率 vs 推理计算量"近似一条直线)。
  • Snell et al. 2024(arXiv 2408.03314):在固定的推理/测试期计算预算下,采用计算最优的扩展策略(best-of-N + PRM beam search + 顺序修订的混合方案),可以让小模型在 FLOPs 对齐的设置中匹配甚至超过 14× 更大的模型——前提是基座模型在该任务上已有非平凡的成功率。

💡 范式心智模型——把推理视为对推理路径的搜索

  • System 1(快):一次贪心解码 = 一条路径
  • System 2(慢):多条路径 + 验证器 + 回溯 = 树搜索(Tree-of-Thought)或长 CoT(o1)

可以把 LLM 视为 policy + value 的组合(类似 AlphaZero),推理就是一次类似 MCTS 的搜索过程。

1.2 推理模型的核心组件

       problem prompt
           │
           ↓
   ┌───────────────────────────┐
   │   Policy LLM (sampler)    │ ← generate candidate reasoning traces
   │   - greedy / temperature  │
   │   - long CoT (o1, R1)     │
   │   - tree expansion (ToT)  │
   └───────────────────────────┘
           │  N traces
           ↓
   ┌───────────────────────────┐
   │  Verifier / Reward Model  │
   │  - ORM (outcome only)     │
   │  - PRM (per-step)         │
   │  - rule-based (math/code) │
   └───────────────────────────┘
           │
           ↓
   ┌───────────────────────────┐
   │  Aggregator               │
   │  - majority vote (SC)     │
   │  - best-of-N (verifier)   │
   │  - beam search (PRM)      │
   │  - MCTS (rStar)           │
   └───────────────────────────┘
           │
           ↓
       final answer

不同推理模型路线本质上就是在三个组件之间做选择:

  • o1 / R1:把搜索内化进 policy(单次长 CoT 生成,policy 自我反思)
  • ToT / rStar:外部显式搜索(MCTS / BFS / beam)
  • Best-of-N + PRM:采样 + 验证器(最朴素的测试期扩展)

§2 CoT 的演进:从 Wei 2022 到 o1

2.1 Chain-of-Thought(Wei et al., NeurIPS 2022, arXiv 2201.11903)

核心发现:用 few-shot 提示示范"逐步推理",可以在大模型(>62B PaLM)上触发涌现式推理能力;GSM8K 从 18% 跃升至 57%。

Q: Roger has 5 tennis balls. He buys 2 more cans of tennis balls. Each can has 3 tennis balls. How many tennis balls does he have now?
A: Roger started with 5 balls. 2 cans of 3 balls each is 6 balls. 5 + 6 = 11.
The answer is 11.

关键点:

  • 不是微调——纯粹是提示工程,能力本来就存在于基座模型中
  • 涌现性:在小模型上 CoT 反而退化(噪声超过信号)
  • Kojima et al. 2022 "Let's think step by step" 后来证明 zero-shot CoT 也有效

2.2 Self-Consistency(Wang et al. 2022, arXiv 2203.11171)

观察:CoT 解码是随机的(temperature > 0);对同一问题采样多次会得到不同的推理路径,但**正确答

登录后查看全文
Auto-claude-code-research-in-sleep