推理模型

为什么「想一想再回答」能让 AI 变聪明?

Chain-of-Thought 推理 o1/R1
阅读时间约 10 分钟
Chapter 01

快思考 vs 慢思考

诺贝尔经济学奖得主 Daniel Kahneman 在《思考,快与慢》中提出了著名的双系统理论:人类的思维分为系统 1(快速、直觉)和系统 2(缓慢、审慎)。这个类比完美地解释了普通 LLM 和推理模型的区别。

系统 1(标准 LLM):看到问题就立即输出答案。它依赖模式匹配——训练中见过无数次类似的问题,所以能迅速"脱口而出"。问 "2+2=?",它瞬间回答 "4"。

系统 2(推理模型):在回答之前先"想一想"。它会生成一连串的思考 Token,把复杂问题拆解成小步骤,逐步推导出答案。遇到"证明勾股定理",它会一步步写出推理过程。

// 互动演示:两种思考方式

点击卡片,观察两种模型面对同一问题的不同反应:

System 1 — 标准 LLM
快速直觉
模式匹配,一步到位
Q: 一个水池有两个进水管,A管6小时注满,B管8小时注满。同时打开,几小时注满?
System 2 — 推理模型
深度推理
逐步思考,层层推导
Q: 一个水池有两个进水管,A管6小时注满,B管8小时注满。同时打开,几小时注满?

普通 LLM 像抢答,推理模型像深思——抢答赢速度,深思赢准确率。

Chapter 02

Chain-of-Thought — 思维链的魔力

2022 年,Google 研究员发现了一个惊人的现象:只要在 Prompt 中加入 "Let's think step by step",大语言模型在数学和逻辑推理任务上的准确率就会大幅提升。这就是 Chain-of-Thought(CoT,思维链)

不使用思维链时,模型直接给出答案——往往容易出错:

Q: 17 x 24 = ?  A: __(可能给出错误答案)

使用思维链后,模型"展示解题过程",准确率显著提升:

Q: 17 x 24 = ? Let me think: 17x20=340, 17x4=68, 340+68=408 ✓

更进一步,o1、R1、QwQ 等推理模型在训练过程中就学会了自动生成思维链。它们会产出数百甚至数千个思考 Token,然后才给出最终答案——这就是 Extended Thinking(扩展思考)

// 互动演示:直接回答 vs 思维链回答

Q: 一家书店周一卖了 32 本书,周二卖的是周一的 1.5 倍,周三比周二少 8 本。三天一共卖了多少本?

思维链就像考试要求「写出解题过程」——过程对了,答案自然对。

Chapter 03

o1、R1、QwQ — 推理模型的竞赛

从 2024 年起,各大 AI 实验室纷纷推出自己的推理模型,开启了一场全新的竞赛:

OpenAI o1/o3:率先提出"test-time compute scaling"概念——模型在推理阶段投入更多计算,思考越久答案越好。o1 在数学竞赛和编程任务上表现惊艳。

DeepSeek R1:开源推理模型,从 671B 的混合专家模型(MoE)蒸馏出 1.5B 到 70B 的多种尺寸。证明了小模型也能拥有强大的推理能力。

Qwen QwQ:阿里巴巴的推理模型,展示了中文环境下的强大推理表现。

这些模型的核心发现是一致的:学会在更难的问题上分配更多计算资源

// 互动对比:推理模型能力矩阵

能力分数越高,条越长(基于公开 Benchmark 归一化,满分 100):

模型 厂商 数学 编程 推理
o3 OpenAI
96
92
94
o1 OpenAI
90
88
89
DeepSeek R1 DeepSeek
88
85
87
QwQ-32B Alibaba
83
79
82
R1-Distill-7B DeepSeek
62
55
60

推理模型就像考生学会了「难题多花时间」——不是更聪明,而是更会分配精力。

Chapter 04

Test-Time Compute — 推理时投入更多算力

传统的 AI 变强路径是 Training-time Compute(训练时算力):用更多数据、更大模型、更长时间来训练。OpenAI 的 Scaling Law 就是这条路线的理论基础。

但推理模型开辟了第二条路径:Test-time Compute(推理时算力)。同一个模型,在面对更难的问题时思考更久,生成更多思考 Token,从而提高准确率。

这带来了一个重要的 权衡:推理模型更慢,消耗更多 Token(思考 Token 也要计费)。但对于复杂任务,准确率的提升远超额外的成本。关键在于——收益递减:思考太久,提升会越来越小。

// 互动演示:思考预算 vs 准确率

拖动滑块调整"思考预算"(允许生成的思考 Token 数量),观察准确率变化:

思考 Token 数 准确率 %
2048

Test-time compute 就像「开卷考试给更多时间」——同样的知识,多想一会儿就能做对更难的题。

Chapter 05

总结

🧠

慢思考 > 快思考(复杂任务)

面对复杂问题,逐步推理比直觉回答更可靠。推理模型用"系统2思维"攻克难题。

📝

思维链提升准确率

让模型"写出解题过程",准确率在数学、逻辑、编程任务上显著提升。

推理时间可以换准确度

Test-time compute 是一种全新的 Scaling 维度:同一模型思考越久,表现越好。

📦

蒸馏让小模型也能推理

DeepSeek R1 证明,大模型的推理能力可以蒸馏到 7B 甚至 1.5B 的小模型中。

推理模型的本质启示:AI 变强不只靠更大的模型,也靠更深的思考。

下一篇:RLHF