推理 vs 训练

为什么训练需要几百张卡,推理只要一张?

训练 推理 反向传播
阅读时间约 8 分钟
Chapter 01

学习 vs 考试

理解训练和推理最简单的方式就是:训练 = 学习推理 = 考试。学习需要大量时间、精力和资源;而考试只需要运用已有的知识快速作答。

● TRAINING · 训练
📚
学习阶段
  • 📖 阅读数万亿个 Token 的语料
  • ✏️ 反复调整数十亿/数万亿参数
  • ⏱️ 持续数周到数月
  • 💰 花费数千万到数亿美元
  • 🖥️ 需要数千张 GPU
数周 ~ 数月
● INFERENCE · 推理
✍️
答题阶段
  • 🔍 读取用户的一个问题
  • ⚡ 用已有权重快速计算答案
  • ⏱️ 毫秒级响应
  • 💰 每次 $0.001 ~ $0.03
  • 📱 一台手机/笔记本就行
~500ms

训练就像花三年学英语,推理就像用英语点一杯咖啡——学习很慢,但用起来很快。

Chapter 02

训练:反向传播与梯度更新

训练的核心是一个反复循环的过程:前向传播(计算预测)→ 计算损失(与正确答案对比)→ 反向传播(计算每个参数的梯度)→ 更新权重(微调参数)。

关键的内存消耗来自:训练需要存储所有中间激活值(每一层的输出),因为反向传播需要用它们来计算梯度。这就是训练吃内存的根本原因。

// 互动演示:训练四步循环

输入层 隐藏层1 隐藏层2 输出层 Loss stored stored
内存占用

反向传播就像老师批改试卷——从最终答案(损失)往回找每一步的错误,然后纠正。

Chapter 03

推理:只需前向传播

推理只做一件事——前向传播。数据从输入层流到输出层,权重是冻结的(只读),不需要计算梯度,不需要存储中间激活值。这意味着内存需求只有训练的一小部分。

// 互动演示:推理 — 只有前向传播

输入层 隐藏层1 隐藏层2 输出层 🔒 🔒 权重冻结 · 只读 · 无梯度
内存占用

推理就像背好公式后做题——不需要推导公式(训练),直接代入计算就行。

Chapter 04

算力差异:天壤之别

训练和推理的算力需求差距可达 1 亿倍以上。这就是为什么训练只有大公司和研究机构能承担,而推理可以跑在你的手机上。

// 算力对比

GPT-4 训练~25,000 × A100 × 90 天
~$100,000,000
GPT-4 单次推理1 × GPU × 500ms
~$0.03
Llama 3 70B 训练~6,000 × H100 × 数周
~$10,000,000+
端侧推理 (9B on MacBook)1 × Apple Silicon × 实时
$0 (你的设备)

训练与推理的算力差距

训练像建造一座工厂(巨大投入),推理像工厂生产一件产品(边际成本极低)。

Chapter 05

总结

📚

训练是学习,推理是应用

训练从数据中学习模式和知识,推理用学到的知识来回答问题。

🔄

训练需要梯度,推理不需要

训练需要反向传播计算梯度并更新权重,推理只做前向传播。

训练吃算力,推理吃带宽

训练是计算密集的(大量矩阵运算),推理是内存带宽密集的(读取权重)。

📱

推理可以在边缘设备上做

训练需要数据中心,但推理只需一台设备——这就是端侧 AI 的基础。

训练创造智能,推理释放智能——而边缘推理让智能触手可及。

这就是为什么 AtomGradient 专注于边缘推理——把训练好的智能带到你的设备上。

下一篇:Prefill 与 Decode