统一内存架构

为什么 Apple Silicon 特别适合跑 AI?

Apple Silicon 统一内存 UMA
阅读时间约 10 分钟
Chapter 01

传统架构的瓶颈

CPU 和 GPU 各有各的内存

在传统的 PC 和服务器架构中,CPU 使用系统内存(RAM),而独立 GPU 拥有自己的显存(VRAM)。两者之间通过 PCIe 总线连接。当 AI 模型需要在 GPU 上运行时,数据必须先从 RAM 拷贝到 VRAM——这个过程就是一个巨大的瓶颈。

PCIe 4.0 x16 的理论带宽约为 32 GB/s,而 GPU 显存本身的带宽可以达到数 TB/s。这意味着数据搬运的速度远慢于计算速度,GPU 常常在"等数据"。

NVIDIA 的高端 GPU 使用 HBM(高带宽内存),提供 2-4 TB/s 的惊人带宽。但问题是容量有限:消费级 GPU 通常只有 8-24 GB VRAM,即使是数据中心级的 H100 也只有 80 GB。对于大型语言模型来说,如果模型参数无法完全放进 VRAM,就根本跑不起来。

// 传统分离式架构

CPU
PCIe ~32 GB/s
GPU
RAM
64-128 GB
VRAM
8-80 GB
⚠ 数据必须在 RAM 和 VRAM 之间拷贝

传统架构就像两个厨房之间只有一条窄走廊——食材必须来回搬运,厨师(GPU)再快也得等食材送到。

Chapter 02

Apple Silicon 的革命

一块芯片,一池内存

Apple Silicon 采用了统一内存架构(Unified Memory Architecture, UMA)。在这种架构下,CPU、GPU 和 Apple 神经网络引擎(ANE)共享同一个内存池。没有 RAM 和 VRAM 的区分——所有处理器访问的是同一片物理内存,使用相同的地址空间。

这意味着数据不需要拷贝。当 CPU 加载了模型权重后,GPU 可以直接读取同一份数据,ANE 也可以同时访问——零拷贝(Zero-Copy)。这消除了传统架构中最大的瓶颈。

更重要的是,统一内存的容量远超传统 VRAM。M2 Ultra 提供最高 192 GB 统一内存,M4 Max 提供最高 128 GB——这比任何消费级 GPU 的显存都要大得多。

// Apple Silicon 统一内存架构

CPU
GPU
ANE
统一内存池
最高 192 GB · 所有处理器共享
✓ 无需数据拷贝 · 同一地址空间 · 零延迟共享

统一内存就像一个开放式大厨房——所有厨师(CPU、GPU、ANE)围着同一张大工作台,食材就在手边,无需搬运。

Chapter 03

内存带宽 — AI 推理的隐形天花板

大型语言模型的推理过程是内存带宽受限(memory-bandwidth bound)的,而非计算受限。在逐 Token 生成阶段(decode),每生成一个 Token 都需要读取整个模型的权重。因此,内存带宽直接决定了推理速度(tok/s)

Apple Silicon 的内存带宽随芯片代际持续提升:

// 内存带宽对比

关键权衡:

NVIDIA GPU 带宽更高,但显存容量有限。Apple Silicon 带宽较低,但统一内存容量大得多——能跑更大的模型,尽管速度稍慢。对于端侧 AI,"能跑"比"跑得最快"更重要。

Chapter 04

为什么这对端侧 AI 特别重要

大型模型(30B+ 参数)在 Q4 量化后仍需要 15-20 GB 内存,更大的 70B 模型则需要 35-40 GB。这远超任何消费级 GPU 的 VRAM 容量,但完全可以放进 M2 Ultra 的 192 GB 或 M4 Max 的 128 GB 统一内存中。

零拷贝特性让 CPU/GPU/ANE 混合推理成为可能。模型的不同层可以分配给最适合的处理器执行,无需在它们之间搬运数据。(详见我们的 ANE 混合推理文章。)

MoE(混合专家模型)在统一内存架构上特别受益。以 Qwen 35B MoE 为例:全部 35B 参数需要常驻内存,但每次推理只激活约 3B 参数。传统架构需要把 35B 参数全部放进 VRAM;而在 Apple Silicon 上,统一内存轻松容纳全部参数,GPU 只需计算激活的 3B——效率极高。

AtomGradient 的研究数据显示:M2 Ultra 运行 35B MoE 模型可达 49.9 tok/s,这在消费级硬件上是数据中心级的表现。

// 模型尺寸 vs 设备内存

哪些模型能在哪些设备上运行?(Q4 量化后的内存需求)

统一内存让 Apple Silicon 成为 MoE 的理想平台——就像拥有一个巨大的书架,虽然每次只读几本书,但所有书都随手可取,无需去仓库搬运。

Chapter 05

总结

🔗

统一 > 分离

统一内存消除了 CPU/GPU 之间的数据拷贝瓶颈,所有处理器共享同一内存池。

带宽决定推理速度

LLM 推理是内存带宽受限的——带宽越高,每秒生成的 Token 越多。

📦

大容量 = 跑更大模型

192 GB 统一内存让消费级设备运行 70B+ 模型成为现实。

🔄

零拷贝启用混合推理

CPU/GPU/ANE 无需数据搬运即可协作推理,MoE 模型尤其受益。

统一内存让 Apple Silicon 用消费级硬件做到了数据中心级别的模型部署。

下一篇:零拷贝模型加载