不上传数据也能获得个性化 AI?跨域数据的涌现智能
阅读时间 ~10 分钟 · 基于 AtomGradient Prism 研究云端 AI 需要你的数据才能变得实用——但你并不想把隐私数据上传到别人的服务器。这就是隐私-效用悖论:你越想让 AI 了解你,就越需要暴露自己。
当前主流范式是「大模型 + 小数据」——云端运行 GPT-5 级别的巨型模型,但只能依赖薄薄的聊天记录来理解你。Prism 提出了一个完全不同的思路:「中模型 + 丰富数据」——在本地运行 9-35B 参数的模型,配合 90 天完整的生活数据。
Prism 从四个领域整合你的生活数据,每个领域捕捉不同维度的生活状态。它们来自四个独立的应用,各自在设备上安静地记录。
支出 · 收入 · 储蓄率 · 消费类目
三餐记录 · 营养摄入 · 饮水量
情绪评分 · 睡眠 · 压力 · 日记
阅读时长 · 话题偏好 · 高亮笔记
Prism 的关键发现:IIR(洞察增量比)= 1.48x——四域全整合产生的洞察质量,比单域平均值高出 48%。这不是简单的叠加,而是跨域维度的涌现。
单域只能看到碎片,全景整合才能看到完整图景:
数据停留在每台设备上,只有压缩摘要在设备间流转。压缩比高达 125.5x(108,850 字节 → 867 字节)。零原始数据泄漏——由架构保证,而非依赖政策。
9B 模型在丰富数据下达到 35B 模型 93.4% 的质量(79.0 vs 84.6)。而收益递减效应明显:2B→9B 提升 14.9 分,9B→35B 仅提升 5.6 分。9B 是实用最优点。
| 设备 | 芯片 | 速度 (tok/s) |
|---|---|---|
| Mac Studio | M2 Ultra | 49.9 |
| MacBook Pro 14" | M1 Max | 21.9 |
| MacBook Pro 13" | M2 Pro | 12.7 |
端侧运行的中等规模模型,配合完整的本地数据,能够媲美云端大模型的个性化表现。
IIR = 1.48x,四域整合的洞察质量远超单域之和,跨域维度是关键驱动力。
125.5x 压缩比,仅传输摘要,原始数据永远不离开设备——由架构而非政策保证。
达到 35B 的 93.4% 质量,M1 Max 即可流畅运行,收益递减使更大模型性价比不高。