苹果 20B 端侧模型 · 专题研究
APPLE FOUNDATION MODEL · 专题研究

苹果为什么把 20B 装进手机

大容量、小开销——苹果用稀疏架构让一颗 200 亿参数模型平时只激活 1–4B,端侧第一次同时拥有「大模型的容量、小模型的开销」。
刘学仕 | 2026-06 | 公司战略件 | 受众:战略部总裁
边界声明:本报告基于苹果 2026-06-08 官方发布及公开学术资料;苹果尚未发布 AFM 3 完整技术报告,20B 级能耗/续航、第三方横评等关键指标待补;文中带「判断」字样者为研究员推断,非苹果官方口径。
摘要 执行摘要
核心判断:苹果做 20B 不是参数炫技,而是用稀疏架构把「模型容量」与「每次开销」解耦——让端侧第一次有了大模型的容量、小模型的开销。这套设计之所以成立,是因为它同时对用户、开发者、苹果三方创造价值;三方价值同时成立,才是「为什么做」的完整答案。

具体说,苹果在原有 3B 端侧模型之上,新增了一颗 20B 参数的稀疏激活模型 AFM 3 Core Advanced。它的关键不在参数大,而在一种架构选择:整颗模型存放在闪存里,靠指令跟随剪枝(IFP)每次只把这次任务用得上的 1–4B 参数叫醒——苹果官方明确这不是标准 MoE,因为手机闪存到内存的带宽撑不起逐字换权重,所以改为「按一次提问选一次」。

为什么对三方都有价值对用户,是把过去要上云才有的质量搬回本地(官方实证为表现力语音与高精度听写);对开发者,是零成本调用本地大模型、生态自转的飞轮;对苹果,是分层卖硬件、锁住用户、节省云端成本的战略护城河。

这套栈别人能不能复制?把它从训练到落地拆成关键构件后会发现一个反直觉的结论:DRAM 容量和闪存带宽恰恰不是苹果的优势(安卓旗舰内存 12–24GB 已领先、UFS 5.0 闪存即将反超)。真正卡死安卓的只有三项——垂直整合、NPU 运行时动态换权、稀疏模型训练 know-how。苹果的护城河不是单一技术、更不是堆硬件,而是垂直整合让所有构件互相适配。

时空坐标:2026 年内 × 全球量产消费级端侧 AI | 置信度:高(架构定性、数据署名、设备门槛均经官方一手核验) | 决策时点:启动议题

来源:Apple ML Research 三代模型博客(2026-06-08,已核验);IFP 论文 arXiv 2501.02086(ICML 2025)
第一章 苹果做了什么(含能否复制)
导语:本章先讲清苹果这颗 20B 端侧模型到底是什么、怎么做到的,再回答一个关键问题——这套技术栈别人能不能复制、门槛卡在哪。结论先行:硬件不是苹果的护城河,垂直整合才是。
1.1先看全景:第三代基础模型,端侧两个、云侧三个

苹果 2026 年 6 月 8 日发布第三代基础模型(AFM 3),共五个模型,与谷歌有合作。端侧两个:Core(3B 稠密,做通用文本与任务分发)、Core Advanced(20B 稀疏激活,原生多模态、语音、听写)。云侧三个:Cloud(服务端主力文本)、ADM Cloud(扩散模型,做图像生成)、Cloud Pro(承接智能体与复杂推理,由 Gemini 蒸馏而来)。

两个容易被忽略但重要的细节:第一,五个模型里只有 Cloud Pro 跑在谷歌云的 NVIDIA GPU 上,其余四个都用苹果自家芯片;第二,三个云模型的参数苹果一个都没公开,目前外界只知道两个端侧模型的规模。这说明苹果在端云分工上有意保持模糊,也给"完整端云协同图景"留了信息缺口。

模型端/云参数架构 / 定位跑在哪
Core端侧3B稠密 · 通用文本/任务分发Apple 芯片
Core Advanced端侧20B(激活 1–4B)稀疏 · 原生多模态/语音/听写Apple 芯片
Cloud云侧未公开服务端主力文本Apple 芯片
ADM Cloud云侧未公开扩散模型 · 图像生成Apple 芯片
Cloud Pro云侧未公开智能体/复杂推理 · Gemini 蒸馏谷歌云 NVIDIA GPU
来源:Apple ML Research 三代模型博客(2026-06-08,已核验)
1.2不是把 3B 放大,而是在 3B 之上新增 20B 一档

一个常见误读是"苹果一年内把 3B 模型放大成了 20B"。事实并非如此:约 3B 的端侧模型 2024、2025、2026 连续三代都在,从未消失;2026 年苹果是在它之上新增了一颗 20B 的 Core Advanced 作为更高一档,由 12GB 内存等更强硬件解锁。

这个区分很重要——它说明苹果是有意做能力分层,不是简单堆参数:轻任务、低端机用 3B,重任务、高端机用 20B,系统按硬件自动选档。这也呼应了第二章会讲的"分层卖硬件"战略。

端侧模型容量三代演进(B)051015203B2024 一代端侧首发3B2025 二代+开发者框架20B2026 三代新增 Core Advanced约 7× 跃迁约 3B 端侧模型连续三代都在;2026 是在其之上新增 20B 一档,非放大 3B
图 1 端侧模型容量三代演进——约 3B 三代都在,2026 新增 20B 一档
来源:Apple ML Research 三代模型博客(已核验);12GB 门槛与机型据 MacRumors / TrendForce
1.3怎么做到:全量存闪存,按指令剪枝激活,且明确不是标准 MoE

机制分三步:第一,完整 20B 模型全量存在 NAND 闪存里,平时不占内存;第二,每次来任务,IFP(指令跟随剪枝)读懂这次的指令、动态剪出用得上的前馈网络子集——注意是按一次提问选一次,不是每个字都选;第三,高频的共享专家常驻内存、其余路由专家按需从闪存换入,在内存里拼成一个临时的稠密模型来跑。

完整 20B 全量存 NAND 闪存 读指令 IFP 剪枝 按 prompt 选 FFN 子集 (非逐 token) DRAM 拼出临时稠密模型 共享专家常驻 + 路由专家按需换入 每次只激活 1–4B 来源:Apple ML 三代模型博客 + IFP 论文 arXiv 2501.02086(ICML 2025)
图 2 IFP 按提问剪枝的三步机制

技术上,IFP 的核心是一个稀疏掩码预测器——一个比主模型小得多的网络,读取 prompt 后用 SoftTopK 算子生成可微的激活掩码,与大模型联合训练。这与两种相邻方案都不同:

✗ 标准 MoE(手机上行不通)

每个字都换一组专家权重,手机闪存到内存的带宽根本扛不住逐字换权。苹果官方原话点明了这正是不用标准 MoE 的原因。

✓ 苹果 IFP(按提问选一次)

一次提问选定专家后整段生成不再重载,等价于一个稠密小模型,绕开带宽墙。动态剪枝开销仅占生成时间约 1–2%。

效果上有硬数据:IFP 原型把 9B 剪到 3B 激活,编码任务比 3B 稠密高 8 分、数学高 5 分,整体逼近 9B 稠密模型,而首字延迟和解码速度都接近 3B 稠密。这就是"大容量、小开销"的算法根基。

来源:Apple ML 三代模型博客 + IFP 论文 arXiv 2501.02086(ICML 2025,均已核验)。苹果定性:sparse architecture + IFP
1.420B 官方只点名两项能力,且都在 1B 激活档取得

这是研究中一个需要诚实澄清的点:苹果官方拿出实证、明确署名给 20B Core Advanced 的能力,只有两项——而且都是在最小的 1B 激活档取得的,并非满血 4B。

能力20B 表现对比上代
表现力语音 TTSGeneral Voice MOS 4.15vs 3.87
(同上·会话语音)MOS 4.24vs 3.82
系统级高精度听写整体质量偏好 44.7%vs 17.6%(七维全胜)

同样重要的是哪些不是 20B 的功劳:流传中常被算到 20B 头上的"文本胜率 45.6%""图像理解 >61%",官方其实都署名给了 3B Core——3B 本身就具备视觉能力(内置 300M 参数的 ViTDet-L 视觉编码器)。把这两笔数据还给 3B,是这份研究纠正的一处关键误读。

来源:Apple ML Research 三代模型博客(2026-06-08,已核验)
1.5独走 20B:赢的不是把模型做大,是把容量与开销解耦
全行业端侧主力模型参数 (B)20苹果3荣耀3三星3谷歌来源:端侧 20B 为苹果官方;Gemini Nano 1.8–3.25B 据 Google DeepMind arXiv 2312.11805(外部,非苹果对比)
图 3 全行业量产端侧主力模型参数对比(B)

横向看,苹果这颗 20B 在量产手机端侧是断层第一——荣耀 MagicLM、三星、小米、谷歌的端侧主力都在 3B 量级,没有第二家做到 20B 量产上机。但更重要的是赢的方式:传统 4B 稠密模型,容量和每次开销绑死,每次都要全跑,要更强只能整体做大、更慢更耗电;苹果的 20B 稀疏不一样,20B 大容量装闪存,每次只激活 1–4B

核心判断

它享受 20B 的「容量」,却只付 1–4B 的「开销」——这是稠密小模型给不了的,也是后文三方价值的技术根基。

来源:端侧 20B 为苹果官方;Gemini Nano 据 Google DeepMind arXiv 2312.11805(外部,非苹果对比)
1.6从训练到跑通:逐项看苹果做法 vs 安卓,硬件不是苹果的优势

把跑通这颗 20B 从训练到落地拆成关键构件,逐项对比苹果做法与安卓现状,门槛一目了然。先纠正一个概念:存进闪存的是模型权重,不是"推理引擎"——引擎是跑在内存里的代码,准确说法是"支持从闪存按需换入权重的推理引擎"。

关键构件苹果做法安卓现状 / 难点门槛
稀疏架构 + 按提问路由IFP 指令跟随剪枝,整模型存闪存主力多为稠密 3–7B,需重训稀疏模型
训练可剪枝稀疏模型联合训练掩码预测器 + 2bit QAT算力 / 数据 / know-how 三重门槛
闪存按需换权推理引擎自研引擎(windowing、行列捆绑)开源已有(PowerInfer-2 / MNN)
缓存调度(共享专家常驻)prefill 锁定 + 共享专家驻 DRAM开源已有(命中率优化)
NPU 运行时动态换权Neural Engine + 统一内存零拷贝NPU 要求权重预加载,不支持动态换
DRAM 容量12GB安卓旗舰 12–24GB,已领先
闪存读带宽NVMe 实测约 1.5–3 GB/sUFS 4.0 约 4.2、UFS 5.0 约 10.8,已/即将反超

读表:红=高门槛(安卓难),黄=中门槛(开源可达),绿=低门槛(安卓已领先或即将反超)。一个反直觉但关键的发现:DRAM 容量和闪存带宽恰恰不是苹果的优势——苹果内存才 12GB,自研存储实测顺序读约 1.5–3 GB/s,还慢于安卓 UFS 4.0 的约 4.2 GB/s。如果说苹果靠堆硬件领先,那是看错了方向。

来源:IFP 2501.02086;LLM in a flash 2312.11514;PowerInfer-2 2406.06282;zFLoRA 2510.25784;UFS 5.0 JEDEC / 三星
1.7真正卡死安卓的,是这三项——且前两项是结构性的

垂直整合(做不到)

苹果一家掌控芯片+内存+存储控制器+OS+模型+框架,端到端协同;安卓是高通/联发科+谷歌+厂商分工,改不动 NPU 底层、模型难与硬件协同。

NPU 运行时动态换权

移动 NPU 要求权重预加载固定内存,不支持高效动态换入;安卓闪存换权方案被迫退回 CPU/GPU 跑(zFLoRA 在骁龙 8 Elite NPU 实测确认)。

稀疏训练 know-how

IFP 联合训练掩码预测器 + 2bit QAT,算力/数据/工程三重门槛;安卓主力仍是稠密 3–7B,需重新设计训练。

但要说清楚另一面:安卓并非全盘落后。在闪存换权推理引擎、缓存调度、量化、内存容量、闪存带宽这五项上,安卓要么靠开源方案做得到、要么硬件已经领先。学术界甚至已在安卓真机上跑通了原型——PowerInfer-2 在一加 12 上把一个 47B 稀疏模型跑到了 11.68 token/s,靠的是缓存命中率 96–98%。所以"技术上能不能做到"答案是能,卡的是量产化的那三项硬骨头。

本章收束

安卓在推理引擎、缓存、量化、内存、闪存五项上做得到甚至已领先,真正卡死的只有上面三项,且①②是结构性的。苹果的护城河不是某一项单点技术、更不是堆硬件,而是垂直整合让所有构件互相适配——这是判断竞争格局时最该看清的一点。

来源:zFLoRA arXiv 2510.25784(NPU 换权实测);llm.npu 2407.05858;PowerInfer-2 2406.06282;苹果 ML 博客
第二章 对谁有价值(这就是「为什么做」的答案)
导语:上一章讲清苹果做了什么,这一章回答为什么做。答案不是单一动因,而是这颗 20B 同时对用户、开发者、苹果三方创造价值——三方价值同时成立,才是完整答案。
2.1对用户:把过去要上云的大模型质量,搬回了本地

20B 对用户的价值要分两层说清——苹果拿出实证的,和合理但尚无实证的推断。

官方实证(且都在 1B 激活档取得)

表现力语音 TTS:可定制 Siri 语音,MOS 4.15 vs 上代 3.87;会话语音 4.24 vs 3.82。

系统级高精度听写:整体质量偏好 44.7% vs 17.6%,七个维度全胜。

研究员推断(合理但苹果未给 20B vs 3B 实证)

更长上下文的本地处理(整篇文档、长对话不上云);更复杂的本地多步推理;更多语言与专业领域覆盖。

注:图像理解 >61%、文本 45.6% 官方均署名 3B Core,非 20B。

关键在于:这些质量过去要联网上云才有,现在本地就能用——离线、隐私、且不像云端那样受网络波动影响而衰减。对用户而言,这是"大模型质量"第一次稳定地装进口袋。

来源:Apple ML Research 三代模型博客(2026-06-08,已核验);图像理解>61%、文本45.6% 官方均署名 AFM 3 Core(3B)
2.2对开发者:三行代码调本地大模型,生态自己转起来

苹果的 Foundation Models 框架让开发者几行 Swift 代码就能调用端侧模型,且系统按硬件自动选档(开发者不用、也不能手动指定 20B),还支持结构化输出(类型安全)、工具调用、多轮会话、图像输入,并提供 LoRA adapter 工具包。最关键的是零 API 成本——本地推理不花钱、不限量、保护隐私。

这形成一个自我强化的飞轮:零成本 → 更多应用接入 → 用户更黏 → 生态更强 → 吸引更多开发者。每一环都自我强化,苹果不需要持续补贴就能让生态自转——这正是平台型护城河的典型形态。

零成本更多应用用户更黏生态更强更多开发者
图 4 开发者生态自转飞轮
来源:Apple Foundation Models 框架(官方);开发者解读(ofox.ai,2026)
2.3对苹果:分层卖硬件、锁住用户、压低云成本的护城河
1

分层卖硬件

20B 需 12GB 内存,只有 iPhone 17 Pro/Pro Max/Air 等高端机解锁,成为牵引用户升级旗舰的卖点。

2

锁住用户

端侧模型与 iOS 深度绑定、与个人数据本地结合,越用越离不开苹果生态,迁移成本升高。

3

压低云成本

高频任务在端侧零边际成本处理,替代原本要付费的云端调用,长期省下可观 OPEX。

需要诚实标注:上述"分层/留存/成本"是基于公开事实的研究员判断,非苹果明说;其中"省云成本"的成立前提,是任务确实在端侧高频运行——若多数重任务仍走云端,这条逻辑会打折。

来源:Apple ML 博客(官方);分层/留存/成本为基于公开事实的研究员判断;12GB 门槛据媒体
2.4三方共振,才是押注 20B 的根本动因
核心判断

把三方价值叠在一起,"为什么做 20B"的答案就完整了:它同时是用户的全能本地助手、开发者的零成本平台、苹果的硬件与生态护城河。任何单独一方都不足以解释这次投入,三方价值同时成立才是根本动因。

更深一层的战略动机(研究员判断):抬高端侧能力的天花板、为多模态时代提前卡位、在 AI 叙事上重新夺回主动权。有机构评论称 AFM 3 是苹果 AI 的"实质性正面重置"——在经历上一代 Apple Intelligence 的平淡反响后,这一代被视为苹果重新证明其端侧 AI 决心的信号。

来源:核心判断为研究员综合;"正面重置"评论据美银(机构观点)
第三章 更大参数的想象与边界
导语:这一章既讲清更大参数的价值边界(哪些任务大模型并不必要),也讲清技术上能不能继续做大、瓶颈在哪,最后诚实划出"哪些到手了、哪些还是赌注"。
3.1窄任务上,小激活就够了——大参数的边际收益会饱和

先泼一盆冷水:并非所有任务都需要 20B。三组学术证据都指向同一点——在边界明确的窄任务上,把模型从中等规模再做大,收益迅速衰减。

CS-Bench(计算机知识)

+2.66%

72B→110B
而 0.5→7B 时能涨 16%

函数调用 TUCAN

+0.83%

9B→27B(微调后)
几乎打平

法律抽取 ContractEval

8B 反超

8B vs 14B
F1 0.53 vs 0.50

窄任务上,规模每上一档的边际收益(%)0%5%10%15%+16%0.5→7B+6.5%7→32B+3.5%32→72B+2.66%72→110B小模型阶段:每上一档大幅提升大模型阶段:收益逼近零CS-Bench 实测;中间两点为示意衰减趋势。仅就边界明确的窄任务,通用推理不适用
图 5 窄任务上规模每上一档的边际收益急剧衰减

但必须严格限定:这只对窄任务成立。通用推理、长程任务执行的能力,仍随规模持续提升——有专门研究反驳"全面递减"是一种测量假象。所以正确的结论不是"大模型没用",而是"窄任务上小激活够用,大容量的价值在别处",这恰好为苹果"按需激活 1–4B"的设计提供了依据。

来源:CS-Bench arXiv 2406.08587;TUCAN arXiv 2506.23394;ContractEval arXiv 2508.03080;递减假象反驳 arXiv 2509.09677
3.2那更大参数的独特价值在哪?四个稀疏激活给不了的地方

既然窄任务不需要大模型,20B 的大容量价值体现在哪?四个方向:

世界知识长尾

覆盖更多冷门事实,随参数近单调增长,小模型记不住长尾。

低资源语言

小语种、方言能力需要更大容量承载,是大模型的明显优势区。

复杂推理涌现

多步推理能力约在 13B 阈值附近涌现,小模型难以稳定完成。

还有一项是多模态视觉深度——更大容量能承载更细致的图像理解。

核心判断

大容量的价值在于抬高质量上限、拓宽覆盖广度;而稀疏激活让这份容量的开销保持可控——这正是 20B 路线的意义:要的是容量带来的上限,不是每次都全跑的开销。

来源:长尾 arXiv 2211.08411/2212.10511;多语言 arXiv 2506.19468;涌现 Wei et al. 2022 + 研究员判断
3.3技术上能支撑更大,但瓶颈是带宽不是存储

存储不是瓶颈

就算 120B 模型,4-bit 量化后也才约 60GB,而 iPhone 闪存有 1–2TB,装得绰绰有余。模型再大也"装得下"。

真瓶颈:搬运速度,不是装不装得下

带宽:模型从闪存搬进内存这条路很窄,内存比闪存快 19–130 倍

内存:DRAM 装的是「激活缓存」而非整个模型;越大命中率越高、越少回闪存。

密集 70B 从手机闪存仅 1.8–3.4 token/s → 不可用;稀疏激活(active≤4B)是端侧扩容的唯一可行解。

这里要澄清一个容易误解的点(这也是研究中一处关键修正):稀疏模型并不需要把整个模型放进内存,内存里装的只是这次激活用到的那一小块加常驻的共享专家,相当于一个缓存。所以内存大小限制的不是"能装多大模型",而是缓存命中率——内存越大、要的权重越可能已在内存里、越少去慢速闪存捞。PowerInfer-2 的实测印证了这点:靠 96–98% 的缓存命中率,才让 47B 稀疏模型在手机上跑到 11.68 token/s。

来源:苹果 LLM in a flash arXiv 2312.11514;MNN-LLM 2506.10443;ActiveFlow 2504.08378;PowerInfer-2 2406.06282
3.4会不会换上更快的闪存?UFS 5.0 的窗口

既然瓶颈是搬运速度,那闪存升级能不能解局?这是判断"安卓何时可能追上、苹果会不会进一步做大"的关键变量。

规格发布顺序读带宽意义
UFS 4.0 / 4.12022 / 2025约 4.2 GB/s当前安卓旗舰主流
苹果 NVMe(iPhone)实测约 1.5–3 GB/s顺序读反而低于 UFS 4.0
UFS 5.02026-02 发布约 10.8 GB/s带宽翻倍 + 省电约 40%

UFS 5.0 三星已宣布 2026 Q4 量产、最大 1TB,预计 2027 年初 Galaxy S27 系列首发。它把安卓闪存顺序带宽推到当前 iPhone 的两倍以上,对"闪存按需换权"这条路是直接利好——这意味着苹果在闪存带宽上不仅没优势,明年还会被安卓反超。这进一步印证:苹果的护城河不在硬件单点,而在垂直整合。

来源:JEDEC UFS 5.0 规格(2026-02);三星量产公告(2026-06-23);UFS 4.x 三星/美光规格;iPhone NVMe 第三方跑分
3.5苹果手机端侧模型,会持续做大吗?会扩,但有节制

支持「会继续做大」

  • IFP 架构本就为容纳更大参数池而设计
  • 端侧从 3B 一步跳到 20B,约 7 倍跃迁,显示意愿
  • 芯片带宽逐代提升,腾出空间

制约「难以无限做大」

  • 闪存搬运速度是物理硬墙;内存越小越频繁回闪存、越慢
  • Federighi(软件工程高级副总裁)成本敏感,重任务宁可放云端
  • 窄任务 3–4B 已够用,做大边际收益低
研究员判断

会扩,但有节制——更可能在稀疏激活框架内稳步上探(如 30–40B 但激活仍 ≤4B),而非无限做大;端侧参数有自然上限。本判断仅就手机端侧模型,不含云侧。

来源:苹果官方/IFP 论文;The Information/CNBC;均为信号,结论属研究员推断。仅就手机端侧模型,不含云侧
3.6诚实的边界:哪些到手了,哪些还是赌注

已兑现

1B 激活档的表现力语音、高精度听写已落地、有官方数据支撑——这部分是实打实到手的。

押注未来

满血 20B 的更大容量更像是为多模态时代储备;其完整价值尚待第三方验证。

代价单列:20B 级端侧能耗/续航苹果未公开(待夏季技术报告);12GB 门槛把它锁在高端机;2026 年内存涨价推高物料成本(BOM)。商业上待观察:上一代 Apple Intelligence 并未明显拉动换机与付费意愿(调研显示仅约 3% 用户表示愿付费)——这是悬在"对苹果价值"判断上的最大问号,下一章会作为最硬的反方展开。

来源:Apple ML 博客;venturebeat;TrendForce/Gartner 内存涨价;CNBC/MacRumors 换机数据;YouGov 付费意愿
反方 反方与关键风险
导语:本章带牙齿——装的是真能动摇核心判断的硬反方与失效条件,不是合规清单。反方顶前,是为了让决策者看清这份判断在什么情况下会塌。
反-1能推翻本判断的,是「20B 在商业上无法兑现」

最硬的一条反方:上一代 Apple Intelligence 并未明显拉动换机与付费——多家机构观察一致,调研显示仅约 3% 用户愿为其付费。如果 20B 这代重蹈覆辙,那么"三方价值成立"判断中"对苹果"那一环就会落空,整个"为什么做"的逻辑会被削弱为"技术领先但商业落空"。

第二条:苹果重任务重度依赖云端(Private Cloud Compute 与定制 Gemini),且 Federighi 对成本敏感。这意味着端侧路线可能克制而非激进——不应假设苹果必然持续把端侧参数做大。

第三条:窄任务上 3–4B 已够用(见 3.1)。若多数日常任务并不需要 20B,那么这颗大模型的实际使用频率存疑,"对苹果省云成本"的逻辑也随之打折。

失效条件

若苹果夏季技术报告显示 20B 实际能耗/续航代价过高,或第三方横评显示 20B 相对 3B 增量有限,则"对用户价值"判断需下调。这是本研究主动设定的降级触发。

来源:郭明錤/Counterpoint/CNBC 换机数据;YouGov 付费意愿调研;The Information(Federighi 成本敏感)
反-2研究过程中已修正的五处误读(自我对抗记录)

这份研究经过多轮红队对抗和用户质疑,以下五处早期判断已被推翻或修正,列出以示论证的诚实:

  • "20B 是标准 MoE" → 不成立。苹果官方定性 sparse architecture + IFP,明确与 standard MoE 区分(带宽撑不起逐 token 换权)。
  • "一代从 3B 跳到 20B" → 不成立。约 3B 连续三代都在,20B 是 2026 新增一档。
  • "文本/图像数据是 20B 的" → 不成立。45.6% 文本、>61% 图像理解官方均署名 3B Core。
  • "DRAM 容量是瓶颈" → 修正。稀疏模型不需整模型进 DRAM,DRAM 装缓存、约束的是速度/命中率而非容量。
  • "闪存/内存是苹果硬件优势" → 修正。苹果内存 12GB 少于安卓旗舰、NVMe 顺序读慢于 UFS 4.0;硬件反是安卓相对优势。
来源:研究过程红队对抗与用户质疑记录;各修正均回溯至苹果官方一手与学术原始来源
缺口 信息缺口与监测信号
导语:诚实标出还没看清的地方,以及哪些信号一旦出现就该更新今天的判断。
缺-1四个待补缺口
信息缺口影响补全后判断如何升级
20B 级端侧能耗/续航无独立实测影响"代价"评估续航达标则"押注未来"部分坐实
苹果零第三方横评偏好率仅对自家基线可判断 20B 真实竞争力
三个云模型参数未公开端云分工不明得到完整端云协同图景
安卓量产闪存换入时间点影响竞争窗口判断确认苹果领先窗口长度
缺-2三个会改变判断的监测信号
  • iPhone DRAM 升至 16–24GB——注意不是为了装下更大模型(稀疏模型本不需整装),而是缓存大了命中率高、更少回慢速闪存,端侧大模型流畅度大幅改善。
  • 出现必须靠更大容量才能实现、且高频使用的端侧独有杀手级功能。
  • 2027 年苹果把 Core Advanced 升到 >20B 或激活 >4B——确认它要走扩大规模的路线。
来源:Apple 承诺夏季发布技术报告;DRAM-命中率机制据 PowerInfer-2/ActiveFlow;监测信号为研究设定
附录 方法论、边界与信源说明
导语:交代这份研究怎么做的、边界在哪、信源如何分级,供需要追溯的读者查证。
附-1研究方法与立项演变

本报告为公司战略研究件,受众为战略部总裁,目的是说清"苹果为什么做 20B 端侧模型、对三方的价值、以及安卓能否复制"。研究经过完整的深度流程(立项 → 分析角度 → 深度研究 → 核心判断 → 红队对抗 → 叙事框架 → 逐页设计 → 事实溯源自检),并经多轮补充研究修正。

课题演变:最初设想为"端云界面命题",经用户校正聚焦为"为什么做 20B + 三方价值",最终收敛为三章结构(做了什么 / 对谁有价值=为什么做 / 更大参数的想象与边界),后又应需求补充"安卓能否复制"的全链条技术拆解。

切入角度:时间轴(端侧模型三代演进)、横向对比(vs 安卓阵营/Gemini Nano)、技术机制(IFP 稀疏激活)、价值链(用户/开发者/苹果三方)。

附-2信源说明(可追溯链接)

以下为本报告关键事实的可核验来源,按来源类型分组,均可点击跳转原文。

苹果官方一手

  • 官方Introducing the Third Generation of Apple's Foundation Models(2026-06-08)——架构定性、五模型矩阵、TTS/听写实证、激活范围出处 machinelearning.apple.com
  • 官方Apple Intelligence Foundation Language Models(2025 技术报告,训练流程/2-bit QAT/KV-cache) arxiv.org/abs/2507.13575

学术原始研究

规格与媒体

  • 规格JEDEC UFS 5.0 标准(顺序读约 10.8 GB/s) jedec.org
  • 外部Gemini Nano 参数(Google DeepMind,外部对比、非苹果官方) arxiv.org/abs/2312.11805
  • 媒体设备门槛/内存涨价:MacRumors、TrendForce;Federighi/换机数据:The Information、CNBC;"正面重置"评论:美银(机构观点,无公开链接)
附-3术语
  • 稀疏激活:模型总参数很大,但每次推理只激活其中一小部分,从而"大容量、小开销"。
  • IFP(指令跟随剪枝):苹果用的方法,按一次提问的指令动态选出要激活的参数子集,整段生成不再更换。
  • 按提问路由 vs 逐字路由:苹果按一次提问选定专家(适配手机带宽);标准 MoE 每个字都换专家(手机带宽扛不住)。
  • 共享专家 / 路由专家:高频共用的参数常驻内存(共享专家),其余按需从闪存换入(路由专家)。
  • NAND→DRAM 带宽:模型权重从闪存搬进运行内存的速度,是端侧大模型的真正瓶颈。
  • 缓存命中率:本次激活所需权重恰好已在内存中的比例;越高越少回慢速闪存,速度越快。