具体说,苹果在原有 3B 端侧模型之上,新增了一颗 20B 参数的稀疏激活模型 AFM 3 Core Advanced。它的关键不在参数大,而在一种架构选择:整颗模型存放在闪存里,靠指令跟随剪枝(IFP)每次只把这次任务用得上的 1–4B 参数叫醒——苹果官方明确这不是标准 MoE,因为手机闪存到内存的带宽撑不起逐字换权重,所以改为「按一次提问选一次」。
为什么对三方都有价值:对用户,是把过去要上云才有的质量搬回本地(官方实证为表现力语音与高精度听写);对开发者,是零成本调用本地大模型、生态自转的飞轮;对苹果,是分层卖硬件、锁住用户、节省云端成本的战略护城河。
这套栈别人能不能复制?把它从训练到落地拆成关键构件后会发现一个反直觉的结论:DRAM 容量和闪存带宽恰恰不是苹果的优势(安卓旗舰内存 12–24GB 已领先、UFS 5.0 闪存即将反超)。真正卡死安卓的只有三项——垂直整合、NPU 运行时动态换权、稀疏模型训练 know-how。苹果的护城河不是单一技术、更不是堆硬件,而是垂直整合让所有构件互相适配。
时空坐标:2026 年内 × 全球量产消费级端侧 AI | 置信度:高(架构定性、数据署名、设备门槛均经官方一手核验) | 决策时点:启动议题
苹果 2026 年 6 月 8 日发布第三代基础模型(AFM 3),共五个模型,与谷歌有合作。端侧两个:Core(3B 稠密,做通用文本与任务分发)、Core Advanced(20B 稀疏激活,原生多模态、语音、听写)。云侧三个:Cloud(服务端主力文本)、ADM Cloud(扩散模型,做图像生成)、Cloud Pro(承接智能体与复杂推理,由 Gemini 蒸馏而来)。
两个容易被忽略但重要的细节:第一,五个模型里只有 Cloud Pro 跑在谷歌云的 NVIDIA GPU 上,其余四个都用苹果自家芯片;第二,三个云模型的参数苹果一个都没公开,目前外界只知道两个端侧模型的规模。这说明苹果在端云分工上有意保持模糊,也给"完整端云协同图景"留了信息缺口。
| 模型 | 端/云 | 参数 | 架构 / 定位 | 跑在哪 |
|---|---|---|---|---|
| Core | 端侧 | 3B | 稠密 · 通用文本/任务分发 | Apple 芯片 |
| Core Advanced | 端侧 | 20B(激活 1–4B) | 稀疏 · 原生多模态/语音/听写 | Apple 芯片 |
| Cloud | 云侧 | 未公开 | 服务端主力文本 | Apple 芯片 |
| ADM Cloud | 云侧 | 未公开 | 扩散模型 · 图像生成 | Apple 芯片 |
| Cloud Pro | 云侧 | 未公开 | 智能体/复杂推理 · Gemini 蒸馏 | 谷歌云 NVIDIA GPU |
一个常见误读是"苹果一年内把 3B 模型放大成了 20B"。事实并非如此:约 3B 的端侧模型 2024、2025、2026 连续三代都在,从未消失;2026 年苹果是在它之上新增了一颗 20B 的 Core Advanced 作为更高一档,由 12GB 内存等更强硬件解锁。
这个区分很重要——它说明苹果是有意做能力分层,不是简单堆参数:轻任务、低端机用 3B,重任务、高端机用 20B,系统按硬件自动选档。这也呼应了第二章会讲的"分层卖硬件"战略。
机制分三步:第一,完整 20B 模型全量存在 NAND 闪存里,平时不占内存;第二,每次来任务,IFP(指令跟随剪枝)读懂这次的指令、动态剪出用得上的前馈网络子集——注意是按一次提问选一次,不是每个字都选;第三,高频的共享专家常驻内存、其余路由专家按需从闪存换入,在内存里拼成一个临时的稠密模型来跑。
技术上,IFP 的核心是一个稀疏掩码预测器——一个比主模型小得多的网络,读取 prompt 后用 SoftTopK 算子生成可微的激活掩码,与大模型联合训练。这与两种相邻方案都不同:
每个字都换一组专家权重,手机闪存到内存的带宽根本扛不住逐字换权。苹果官方原话点明了这正是不用标准 MoE 的原因。
一次提问选定专家后整段生成不再重载,等价于一个稠密小模型,绕开带宽墙。动态剪枝开销仅占生成时间约 1–2%。
效果上有硬数据:IFP 原型把 9B 剪到 3B 激活,编码任务比 3B 稠密高 8 分、数学高 5 分,整体逼近 9B 稠密模型,而首字延迟和解码速度都接近 3B 稠密。这就是"大容量、小开销"的算法根基。
这是研究中一个需要诚实澄清的点:苹果官方拿出实证、明确署名给 20B Core Advanced 的能力,只有两项——而且都是在最小的 1B 激活档取得的,并非满血 4B。
| 能力 | 20B 表现 | 对比上代 |
|---|---|---|
| 表现力语音 TTS | General Voice MOS 4.15 | vs 3.87 |
| (同上·会话语音) | MOS 4.24 | vs 3.82 |
| 系统级高精度听写 | 整体质量偏好 44.7% | vs 17.6%(七维全胜) |
同样重要的是哪些不是 20B 的功劳:流传中常被算到 20B 头上的"文本胜率 45.6%""图像理解 >61%",官方其实都署名给了 3B Core——3B 本身就具备视觉能力(内置 300M 参数的 ViTDet-L 视觉编码器)。把这两笔数据还给 3B,是这份研究纠正的一处关键误读。
横向看,苹果这颗 20B 在量产手机端侧是断层第一——荣耀 MagicLM、三星、小米、谷歌的端侧主力都在 3B 量级,没有第二家做到 20B 量产上机。但更重要的是赢的方式:传统 4B 稠密模型,容量和每次开销绑死,每次都要全跑,要更强只能整体做大、更慢更耗电;苹果的 20B 稀疏不一样,20B 大容量装闪存,每次只激活 1–4B。
它享受 20B 的「容量」,却只付 1–4B 的「开销」——这是稠密小模型给不了的,也是后文三方价值的技术根基。
把跑通这颗 20B 从训练到落地拆成关键构件,逐项对比苹果做法与安卓现状,门槛一目了然。先纠正一个概念:存进闪存的是模型权重,不是"推理引擎"——引擎是跑在内存里的代码,准确说法是"支持从闪存按需换入权重的推理引擎"。
| 关键构件 | 苹果做法 | 安卓现状 / 难点 | 门槛 |
|---|---|---|---|
| 稀疏架构 + 按提问路由 | IFP 指令跟随剪枝,整模型存闪存 | 主力多为稠密 3–7B,需重训稀疏模型 | 高 |
| 训练可剪枝稀疏模型 | 联合训练掩码预测器 + 2bit QAT | 算力 / 数据 / know-how 三重门槛 | 高 |
| 闪存按需换权推理引擎 | 自研引擎(windowing、行列捆绑) | 开源已有(PowerInfer-2 / MNN) | 中 |
| 缓存调度(共享专家常驻) | prefill 锁定 + 共享专家驻 DRAM | 开源已有(命中率优化) | 中 |
| NPU 运行时动态换权 | Neural Engine + 统一内存零拷贝 | NPU 要求权重预加载,不支持动态换 | 高 |
| DRAM 容量 | 12GB | 安卓旗舰 12–24GB,已领先 | 低 |
| 闪存读带宽 | NVMe 实测约 1.5–3 GB/s | UFS 4.0 约 4.2、UFS 5.0 约 10.8,已/即将反超 | 低 |
读表:红=高门槛(安卓难),黄=中门槛(开源可达),绿=低门槛(安卓已领先或即将反超)。一个反直觉但关键的发现:DRAM 容量和闪存带宽恰恰不是苹果的优势——苹果内存才 12GB,自研存储实测顺序读约 1.5–3 GB/s,还慢于安卓 UFS 4.0 的约 4.2 GB/s。如果说苹果靠堆硬件领先,那是看错了方向。
苹果一家掌控芯片+内存+存储控制器+OS+模型+框架,端到端协同;安卓是高通/联发科+谷歌+厂商分工,改不动 NPU 底层、模型难与硬件协同。
移动 NPU 要求权重预加载固定内存,不支持高效动态换入;安卓闪存换权方案被迫退回 CPU/GPU 跑(zFLoRA 在骁龙 8 Elite NPU 实测确认)。
IFP 联合训练掩码预测器 + 2bit QAT,算力/数据/工程三重门槛;安卓主力仍是稠密 3–7B,需重新设计训练。
但要说清楚另一面:安卓并非全盘落后。在闪存换权推理引擎、缓存调度、量化、内存容量、闪存带宽这五项上,安卓要么靠开源方案做得到、要么硬件已经领先。学术界甚至已在安卓真机上跑通了原型——PowerInfer-2 在一加 12 上把一个 47B 稀疏模型跑到了 11.68 token/s,靠的是缓存命中率 96–98%。所以"技术上能不能做到"答案是能,卡的是量产化的那三项硬骨头。
安卓在推理引擎、缓存、量化、内存、闪存五项上做得到甚至已领先,真正卡死的只有上面三项,且①②是结构性的。苹果的护城河不是某一项单点技术、更不是堆硬件,而是垂直整合让所有构件互相适配——这是判断竞争格局时最该看清的一点。
20B 对用户的价值要分两层说清——苹果拿出实证的,和合理但尚无实证的推断。
表现力语音 TTS:可定制 Siri 语音,MOS 4.15 vs 上代 3.87;会话语音 4.24 vs 3.82。
系统级高精度听写:整体质量偏好 44.7% vs 17.6%,七个维度全胜。
更长上下文的本地处理(整篇文档、长对话不上云);更复杂的本地多步推理;更多语言与专业领域覆盖。
注:图像理解 >61%、文本 45.6% 官方均署名 3B Core,非 20B。
关键在于:这些质量过去要联网上云才有,现在本地就能用——离线、隐私、且不像云端那样受网络波动影响而衰减。对用户而言,这是"大模型质量"第一次稳定地装进口袋。
苹果的 Foundation Models 框架让开发者几行 Swift 代码就能调用端侧模型,且系统按硬件自动选档(开发者不用、也不能手动指定 20B),还支持结构化输出(类型安全)、工具调用、多轮会话、图像输入,并提供 LoRA adapter 工具包。最关键的是零 API 成本——本地推理不花钱、不限量、保护隐私。
这形成一个自我强化的飞轮:零成本 → 更多应用接入 → 用户更黏 → 生态更强 → 吸引更多开发者。每一环都自我强化,苹果不需要持续补贴就能让生态自转——这正是平台型护城河的典型形态。
20B 需 12GB 内存,只有 iPhone 17 Pro/Pro Max/Air 等高端机解锁,成为牵引用户升级旗舰的卖点。
端侧模型与 iOS 深度绑定、与个人数据本地结合,越用越离不开苹果生态,迁移成本升高。
高频任务在端侧零边际成本处理,替代原本要付费的云端调用,长期省下可观 OPEX。
需要诚实标注:上述"分层/留存/成本"是基于公开事实的研究员判断,非苹果明说;其中"省云成本"的成立前提,是任务确实在端侧高频运行——若多数重任务仍走云端,这条逻辑会打折。
把三方价值叠在一起,"为什么做 20B"的答案就完整了:它同时是用户的全能本地助手、开发者的零成本平台、苹果的硬件与生态护城河。任何单独一方都不足以解释这次投入,三方价值同时成立才是根本动因。
更深一层的战略动机(研究员判断):抬高端侧能力的天花板、为多模态时代提前卡位、在 AI 叙事上重新夺回主动权。有机构评论称 AFM 3 是苹果 AI 的"实质性正面重置"——在经历上一代 Apple Intelligence 的平淡反响后,这一代被视为苹果重新证明其端侧 AI 决心的信号。
先泼一盆冷水:并非所有任务都需要 20B。三组学术证据都指向同一点——在边界明确的窄任务上,把模型从中等规模再做大,收益迅速衰减。
72B→110B
而 0.5→7B 时能涨 16%
9B→27B(微调后)
几乎打平
8B vs 14B
F1 0.53 vs 0.50
但必须严格限定:这只对窄任务成立。通用推理、长程任务执行的能力,仍随规模持续提升——有专门研究反驳"全面递减"是一种测量假象。所以正确的结论不是"大模型没用",而是"窄任务上小激活够用,大容量的价值在别处",这恰好为苹果"按需激活 1–4B"的设计提供了依据。
既然窄任务不需要大模型,20B 的大容量价值体现在哪?四个方向:
覆盖更多冷门事实,随参数近单调增长,小模型记不住长尾。
小语种、方言能力需要更大容量承载,是大模型的明显优势区。
多步推理能力约在 13B 阈值附近涌现,小模型难以稳定完成。
还有一项是多模态视觉深度——更大容量能承载更细致的图像理解。
大容量的价值在于抬高质量上限、拓宽覆盖广度;而稀疏激活让这份容量的开销保持可控——这正是 20B 路线的意义:要的是容量带来的上限,不是每次都全跑的开销。
就算 120B 模型,4-bit 量化后也才约 60GB,而 iPhone 闪存有 1–2TB,装得绰绰有余。模型再大也"装得下"。
带宽:模型从闪存搬进内存这条路很窄,内存比闪存快 19–130 倍。
内存:DRAM 装的是「激活缓存」而非整个模型;越大命中率越高、越少回闪存。
密集 70B 从手机闪存仅 1.8–3.4 token/s → 不可用;稀疏激活(active≤4B)是端侧扩容的唯一可行解。
这里要澄清一个容易误解的点(这也是研究中一处关键修正):稀疏模型并不需要把整个模型放进内存,内存里装的只是这次激活用到的那一小块加常驻的共享专家,相当于一个缓存。所以内存大小限制的不是"能装多大模型",而是缓存命中率——内存越大、要的权重越可能已在内存里、越少去慢速闪存捞。PowerInfer-2 的实测印证了这点:靠 96–98% 的缓存命中率,才让 47B 稀疏模型在手机上跑到 11.68 token/s。
既然瓶颈是搬运速度,那闪存升级能不能解局?这是判断"安卓何时可能追上、苹果会不会进一步做大"的关键变量。
| 规格 | 发布 | 顺序读带宽 | 意义 |
|---|---|---|---|
| UFS 4.0 / 4.1 | 2022 / 2025 | 约 4.2 GB/s | 当前安卓旗舰主流 |
| 苹果 NVMe(iPhone) | — | 实测约 1.5–3 GB/s | 顺序读反而低于 UFS 4.0 |
| UFS 5.0 | 2026-02 发布 | 约 10.8 GB/s | 带宽翻倍 + 省电约 40% |
UFS 5.0 三星已宣布 2026 Q4 量产、最大 1TB,预计 2027 年初 Galaxy S27 系列首发。它把安卓闪存顺序带宽推到当前 iPhone 的两倍以上,对"闪存按需换权"这条路是直接利好——这意味着苹果在闪存带宽上不仅没优势,明年还会被安卓反超。这进一步印证:苹果的护城河不在硬件单点,而在垂直整合。
会扩,但有节制——更可能在稀疏激活框架内稳步上探(如 30–40B 但激活仍 ≤4B),而非无限做大;端侧参数有自然上限。本判断仅就手机端侧模型,不含云侧。
1B 激活档的表现力语音、高精度听写已落地、有官方数据支撑——这部分是实打实到手的。
满血 20B 的更大容量更像是为多模态时代储备;其完整价值尚待第三方验证。
代价单列:20B 级端侧能耗/续航苹果未公开(待夏季技术报告);12GB 门槛把它锁在高端机;2026 年内存涨价推高物料成本(BOM)。商业上待观察:上一代 Apple Intelligence 并未明显拉动换机与付费意愿(调研显示仅约 3% 用户表示愿付费)——这是悬在"对苹果价值"判断上的最大问号,下一章会作为最硬的反方展开。
最硬的一条反方:上一代 Apple Intelligence 并未明显拉动换机与付费——多家机构观察一致,调研显示仅约 3% 用户愿为其付费。如果 20B 这代重蹈覆辙,那么"三方价值成立"判断中"对苹果"那一环就会落空,整个"为什么做"的逻辑会被削弱为"技术领先但商业落空"。
第二条:苹果重任务重度依赖云端(Private Cloud Compute 与定制 Gemini),且 Federighi 对成本敏感。这意味着端侧路线可能克制而非激进——不应假设苹果必然持续把端侧参数做大。
第三条:窄任务上 3–4B 已够用(见 3.1)。若多数日常任务并不需要 20B,那么这颗大模型的实际使用频率存疑,"对苹果省云成本"的逻辑也随之打折。
若苹果夏季技术报告显示 20B 实际能耗/续航代价过高,或第三方横评显示 20B 相对 3B 增量有限,则"对用户价值"判断需下调。这是本研究主动设定的降级触发。
这份研究经过多轮红队对抗和用户质疑,以下五处早期判断已被推翻或修正,列出以示论证的诚实:
| 信息缺口 | 影响 | 补全后判断如何升级 |
|---|---|---|
| 20B 级端侧能耗/续航无独立实测 | 影响"代价"评估 | 续航达标则"押注未来"部分坐实 |
| 苹果零第三方横评 | 偏好率仅对自家基线 | 可判断 20B 真实竞争力 |
| 三个云模型参数未公开 | 端云分工不明 | 得到完整端云协同图景 |
| 安卓量产闪存换入时间点 | 影响竞争窗口判断 | 确认苹果领先窗口长度 |
本报告为公司战略研究件,受众为战略部总裁,目的是说清"苹果为什么做 20B 端侧模型、对三方的价值、以及安卓能否复制"。研究经过完整的深度流程(立项 → 分析角度 → 深度研究 → 核心判断 → 红队对抗 → 叙事框架 → 逐页设计 → 事实溯源自检),并经多轮补充研究修正。
课题演变:最初设想为"端云界面命题",经用户校正聚焦为"为什么做 20B + 三方价值",最终收敛为三章结构(做了什么 / 对谁有价值=为什么做 / 更大参数的想象与边界),后又应需求补充"安卓能否复制"的全链条技术拆解。
切入角度:时间轴(端侧模型三代演进)、横向对比(vs 安卓阵营/Gemini Nano)、技术机制(IFP 稀疏激活)、价值链(用户/开发者/苹果三方)。
以下为本报告关键事实的可核验来源,按来源类型分组,均可点击跳转原文。
苹果官方一手
学术原始研究
规格与媒体