是什么

端侧 AI(on-device AI)指把模型部署在终端设备本地运行,而不是把请求发往云端服务器。承载它的设备包括手机、笔记本、智能眼镜、耳机、汽车座舱与各类物联网终端。

为了塞进这些设备,端侧模型必须经过一整套压缩工序:量化把权重从 32 位浮点降到 8 位甚至更低比特;知识蒸馏用大模型的输出训练小模型;剪枝去掉冗余参数;再针对具体芯片做算子融合与编译优化。苹果公开的技术资料里,其端侧模型约 30 亿参数、权重被量化到 2 位——这个组合很能说明端侧工程的取舍强度。

为什么重要

端侧 AI 的价值可以压缩成四条,每条都对应云端做不到的事。

隐私。数据不离开设备,就不存在传输泄露、服务商留存、跨境合规这些问题。相册、短信、健康数据、通话录音这类内容,本来就不该为了做一次摘要而上传。苹果把隐私作为 Apple Intelligence 的核心卖点,正是基于这一点:大量功能在设备上私密处理,仅在必要且获得许可时才使用安全的云端处理。

延迟。省掉一次网络往返,响应可以从几百毫秒降到几十毫秒。对输入法联想、实时字幕、语音唤醒这类交互,这个差别决定了体验能否成立。

可用性。地铁、飞机、地下车库、境外漫游——网络不可靠的场景比想象中多。

成本。端侧推理不按 token 计费。对需要持续后台运行的功能(照片自动分类、通知摘要),这是唯一能算得过账的方式。

代价同样明确:能力上限低。苹果自己就直白地说明,其端侧模型面向摘要、抽取、分类这类任务,不面向世界知识与高级推理——那些仍属于服务器级模型的领域。指望端侧模型回答冷门事实、做长链推理或写长文,方向就错了。

在 AI 产业链中的位置

端侧 AI 横跨模型层与终端硬件:向下它对芯片层提出 NPU 算力、内存带宽与低功耗的具体要求,推动了AI PC 的 NPU 门槛与手机 SoC 的 AI 单元竞赛;向上它是应用层功能的底座,也是AI 眼镜这类极低功耗设备唯一可行的本地智能方案。开放权重生态是它的重要供给来源——大量端侧模型直接基于开源小模型微调而来,Ollama 这类工具则把同一套思路带到了个人电脑上。

各家在做什么

国内手机厂商的端侧布局在 2026 年 7 月有了一个统一的公开参照。据财联社报道,网信办于 2026 年 7 月 15 日发布了首批 7 款手机端侧生成式人工智能服务的备案信息:苹果的 Apple 智能、华为小艺大模型、OPPO AndesGPT 大模型、vivo 蓝心端侧大模型、小米澎湃 AI、三星盖乐世 AI、努比亚豆包大模型。这是手机端侧模型服务首次纳入生成式人工智能服务备案体系。

各家的路线略有差别。苹果在 2025 年通过 Foundation Models 框架把约 30 亿参数的端侧模型开放给第三方应用,与 Swift 深度集成,支持结构化输出与工具调用,随 iOS 26 一代系统提供。vivo 的蓝心(BlueLM)走的是多档位策略,从十亿级的纯端侧模型到百亿级的端云两用模型再到云端主力模型分层覆盖。OPPO 的 AndesGPT 同样按参数量分档,由调度策略决定请求落在端还是云。华为与小米则把端侧能力与各自的系统助手(小艺、澎湃 AI)绑定。

共同点是「端云协同」:简单请求本地处理,复杂请求上云。这个设计合理,但也提醒用户注意一件事——隐私优势只在请求确实走端侧那条路时才成立,而具体走哪条路,通常由系统自行决定且不显式告知。

局限

除了能力上限,还有几个现实约束值得知道。模型常驻会占用可观内存,低配设备上可能被系统回收,导致首次调用要重新加载。持续推理会明显影响续航与机身温度,厂商因此常在后台设置限流。模型更新依赖系统或应用更新,节奏远慢于云端,端侧模型「过时」的速度比云端快得多。而在多语言、专业领域这些长尾能力上,端侧与云端的差距是结构性的,短期内不会靠工程优化抹平。