是什麼

端側 AI(on-device AI)指把模型部署在終端裝置本地執行,而不是把請求發往雲端伺服器。承載它的裝置包括手機、筆記本、智慧眼鏡、耳機、汽車座艙與各類物聯網終端。

為了塞進這些裝置,端側模型必須經過一整套壓縮工序:量化把權重從 32 位浮點降到 8 位甚至更低位元;知識蒸餾用大模型的輸出訓練小模型;剪枝去掉冗餘引數;再針對具體晶片做運算元融合與編譯最佳化。蘋果公開的技術資料裡,其端側模型約 30 億引數、權重被量化到 2 位——這個組合很能說明端側工程的取捨強度。

為什麼重要

端側 AI 的價值可以壓縮成四條,每條都對應雲端做不到的事。

隱私。資料不離開裝置,就不存在傳輸洩露、服務商留存、跨境合規這些問題。相簿、簡訊、健康資料、通話錄音這類內容,本來就不該為了做一次摘要而上傳。蘋果把隱私作為 Apple Intelligence 的核心賣點,正是基於這一點:大量功能在裝置上私密處理,僅在必要且獲得許可時才使用安全的雲端處理。

延遲。省掉一次網路往返,響應可以從幾百毫秒降到幾十毫秒。對輸入法聯想、即時字幕、語音喚醒這類互動,這個差別決定了體驗能否成立。

可用性。地鐵、飛機、地下車庫、境外漫遊——網路不可靠的場景比想象中多。

成本。端側推理不按 token 計費。對需要持續後台執行的功能(照片自動分類、通知摘要),這是唯一能算得過賬的方式。

代價同樣明確:能力上限低。蘋果自己就直白地說明,其端側模型面向摘要、抽取、分類這類任務,不面向世界知識與高階推理——那些仍屬於伺服器級模型的領域。指望端側模型回答冷門事實、做長鏈推理或寫長文,方向就錯了。

在 AI 產業鏈中的位置

端側 AI 橫跨模型層與終端硬體:向下它對晶片層提出 NPU 算力、記憶體頻寬與低功耗的具體要求,推動了AI PC 的 NPU 門檻與手機 SoC 的 AI 單元競賽;向上它是應用層功能的底座,也是AI 眼鏡這類極低功耗裝置唯一可行的本地智慧方案。開放權重生態是它的重要供給來源——大量端側模型直接基於開源小模型微調而來,Ollama 這類工具則把同一套思路帶到了個人電腦上。

各家在做什麼

國內手機廠商的端側佈局在 2026 年 7 月有了一個統一的公開參照。據財聯社報道,網信辦於 2026 年 7 月 15 日釋出了首批 7 款手機端側生成式人工智慧服務的備案資訊:蘋果的 Apple 智慧、華為小藝大模型、OPPO AndesGPT 大模型、vivo 藍心端側大模型、小米澎湃 AI、三星蓋樂世 AI、努比亞豆包大模型。這是手機端側模型服務首次納入生成式人工智慧服務備案體系。

各家的路線略有差別。蘋果在 2025 年通過 Foundation Models 框架把約 30 億引數的端側模型開放給第三方應用,與 Swift 深度整合,支援結構化輸出與工具呼叫,隨 iOS 26 一代系統提供。vivo 的藍心(BlueLM)走的是多檔位策略,從十億級的純端側模型到百億級的端雲兩用模型再到雲端主力模型分層覆蓋。OPPO 的 AndesGPT 同樣按引數量分檔,由排程策略決定請求落在端還是雲。華為與小米則把端側能力與各自的系統助手(小藝、澎湃 AI)繫結。

共同點是「端雲協同」:簡單請求本地處理,複雜請求上雲。這個設計合理,但也提醒使用者注意一件事——隱私優勢只在請求確實走端側那條路時才成立,而具體走哪條路,通常由系統自行決定且不顯式告知。

侷限

除了能力上限,還有幾個現實約束值得知道。模型常駐會佔用可觀記憶體,低配裝置上可能被系統回收,導致首次呼叫要重新載入。持續推理會明顯影響續航與機身溫度,廠商因此常在後台設定限流。模型更新依賴系統或應用更新,節奏遠慢於雲端,端側模型「過時」的速度比雲端快得多。而在多語言、專業領域這些長尾能力上,端側與雲端的差距是結構性的,短期內不會靠工程最佳化抹平。