蘋果正在探索一條讓強大AI模型直接在iPhone上執行的新路徑。據CNBC報道,蘋果正與一家由加州理工學院孵化的矽谷公司PrismML進行早期技術評估洽談,後者聲稱已能將阿里巴巴開源大模型通義千問大幅壓縮,使其在消費級手機上完整執行。

PrismML執行長Babak Hassibi向CNBC透露,公司已將通義千問模型從約54GB壓縮至不足4GB,記憶體佔用降至原來的十五分之一,從而讓全部270億引數能在iPhone 15及更新機型上本地執行。Hassibi將雙方接觸描述為“非常早期的階段”,目前尚不清楚會走向何方,但“進展順利”。蘋果未對此置評。

這一技術動向恰逢蘋果向公眾推送iOS 27公測版,首次大規模開放經過長期重構的Siri。蘋果正試圖讓Siri在與OpenAIAnthropic的助手競爭中更具吸引力,同時將更多個人資訊和AI處理留在裝置端。PrismML的技術恰好對準了蘋果AI戰略的核心約束:當前最強大的模型通常需要過多記憶體和算力,難以在智慧手機上執行。

PrismML的壓縮方法並非簡單的模型剪枝或量化。據Hassibi介紹,其核心在於大幅簡化模型內部資訊的儲存方式——將每個數值從16位元壓縮至僅1或3種可能取值,從而顯著降低儲存和運算所需記憶體。他將其類比為晶片行業從8位計算邁向4位計算,但走得更遠。該公司稱,壓縮後的模型記憶體佔用降低10至15倍,響應生成速度提升6至8倍,能耗降低3至6倍,且均基於現有硬體實現。

不過,壓縮也帶來效能折損。Hassibi坦承,模型整體效能通常會下降幾個百分點,其中事實回憶能力衰退較明顯,而推理、數學和程式設計等技能相對穩健。PrismML已免費釋出兩個壓縮版模型,設計用於iPhoneMacBook及搭載輝達晶片的PC等日常裝置。

產業分析師對此持審慎樂觀態度。Creative Strategies總裁Carolina Milanesi指出,更小的模型能讓蘋果將計算攝影、影片生成以及依賴敏感個人資料的健康與健身工具等更復雜的功能遷移到iPhone本地。“能在裝置端處理得越多越好,”她強調,尤其涉及使用者希望保密的健康和用藥資料時。Asymco創始人Horace Dediu則認為,蘋果的目標並非單純降低記憶體佔用,而是在同等物理限制下塞進更強大的模型,讓絕大多數常見Siri互動留在本地,僅將最複雜的任務交給雲端。

但技術落地仍面臨關鍵考驗。Counterpoint Research研究總監Tarun Pathak提醒,模型在長提示詞下的表現、多工場景的電池消耗,以及面對數百萬次請求、數千種裝置組合時的可靠性,才是真正的試金石。IDC客戶端處理器研究負責人Phil Solis則指出,功耗可能是最大的未知數——即便記憶體需求降低,一個足夠強大、能頻繁甚至持續在後台執行的模型仍可能快速耗盡手機電量。

PrismML的技術源自Hassibi在加州理工的研究團隊,大學持有底層專利並獨家授權給該公司。今年3月,PrismML完成1625萬美元種子輪融資,由Khosla Ventures等參投。Hassibi表示,谷歌的開源模型Gemma將是下一個壓縮物件,之後會瞄準更大規模的模型,包括目前通常需要資料中心硬體才能執行的前沿實驗室模型。該公司認為,這項技術最終可延伸至手機和筆記型電腦之外,進入機器人、自主系統等需要快速本地決策的領域。

此次洽談正值業界圍繞AI效率提升是否會最終減少對記憶體晶片和昂貴資料中心基礎設施需求的激烈辯論之際。若端側模型壓縮技術成熟並大規模普及,可能從結構上改變雲端推理算力的增長曲線,並對HBM高頻寬記憶體等關鍵零部件的長期需求敘事產生深遠影響。對蘋果而言,其軟硬體一體化的設計能力——從iPhone晶片到作業系統的垂直整合——可能為這類壓縮模型的部署提供獨特優勢,但PrismML的技術主張仍需在受控演示之外得到大規模驗證。