由加州理工學院研究團隊創立的 PrismML 公司,近日正式釋出了名為 Bonsai 27B 的開源推理模型。這個擁有 270 億引數的模型,其最引人注目之處並非引數規模本身,而是它被壓縮到了足以在 iPhone 上本地執行的尺寸——最小版本僅約 3.9 GB

Bonsai 27B 基於阿里巴巴的 Qwen3.6-27B 模型開發,並採用了極端的壓縮技術。通常,一個 270 億引數的模型需要約 54 GB 的儲存空間,即便經過常規壓縮也仍需約 18 GB。PrismML 的做法是將每個神經網路權重的表示精度從常見的 16 位大幅降低至 1 位或略低於 2 位,從而實現了兩個輕量級版本:一個約 5.9 GB,面向筆記型電腦;另一個約 3.9 GB,專為智慧手機設計,其大小足以裝入 iPhone 17 Pro Max 有限的記憶體中。考慮到 iPhone 的 12 GB RAM 中僅約 6 GB 可供單個應用使用,這種壓縮程度至關重要。

在效能方面,PrismML 的自有基準測試顯示,壓縮對模型能力的影響有限。在 15 項基準測試中,較大的筆記本版本保留了原始模型 95% 的效能,而更小的手機版本則保留了 90%。尤其值得關注的是,數學和程式設計相關的得分幾乎未受影響。效能下降較為明顯的領域主要集中在更激進的 1 位壓縮版本上,特別是影像理解、指令遵循和基於智慧體的工具使用等任務。在效率上,1 位版本的 Bonsai 每 GB 的“智慧密度”達到了 0.530,遠超三元和 FP16 模型。

在實際執行表現上,白皮書資料顯示,較小的模型版本在 iPhone 17 Pro Max 上可實現每秒約 11 個 token 的生成速度。電池續航測試表明,每消耗 1% 的電量可生成約 672 個 token,據此推算,滿電狀態下可生成約 6.7 萬個 token。不過,晶片在持續執行超過五分鐘後會出現輕微的效能限制。

PrismML 認為,現代 AI 應用越來越需要在本地執行強大模型。一個智慧體可能連續進行數百次模型呼叫,若在雲端執行,每次呼叫都會產生 token 成本、網路延遲,並且螢幕內容、文件等隱私資料都會離開裝置。而端側執行可將這些迴圈的邊際成本降至零,並確保使用者資料留在本地,這為常駐智慧體、離線助手和混合系統奠定了基礎。簡單和隱私敏感的任務留在裝置端,只有最複雜的步驟才傳送到雲端的前沿模型處理。

CNBC 報道,蘋果公司已就 Bonsai 背後的壓縮技術與 PrismML 進行接觸。PrismML 執行長 Babak Hassibi 證實,蘋果及其他公司正在測試這些模型的速度、功耗和效能,並稱談判處於“非常早期”階段,但“進展順利”。對蘋果而言,獲得授權的壓縮技術意義重大。在 2026 年全球開發者大會(WWDC) 上,蘋果釋出了基於與谷歌合作開發的 Gemini 技術重構的 Siri,但其自研模型在基準測試中仍落後於競爭對手。目前,其最強大的端側模型已要求 iPhone 至少配備 12 GB RAM,複雜查詢仍需依賴雲端輝達 GPU。Bonsai 的技術若被採納,或能幫助蘋果縮小在端側 AI 能力上的差距。

該模型的權重已根據 Apache 2.0 許可協議開放,可通過蘋果的 MLX 框架在蘋果裝置上執行,也支援 輝達 GPU。PrismML 還提供了限時免費的開發者預覽 API 和 HuggingFace 上的線上演示。公司創立時獲得了 Khosla Ventures、Cerberus 和谷歌的支援,三星也持續為其提供支援。PrismML 的下一步計劃是將壓縮技術應用於谷歌的 Gemma 模型系列。