2026年,深圳華強北的電子市場裡出現了一種新物種:巴掌大小的鋁合金盒子,內建一顆10瓦功耗的晶片,卻能執行千億引數的大語言模型。這個需求在OpenClaw等端側模型興起後被推向高點。聯想在此基礎上推出了AI主機P7,長城電腦釋出了N90Pro AI PC。一個全新的硬體品類正在成形——Agent Computer:專為AI設計的硬體載體。
這類端側裝置的心臟,是一顆存算一體晶片,來自一家叫做後摩智慧的公司。這家公司成立6年,其大算力存算一體晶片M50於2025年初流片,2026年2月正式量產。M50在10瓦功耗下提供160TOPS算力,可以執行幾百億到千億引數的大模型。2026年上半年,後摩智慧收到了超出預期的客戶訂單,客戶名單從聯想、長城延伸到運營商的通訊AI RAN、陪伴機器人公司,以及一批正在深圳湧現的Agent硬體公司。
後摩智慧CEO吳強表示,存算一體解決的核心問題是能效比——同等面積下算力更大、頻寬更大。傳統晶片的工作方式像跑車必須在倉庫和賽道之間往返拉貨,AI計算資料量爆炸時,資料搬運成為瓶頸。存算一體的思路是:既然搬資料是瓶頸,那就不搬了,把計算直接放到儲存內部去做。吳強打過一個比方:GPU通用性更好,但讓存算一體晶片做神經網路,不管是CV還是大模型,都比GPU幹得好。
2020年底吳強決定創業時,中國半導體正處於國產替代狂熱期,壁仞科技、摩爾線程等十幾家公司扎堆講“中國輝達”的故事,合計融資超百億。朋友勸吳強直接做GPU國產替代,但他判斷:“如果我也去做GPU,剛開始會容易點,但長期來說很難有差異化。”他選擇了存算一體,因為更接近落地和商業化。彼時存算一體仍停留在學術論文中,天使輪融資時很多投資人都聽不懂。
轉變發生在2023年,大模型爆發後,吳強判斷未來一定有很多物理場景需要在本地跑大模型,因為傳輸成本、隱私和時延問題,大模型端邊推理一定是趨勢。2023年下半年,後摩用第一代產品適配了智譜的GLM-6B模型,發現存算一體跑大模型效果出奇地好。2024年初,大算力存算一體晶片M50開始研發。
從Token經濟學角度看,吳強認為端邊推理和雲端推理的成本結構有本質區別:雲端推理是持續消耗的成本結構,用的越多付費越多;端邊推理是一次性硬體投入,零邊際成本。裝置購買後,所有推理任務在本地完成,無Token消費、無呼叫次數限制,相當於一個“免費Token工廠”。存算一體架構改變Token生產成本的邏輯在於:低功耗、高效率推理讓Token生成成本降低;更重要的是,在端邊功耗和成本敏感的場景下,存算一體讓足夠大的大模型執行變成可能。
吳強認為,未來的主流模式更可能是“端雲協同”,系統自動判斷任務該由端側還是雲端處理,在成本、效能和體驗之間找到平衡點。他判斷,中國未來“Token出海”是一個很大的機會:國產開源模型加國產晶片,絕對能力可能做不到海外SOTA水平,但通過價效比一定能覆蓋到國際舞台。後摩智慧的海外客戶都是做端邊智慧裝置的,他們喜歡這種本地的“免費Token工廠”——小巧、不依賴網路、足夠智慧。
關於競爭,吳強表示,存算一體的好處是後摩與巨頭在同一起跑線上。輝達那套東西已經走得很深了,要用存算一體這種顛覆性技術意味著把原來的東西通通打破,歷史包袱太重。而後摩從零開始,沒有包袱,整個架構都是存算一體。他認為,隨著大模型普及,算力超過百T的端邊大模型晶片會逐漸成為主導,在這塊後摩是先行者。未來端邊晶片公司可能不超過5家,每家都有自己的主戰場。