2026年,深圳华强北的电子市场里出现了一种新物种:巴掌大小的铝合金盒子,内置一颗10瓦功耗的芯片,却能运行千亿参数的大语言模型。这个需求在OpenClaw等端侧模型兴起后被推向高点。联想在此基础上推出了AI主机P7,长城电脑发布了N90Pro AI PC。一个全新的硬件品类正在成形——Agent Computer:专为AI设计的硬件载体。

这类端侧设备的心脏,是一颗存算一体芯片,来自一家叫做后摩智能的公司。这家公司成立6年,其大算力存算一体芯片M50于2025年初流片,2026年2月正式量产。M50在10瓦功耗下提供160TOPS算力,可以运行几百亿到千亿参数的大模型。2026年上半年,后摩智能收到了超出预期的客户订单,客户名单从联想、长城延伸到运营商的通信AI RAN、陪伴机器人公司,以及一批正在深圳涌现的Agent硬件公司。

后摩智能CEO吴强表示,存算一体解决的核心问题是能效比——同等面积下算力更大、带宽更大。传统芯片的工作方式像跑车必须在仓库和赛道之间往返拉货,AI计算数据量爆炸时,数据搬运成为瓶颈。存算一体的思路是:既然搬数据是瓶颈,那就不搬了,把计算直接放到存储内部去做。吴强打过一个比方:GPU通用性更好,但让存算一体芯片做神经网络,不管是CV还是大模型,都比GPU干得好。

2020年底吴强决定创业时,中国半导体正处于国产替代狂热期,壁仞科技、摩尔线程等十几家公司扎堆讲“中国英伟达”的故事,合计融资超百亿。朋友劝吴强直接做GPU国产替代,但他判断:“如果我也去做GPU,刚开始会容易点,但长期来说很难有差异化。”他选择了存算一体,因为更接近落地和商业化。彼时存算一体仍停留在学术论文中,天使轮融资时很多投资人都听不懂。

转变发生在2023年,大模型爆发后,吴强判断未来一定有很多物理场景需要在本地跑大模型,因为传输成本、隐私和时延问题,大模型端边推理一定是趋势。2023年下半年,后摩用第一代产品适配了智谱GLM-6B模型,发现存算一体跑大模型效果出奇地好。2024年初,大算力存算一体芯片M50开始研发。

从Token经济学角度看,吴强认为端边推理和云端推理的成本结构有本质区别:云端推理是持续消耗的成本结构,用的越多付费越多;端边推理是一次性硬件投入,零边际成本。设备购买后,所有推理任务在本地完成,无Token消费、无调用次数限制,相当于一个“免费Token工厂”。存算一体架构改变Token生产成本的逻辑在于:低功耗、高效率推理让Token生成成本降低;更重要的是,在端边功耗和成本敏感的场景下,存算一体让足够大的大模型运行变成可能。

吴强认为,未来的主流模式更可能是“端云协同”,系统自动判断任务该由端侧还是云端处理,在成本、性能和体验之间找到平衡点。他判断,中国未来“Token出海”是一个很大的机会:国产开源模型加国产芯片,绝对能力可能做不到海外SOTA水平,但通过性价比一定能覆盖到国际舞台。后摩智能的海外客户都是做端边智能设备的,他们喜欢这种本地的“免费Token工厂”——小巧、不依赖网络、足够智能。

关于竞争,吴强表示,存算一体的好处是后摩与巨头在同一起跑线上。英伟达那套东西已经走得很深了,要用存算一体这种颠覆性技术意味着把原来的东西通通打破,历史包袱太重。而后摩从零开始,没有包袱,整个架构都是存算一体。他认为,随着大模型普及,算力超过百T的端边大模型芯片会逐渐成为主导,在这块后摩是先行者。未来端边芯片公司可能不超过5家,每家都有自己的主战场。