雅虎财经视频节目 In the Loop 主持人 Ejaaz Ahamadeen 在最新一期节目中分析了 Cerebras(CBRS)芯片与传统 AI 芯片的差异,并探讨了超快推理的市场机会。

Ahamadeen 指出,Cerebras 芯片将内存与 GPU 集成在一起,形成一个单一单元,因此从发送提示到模型运行的时间大幅缩短。这种设计虽然成本更高,但响应速度极快,能立即输出结果。他提到,Cerebras 芯片的内存容量约为 44GB,而当今现代模型的权重数据往往达到 数 TB 级别,因此仍需多块芯片协同工作。但如果企业愿意支付前期成本,就能以极快速度服务大量用户,这对 Jane Street 等公司极具价值。

Ahamadeen 将 Cerebras 的独特卖点概括为“销售更快的推理”。他进一步思考:快速推理的实际市场机会究竟有多大?是否仅限于 Jane Street 这类交易算法公司,还是其他行业也愿意为获得这种芯片支付溢价,以击败竞争对手并赚取丰厚利润?

为了直观展示速度差异,Ahamadeen 在节目中用演示对比了不同推理速度。普通 AI 模型的响应速度对一般用户已足够;英伟达(NVDA)的超快演示则快得多,眨眼间答案就已出现。但他指出,对普通用户而言,这种速度并非必需,也不值得为此每月支付 500 美元。然而,对于 Jane Street 这样的公司,毫秒甚至秒级的延迟可能意味着 数千万至数亿美元 的交易损失,因此速度至关重要。

Ahamadeen 展示了 Cerebras 超快推理达到 每秒 750 个 token 的效果,称其几乎在屏幕上瞬间出现,耗时仅 0.2 秒。而 Cerebras 的目标是达到 每秒 5000 个 token,在演示中显示为 0.0 秒,人类几乎无法感知。他强调,这些芯片的目标客户并非零售用户,而是那些时间至关重要的企业——延迟可能造成 数十亿至数百亿美元 的损失。

节目由 高通(QCOM) 赞助。Ahamadeen 的讨论还涉及 谷歌(GOOG) 等公司,但未展开具体细节。整体来看,Cerebras 正试图以超快推理在 AI 芯片市场中开辟差异化定位,专注于对延迟极度敏感的企业客户。