在世界人工智能大会WAIC期间,灵汐科技正式推出自研类脑超节点集群产品——LynAInfra(灵琍),瞄准当前AI推理领域的两大核心痛点:能耗过高推理延迟偏高。该公司宣称,其产品在推理能效比上较传统GPU方案提升3-10倍,首token延迟可压缩至几十到百毫秒级别,为国产高速推理赛道开辟了一条全新路径。

当前AI行业面临明显瓶颈:尽管GPU不断迭代,传统芯片架构的底层局限仍难以突破,而推理需求正迎来爆发式增长。据行业预测,未来推理业务将占据AI基础设施市场80%以上的份额。随着Token经济兴起,AI编程加速、AI视频生成、多智能体协同等高价值场景对推理时延和使用成本提出更高要求,GPU方案运营开销大、首token延迟偏高的短板愈发突出。英伟达布局Groq加码高速推理赛道,也印证了行业正在急切寻找推理架构革新方案。

灵汐科技依托自研类脑芯片的存算一体、事件驱动、众核并行先天特质,打造了LynAInfra类脑高性能超节点,对标创新版Groq。该产品由灵汐科技完全自主研发,基于国内已实现规模化商用落地的类脑芯片构建。其核心产品LynAInfra128算力柜搭载128张HP640系列板卡,单柜级联数千颗类脑芯片,释放近100P@FP16算力,整机功耗控制在30kW以内。

在互联架构上,LynAInfra依托自研LynxLink高速互联协议以及统一内存地址编译技术,既支持单机柜算力提升(Scale up),也可多机柜横向扩展(Scale out),打破单卡、单节点显存和算力上限,适配不同体量的大模型部署任务。设备采用风冷散热方案,模块化设计兼容现有智算中心机柜、供电、网络配套设施,大幅降低客户部署改造成本。多机柜之间可以做到无感级联,轻松承载超大模型运行任务。

从产业价值看,LynAInfra128凭借架构级节能优势,用30kW功耗撑起近100P算力,有助于减少算力使用过程中的碳排放,助力智算中心绿色建设,响应国家双碳战略。对于企业客户而言,该方案可显著降低大模型推理的单位算力开销,缩减整体拥有成本,助力大模型落地于产业数字化、城市治理、前沿科研等场景。更深层次来看,整套方案坚持国产自主创新路线,摆脱国外算力架构束缚,加固国产算力供应链安全。灵汐科技此举不仅为高速推理市场带来新选择,也可能推动类脑计算在AI基础设施领域的商业化进程。