华为自研光引擎Hi-ONE的首个落地场景已经明确——千卡级超节点。在不久前的CIOE上,海思展示了这颗带宽能力达7.2T的光引擎,并透露Hi-ONE将以NPO(Near-Packaged Optics,近封装光学)形式进入下一代超节点。华为称,这是全球首个采用NPO的AI智算超节点。
NPO的选择与电信号传输路径直接相关。随着芯片侧高速接口速率不断提升,从电芯片到光引擎之间的电连接越长,信号越容易出现衰减和失真,信号完整性挑战越大。传统可插拔光模块需要让高速电信号在PCB板上走较长距离,而CPO(Co-Packaged Optics,共封装光学)则将光引擎与主芯片更紧密绑定。华为锚定的NPO试图在带宽、时延和可维护性之间寻找平衡,将高速电连接压缩至约5厘米。
在随后举行的华为全联接大会上,华为进一步公布了Hi-ONE在下一代超节点中的部署情况:5500颗Hi-ONE将替代4.8万颗800G可插拔光模块,进入4096卡昇腾960超节点;跨柜灵衢互联设备支持176个1.6T端口,单机全光互联带宽约280T。
不过,公开信息仍以规模和性能参数为主。雷峰网近期对话光通信产业人士,试图厘清Hi-ONE进入昇腾960超节点之后,哪些技术路径已经可见,哪些仍待解答。
Hi-ONE并非今年才出现。早在2025年IFOC讯石光通信大会上,海思就已披露这颗光引擎采用内置共享集成光源和硅光芯片。按7.2T容量计算,一颗Hi-ONE对应9个800G可插拔光模块,所需光源和光器件数量随之大幅减少。与之直接相关的是Hi-ONE内置的共享多波长集成光源:多条发射路径可以共用光源资源,无需分别配置独立光源。同时,不同波长的光可通过WDM(Wavelength Division Multiplexing,波分复用)架构复用到同一根光纤中,以减少光纤数量。
但公开信息并未进一步解释,在这套共享多波长设计中,发射侧到底有多少个发光单元、使用多少个波长,又如何分配给36条发射通道。更值得注意的是,在硅光材质上做内置光源,在业内极其罕见。业内人士J叔关心的正是这一层,他认为这些配置最终都会牵动传输距离、面积、功耗、散热以及冗余设计等工程代价。
硅光芯片本身不会发光,需要激光器点亮。为了让光源尽量远离服务器内部更复杂的热环境,以及避免光源损坏后难以单独更换,不少方案会选择将激光器放置在光引擎外。光芯片产业人士David也表示,在当下的NPO方案中,内置光源并不是常见选择。不过在他看来,华为的不同寻常也是顺理成章的事——既然已经舍弃传统可插拔光模块、选择把光引擎推到主芯片附近,华为显然希望进一步提高系统集成度,并尽可能压缩光互联占用的物理空间。如果激光器仍然独立部署在外,系统就还得另外给光源腾位置,削弱NPO在集成度上的优势。
另一个待解问题是7.2T带宽如何被系统拆开使用。Hi-ONE共储备36条光收发通道,单通道速率最高可达200G,总带宽高达7.2T。但这只是单颗Hi-ONE的总传输能力。将视野放大至整套超节点,Hi-ONE集成的7.2T总带宽具体如何被系统使用,成为另一个问题。
在比较华为同期公布的几组参数时,J叔首先注意到,业内6.4T NPO更常见的通道组合是32×200G,Hi-ONE却选择了36×200G。一种直观猜想是,36条通道中存在冗余设计。结合跨柜灵衢互联设备的176个1.6T端口,J叔做了一次算术拆分:按200G单通道计算,一个1.6T端口对应8条通道,32条正好分成4组,36条却无法被8整除。照此推演,J叔认为36条通道可以被理解为32+4,其中32条承担常态通信,4条平时待命,在主通道故障时接替工作。如果这一假设成立,7.2T就是全部物理通道的容量,系统平时实际用于传输数据的只有6.4T。
但J叔随即指出,这种推演会和其他信息相矛盾。华为称5500颗Hi-ONE可替代4.8万个800G光模块,但按7.2T计算,5500个引擎的总带宽约为39.6Pb/s,与4.8万个800G模块的38.4Pb/s相比略有富余;如果每颗引擎只有6.4T可用,总带宽约为35.2Pb/s,又不足以完成这一替代。换句话说,华为的口径更像是按36条通道全部承载流量来计算的。此外,32条中预留4条约12.5%的备份比例,在功耗和面积上代价不小。业内更常见的做法是少量预留,或者在数据传输出错时重新发送这段数据来应对故障。
不过,J叔同时强调,由于Hi-ONE贴近NPU部署,首先连接的是柜内灵衢互联刀片,而非跨柜灵衢互联设备,且华为并未公开176个1.6T端口是否同样采用Hi-ONE,因此拿两个不同层级的参数做整除只是一种推演方式。他指出,36条通道也可能会按照柜内NPU与灵衢交换设备之间的连接关系,被分配到不同链路,或者只是华为在芯片、光引擎和交换设备都由自己定义的前提下自行选择的宽度,不必受限于行业标准的32通道规格。仅凭36×200G、1.6T端口这些公开信息,还无法反推出Hi-ONE在超节点中的真实连接方式。
在核心系统上坚持全栈自研的同时,华为并未一味筑高墙。华为联合中国移动研究院、京东云、百度以及光器件、连接器头部厂商启动OPEN NPO项目,主动建设行业通用标准。这意味着,华为还需要重新划定一条边界——哪些设计可以牢牢攥在自己手里,哪些关键接口必须摆上台面,要求所有参与者共同遵循。这种收放自如的底气,来自华为近30年在光网络上的积累。
过去,华为的光通信能力更多服务于骨干网、城域网和数据中心等大型通信网络,解决的是长距离、大带宽的数据传输。进入AI智算时代,越来越多计算芯片被塞进同一套系统,高带宽互联的需求也开始向更短距离延伸。Hi-ONE正是在这样的变化中加入昇腾超节点,直接参与高速互联。由此,华为原本分散在不同业务线上的能力,也在超节点里完成了一次会师:昇腾负责输出算力,灵衢组织机内与机间的高速连接,Hi-ONE则负责光侧链路的物理延伸,最终共同组装出完整的超节点系统。
David指出,这些原本需要产业链上下游不同企业反复协商、彼此适配的环节,现在全都掌握在华为自己手里,这意味着华为无需等待一套全行业统一的标准。但不是所有人都是华为。David以阿里、腾讯为例,这些云厂商同样在布局NPO和超节点光互联,却没有华为这样完整的硬件链条,因此更需要先定义好系统和互联侧的需求,再让不同供应商围绕同一套规格开发产品。
今年国内外围绕NPO的标准动作越来越密集。除了华为联合启动的OPEN NPO项目,由Coherent、Marvell、Molex等产业链厂商发起的Open CPX MSA(Multi-Source Agreement,多源协议),已在9月发布的1.0规范中将6.4T、7.2T以及不同光源方案纳入同一套Socket和管理框架;国际光通信产业组织OIF也已启动面向下一代NPO模块的正式标准项目,该提案由中国信通院联合华为、腾讯、阿里云、美团、中国移动等产业方推动立项,覆盖6.4T和12.8T、单通道200G,并计划进一步统一机械外形、电气接口、供电、液冷和光连接等关键接口。
但一个生态内部需要共同规则,并不等于NPO最终一定要走向大一统。David认为,不同于传统可插拔光模块需要适配不同服务器和交换机,当NPO服务于超节点内部这一相对封闭的Scale-Up(纵向扩展)场景时,多套接口规范长期并存,并不妨碍不同系统各自运行。这也决定了供应商更现实的选择。J叔直言,生态需要生意来构建,卖给谁,就跟随谁。