华为发布全球首个NPO光引擎超节点昇腾960,支持百万卡AI集群与8EFLOPS FP8算力

SmartHey9月17日消息,今日,华为全联接大会2026在上海正式开幕。大会上,华为重磅发布全球首个基于NPO(Near-Packaged Optics)光引擎技术的超节点——昇腾960超节点,全面加速十万亿参数规模大模型的训练与推理进程。

随着大模型参数量持续突破十万亿级,传统AI基础设施面临带宽、功耗与扩展性瓶颈。超节点由此成为构建下一代超大规模AI算力底座的关键架构。其核心设计理念在于:通过统一协议实现集群内所有计算、存储与网络组件的平等互联;支持跨物理服务器的全局内存一致访问;并采用“近铜远光”的混合互连策略——近距依赖高密度铜缆,远距则由高性能光互连承载,兼顾延迟、带宽与能效。

华为同步推出业界首款量产NPO光引擎Hi-ONE。作为当前行业传输能力最强的NPO产品,其单模块总带宽达7.2Tbps,并首次在NPO封装内集成激光光源,真正实现“光源内置”,大幅简化系统光路设计与运维复杂度。

在汪涛现场发布中,昇腾960超节点被明确为全球首个搭载Hi-ONE光引擎的超节点系统。该节点采用正交式硬件架构与全液冷散热设计,依托灵衢(Lingqu)智能无损网络,实现跨节点内存统一编址与毫秒级低时延访问,单节点最高可扩展至4096颗昇腾AI芯片,提供8EFLOPS(FP8)与16EFLOPS(FP4)峰值AI算力。

实测数据显示:一个昇腾960超节点以5500颗Hi-ONE光引擎,替代传统方案所需的48,000颗800G光模块,在同等算力下降低整机功耗超550千瓦;系统平均无故障运行时间(MTBF)提升一倍,整体可用性达99.8%,显著加快前沿大模型迭代与业务落地节奏。

值得一提的是,华为将超节点范式延伸至通用计算领域,全新升级鲲鹏超节点。该节点基于灵衢全光组网架构,最大支持4096个通用计算节点,构建256TB规模的统一内存池,可为AI Agent提供更高密度的隔离沙箱、亚秒级沙箱启动能力,以及更优的向量检索吞吐与响应性能。

此外,华为发布面向大模型KV缓存场景的OceanStor M900集群解决方案。该方案基于灵衢UnifiedBus高速总线,支持L3.5层级“一跳直连”架构,实现PB级键值缓存的低延迟、高并发访问,有效缓解大模型推理中的缓存墙问题。

多个昇腾960超节点可通过灵衢网络或RoCE协议灵活互联,构建超大规模超节点集群。借助二层CLOS四平面组网架构,集群最大可扩展至51.2万张AI加速卡;进一步融合多轨道动态拓扑调度技术后,最终支持百万卡级昇腾超节点集群,为未来千亿Agent协同与超长上下文大模型提供坚实算力基座。