标题华为发布昇腾960超节点,以光互联支撑十万亿大模型

华为发布昇腾960超节点,以光互联支撑十万亿大模型

9月17日,华为全联接大会2026在上海启幕。华为副董事长、轮值董事长汪涛在主题演讲中发布全球首个采用NPO(近封装光学)技术的超节点——昇腾960超节点。该产品专为加速十万亿参数规模的大模型训练与推理而设计,标志着AI基础设施架构正从传统服务器堆叠向系统级光互联演进。

华为昇腾960超节点发布:业界首个采用NPO的超节点,支持十万亿大模型训练和推理
华为昇腾960超节点发布:业界首个采用NPO的超节点,支持十万亿大模型训练和推理

随着大模型参数量迈向十万亿级别,传统以铜缆和铜线为主的电互联方案面临功耗高、延迟大和扩展性受限的瓶颈。华为此次引入的NPO技术,简单理解是将光收发模块从交换机面板上“搬”到芯片封装附近,大幅缩短电信号传输路径,从而降低信号损耗并提升传输密度。昇腾960超节点正是基于这一原理,将光技术下沉至节点内部。

在具体架构上,昇腾960超节点基于“灵衢+Hi-ONE”打造。灵衢是华为的全光组网技术,Hi-ONE则是其自研的NPO光引擎。据公开信息,这是业界首个量产的NPO产品,总容量达7.2T,也是目前同类产品中唯一实现内置光源的方案。通过正交架构和全液冷设计,昇腾960超节点基于灵衢实现内存统一编址,可扩展至4096卡规模,实现8EFLOPS的FP8算力和16EFLOPS的FP4算力。

从成本和稳定性维度看,这一架构展现出了明显的代际优势。传统超大规模集群在构建同等规模的互联能力时,需要大量可插拔光模块。昇腾960超节点通过部署5500个Hi-ONE,替代了原本所需的4.8万颗800G光模块。这一替换直接使系统功耗降低超过550千瓦,同时系统无故障运行时间提升一倍,系统可用度达到99.8%。对于面临高昂电费和频繁宕机风险的AI训练任务而言,运维成本和稳定性将得到实质性改善。

除算力节点外,华为此次还将超节点理念延伸至通用计算和存储领域。在通算系统方面,华为推出鲲鹏超节点,基于灵衢全光组网最大支持4096个节点,形成256TB统一内存池。据业内人士分析,这一设计主要面向AI Agent应用场景,可为Agent提供更高密度的沙箱运行环境、更快的启动速度以及更优的向量检索性能。在存储端,华为发布了OceanStor M900集群,该方案基于灵衢UnifiedBus总线,支持“一跳直连”的L3.5层PB级KV缓存,旨在解决大模型推理过程中的长上下文显存瓶颈问题。

在单节点能力提升的基础上,华为进一步展示了向超大规模集群扩展的能力。多个昇腾960超节点可通过灵衢网络或RoCE协议连接,构建最大规模达51.2万卡的集群。结合多轨道拓扑技术,最终可支持100万卡规模的昇腾超节点集群。据国际市场调研机构IDC于2026年8月发布的《全球AI基础设施演进预测报告》显示,到2028年,全球将有超过30%的大模型训练任务在十万卡以上规模的集群中运行。华为此次公布的百万卡级扩展能力,为未来更大参数规模的模型预训练预留了硬件空间。

在底层芯片研发节奏上,汪涛透露了昇腾系列的最新路线图。昇腾960芯片研发进度超出预期,性能实现倍增。其中,昇腾960DT(训练版)较原目标提前三个季度,预计于2027年第一季度准备就绪;昇腾960PR(推理版)将于2027年第三季度准备就绪。未来,昇腾芯片将保持一年一代的演进节奏,计划在2028年和2029年陆续推出昇腾970和昇腾980芯片,依靠架构创新实现算力规格的持续翻倍。

尽管华为在系统级互联和芯片迭代上展现出强劲势头,但行业竞争与生态挑战依然存��。当前,全球头部云服务商如谷歌、微软及Meta均在自研基于以太网或光互联的集群网络架构,试图在AI算力军备竞赛中占据主导权。据半导体分析机构SemiAnalysis于2026年7月发布的《全球AI芯片供应链报告》指出,算力集群的硬件规模优势仅是基础,软件栈的成熟度与开发者生态的繁荣度同样是决定硬件利用率的关键因素。华为昇腾生态在软件易用性、算子库完备度以及跨厂商硬件兼容性方面,仍需在激烈的市场竞争中经受大规模商业化的持续检验。

华为此次通过NPO技术的规模化商用,将光互联从数据中心机房间推进至节点内部,展示了以系统架构创新缓解芯片制造瓶颈的路径。随着大模型训练对算力集群规模的要求不断攀升,底层网络拓扑的代际更迭将成为AI基础设施行业的核心竞争点。昇腾960超节点的发布,不仅是单一产品的升级,也意味着AI算力基础设施建设正加速向“光铜协同”的新阶段迈进。

本文由AI辅助生成

分享到: