当前位置:首页 >  科技 >  互联网 >  正文

华为发布昇腾960超节点:首个采用 NPO 技术,2027 年就绪

 2026-09-17 18:49  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

A5站长网9月17日消息,第十一届华为全联接大会 2026 在上海开幕。华为副董事长、轮值董事长汪涛在主题演讲中宣布,业界首个采用 NPO 技术的昇腾960超节点正式发布,单个超节点为 4096 卡规模,最大可提供 8E FP8 算力,HBM 容量达到 1PB。芯片侧,面向训练的昇腾 960DT 比原计划提前三个季度,将于 2027 年第一季度就绪;面向推理的 960PR 提前一个季度,2027 年第三季度就绪。风冷与液冷版本会在 2027 年内陆续上市。

超节点可以理解成用高速互联协议把一批计算节点绑成逻辑上的一台计算机,具备跨物理节点的统一内存编址能力。华为给出的仿真数据是:同样组成 10 万卡集群,以 4096 卡超节点为基本单元,相比约 1.25 万台传统 8 卡服务器,模型算力利用率可以达到后者的 2.75 倍。传统架构下集群内通信会吃掉超过 40% 的训练时间,这解释了华为为什么把大模型训练推向十万亿参数时选了这条路线。

系统的核心部件是芯片,关键则在互联。华为发布的光互联产品 Hi-ONE 采用 NPO(近封装光学)形态,单引擎传输容量 7.2T,华为称这是业界首个量产的 NPO 产品,也是目前唯一实现内置光源的 NPO 产品。配合灵衢 UnifiedBus 总线协议,它把昇腾超节点、鲲鹏超节点和 KV 缓存集群这些子系统平等连起来,减少协议转换开销。华为同时在光互联标准组织 OIF 提出了 NPO 标准立项建议。

同场升级的还有鲲鹏超节点与存储。鲲鹏超节点基于灵衢全光组网,最大支持 4096 节点,形成最高 256TB 的统一内存池。在 Agent 沙箱场景里,十万级沙箱的启动速度比传统服务器方案提升 30 倍,沙箱密度还有 25% 的余量;百亿千维的复杂向量检索效率实现倍增。存储侧,华为推出基于灵衢、支持一跳直连的 PB 级 KV 缓存系统 OceanStor M900,用混合介质加 Retention 算法把 SSD 读写寿命提升 16 倍。面向长序列推理的缓存,被单独当成一层基础设施来建。

集群规模是这次公布的另一个数字。通过二层 CLOS 四平面组网,昇腾超节点集群最大可到 51.2 万卡;叠加多轨道拓扑技术,最大可支持百万卡规模的昇腾超节点集群。汪涛明确了演进节奏:昇腾系列坚持一年一代,2028 年推出昇腾 970,2029 年推出昇腾 980,算力规格继续翻倍,访存带宽、访存容量与互联带宽同步提升。

落地进度也在会上披露:昇腾 910C 超节点已部署超过 1000 套,客户超过 370 家,昇腾 950 超节点进入规模商用。生态方面,鲲鹏全球开发者超过 416 万,CANN 进入常态化开源社区运营,昇腾覆盖 90 多个主流第三方社区,并成为 PyTorch 官方支持的技术路线。汪涛对趋势的判断是,大模型参数正快速迈向 10 万亿,2030 年将达到 100 万亿以上;中国每日推理 token 已增长到约 500 万亿,2030 年进入百万万亿级。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

热门排行

信息推荐