华为把 Ascend 960DT 提前三个季度,并推出业界首个基于 NPO 的 SuperPoD
2026年9月17日,华为在上海 HUAWEI CONNECT 2026 上给出了两张时间表。第一张是芯片:Ascend 960DT 将于 2027 年第一季度可用,比原路线图提前三个季度;Ascend 960PR 提前一个季度,落在 2027 年第三季度;2028 与 2029 年,Ascend 970 与 980 依次推出。华为轮值董事长王涛在主题演讲里给出的说法是,昇腾系列已经进入一年一代的节奏。第二张表是系统:Atlas 960E SuperPoD 发布,华为称之为业界首个基于近封装光学(NPO)的 SuperPoD。芯片提前,系统也换了底座,这两件事在同一场发布会里出现,指向的不是单点性能,而是把成千上万颗芯片连成一台机器的工程能力。
先看光学这条线,因为它是这次发布里最具体的一块。华为把基于近封装光学的下一代光互连产品命名为 Hi-ONE,即高密度光互连节点引擎,采用自研技术并做了光、机、电、磁、热的多物理场设计,单个引擎的传输容量为 7.2 Tbit/s。华为的说法是,这是业界首个可以量产的 NPO 产品,也是首个内置光源的 NPO 产品。和统一总线结合起来,它要解决的是 SuperPoD 内外互连的扩展难度。华为近期已经向光互连论坛(OIF)提交了一份关于近封装光学的实施协议,并称收到了产业伙伴的广泛正面反馈。
这块光学技术直接决定了 Atlas 960E 的形状。单个 Atlas 960E SuperPoD 最多可扩展到 4096 颗 NPU,提供 8 EFLOPS 的 FP8 算力,HBM 容量最高 1 PB。真正值得注意的是它用了 5500 个 Hi-ONE 单元,而按传统方式连接这些 NPU 需要 48000 个 800G 光模块。华为给出的结论是这使功耗下降超过 550 千瓦,同时把系统无故障运行时间翻倍,达到 99.8% 的系统可用性。换句话说,NPO 的价值不在于单引擎跑得更快,而在于它把互连器件数量降了一个数量级,而互连器件的数量直接决定了大集群的功耗、故障点和布线复杂度。对于几万卡规模的训练集群,这三项都是做实之后才敢谈的成本。
芯片路线图之外,华为这次还补了一块过去相对薄弱的短板:面向智能体的内存与上下文存储。TaiShan 950 SuperPoD 被全面升级,基于统一总线全光网络,最多支持 4096 个节点,统一内存池最高 256 TB。华为给出的三组对比是:沙箱密集型负载下,10 万个沙箱的启动速度比传统服务器快 30 倍,沙箱密度还能再提升 25%;在 100 亿条 1000 维向量的向量检索上,搜索效率是传统服务器的两倍。同时发布的 OceanStor M900 是面向上下文的内存存储集群,为智能体推理提供多级 KV 缓存,支持一跳直达,在 L3.5 层提供 PB 级缓存,并称通过混合介质与优化后的保留算法把 SSD 读写寿命延长了 16 倍。这些指标的共同点是它们都在回答同一个问题:当模型上下文越来越长、智能体越开越多,谁来装这些中间状态。
把系统拼起来的是 SuperCluster。它用统一总线把多种互连协议收敛成一套统一协议,显著降低协议转换开销,从而在 Ascend SuperPoD、Kunpeng SuperPoD 与 KV 缓存集群之间实现点对点互连,目标是支撑十万亿参数级模型的训练与推理。华为还引用其 Markov Lab 的仿真结果:用 4k NPU 的 SuperPoD 构建十万卡集群,相比用 8 卡服务器构建的十万卡集群,MFU 可提升 2.75 倍。这里有一个必须一并说清楚的反面信息。科技分析师 Rui Ma 在社交平台上指出,华为此前曾表示 Atlas 960 SuperPoD 将扩展到 15488 颗 Ascend 960 芯片,而本周发布中提到的是 4096 颗,她的评价是芯片本身提前了很多,但宣布的 SuperPoD 比原本规划的规模小得多。这个差额是理解这次发布的关键之一:路线图提前与系统规模缩水同时发生,不能只引用其中一半。
🤔 常见问题解答
Ascend 960DT 什么时候可用?
2027 年第一季度,比华为原路线图提前三个季度,原来的计划是 2027 年第三季度。Ascend 960PR 从原计划提前一个季度,落在 2027 年第三季度。华为称昇腾系列已进入一年一代的节奏,2028 与 2029 年将分别推出 Ascend 970 与 980。
Atlas 960E SuperPoD 的规模是多少?
单集群最多可扩展到 4096 颗 NPU,提供 8 EFLOPS 的 FP8 算力,HBM 容量最高 1 PB,使用 5500 个 Hi-ONE 单元替代传统的 48000 个 800G 光模块,功耗下降超过 550 千瓦,系统可用性 99.8%。
Hi-ONE 是什么?
华为基于近封装光学(NPO)的下一代光互连产品,全称高密度光互连节点引擎,单引擎传输容量 7.2 Tbit/s。华为称其为业界首个可量产的 NPO 产品,也是首个内置光源的 NPO 产品,并已向光互连论坛(OIF)提交 NPO 实施协议。
这次发布有什么需要留意的地方?
科技分析师 Rui Ma 指出,华为此前称 Atlas 960 SuperPoD 将扩展到 15488 颗 Ascend 960 芯片,而本次发布提到的是 4096 颗,即芯片明显提前但 SuperPoD 规模远小于原规划。引用这次发布时,提前与缩水两面都需要一并说明。
🛠️ 推荐工具
总结
2026年9月17日,华为在上海 HUAWEI CONNECT 2026 发布多项 AI 计算技术与产品。芯片方面:Ascend 960DT 将于 2027 年第一季度可用,比原路线图提前三个季度;Ascend 960PR 提前一个季度至 2027 年第三季度;华为称昇腾系列进入一年一代节奏,Ascend 970 与 980 将分别在 2028 与 2029 年推出。系统与光学方面:发布业界首个基于近封装光学的 Atlas 960E SuperPoD,单集群最多 4096 颗 NPU、8 EFLOPS FP8 算力、最高 1 PB HBM,用 5500 个 Hi-ONE 光学引擎替代传统的 48000 个 800G 光模块,功耗下降超 550 千瓦,系统可用性 99.8%;Hi-ONE 单引擎传输容量 7.2 Tbit/s,华为称其为业界首个可量产、首个内置光源的 NPO 产品,并已向 OIF 提交 NPO 实施协议。内存与存储方面:TaiShan 950 SuperPoD 升级至最多 4096 节点、统一内存池最高 256 TB,10 万沙箱启动速度比传统服务器快 30 倍、沙箱密度再提升 25%,百亿条千维向量检索效率为传统服务器两倍;OceanStor M900 提供 L3.5 层 PB 级 KV 缓存,称将 SSD 读写寿命延长 16 倍。集群方面:SuperCluster 用统一总线收敛多种互连协议,支撑十万亿参数级模型;华为引用 Markov Lab 仿真称 4k NPU SuperPoD 构建的十万卡集群 MFU 相比 8 卡服务器方案提升 2.75 倍。需一并说明的反面信息:科技分析师 Rui Ma 指出该 SuperPoD 规模从原规划的 15488 颗芯片缩减为本次公布的 4096 颗。本文所有数据均来自华为官方主题演讲页面与 AP、TechCrunch 报道,无推测内容。
来源链接:Huawei: Advancing the Agentic World, Building a Solid Silicon Foundation (HUAWEI CONNECT 2026 keynote)
TechCrunch: Huawei plans Q1 2027 launch of new AI chip as it takes on Nvidia
AP: Huawei unveils new chip technologies as Chinese firm steps up the AI race with Nvidia