AIHub

昇腾 960 超节点发布的第二天:8 EFLOPS、1PB HBM 离你有多远,普通开发者接上国产算力的三条路

进阶约 13 分钟读完2026-09-18#华为昇腾#国产算力#NPO#CANN#vLLM#模型部署
昇腾 960 超节点发布的第二天:8 EFLOPS、1PB HBM 离你有多远,普通开发者接上国产算力的三条路

昨天(2026 年 9 月 17 日),华为全联接大会 2026 在上海开幕,轮值董事长汪涛交出了「韬定律」提出四个月后的最新答卷:昇腾 960 系列芯片研发进度超预期,960DT 提前三个季度到 2027 年一季度就绪,960PR 提前一个季度到 2027 年三季度,此后一年一代,970 排进 2028、980 排进 2029。

和芯片同步亮相的,是业界首个采用 NPO(近封装光学)技术的昇腾 960 超节点:单个超节点 4096 卡,最大提供 8 EFLOPS FP8 算力和 1PB HBM 容量,内部用 5500 个 Hi-ONE 光引擎替换了原本需要的 4.8 万颗 800G 光模块,功耗直降超 550 千瓦。华为马尔科夫实验室的仿真数据显示:用 4K 超节点构建 10 万卡集群,相比传统 8 卡服务器架构,MFU(算力利用率)提升达 2.75 倍——因为传统架构下集群内通信开销能吃掉训练总时长的 40% 以上。背景数据同样惊人:中国每日推理 Token 已到 500 万亿量级,昇腾 910C 超节点已部署超 1000 套,950 超节点规模商用。

但说实话,超节点是云厂商和大模型公司的战场。对普通开发者和小团队,真正的问题是:这股东风能怎么蹭?今天、用普通预算,怎么把模型跑在昇腾上? 本文给三条已验证可行的路径。

一、路径零成本体验:云上按卡时租昇腾

不用买卡,也不用等 960——现在商用的昇腾 910B/910C 已经够跑绝大多数推理和中小规模训练。三种租法按上手难度排:

  1. 华为云 ModelArts / 昇腾 AI 云服务:控制台选昇腾 910 系列资源池,镜像里预装 CANN 和 MindSpore,开一台昇腾推理实例和开普通 GPU 实例体验几乎一致;
  2. 各地智算中心 / 算力券:2026 年各省市智算中心普遍对中小企业发算力券,部分补贴比例能到 50%,申请门槛远比想象低,值得先查本地政策;
  3. 第三方平台:OpenCSG、趋动科技 OrionX 等聚合平台支持按小时租用昇腾资源,适合短期压测。

一个选型参考:纯推理场景(vLLM / MindIE 起服务)选 910B 单卡或 4 卡即可跑 70B 级量化模型;训练场景优先找带超节点架构的集群,因为超节点对 MFU 的提升对训练远比对推理重要。

二、推理部署:vLLM-Ascend 是你最熟的那套

好消息是昇腾生态最大的进步发生在软件层——你大概率不用学一套全新的框架。torch_npu 让 PyTorch 代码几乎零改动上昇腾,而 vLLM 官方社区的 Ascend 版本(vllm-ascend) 让你沿用熟悉的 OpenAI 兼容 API。

PyTorch 适配只需三行:

import torch
import torch_npu  # 把 CUDA 设备换成 NPU
device = "npu:0"
torch.npu.set_device(device)
# 原 CUDA 代码基本不动,torch.cuda.is_available() 换 torch.npu.is_available()

用 vllm-ascend 起一个 OpenAI 兼容服务:

pip install vllm vllm-ascend
vllm serve Qwen/Qwen3-32B --tensor-parallel-size 4 --device npu
# 之后 curl localhost:8000/v1/chat/completions 和 GPU 版完全一致

如果你的推理框架还没适配昇腾,华为官方的 MindIE(Mind Inference Engine)是兜底选项:支持主流开源模型的一键部署,提供 continuous batching 和量化能力,910B 上 Qwen 系列 32B 模型的吞吐已接近同价位 GPU 方案。

三、训练与微调迁移:一张对照清单

从 CUDA 迁到昇腾做训练/微调,坑主要不在算子而在生态细节。迁移前按这张清单自查:

环节 CUDA 世界 昇腾世界 注意点
框架 PyTorch + CUDA PyTorch + torch_npu 90% 代码不用改,10% 在自定义 CUDA kernel
微调工具 LLaMA-Factory / Axolotl ms-swift / LLaMA-Factory(已支持 NPU) LLaMA-Factory 加 --device npu 即可
算子库 FlashAttention-2 FlashAttention 已原生支持 NPU 老版本 FA 编译失败就先升级
分布式 NCCL HCCL 环境变量名不同,NCCL_ 前缀换成 HCCL_
精度 BF16 默认 BF16 支持完善,FP8 看芯片代际 910C 起 FP8 可用,960 才到 8 EFLOPS 级

实践上建议的路线:先用 ms-swift 或 LLaMA-Factory 在单卡上把 LoRA 微调跑通(这一步几乎无痛),再上多机多卡做全参训练。全参训练的分布式调试才是真考验,HCCL 的通信拓扑和超节点的互联架构强相关——这正是 960 超节点 NPO 互联要解决的痛点,租用带超节点架构的集群时优先确认网络配置是否已按 HCCL 最佳实践调优。

注意事项与常见问题

Q:现在是上昇腾的时机吗? 推理:是。vllm-ascend + torch_npu 的成熟度已经足够生产用,且在算力紧张、出口管制反复的背景下,国产算力是真实的备案与合规选项。训练:看规模,LoRA/中小规模全参可上,超大集群训练建议等有 960 超节点商用实例后再评估。

Q:CUDA 代码迁移成本到底多大? 纯 PyTorch 业务代码接近零成本;有自定义 CUDA kernel 的项目成本陡增,需要改写成 Ascend C 或找已有算子替代。迁移前先用 torch_npu 的兼容性检查工具扫一遍。

Q:云租用价格相比 GPU 如何? 910B 单卡时租价格普遍低于同代 A100/H100 的紧俏市场价,且供应稳定、排队短;但二手 GPU 市场价格波动大,长期租约建议两边都询价。

Q:超节点(SuperNode)和我有什么关系? 直接面向万亿参数训练和超大集群。它带来的 MFU 提升会间接降低云上训练单价,普通开发者享受的是「更便宜的租用价格」这个结果,而不是架构本身。

小结

9 月 17 日发布的昇腾 960 超节点把国产算力的叙事从「能替代」推向「在某些维度领先」:8 EFLOPS FP8、1PB HBM、NPO 光引擎替掉 4.8 万颗光模块、MFU 提升 2.75 倍。但落到开发者身上,行动清单其实很朴素:云上按卡时租一台 910 实例,用 import torch_npu 把现有 PyTorch 代码跑起来,用 vllm-ascend 起 OpenAI 兼容服务,微调优先走 ms-swift 或 LLaMA-Factory。国产算力不再是「备选方案」的标签,而是一个今天就能接进工作流的现实选项。

注:文中昇腾 960 超节点参数、芯片时间表及部署数据来自 2026 年 9 月 17 日华为全联接大会公开报道;云服务价格与可用机型以各平台实时页面为准。

相关教程

昇腾 960 超节点发布的第二天:8 EFLOPS、1PB HBM 离你有多远,普通开发者接上国产算力的三条路 | AIHub