华为昇腾 910B 机架式服务器搭载华为新一代昇腾 910B AI 处理器,是昇腾 910 的升级版本,采用增强版达芬奇架构,单芯片 FP16 算力提升至 320 TFLOPS / INT8 算力 640 TOPS,显存容量翻倍至 64GB HBM3,全面对标国际高端 AI 加速卡,是新一代国产 AI 算力旗舰平台。
核心规格
- NPU:华为昇腾 910B(达芬奇架构升级版)
- 制程工艺:7nm+
- AI 算力:FP16 320 TFLOPS / INT8 640 TOPS / BF16 320 TFLOPS(单芯片)
- 功耗:350W(单芯片)
- 显存:64GB HBM3(带宽 1536 GB/s)
- 互联:HCCS 2.0,带宽 448 GB/s
- 配套 CPU:华为鲲鹏 920B / 海光 8000
- 软件栈:CANN 7.0+ + MindSpore 2.0+ / PyTorch 2.x(原生支持)
机架式服务器平台特性
- 机箱规格:2U / 4U / 8U 标准 19 英寸机架式
- NPU 配置:单机 4~8 颗昇腾 910B
- 主板平台:华为自研服务器主板(鲲鹏 / 海光平台)
- 内存:DDR5-4800 ECC RDIMM,512GB~2TB
- 存储扩展:8~16 个 PCIe 5.0 NVMe SSD 热插拔位
- 电源配置:1+1 冗余热插拔电源(2200W~6000W 80 PLUS 钛金)
- 散热设计:前→后定向风道,部分型号液冷冷板
- 远程管理:华为 iBMC + Redfish API + KVM-over-IP + 虚拟媒体
- 网络接口:双 100/200GbE(RoCEv2 RDMA)
相比昇腾 910 的升级
- FP16 算力从 256 TFLOPS 提升至 320 TFLOPS(+25%)
- INT8 算力从 512 TOPS 提升至 640 TOPS(+25%)
- 新增 BFloat16 训练加速,算力 320 TFLOPS
- 显存从 32GB HBM2 升级为 64GB HBM3
- 显存带宽从 1024 GB/s 提升至 1536 GB/s
- HCCS 互联带宽从 392 GB/s 提升至 448 GB/s
- 原生支持 PyTorch 2.x,降低迁移门槛
软件生态
- AI 框架:MindSpore 2.0+ / PyTorch 2.x(原生支持)/ PaddlePaddle
- 开发工具链:CANN 7.0+ Toolkit + ATC + Profiler + 调试工具
- 大模型支持:支持千亿参数大模型训练与推理
- 操作系统:EulerOS / openEuler / 麒麟 V10 / 统信 UOS
- 集群管理:MindCluster + K8s + Volcano + MindX DL 深度学习平台
典型应用场景
- 千亿参数大语言模型训练与微调
- 多模态 AI 大模型训练(视觉 + 语言)
- AI 推理服务集群(大规模部署)
- 自动驾驶端到端模型训练
- 政务/金融 AI 智能服务平台
推荐配置
- 大模型训练型(8U):鲲鹏 920B + 2TB DDR5 ECC + 8×昇腾 910B + 16×7.68TB PCIe5 NVMe + 1+1 6000W
- 训练推理一体型(4U):鲲鹏 920B + 1TB DDR5 ECC + 4×昇腾 910B + 8×3.84TB NVMe + 1+1 3000W
- 推理服务型(2U):海光 8000 + 512GB DDR5 ECC + 2×昇腾 910B + 4×1.92TB NVMe + 1+1 2200W
华为昇腾 910B 机架式服务器以 64GB HBM3 显存和 BFloat16 训练加速,在国产 AI 算力领域对标国际高端 GPU,单机 8 卡可提供超过 5 PFLOPS 的 FP16 算力和 512GB 显存池,是构建国产化大模型训练基础设施的核心平台。