2026-04-10 09:27:51 +08:00
|
|
|
|
---
|
|
|
|
|
|
title: 机场智算中心技术方案
|
|
|
|
|
|
created: 2026-04-08
|
|
|
|
|
|
updated: 2026-04-10
|
|
|
|
|
|
type: solution
|
|
|
|
|
|
tags: [solution, gpu, liquid-cooling, tier, power, network]
|
|
|
|
|
|
sources: [raw/articles/ibm-airport-ai.md, raw/articles/shanghai-ai-computing-guidelines.md, raw/articles/headleo-aiDC-whitepaper.md, raw/articles/industrial-ai-computing-report.md, raw/articles/dubai-airport-huawei-dc.md, raw/articles/daxing-airport-vertiv.md, raw/articles/2025-airport-construction-summit.md]
|
|
|
|
|
|
---
|
|
|
|
|
|
|
2026-04-09 11:24:22 +08:00
|
|
|
|
# 机场智算中心技术方案
|
|
|
|
|
|
|
|
|
|
|
|
> 本方案综合整理自:中国信通院《人工智能算力基础设施赋能研究报告(2025)》、国信证券液冷专题报告、头豹研究院《2025年中国AIDC产业白皮书》、中国工业互联网研究院《工业智算发展研究报告(2025)》、临港算力液冷实践等
|
|
|
|
|
|
> 生成时间:2026-04-08
|
|
|
|
|
|
> 数据来源:详见附录
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 一、机场智算中心概述
|
|
|
|
|
|
|
|
|
|
|
|
### 1.1 定义
|
|
|
|
|
|
|
|
|
|
|
|
机场智算中心(Airport Intelligent Computing Center)是基于 GPU/NPU/ASIC 等异构算力芯片,为机场智能化应用提供**训练与推理**算力服务的专用基础设施。区别于传统数据中心,智算中心以**高性能集群**为核心载体,支撑大模型训练、AI推理、视频分析、智能决策等智能化负载。
|
|
|
|
|
|
|
|
|
|
|
|
### 1.2 与传统数据中心的核心差异
|
|
|
|
|
|
|
|
|
|
|
|
| 对比项 | 传统数据中心 | 智算中心 |
|
|
|
|
|
|
|--------|------------|---------|
|
|
|
|
|
|
| 核心负载 | ERP、Web、数据库 | AI 训练/推理、视频分析 |
|
|
|
|
|
|
| 算力芯片 | CPU 为主 | GPU/NPU 集群为主 |
|
|
|
|
|
|
| 单机柜功率 | 5-15 kW | 50-200+ kW |
|
|
|
|
|
|
| 散热方式 | 风冷为主 | **液冷为主** |
|
|
|
|
|
|
| 网络重点 | 南北向 | **东西向高速互联** |
|
|
|
|
|
|
| PUE 目标 | 1.4-1.6 | **≤1.25**(国家枢纽节点 ≤1.2) |
|
|
|
|
|
|
|
|
|
|
|
|
### 1.3 机场智算中心的典型应用场景
|
|
|
|
|
|
|
|
|
|
|
|
| 应用场景 | 具体内容 | 算力类型 |
|
|
|
|
|
|
|---------|---------|---------|
|
|
|
|
|
|
| 航班智能调度 | 基于大模型的航班延误预测、停机位优化 | 训练+推理 |
|
|
|
|
|
|
| 行李全流程追踪 | 计算机视觉识别、异常检测 | 推理为主 |
|
|
|
|
|
|
| 视频智能分析 | 航站楼安防/客流热力图分析 | 推理为主 |
|
|
|
|
|
|
| 语音客服机器人 | 旅客问答、多语言翻译 | 推理为主 |
|
|
|
|
|
|
| 飞机故障预测 | 时序数据分析、故障预警 | 训练+推理 |
|
|
|
|
|
|
| 机场数字孪生 | 物理仿真、实时渲染 | 训练+推理 |
|
|
|
|
|
|
| 智能驾驶舱/巡检 | 四足机器人视觉导航、障碍检测 | 推理为主 |
|
|
|
|
|
|
|
|
|
|
|
|
### 1.4 算力规模测算参考
|
|
|
|
|
|
|
|
|
|
|
|
根据《2025年中国人工智能计算力发展评估报告》:
|
|
|
|
|
|
|
|
|
|
|
|
- **2024年**:中国智算规模 725.3 EFlops(FP16),同比增长 **74.1%**
|
|
|
|
|
|
- **2025年预测**:中国智算规模将达 **1037.3 EFlops**,增长 43%
|
|
|
|
|
|
- **2023-2028年复合增长率**:智算 **46.2%**,通算 18.8%
|
|
|
|
|
|
|
|
|
|
|
|
机场智算中心规模建议:
|
|
|
|
|
|
|
|
|
|
|
|
| 机场规模 | 推荐智算规模 | GPU 卡数参考 |
|
|
|
|
|
|
|---------|------------|-------------|
|
|
|
|
|
|
| 千万级旅客以下 | 1-10 PFLOPS(FP16) | 64-512 卡 |
|
|
|
|
|
|
| 千万至两千万级 | 10-50 PFLOPS | 512-2048 卡 |
|
|
|
|
|
|
| 两千万级以上 | 50-200 PFLOPS+ | 2048-8000+ 卡 |
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 二、整体技术架构
|
|
|
|
|
|
|
|
|
|
|
|
### 2.1 智算中心系统架构
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌─────────────────────────────────────────────────┐
|
|
|
|
|
|
│ 应用服务层 │
|
|
|
|
|
|
│ 航班调度大模型 │ 行李追踪 │ 安防分析 │ 客服机器人 │
|
|
|
|
|
|
├─────────────────────────────────────────────────┤
|
|
|
|
|
|
│ 模型服务层 │
|
|
|
|
|
|
│ 推理引擎(vLLM/TGI)│ 微调框架 │ 模型仓库 │
|
|
|
|
|
|
├─────────────────────────────────────────────────┤
|
|
|
|
|
|
│ 训练平台层 │
|
|
|
|
|
|
│ 分布式训练框架(NCCL/昇腾集合通信)│ 数据管理 │
|
|
|
|
|
|
├─────────────────────────────────────────────────┤
|
|
|
|
|
|
│ 算力调度层 │
|
|
|
|
|
|
│ 算力调度器│ 作业管理│ 配额计费│ 碳排放管理 │
|
|
|
|
|
|
├─────────────────────────────────────────────────┤
|
|
|
|
|
|
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
|
|
|
|
|
|
│ │ GPU集群 │ │ GPU集群 │ │ CPU通用 │ │
|
|
|
|
|
|
│ │ (训练) │ │ (推理) │ │ 集群 │ │
|
|
|
|
|
|
│ └──────────┘ └──────────┘ └──────────┘ │
|
|
|
|
|
|
├─────────────────────────────────────────────────┤
|
|
|
|
|
|
│ 存储层 │
|
|
|
|
|
|
│ 分布式文件系统│ 分布式数据库│ 对象存储 │
|
|
|
|
|
|
├─────────────────────────────────────────────────┤
|
|
|
|
|
|
│ 网络层 │
|
|
|
|
|
|
│ Spine-Leaf │ RoCE v2 │ 400G/800G │
|
|
|
|
|
|
├─────────────────────────────────────────────────┤
|
|
|
|
|
|
│ 基础设施层 │
|
|
|
|
|
|
│ 供配电 │ 液冷系统 │ 机柜 │ 消防 │ 监控 │
|
|
|
|
|
|
└─────────────────────────────────────────────────┘
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
### 2.2 云边端协同架构
|
|
|
|
|
|
|
|
|
|
|
|
机场智算中心采用**云-边-端**三级协同架构:
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
云端(智算中心)
|
|
|
|
|
|
│
|
|
|
|
|
|
├── 训练集群:大规模长时训练任务
|
|
|
|
|
|
├── 推理服务:实时性要求不高的批量推理
|
|
|
|
|
|
└── 模型管理:模型训练、微调、版本管理
|
|
|
|
|
|
|
|
|
|
|
|
边缘(航站楼/塔台边缘节点)
|
|
|
|
|
|
│
|
|
|
|
|
|
├── 实时推理:时延敏感业务(客流分析、安防告警)
|
|
|
|
|
|
├── 数据汇聚:本地数据预处理
|
|
|
|
|
|
└── 断网自治:与云端断连时独立运行
|
|
|
|
|
|
|
|
|
|
|
|
端侧(摄像头、传感器、机器人)
|
|
|
|
|
|
│
|
|
|
|
|
|
├── 轻量推理:目标检测、异常初筛
|
|
|
|
|
|
└── 数据采集:原始数据上报
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
### 2.3 异构算力架构
|
|
|
|
|
|
|
|
|
|
|
|
机场智算中心建议采用**多元异构算力**架构,主流配置:
|
|
|
|
|
|
|
|
|
|
|
|
| 芯片类型 | 代表产品 | 适用场景 | 备注 |
|
|
|
|
|
|
|---------|---------|---------|------|
|
|
|
|
|
|
| GPU | NVIDIA H100/H200/B200 | 大模型训练、高性能推理 | 主流选择 |
|
|
|
|
|
|
| GPU | NVIDIA L20/L40S | 推理为主、中等规模 | 性价比方案 |
|
|
|
|
|
|
| NPU | 华为昇腾 910B | 国产化替代 | 昇腾生态 |
|
|
|
|
|
|
| NPU | 海光 DCU | 国产化替代 | 兼容 CUDA |
|
|
|
|
|
|
| ASIC | 寒武纪思元 | 特定推理场景 | 国产化 |
|
|
|
|
|
|
|
|
|
|
|
|
**推荐配置原则:**
|
|
|
|
|
|
- 训练集群:H100/H200(NVLink 互联)
|
|
|
|
|
|
- 推理集群:L40S 或国产 NPU(成本优化)
|
|
|
|
|
|
- 国产化要求:昇腾 910B 系列优先
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 三、液冷系统技术方案
|
|
|
|
|
|
|
|
|
|
|
|
> 液冷是智算中心高功率密度散热的**核心技术路线**,也是本方案的重点。
|
|
|
|
|
|
|
|
|
|
|
|
### 3.1 背景与政策要求
|
|
|
|
|
|
|
|
|
|
|
|
根据国家发改委等四部门《数据中心绿色低碳发展专项行动计划》(2024年7月):
|
|
|
|
|
|
|
|
|
|
|
|
| 指标 | 目标 |
|
|
|
|
|
|
|------|------|
|
|
|
|
|
|
| 全国数据中心平均 PUE | < 1.5(2025年底) |
|
|
|
|
|
|
| 大型/超大型新建数据中心 PUE | < 1.25 |
|
|
|
|
|
|
| 国家枢纽节点数据中心 PUE | ≤ 1.2 |
|
|
|
|
|
|
| 绿电占比(枢纽节点新建) | > 80% |
|
|
|
|
|
|
|
|
|
|
|
|
智算中心芯片功耗飞速增长,是液冷成为刚需的根本原因:
|
|
|
|
|
|
|
|
|
|
|
|
| 芯片/系统 | 功耗 | 散热方式 |
|
|
|
|
|
|
|---------|------|---------|
|
|
|
|
|
|
| CPU(英特尔至强 2000系列) | 450-500W/颗 | 风冷极限 |
|
|
|
|
|
|
| GPU(英伟达 A100) | 400W | 需液冷 |
|
|
|
|
|
|
| GPU(英伟达 H100) | 700W | 必须液冷 |
|
|
|
|
|
|
| GPU(英伟达 GB200) | 2700W/超级芯片 | 必须液冷 |
|
|
|
|
|
|
| GPU机架(2024年典型) | 130 kW/rack | 必须液冷 |
|
|
|
|
|
|
| GPU机架(2029年预测) | **> 1 MW/rack** | 全面液冷 |
|
|
|
|
|
|
|
|
|
|
|
|
### 3.2 液冷技术路线对比
|
|
|
|
|
|
|
|
|
|
|
|
液冷技术分为三大类:**冷板式**、**浸没式**、**喷淋式**。
|
|
|
|
|
|
|
|
|
|
|
|
#### 三类方案对比
|
|
|
|
|
|
|
|
|
|
|
|
| 对比项 | 冷板式液冷 | 浸没式液冷(单相) | 浸没式液冷(相变) |
|
|
|
|
|
|
|--------|----------|-----------------|-----------------|
|
|
|
|
|
|
| 成熟度 | ★★★★★ 最高 | ★★★★ 高 | ★★★ 中 |
|
|
|
|
|
|
| 服务器改动 | 冷板安装 | 需定制服务器 | 需定制服务器 |
|
|
|
|
|
|
| 维护便利性 | ★★★★ 较好 | ★★★ 一般 | ★★ 复杂 |
|
|
|
|
|
|
| 散热能力 | 强(覆盖CPU/GPU/显存) | 极强 | 极强(相变换热) |
|
|
|
|
|
|
| 单机柜密度 | 40-130 kW | 100-500 kW | 250-500+ kW |
|
|
|
|
|
|
| 初期投资 | 中等 | 较高 | 最高 |
|
|
|
|
|
|
| 运维成本 | 中等 | 较低 | 较高 |
|
|
|
|
|
|
| 适用场景 | **当前主流,推荐** | 高密度细分场景 | 超高功率特种场景 |
|
|
|
|
|
|
|
|
|
|
|
|
#### 冷板式液冷架构详解
|
|
|
|
|
|
|
|
|
|
|
|
冷板式液冷是**当前市场主流**,技术最成熟,对现有服务器生态改变最小。
|
|
|
|
|
|
|
|
|
|
|
|
**系统架构:**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
室内侧(一次侧冷源)
|
|
|
|
|
|
冷却塔 / 干冷器
|
|
|
|
|
|
↓(自然冷却/蒸发冷却)
|
|
|
|
|
|
冷水机组(可选,夏季备用)
|
|
|
|
|
|
↓
|
|
|
|
|
|
一次侧循环管路
|
|
|
|
|
|
|
|
|
|
|
|
↓ 板式换热器
|
|
|
|
|
|
|
|
|
|
|
|
室内侧(二次侧供液)
|
|
|
|
|
|
CDU(冷却分配单元)
|
|
|
|
|
|
↓
|
|
|
|
|
|
Manifold(液冷分配岐管)
|
|
|
|
|
|
↓
|
|
|
|
|
|
冷板(直接贴附于芯片)
|
|
|
|
|
|
↓
|
|
|
|
|
|
服务器内部:CPU冷板 + GPU冷板 + 内存冷板
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**关键设备参数:**
|
|
|
|
|
|
|
|
|
|
|
|
| 设备 | 功能 | 关键参数 |
|
|
|
|
|
|
|------|------|---------|
|
|
|
|
|
|
| CDU | 冷却液循环、温度控制 | 典型容量 200-400 kW,支持双路 |
|
|
|
|
|
|
| Manifold | 分液到各机柜 | 316L不锈钢,多路分配 |
|
|
|
|
|
|
| 冷板 | 直接接触芯片散热 | 接触面导热硅脂,微通道设计 |
|
|
|
|
|
|
| 一次侧管路 | 外部冷源连接 | 闭式循环,防冻液 |
|
|
|
|
|
|
| 二次侧管路 | 内部供液 | 快接接头,可维护设计 |
|
|
|
|
|
|
|
|
|
|
|
|
**冷却液选型:**
|
|
|
|
|
|
|
|
|
|
|
|
| 类型 | 冷板式常用 | 浸没式常用 |
|
|
|
|
|
|
|------|----------|----------|
|
|
|
|
|
|
| 冷却液 | 乙二醇/丙二醇溶液(防冻)| 氟化液、矿物油(硅油)|
|
|
|
|
|
|
| 去离子水 | 可用(需添加防冻剂)| 不可直接用于浸没 |
|
|
|
|
|
|
|
|
|
|
|
|
### 3.3 液冷方案推荐
|
|
|
|
|
|
|
|
|
|
|
|
#### 方案A:冷板式液冷(推荐新建机场智算中心)
|
|
|
|
|
|
|
|
|
|
|
|
**适用场景:** 单机柜功率 40-130 kW,预留升级空间
|
|
|
|
|
|
|
|
|
|
|
|
**配置建议:**
|
|
|
|
|
|
|
|
|
|
|
|
| 项目 | 参数 |
|
|
|
|
|
|
|------|------|
|
|
|
|
|
|
| 液冷占比 | 80-100%(全液冷) |
|
|
|
|
|
|
| 风冷辅助 | 仅用于网络设备、少量通用服务器 |
|
|
|
|
|
|
| PUE 目标 | ≤ 1.15(100%液冷)/ ≤ 1.25(80%液冷) |
|
|
|
|
|
|
| 单柜功率 | 上限 130 kW(GB200 NVL72 级别) |
|
|
|
|
|
|
|
|
|
|
|
|
**英伟达 GB200 NVL72 参考架构(Vertiv):**
|
|
|
|
|
|
- 单机柜功率:**130 kW**
|
|
|
|
|
|
- 架构:72 GPU + 36 CPU(Grace Blackwell)
|
|
|
|
|
|
- 散热:100% 冷板液冷
|
|
|
|
|
|
- 能耗节省:比传统风冷减少 **25%**
|
|
|
|
|
|
- 空间节省:减少 **75%** 机柜占地
|
|
|
|
|
|
- Vertiv 参考设计已获英伟达官方推荐
|
|
|
|
|
|
|
|
|
|
|
|
#### 方案B:风液融合(过渡期推荐)
|
|
|
|
|
|
|
|
|
|
|
|
**适用场景:** 从传统风冷向全液冷过渡,或单机柜功率 40-80 kW 的中期场景
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | 数值 |
|
|
|
|
|
|
|------|------|
|
|
|
|
|
|
| 风冷支持 | 最高 40 kW/柜 |
|
|
|
|
|
|
| 液冷支持 | 最高 150 kW/柜 |
|
|
|
|
|
|
| 特点 | 风液同源、动态平衡、灵活部署 |
|
|
|
|
|
|
|
|
|
|
|
|
Keydak 金盾 2025 年国际机场博览会发布的风液融合方案已在国内多个智算中心落地。
|
|
|
|
|
|
|
|
|
|
|
|
### 3.4 PUE 优化措施
|
|
|
|
|
|
|
|
|
|
|
|
|| 措施 | 效果 |
|
|
|
|
|
|
||------|------|
|
|
|
|
|
|
|| 全液冷替代精密空调 | PUE 从 1.5 降至 **1.15-1.25**(典型值) |
|
|
|
|
|
|
|| 冷通道封闭 | 减少冷热气流混合,节能 10-15% |
|
|
|
|
|
|
|| 自然冷却利用 | 冬季低温期配合液冷进一步降低 PUE |
|
|
|
|
|
|
|| 高效 UPS(模块化效率≥96%) | 降低供电损耗 |
|
|
|
|
|
|
|| AI 调优 | 实时调节液冷流量与温度 |
|
|
|
|
|
|
|
|
|
|
|
|
> **PUE 边界说明**:PUE = 1.0 为理想值(所有电力用于计算,无任何制冷/供电损耗)。实际智算中心 PUE 取决于:① 液冷比例(全液冷 vs. 风液混合)、② 当地气候条件(冬季低温期可大幅降低冷却功耗)、③ 供电效率(UPS/变压器损耗)。在典型机场气候条件下(无极端寒冷),全液冷 PUE 典型值为 1.15-1.25,接近 1.1 需要浸没式液冷 + 极寒气候 + 自然冷却配合。
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 四、算力集群技术方案
|
|
|
|
|
|
|
|
|
|
|
|
> **设计原则**:本章节遵循 **Scale-Up(节点内纵向扩展)+ Scale-Out(节点间横向扩展)** 双重扩展架构。Scale-Up 以 NVLink/NVSwitch 为核心解决节点内 GPU 全互联问题;Scale-Out 以 InfiniBand/RoCE 为骨干解决多节点集合通信问题。两层网络各有分工,共同支撑从单卡到万卡的算力扩展路径。
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.1 单节点硬件拓扑设计
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.1.1 GPU 节点架构演进
|
|
|
|
|
|
|
|
|
|
|
|
GPU 服务器节点从单卡到多卡的拓扑演进,核心矛盾是** PCIe 带宽瓶颈 vs. NVLink 直连带宽**:
|
|
|
|
|
|
|
|
|
|
|
|
|| 架构代际 | 代表产品 | GPU 互联方式 | 端口聚合双向带宽 | GPU 对等带宽 |
|
|
|
|
|
|
||---------|---------|------------|--------------|------------|
|
|
|
|
|
|
|| 第1代(2018)| V100 SXM2 | NVLink 1.0,6 链路 | 300 GB/s | 300 GB/s |
|
|
|
|
|
|
|| 第2代(2020)| A100 SXM4 | NVLink 3.0,12 链路 | 600 GB/s | 600 GB/s |
|
|
|
|
|
|
|| 第3代(2022)| H100 SXM5 | NVLink 4.0,18 链路 | 900 GB/s | 900 GB/s |
|
|
|
|
|
|
|| 第4代(2024)| B200 SXM | NVLink 5.0,18 链路 | **1.8 TB/s** | **900 GB/s** |
|
|
|
|
|
|
|| 第5代(预测)| Rubin Ultra | NVLink 6.0 | ~3.6 TB/s | ~1.8 TB/s |
|
|
|
|
|
|
|
|
|
|
|
|
**关键结论**:
|
|
|
|
|
|
|
|
|
|
|
|
- NVLink 5 端口聚合双向带宽 1.8 TB/s 是 NVSwitch Fabric 内部 18 链路的总带宽,**任意 GPU 到任意 GPU 的对等带宽仍为 900 GB/s 双向**
|
|
|
|
|
|
- H100 NVLink 4(900 GB/s)是 A100 PCIe 4.0 x16(64 GB/s)的 **14 倍**,因此多 GPU 节点必须走 NVLink/NVSwitch,不能走 PCIe 交换
|
|
|
|
|
|
- 表中第4代"1.8 TB/s"是聚合总带宽,不能与 H100 的"单 GPU 可用带宽 900 GB/s"直接对比
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.1.2 HGX H100/H200 8-GPU 系统拓扑
|
|
|
|
|
|
|
|
|
|
|
|
**NVIDIA HGX H100** 是当前最主流的 AI 训练服务器架构:
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌─────────────────────────────────┐
|
|
|
|
|
|
│ HGX H100 8-GPU Server │
|
|
|
|
|
|
│ │
|
|
|
|
|
|
CPU (AMD EPYC / Intel Xeon) │
|
|
|
|
|
|
│ × 2 │
|
|
|
|
|
|
│ │
|
|
|
|
|
|
PCIe Gen5 x16 (Host Bridge) │
|
|
|
|
|
|
│ │
|
|
|
|
|
|
┌──────────────────────────────────────────────┐ │
|
|
|
|
|
|
│ NVSwitch Fabric(6 芯片,2 平面) │
|
|
|
|
|
|
│ NVSwitch① ── NVSwitch② ── NVSwitch③ │
|
|
|
|
|
|
│ ↖ ↑ ↗ │
|
|
|
|
|
|
│ NVSwitch④ ── NVSwitch⑤ ── NVSwitch⑥ │
|
|
|
|
|
|
│ (全连接拓扑,任意GPU间单跳可达) │
|
|
|
|
|
|
└──────────────────────────────────────────────┘ │
|
|
|
|
|
|
│ │ │ │ │ │ │ │ │
|
|
|
|
|
|
GPU0 GPU1 GPU2 GPU3 GPU4 GPU5 GPU6 GPU7 │
|
|
|
|
|
|
H100 H100 H100 H100 H100 H100 H100 H100 │
|
|
|
|
|
|
SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 │
|
|
|
|
|
|
80GB 80GB 80GB 80GB 80GB 80GB 80GB 80GB │
|
|
|
|
|
|
HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 │
|
|
|
|
|
|
└────────── PCIe Gen5 ─────────┘ │
|
|
|
|
|
|
└────── InfiniBand / RoCE 网卡 ───────────────┘ │
|
|
|
|
|
|
└─────────────────────────────────┘
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**关键拓扑参数(HGX H100):**
|
|
|
|
|
|
|
|
|
|
|
|
|| 参数 | 规格 |
|
|
|
|
|
|
||------|------|
|
|
|
|
|
|
|| GPU 数量 | 8 × NVIDIA H100 SXM5 |
|
|
|
|
|
|
|| GPU 间 NVLink 带宽 | 900 GB/s 双向(全互联)|
|
|
|
|
|
|
|| NVSwitch 芯片数 | **6 片**(2 组各 3 片,全连接拓扑)|
|
|
|
|
|
|
|| NVSwitch 交换容量 | 25.6 Tb/s 每芯片 |
|
|
|
|
|
|
|| 单节点 BF16 算力(稀疏)| ~3,958 TFLOPS ≈ **4 PFLOPS** |
|
|
|
|
|
|
|| 单节点 FP16 算力(稠密)| ~1,979 TFLOPS ≈ **2 PFLOPS** |
|
|
|
|
|
|
|| 每 GPU HBM3 容量 | 80 GB(SXM5 版本)|
|
|
|
|
|
|
|| 每 GPU HBM3 带宽 | 3.35 TB/s |
|
|
|
|
|
|
|| CPU 配置 | 2 × AMD EPYC 9004/9005 或 Intel Xeon Scalable |
|
|
|
|
|
|
|| 主机内存 | 2 TB DDR5 ECC |
|
|
|
|
|
|
|| 存储本地 SSD | 2 × 3.84 TB NVMe(OS + 缓存)|
|
|
|
|
|
|
|| 电源配置 | 4 × 3.3 kW PSU(~13 kW 总功耗)|
|
|
|
|
|
|
|| 散热方式 | 冷板式液冷(必须)|
|
|
|
|
|
|
|
|
|
|
|
|
> **注**:HGX H100 架构中,NVSwitch Fabric 由 **6 片** NVSwitch 芯片组成(每 3 片为一组,构成两个全连接平面),提供节点内 8 GPU 全互联。NCCL 集合通信在 NVSwitch 内部全速运行,不受 PCIe 争用影响。
|
|
|
|
|
|
|
|
|
|
|
|
**CPU 与 GPU 连接路径:**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
CPU0 ──→ PCIe Gen5 x16 ──→ CPU1 (AMD Infinity Fabric / Intel UPI)
|
|
|
|
|
|
└────────┬───────────────────────┐
|
|
|
|
|
|
│ │
|
|
|
|
|
|
NVSwitch InfiniBand/
|
|
|
|
|
|
Fabric (GPU) RoCE 网卡
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
> **注**:HGX H100 架构中,CPU 与 GPU 之间**不直接走 PCIe 交换**,而是通过 NVSwitch 内部路径访问 GPU 内存。NCCL 集合通信在 NVSwitch 内部全速运行,不受 PCIe 争用影响。
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.1.3 GB200 NVL72 机架级超级芯片架构
|
|
|
|
|
|
|
|
|
|
|
|
**GB200 NVL72** 是 NVIDIA Blackwell 架构的机架级集成方案,代表当前最极致的 Scale-Up 设计:
|
|
|
|
|
|
|
|
|
|
|
|
**物理架构:**
|
|
|
|
|
|
|
|
|
|
|
|
|| 组件 | 数量 | 说明 |
|
|
|
|
|
|
||------|------|------|
|
|
|
|
|
|
|| Blackwell GPU (B200) | 72 张 | 每 GPU BF16 算力 ~1,800 TFLOPS(稀疏)|
|
|
|
|
|
|
|| Grace CPU (Neoverse V2) | 36 颗 | 72 核 ARM,每颗 240 GB LPDDR5 |
|
|
|
|
|
|
|| NVLink Switch 芯片 | 9 片 | 来自 NVLink Switch 第4代 |
|
|
|
|
|
|
|| GPU 内存总量 | 13.5 TB HBM3e | 每 GPU 186 GB(×72)|
|
|
|
|
|
|
|| CPU 内存总量 | 8.6 TB LPDDR5 | 每 CPU 240 GB(×36)|
|
|
|
|
|
|
|| NVLink 域带宽(聚合)| **130 TB/s** | 72 GPU 全互联 |
|
|
|
|
|
|
|| 单机柜功率 | **132 kW**(TDP)/ 峰值更高 |
|
|
|
|
|
|
|| CDU 容量 | 250 kW(Supermicro 方案)|
|
|
|
|
|
|
|| 散热方式 | 100% 冷板液冷 |
|
|
|
|
|
|
|
|
|
|
|
|
> **注**:Blackwell 架构的核心营销指标是 BF16 机器学习精度,FP64 主要用于 HPC 科学计算,对机场 AI 推理/训练场景无直接参考价值,原文档使用 FP64 算力指标是误导性引用。
|
|
|
|
|
|
|
|
|
|
|
|
**计算托盘(Compute Tray)结构:**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
每个计算托盘:
|
|
|
|
|
|
┌─────────────────────────────────┐
|
|
|
|
|
|
│ 1 × GB200 超级芯片 (= 2×B200 + 1×Grace CPU) │
|
|
|
|
|
|
│ 显存: 2 × 186 GB = 372 GB HBM3e │
|
|
|
|
|
|
│ 功率: ~2.7 kW(超级芯片总功耗) │
|
|
|
|
|
|
└─────────────────────────────────┘
|
|
|
|
|
|
|
|
|
|
|
|
18 个计算托盘 × 4 GPU/托盘 = 72 GPU
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**NVLink 域设计:**
|
|
|
|
|
|
|
|
|
|
|
|
- 72 GPU 在同一个 **NVLink 域(NVLink Domain)** 内全互联
|
|
|
|
|
|
- 任意两 GPU 之间通信:**单跳**,无需跨交换机
|
|
|
|
|
|
- 对等带宽:**900 GB/s** 任意 GPU 到任意 GPU(是 InfiniBand NDR 400G 的约 2.3 倍;"1.8 TB/s"为 Fabric 聚合总带宽,非对等带宽)
|
|
|
|
|
|
- **张量并行(Tensor Parallelism)** 可覆盖全部 72 GPU,适合超大规模模型
|
|
|
|
|
|
- 推理加速:NVIDIA 官方宣称的 **30 倍加速**基于特定 LLM 基准测试(GPT-3 175B),实际加速比与模型规模、批大小、输入长度强相关,不同 workload 差异显著,不应作为通用指标
|
|
|
|
|
|
|
|
|
|
|
|
**SuperPOD 扩展(8 × NVL72 = 576 GPU):**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
8 × GB200 NVL72 rack
|
|
|
|
|
|
│
|
|
|
|
|
|
│ (NVLink 扩展 via NVLink Switch)
|
|
|
|
|
|
│
|
|
|
|
|
|
576 GPU 全互联域
|
|
|
|
|
|
总带宽: >1 PB/s
|
|
|
|
|
|
总显存: 108 TB HBM3e
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
> **机场场景建议**:GB200 NVL72 单柜 132kW,功率密度极高,建议在机场智算中心**预留**此架构,但当前阶段以 HGX H100/H200 8-GPU 节点为主(单节点 ~13kW,可用液冷机柜支撑)。
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.1.4 推理服务器节点拓扑(4-GPU 配置)
|
|
|
|
|
|
|
|
|
|
|
|
推理服务器针对**高并发、低延迟**场景,与训练服务器拓扑差异显著:
|
|
|
|
|
|
|
|
|
|
|
|
**推荐节点架构:**
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | NVIDIA L40S 方案 | 昇腾 910B 方案(国产)|
|
|
|
|
|
|
|------|----------------|------------------|
|
|
|
|
|
|
| GPU 数量 | 4 × L40S | 4 × 昇腾 910B |
|
|
|
|
|
|
| GPU 显存 | 48 GB GDDR6 | 64 GB HBM |
|
|
|
|
|
|
| GPU 间互联 | PCIe Gen4 交换(无 NVLink)| HCCS(华为集合通信)|
|
|
|
|
|
|
| GPU 通信带宽 | ~64 GB/s(PCIe x16)| ~392 GB/s(HCCS)|
|
|
|
|
|
|
| 单节点算力 | ~2 PFLOPS(FP16)| ~2 PFLOPS(FP16)|
|
|
|
|
|
|
| 适用场景 | 中等规模推理 | 国产化推理 |
|
|
|
|
|
|
| 功耗 | ~4 kW/节点 | ~4.5 kW/节点 |
|
|
|
|
|
|
| 散热 | 风冷或液冷 | 风冷或液冷 |
|
|
|
|
|
|
|
|
|
|
|
|
**L40S vs H100 推理对比:**
|
|
|
|
|
|
|
|
|
|
|
|
| 对比项 | L40S(推理为主)| H100(训练/推理)|
|
|
|
|
|
|
|--------|--------------|----------------|
|
|
|
|
|
|
| 显存带宽 | 864 GB/s GDDR6 | 3.35 TB/s HBM3 |
|
|
|
|
|
|
| INT8 算力 | ~733 TFLOPS | ~3,958 TFLOPS |
|
|
|
|
|
|
| NVLink | 无 | 900 GB/s |
|
|
|
|
|
|
| 功耗 | 350 W | 700 W |
|
|
|
|
|
|
| 推理场景 | 中等 Batch、QPS < 1000 | 大 Batch、高吞吐 |
|
|
|
|
|
|
| 性价比 | 优(推理专用)| 高性能但成本高 |
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.2 多节点集群组网架构(Scale-Out)
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.2.1 集群网络分层架构
|
|
|
|
|
|
|
|
|
|
|
|
智算集群网络分为**三层三平面**:
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌────────────────────────────────────────────────────────────┐
|
|
|
|
|
|
│ 集群外部网络(Border) │
|
|
|
|
|
|
│ 互联网/专线/机场内部网络 ←→ 防火墙/负载均衡 │
|
|
|
|
|
|
└────────────────────────────────────────────────────────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌────────────────────────────────────────────────────────────┐
|
|
|
|
|
|
│ 管理网络平面(Management Network) │
|
|
|
|
|
|
│ BMC / IPMI / SSH / 监控采集 │
|
|
|
|
|
|
│ ←→ 千兆以太网(Out-of-Band) │
|
|
|
|
|
|
│ 带宽:1 Gb/s(管理流量,带外) │
|
|
|
|
|
|
└────────────────────────────────────────────────────────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌────────────────────────────────────────────────────────────┐
|
|
|
|
|
|
│ 存储网络平面(Storage Network) │
|
|
|
|
|
|
│ 分布式存储读写 / checkpoint 存取 │
|
|
|
|
|
|
│ ←→ RoCE v2 / InfiniBand + NVMe-oF │
|
|
|
|
|
|
│ 带宽:200-400 Gb/s │
|
|
|
|
|
|
└────────────────────────────────────────────────────────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌────────────────────────────────────────────────────────────┐
|
|
|
|
|
|
│ 计算网络平面(Compute Network / AI Fabric) │
|
|
|
|
|
|
│ GPU 集合通信(NCCL) / 梯度同步 / 数据并行 │
|
|
|
|
|
|
│ ←→ InfiniBand NDR 400G / Spectrum-X 400G │
|
|
|
|
|
|
│ 带宽:400 Gb/s(节点间) │
|
|
|
|
|
|
└────────────────────────────────────────────────────────────┘
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.2.2 InfiniBand NDR 400G 组网设计
|
|
|
|
|
|
|
|
|
|
|
|
**InfiniBand 是当前 AI 训练集群的事实标准网络**,原因:
|
|
|
|
|
|
|
|
|
|
|
|
- **硬件原生 RDMA**:绕过操作系统内核,直接内存访问,延迟 < 1 μs
|
|
|
|
|
|
- **自适应路由(Adaptive Routing)**:每包独立路由,充分利用所有链路
|
|
|
|
|
|
- **SHARP 网内计算**:在交换机内聚合梯度,无需送回 GPU 再聚合
|
|
|
|
|
|
- **NVIDIA Collective Communications(NCCL)原生支持**
|
|
|
|
|
|
|
|
|
|
|
|
**InfiniBand NDR 400G 关键参数:**
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | 规格 |
|
|
|
|
|
|
|------|------|
|
|
|
|
|
|
| 单端口带宽 | 400 Gbps(NDR = Next Data Rate)|
|
|
|
|
|
|
| 编码方式 | PAM4(每 lane 53.125 Gbaud)|
|
|
|
|
|
|
| 线缆类型 | 光纤(多模 OM4 / 单模 LC)|
|
|
|
|
|
|
| 交换机型号 | NVIDIA QM9700 系列 |
|
|
|
|
|
|
| 交换机端口密度 | 64 端口 × 400G |
|
|
|
|
|
|
| 拓扑支持 | Fat-Tree / DragonFly+ / Hypercube |
|
|
|
|
|
|
| 每交换机延迟 | < 0.6 μs(端到端)|
|
|
|
|
|
|
| 拥塞控制 | CNP(Congestion Notification Packet)|
|
|
|
|
|
|
|
|
|
|
|
|
**Fat-Tree 拓扑设计(推荐中小规模 512 GPU):**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌─────────────┐
|
|
|
|
|
|
│ Core Switch │ InfiniBand QM9700
|
|
|
|
|
|
│ (2-4 台) │ 64 端口 400G
|
|
|
|
|
|
└──────┬──────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌─────────────────┼─────────────────┐
|
|
|
|
|
|
│ │ │
|
|
|
|
|
|
┌────▼────┐ ┌────▼────┐ ┌────▼────┐
|
|
|
|
|
|
│ Agg 1 │ │ Agg 2 │ │ Agg 3 │
|
|
|
|
|
|
│ QM9700 │ │ QM9700 │ │ QM9700 │
|
|
|
|
|
|
└────┬────┘ └────┬────┘ └────┬────┘
|
|
|
|
|
|
│ │ │
|
|
|
|
|
|
[16 servers] [16 servers] [16 servers]
|
|
|
|
|
|
每组 8× GPU 每组 8× GPU 每组 8× GPU
|
|
|
|
|
|
节点 1-16 节点 17-32 节点 33-48
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**端口规划公式:**
|
|
|
|
|
|
|
|
|
|
|
|
| 集群规模 | Spine 交换机数 | 每个 Spine 上联端口 | 下联端口/交换机 |
|
|
|
|
|
|
|---------|--------------|------------------|--------------|
|
|
|
|
|
|
| 64 GPU(8节点)| 2 | 0 | 32-48 |
|
|
|
|
|
|
| 512 GPU(64节点)| 4 | 16-32 | 32 |
|
|
|
|
|
|
| 1024 GPU(128节点)| 8 | 32-64 | 32 |
|
|
|
|
|
|
| 4096 GPU(512节点)| 16 | 32 | 32 |
|
|
|
|
|
|
|
|
|
|
|
|
> 每个 8-GPU 服务器通常配置 **2 × 400G InfiniBand** 双上联,通过多路径(Multi-Path)和 LACP Bonding 实现带宽聚合与冗余容错。典型部署中每台服务器两个 400G 端口分别上联到两台 Leaf 交换机,故障时可无缝切换。
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.2.3 Spectrum-X 以太网方案(替代方案)
|
|
|
|
|
|
|
|
|
|
|
|
**Spectrum-X** 是 NVIDIA 面向 AI 的以太网解决方案,适合**不愿意引入 InfiniBand 专有生态**的用户:
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | Spectrum-X 400G | InfiniBand NDR 400G |
|
|
|
|
|
|
|------|---------------|-------------------|
|
|
|
|
|
|
| 技术基础 | 以太网(RoCE v2)| InfiniBand |
|
|
|
|
|
|
| 延迟 | 1-2 μs | < 0.6 μs |
|
|
|
|
|
|
| NCCL 性能 | 基准 ~100% | 最优 ~100% |
|
|
|
|
|
|
| 生态开放性 | 高(标准以太网)| 低(需 IB 交换设备)|
|
|
|
|
|
|
| 运维复杂度 | 低(统一以太网运维)| 高(独立 IB 网络)|
|
|
|
|
|
|
| 供应商 | NVIDIA、华为 | NVIDIA(Mellanox)|
|
|
|
|
|
|
| 推荐场景 | 推理集群、混合云 | 训练集群(强烈推荐)|
|
|
|
|
|
|
|
|
|
|
|
|
**Spectrum-X 关键技术(ROCEv2 + NVIDIA 网络流优化):**
|
|
|
|
|
|
|
|
|
|
|
|
- **增强 RoCE(eRoCE)**:支持可变 MTU(IMIX),减少小包开销
|
|
|
|
|
|
- **NetFlow 流管理**:智能负载均衡,自动路径选择
|
|
|
|
|
|
- **拥塞控制**:TensorFlow/MPI 层内置支持
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.2.4 万卡集群超节点(SuperPOD)架构
|
|
|
|
|
|
|
|
|
|
|
|
万卡集群的网络设计需要在 **InfiniBand 拓扑** 上精心规划:
|
|
|
|
|
|
|
|
|
|
|
|
**典型 32-GPU SU(可扩展单元)InfiniBand 规划:**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
每 4 台 8-GPU 服务器 = 1 个 SU(32 GPU)
|
|
|
|
|
|
4 × 服务器 × 2 × 400G IB 上联 = 8 个 QSFP-DD 端口连接上联交换机
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**千卡集群(1000+ GPU)Fat-Tree 规格:**
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | 1024 GPU(128节点)| 2048 GPU(256节点)|
|
|
|
|
|
|
|------|----------------|----------------|
|
|
|
|
|
|
| 交换机型号 | QM9700 | QM9700 |
|
|
|
|
|
|
| Spine 数 | 8 | 16 |
|
|
|
|
|
|
| 每 Spine 下联 | 32 端口 400G | 32 端口 400G |
|
|
|
|
|
|
| Agg 层 | 16 | 32 |
|
|
|
|
|
|
| 收敛比 | 1:1(无收敛)| 1:1(无收敛)|
|
|
|
|
|
|
| 总 InfiniBand 端口 | 512 + 512 = 1024 | 1024 + 1024 = 2048 |
|
|
|
|
|
|
| 网络直径 | 3 跳(最差路径)| 3 跳 |
|
|
|
|
|
|
|
|
|
|
|
|
**关键设计原则:**
|
|
|
|
|
|
|
|
|
|
|
|
1. **收敛比 ≤ 1:1**:AI 训练流量无阻塞,避免网络成为瓶颈
|
|
|
|
|
|
2. **InfiniBand 多路径**:每服务器双上联,双 L3 自适应路由
|
|
|
|
|
|
3. **GPU Direct RDMA**:跨节点 GPU 直接内存访问,绕过 CPU
|
|
|
|
|
|
4. **SHARP 网内聚合**:梯度在交换机内聚合,节省 30-50% 通信量
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.3 存储集群设计
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.3.1 存储需求分析
|
|
|
|
|
|
|
|
|
|
|
|
AI 训练集群的存储负载分为三类:
|
|
|
|
|
|
|
|
|
|
|
|
| 存储类型 | 用途 | 性能要求 | 典型容量 |
|
|
|
|
|
|
|---------|------|---------|---------|
|
|
|
|
|
|
| **数据湖存储** | 原始训练数据、语料库 | 顺序读取带宽 ≥500 GB/s | 10-100 PB |
|
|
|
|
|
|
| **模型存储** | 检查点、训练产出模型 | 写入带宽 ≥100 GB/s,延迟 < 1 ms | 1-10 PB |
|
|
|
|
|
|
| **共享文件系统** | 代码、配置、小文件共享 | IOPS ≥ 1M,小文件吞吐 | 100 TB-1 PB |
|
|
|
|
|
|
| **本地缓存** | 热点数据本地加速 | NVMe 本地,读缓存 | 1-10 TB/节点 |
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.3.2 全闪存分布式文件系统架构
|
|
|
|
|
|
|
|
|
|
|
|
**推荐方案:JuiceFS + 对象存储(兼容 S3)+ 本地 NVMe 缓存**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌─────────────────────────────────────────────────────────┐
|
|
|
|
|
|
│ 应用层(GPU 节点) │
|
|
|
|
|
|
│ 训练框架 ───→ JuiceFS FUSE / CSI 驱动 ───→ POSIX 接口 │
|
|
|
|
|
|
└─────────────────────────────────────────────────────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌─────▼─────┐
|
|
|
|
|
|
│ JuiceFS │ 元数据引擎(TiKV/RocksDB)
|
|
|
|
|
|
│ 客户端 │ 缓存层(L1本地 NVMe / L2 共享 SSD)
|
|
|
|
|
|
└─────┬─────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌───────────────┼───────────────┐
|
|
|
|
|
|
│ │ │
|
|
|
|
|
|
┌─────▼─────┐ ┌─────▼─────┐ ┌─────▼─────┐
|
|
|
|
|
|
│ 对象存储 │ │ 对象存储 │ │ 对象存储 │
|
|
|
|
|
|
│ (MinIO) │ │ (CEPH RGW)│ │ (S3 兼容) │
|
|
|
|
|
|
│ 10+ PB │ │ 多站点 │ │ 备份 │
|
|
|
|
|
|
└───────────┘ └───────────┘ └───────────┘
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**JuiceFS 关键参数(AI 训练场景):**
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | 推荐值 |
|
|
|
|
|
|
|------|-------|
|
|
|
|
|
|
| 元数据引擎 | TiKV(分布式,≥3 节点)或 Redis(单机测试)|
|
|
|
|
|
|
| 数据存储 | 对象存储(S3 兼容,任意厂商)|
|
|
|
|
|
|
| 本地缓存 | 每节点 1-2 TB NVMe SSD(L1 缓存)|
|
|
|
|
|
|
| 共享 SSD 缓存 | 每机柜 4-8 TB NVMe SSD(L2 缓存)|
|
|
|
|
|
|
| 小文件聚合 | 4 MiB chunk,减少元数据压力 |
|
|
|
|
|
|
| 读取预取 | 自动预取临近数据块,降低 IO 等待 |
|
|
|
|
|
|
| 并行读 | 128-256 并发线程,最大化带宽利用率 |
|
|
|
|
|
|
|
|
|
|
|
|
**分布式存储产品选型:**
|
|
|
|
|
|
|
|
|
|
|
|
| 产品 | 类型 | 适用规模 | AI 训练适配度 |
|
|
|
|
|
|
|------|------|---------|------------|
|
|
|
|
|
|
| JuiceFS | 元数据+对象存储分离 | 中大规模 | ★★★★★ |
|
|
|
|
|
|
| BeeGFS | 并行文件系统 | 超大规模 | ★★★★ |
|
|
|
|
|
|
| GPFS(IBM Spectrum Scale)| 并行文件系统 | 企业级 | ★★★★ |
|
|
|
|
|
|
| 曙光 ParaStor | 全闪存分布式 | 国产化 | ★★★★ |
|
|
|
|
|
|
| 华为 OceanStor 9000 | 全闪存分布式 | 大规模 | ★★★★ |
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.3.3 存储网络设计
|
|
|
|
|
|
|
|
|
|
|
|
**存储流量走独立 RoCE v2 网络,与计算网络物理隔离:**
|
|
|
|
|
|
|
|
|
|
|
|
| 网络平面 | 协议 | 带宽 | 交换机 |
|
|
|
|
|
|
|---------|------|------|-------|
|
|
|
|
|
|
| 计算网络 | InfiniBand NDR | 400G × 2(双上联)| QM9700 |
|
|
|
|
|
|
| 存储网络 | RoCE v2 + NVMe-oF | 200-400G | Spectrum-X / 华为 CloudEngine |
|
|
|
|
|
|
| 管理网络 | 以太网 | 1G | 接入交换机 |
|
|
|
|
|
|
|
|
|
|
|
|
**存储性能目标(AI 训练):**
|
|
|
|
|
|
|
|
|
|
|
|
|| 指标 | 目标值 | 前提条件 |
|
|
|
|
|
|
||------|-------|---------|
|
|
|
|
|
|
|| 聚合读带宽 | ≥ 500 GB/s(10 PB 集群)| 需 20+ 全闪存存储节点,每节点 25 GB/s 读带宽,200G 存储网络聚合 |
|
|
|
|
|
|
|| 聚合写带宽 | ≥ 100 GB/s | 需 NVMe SSD 配置,多路并发写入 |
|
|
|
|
|
|
|| 元数据 IOPS | ≥ 100 万 | 需分布式元数据引擎(如 TiKV),小文件聚合策略 |
|
|
|
|
|
|
|| 检查点保存时间 | ≤ 30 秒(100 GB 检查点)| 需 100G+ 存储网络 + 本地 NVMe SSD 缓存 |
|
|
|
|
|
|
|| 存储可靠性 | 99.9999%(6 个 9)| 副本/纠删码策略,多站点部署 |
|
|
|
|
|
|
|
|
|
|
|
|
> **注**:上述性能目标均为有前置条件的系统设计指标,实际达成需要:足够的存储节点数量、充足的存储网络带宽、正确配置的小文件聚合策略。初次建设时应优先保证核心指标(检查点写入带宽),其他指标可随集群扩展逐步达标。
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.4 训练集群软件栈
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.4.1 分布式训练框架
|
|
|
|
|
|
|
|
|
|
|
|
AI 训练软件栈从底层到应用分为五层:
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌──────────────────────────────────────────┐
|
|
|
|
|
|
│ 应用层:训练脚本(PyTorch/LLaMA-Factory)│
|
|
|
|
|
|
├──────────────────────────────────────────┤
|
|
|
|
|
|
│ 框架层:PyTorch 2.x + 分布式通信优化 │
|
|
|
|
|
|
│ DeepSpeed / Megatron-LM / ColossalAI│
|
|
|
|
|
|
├──────────────────────────────────────────┤
|
|
|
|
|
|
│ 通信层:NCCL 2.x(NVIDIA) │
|
|
|
|
|
|
│ HCCS(昇腾)/ OpenUCCL(国产) │
|
|
|
|
|
|
├──────────────────────────────────────────┤
|
|
|
|
|
|
│ 驱动层:CUDA 12.x / ROCm 6.x │
|
|
|
|
|
|
│ GPU Driver / cuBLAS / cuDNN │
|
|
|
|
|
|
├──────────────────────────────────────────┤
|
|
|
|
|
|
│ 硬件层:NVLink / InfiniBand / RoCE │
|
|
|
|
|
|
└──────────────────────────────────────────┘
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**框架选型建议:**
|
|
|
|
|
|
|
|
|
|
|
|
| 框架 | 适用场景 | 并行策略支持 |
|
|
|
|
|
|
|------|---------|------------|
|
|
|
|
|
|
| **PyTorch 2.x + FSDP** | 通用大模型训练 | DDP / FSDP / TP |
|
|
|
|
|
|
| **DeepSpeed ZeRO** | 超大模型(千亿参数+)| ZeRO-1/2/3、流水线、张量并行 |
|
|
|
|
|
|
| **Megatron-LM** | 极致张量并行优化 | TP + PP + DP 三维并行 |
|
|
|
|
|
|
| **ColossalAI** | 异构训练、多种并行策略 | 动态调度、ZeRO++ |
|
|
|
|
|
|
|
|
|
|
|
|
**DeepSpeed ZeRO 并行策略详解:**
|
|
|
|
|
|
|
|
|
|
|
|
| 策略 | 显存优化 | 通信量 | 适用场景 |
|
|
|
|
|
|
|------|---------|--------|---------|
|
|
|
|
|
|
| ZeRO-1 | 分片优化器状态 | 较少 | 大模型,多节点 |
|
|
|
|
|
|
| ZeRO-2 | + 分片梯度 | 中等 | 大模型,多节点 |
|
|
|
|
|
|
| ZeRO-3 | + 分片参数 | 较大(all-gather)| 超级大模型 |
|
|
|
|
|
|
| ZeRO-Offload | CPU 卸载 | 依赖 PCIe | 单机大模型 |
|
|
|
|
|
|
| ZeRO-Infinity | 卸载到 NVMe/内存 | 依赖带宽 | 超大模型,单机 |
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.4.2 集合通信配置(NCCL)
|
|
|
|
|
|
|
|
|
|
|
|
NCCL 是 NVIDIA GPU 集合通信库,是分布式训练性能的核心:
|
|
|
|
|
|
|
|
|
|
|
|
**NCCL 关键配置参数:**
|
|
|
|
|
|
|
|
|
|
|
|
```bash
|
|
|
|
|
|
# NCCL 环境变量参考配置
|
|
|
|
|
|
NCCL_DEBUG=info # 调试日志(生产环境关闭)
|
|
|
|
|
|
NCCL_IB_DISABLE=0 # 启用 InfiniBand
|
|
|
|
|
|
NCCL_NET_GDR_LEVEL=PIX # GPU 直接访问网卡(最佳性能)
|
|
|
|
|
|
NCCL_NVLS_DISABLE=0 # 启用 NVLink 域内通信
|
|
|
|
|
|
NCCL_MIN_NCHANNELS=4 # 最小通道数
|
|
|
|
|
|
NCCL_MAX_NCHANNELS=16 # 最大通道数(InfiniBand 多路径)
|
|
|
|
|
|
NCCL_ALGO=Tree # 集合通信算法(Ring/Tree/Tunnel)
|
|
|
|
|
|
NCCL_PROTO=LL # 协议(Simple/ LL/ Elemy)
|
|
|
|
|
|
NCCL_BUFFSIZE=2097152 # 环形缓冲区大小(字节)
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**NCCL 在 GB200 NVL72 中的拓扑感知:**
|
|
|
|
|
|
|
|
|
|
|
|
```python
|
|
|
|
|
|
# 拓扑感知的进程亲和性设置(关键!)
|
|
|
|
|
|
import torch
|
|
|
|
|
|
import torch.distributed as dist
|
|
|
|
|
|
|
|
|
|
|
|
# 获取 GPU NVLink 对等关系
|
|
|
|
|
|
torch.cuda.can_device_access_peer(local_gpu, remote_gpu)
|
|
|
|
|
|
|
|
|
|
|
|
# Megatron-LM 中使用 NVL72 拓扑
|
|
|
|
|
|
# nvidia.com/gpu.clique: 同一 NVLink 域内的 GPU 标记
|
|
|
|
|
|
# Megatron 自动优先在 NVLink 域内布置张量并行组
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**NCCL 测试验证(上线前必须执行):**
|
|
|
|
|
|
|
|
|
|
|
|
```bash
|
|
|
|
|
|
# 单节点 8-GPU NCCL 测试
|
|
|
|
|
|
./build/all_reduce_perf -b 8M -e 8G -f 2 -g 8
|
|
|
|
|
|
|
|
|
|
|
|
# 跨节点 NCCL 测试(每个节点启动)
|
|
|
|
|
|
./build/all_reduce_perf -b 8M -e 8G -f 2 -g 8 \
|
|
|
|
|
|
-N 1 -w 100 -n 100
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**预期 NCCL 带宽基准:**
|
|
|
|
|
|
|
|
|
|
|
|
| 通信模式 | H100 NVLink 域内 | H100 InfiniBand 400G | L40S PCIe |
|
|
|
|
|
|
|---------|--------------|-------------------|-----------|
|
|
|
|
|
|
| AllReduce(8 GPU)| ~850-900 GB/s | 300-350 GB/s | ~60 GB/s |
|
|
|
|
|
|
| AllReduce(跨节点)| N/A | 300-350 GB/s | ~60 GB/s |
|
|
|
|
|
|
| AllGather | ~880 GB/s | 280-320 GB/s | ~55 GB/s |
|
|
|
|
|
|
| ReduceScatter | ~870 GB/s | 280-320 GB/s | ~55 GB/s |
|
|
|
|
|
|
|
|
|
|
|
|
> **目标**:InfiniBand 400G 的 NCCL 带宽应达到理论峰值的 **80% 以上**(即 ≥ 320 GB/s),否则说明网络有瓶颈。
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.4.3 作业调度器选型
|
|
|
|
|
|
|
|
|
|
|
|
| 调度器 | 适用场景 | 优点 | 缺点 |
|
|
|
|
|
|
|--------|---------|------|------|
|
|
|
|
|
|
| **Slurm** | 超算/HPC 传统场景 | 生态成熟,稳定可靠 | 不支持容器原生 |
|
|
|
|
|
|
| **Kubernetes + Volcano** | 云原生 AI 平台 | 生态丰富,弹性伸缩 | 配置复杂 |
|
|
|
|
|
|
| **Kubeflow** | MLOps 全流程 | 与 K8s 深度集成 | 较重 |
|
|
|
|
|
|
| **OpenPAI(微软)** | 企业内部 AI 平台 | 支持多租户 | 社区活跃度下降 |
|
|
|
|
|
|
| **VarStore(平头哥)** | 大规模训练 | 高效调度 | 主要支持 TPU 生态 |
|
|
|
|
|
|
|
|
|
|
|
|
**Kubernetes + Volcano 推荐配置(机场智算中心):**
|
|
|
|
|
|
|
|
|
|
|
|
```yaml
|
|
|
|
|
|
# Volcano Job 示例:启动一个 64-GPU 分布式训练任务
|
|
|
|
|
|
apiVersion: batch.volcano.sh/v1alpha1
|
|
|
|
|
|
kind: Job
|
|
|
|
|
|
metadata:
|
|
|
|
|
|
name: flight-delay-llm-training
|
|
|
|
|
|
spec:
|
|
|
|
|
|
replicas: 8 # 8 个 Pod(每 Pod 8 GPU)
|
|
|
|
|
|
minAvailable: 64 # 至少 64 GPU 可用才启动
|
|
|
|
|
|
schedulerName: volcano
|
|
|
|
|
|
tasks:
|
|
|
|
|
|
- replicas: 8
|
|
|
|
|
|
name: trainer
|
|
|
|
|
|
template:
|
|
|
|
|
|
spec:
|
|
|
|
|
|
containers:
|
|
|
|
|
|
- name: training
|
|
|
|
|
|
image: pytorch:2.3-cuda12.1
|
|
|
|
|
|
command:
|
|
|
|
|
|
- torchrun
|
|
|
|
|
|
- --nproc_per_node=8
|
|
|
|
|
|
- --nnodes=8
|
|
|
|
|
|
- /workspace/train.py
|
|
|
|
|
|
resources:
|
|
|
|
|
|
nvidia.com/gpu: 8
|
|
|
|
|
|
volumeMounts:
|
|
|
|
|
|
- mountPath: /data
|
|
|
|
|
|
name: data-volume
|
|
|
|
|
|
volumes:
|
|
|
|
|
|
- name: data-volume
|
|
|
|
|
|
persistentVolumeClaim:
|
|
|
|
|
|
claimName: training-data-pvc
|
|
|
|
|
|
nodeSelector:
|
|
|
|
|
|
nvidia.com/gpu.product: H100-SXM5-80GB
|
|
|
|
|
|
tolerations:
|
|
|
|
|
|
- key: "nvidia.com/gpu"
|
|
|
|
|
|
operator: "Exists"
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.5 推理集群设计
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.5.1 高吞吐推理架构
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌──────────────────┐
|
|
|
|
|
|
│ L4/L40S 推理节点 │
|
|
|
|
|
|
│ (Kubernetes Pod) │
|
|
|
|
|
|
│ vLLM / TFLite │
|
|
|
|
|
|
└────────┬─────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌────────▼─────────┐
|
|
|
|
|
|
│ RoCE v2 存储网络 │
|
|
|
|
|
|
│ (模型加载/热数据) │
|
|
|
|
|
|
└────────┬─────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌──────────────────────────────────┼──────────────────────┐
|
|
|
|
|
|
│ 推理服务层(Kubernetes) │
|
|
|
|
|
|
│ Prometheus + Alertmanager(监控) │ Seldon Core(Serving)│
|
|
|
|
|
|
└──────────────────────────────────┴──────────────────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
▼
|
|
|
|
|
|
┌──────────┐
|
|
|
|
|
|
│ LLM Router│
|
|
|
|
|
|
│ (流量调度)│
|
|
|
|
|
|
└──────────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌────────────────┼────────────────┐
|
|
|
|
|
|
▼ ▼ ▼
|
|
|
|
|
|
┌──────────┐ ┌──────────┐ ┌──────────┐
|
|
|
|
|
|
│ 推理节点1 │ │ 推理节点2 │ │ 推理节点3 │
|
|
|
|
|
|
│ L40S ×4 │ │ L40S ×4 │ │ L40S ×4 │
|
|
|
|
|
|
└──────────┘ └──────────┘ └──────────┘
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.5.2 推理引擎深度对比
|
|
|
|
|
|
|
|
|
|
|
|
| 引擎 | 开发方 | 推理框架 | KV Cache | 多模型 | 国产适配 |
|
|
|
|
|
|
|------|-------|---------|---------|-------|--------|
|
|
|
|
|
|
| **vLLM** | 伯克利 LMSYS | PyTorch | PagedAttention | 是 | 昇腾(第三方)|
|
|
|
|
|
|
| **TensorRT-LLM** | NVIDIA 官方 | TensorRT | 动态批处理 | 是 | 仅 NVIDIA GPU |
|
|
|
|
|
|
| **SGLang** | 斯坦福 | PyTorch | RadixAttention | 是 | 昇腾(实验)|
|
|
|
|
|
|
| **Ollama** | 本地推理 | Llama.cpp | - | 多模型 | CPU/GPU |
|
|
|
|
|
|
| **TGI** | HuggingFace | 多种后端 | 是 | 是 | 昇腾(第三方)|
|
|
|
|
|
|
|
|
|
|
|
|
**vLLM 关键配置参数:**
|
|
|
|
|
|
|
|
|
|
|
|
```python
|
|
|
|
|
|
# vLLM 推理服务配置
|
|
|
|
|
|
vllmArgs = [
|
|
|
|
|
|
"--model", "/models/flight-llm-7b",
|
|
|
|
|
|
"--tensor-parallel-size", "4", # 张量并行度
|
|
|
|
|
|
"--gpu-memory-utilization", "0.92", # GPU 显存利用率(0.92 = 92%)
|
|
|
|
|
|
"--max-num-batched-tokens", "8192", # 最大批处理 token 数
|
|
|
|
|
|
"--max-num-seqs", "256", # 最大并发序列数
|
|
|
|
|
|
"--enable-chunked-prefill", # 启用分块预填充
|
|
|
|
|
|
"--enforce-eager", # 禁用 CUDA graph(调试用)
|
|
|
|
|
|
"--port", "8000",
|
|
|
|
|
|
"--host", "0.0.0.0",
|
|
|
|
|
|
]
|
|
|
|
|
|
|
|
|
|
|
|
# 关键说明:
|
|
|
|
|
|
# --gpu-load-fraction 不是 vLLM 合法参数,GPU 负载比例通过 --gpu-memory-utilization 控制
|
|
|
|
|
|
# 0.92 表示 vLLM 最多占用每卡 92% 的显存(预留 8% 给 CUDA kernel 等)
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
**TensorRT-LLM 推理性能参考(H100 单卡):**
|
|
|
|
|
|
|
|
|
|
|
|
| 模型 | FP16 吞吐(tokens/s)| INT8 吞吐(tokens/s)| 显存占用(FP16)|
|
|
|
|
|
|
|------|------------------|------------------|------------|
|
|
|
|
|
|
| Llama-3-8B | ~5,000 | ~8,000 | ~20 GB |
|
|
|
|
|
|
| Llama-3-70B | ~1,200(TP4)| ~2,000(TP4)| ~160 GB |
|
|
|
|
|
|
| Mistral-7B | ~6,000 | ~9,500 | ~18 GB |
|
|
|
|
|
|
| Qwen-72B | ~800(TP8)| ~1,500(TP8)| ~280 GB |
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.5.3 PD 分离(Prefill-Deploy 分离)架构
|
|
|
|
|
|
|
|
|
|
|
|
对于超大模型推理,**PD 分离**可显著提升 GPU 利用率:
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
┌─────────────┐
|
|
|
|
|
|
│ Router │
|
|
|
|
|
|
│ (请求路由) │
|
|
|
|
|
|
└──────┬──────┘
|
|
|
|
|
|
│
|
|
|
|
|
|
┌────────────┴────────────┐
|
|
|
|
|
|
▼ ▼
|
|
|
|
|
|
┌─────────────┐ ┌─────────────┐
|
|
|
|
|
|
│ Prefill 节点 │ │ Decode 节点 │
|
|
|
|
|
|
│ H100/H200 │ KV Cache │ L40S/H20 │
|
|
|
|
|
|
│ 计算密集 │ ──传输──→ │ 显存密集 │
|
|
|
|
|
|
│ 高延迟 │ │ 低延迟高吞吐 │
|
|
|
|
|
|
└─────────────┘ └─────────────┘
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
| 对比项 | 传统单节点推理 | PD 分离推理 |
|
|
|
|
|
|
|--------|------------|-----------|
|
|
|
|
|
|
| GPU 利用率 | < 30%(Decode 瓶颈)| 70-90% |
|
|
|
|
|
|
| 首 token 延迟 | 固定 | 可优化(Prefill 专用优化)|
|
|
|
|
|
|
| 吞吐 | 受限于最慢阶段 | 各阶段独立扩缩容 |
|
|
|
|
|
|
| 适用模型 | < 30B 参数 | 任意规模,尤其是 > 70B |
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.6 国产化集群方案
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.6.1 华为昇腾 910B 集群方案
|
|
|
|
|
|
|
|
|
|
|
|
**昇腾 910B 关键参数:**
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | 昇腾 910B | NVIDIA H100 | 对比 |
|
|
|
|
|
|
|------|---------|-----------|------|
|
|
|
|
|
|
| FP16 算力 | 640 TFLOPS | 1,979 TFLOPS | H100 的 32% |
|
|
|
|
|
|
| INT8 算力 | 1,280 TOPS | 3,958 TOPS | H100 的 32% |
|
|
|
|
|
|
| HBM 容量 | 64 GB | 80 GB | - |
|
|
|
|
|
|
| HBM 带宽 | 1.6 TB/s | 3.35 TB/s | H100 的 48% |
|
|
|
|
|
|
| 芯片互联 | HCCS(910 GB/s)| NVLink(900 GB/s)| 基本持平 |
|
|
|
|
|
|
| 功耗 | 400 W | 700 W | 能效比更高 |
|
|
|
|
|
|
| 制程 | 7nm | 4nm | 差一代 |
|
|
|
|
|
|
| 生态 | 昇腾 CANN / MindSpore | CUDA / cuDNN | 差距较大 |
|
|
|
|
|
|
|
|
|
|
|
|
**昇腾集群组网拓扑(Atlas 900 PoD):**
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
昇腾 910B 服务器(含 8 × NPU)
|
|
|
|
|
|
│
|
|
|
|
|
|
│ PCIe Gen5 x16
|
|
|
|
|
|
│
|
|
|
|
|
|
┌─────▼─────┐
|
|
|
|
|
|
│ HCCS Switch │ 华为自研高速互联交换机
|
|
|
|
|
|
│ (392 GB/s) │ 8 × HCCS 端口,双向
|
|
|
|
|
|
└─────┬─────┘
|
|
|
|
|
|
│ 跨服务器 HCCS
|
|
|
|
|
|
(Scale-Up: 节点内)
|
|
|
|
|
|
│
|
|
|
|
|
|
▼
|
|
|
|
|
|
InfiniBand / 以太网络
|
|
|
|
|
|
(Scale-Out: 节点间)
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
> **注**:原文档将 HCCS 带宽误写为 128 GB/s,实际华为官方参数为 **392 GB/s**(双向),用于 8 × NPU 节点内全互联,与 NVLink 4.0 的 900 GB/s 仍有量级差距,但优于 PCIe Gen4 x16(约 64 GB/s)。
|
|
|
|
|
|
|
|
|
|
|
|
**昇腾软件栈:**
|
|
|
|
|
|
|
|
|
|
|
|
| 层次 | 昇腾组件 | 替代 NVIDIA |
|
|
|
|
|
|
|------|---------|-----------|
|
|
|
|
|
|
| 芯片 | Ascend 910B NPU | H100/H200 GPU |
|
|
|
|
|
|
| 驱动 | Huawei CANN | CUDA |
|
|
|
|
|
|
| 通信库 | HCCS(昇腾集合通信)| NCCL |
|
|
|
|
|
|
| 框架 | MindSpore / PyTorch(第三方)| PyTorch |
|
|
|
|
|
|
| 算子库 | Ascend Math / ACL | cuBLAS / cuDNN |
|
|
|
|
|
|
| 推理引擎 | MindX / ATLAS | TensorRT |
|
|
|
|
|
|
| 集群管理 | FusionCube / ascendCL | DGX 系统 |
|
|
|
|
|
|
|
|
|
|
|
|
**昇腾集群注意问题:**
|
|
|
|
|
|
|
|
|
|
|
|
- **CUDA 兼容性问题**:昇腾 CANN ≠ CUDA,PyTorch 模型需用 **Ascend PyTorch** 适配(torch_npu 库),部分算子可能需要自行移植
|
|
|
|
|
|
- **生态成熟度**:较 NVIDIA 仍有差距,建议配合华为原厂支持
|
|
|
|
|
|
- **NPU 亲和性**:MindSpore 在昇腾上性能最优,PyTorch 适配版本性能略有损耗
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.6.2 海光 DCU 方案
|
|
|
|
|
|
|
|
|
|
|
|
| 参数 | 海光 DCU Z100 | NVIDIA A100 | 对比 |
|
|
|
|
|
|
|------|-------------|-----------|------|
|
|
|
|
|
|
| FP16 算力 | 256 TFLOPS | 624 TFLOPS | A100 的 41% |
|
|
|
|
|
|
| HBM 容量 | 64 GB | 40/80 GB | 对标 A100 80G |
|
|
|
|
|
|
| 功耗 | 350 W | 400 W | 略低 |
|
|
|
|
|
|
| 生态 | ROCm(部分兼容)| CUDA | 兼容性较好 |
|
|
|
|
|
|
|
|
|
|
|
|
**优势**:海光 DCU 基于 AMD ROCm 生态,**与 CUDA 兼容性较好**,迁移成本低于昇腾。
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.7 集群管理、监控与运维
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.7.1 硬件监控体系
|
|
|
|
|
|
|
|
|
|
|
|
| 监控维度 | 工具 | 采集指标 |
|
|
|
|
|
|
|---------|------|---------|
|
|
|
|
|
|
| GPU 监控 | DCGM(NVIDIA)/ msmonitor(昇腾)| 温度、功耗、利用率、显存、ECC 错误 |
|
|
|
|
|
|
| InfiniBand 监控 | UFM(NVIDIA)/ Mellanox firmware | 端口状态、误码率、拓扑 |
|
|
|
|
|
|
| 存储监控 | JuiceFS / BeeGFS 内置工具 | 带宽、IOPS、元数据延迟 |
|
|
|
|
|
|
| 节点监控 | node_exporter + Prometheus | CPU、内存、网络、磁盘 |
|
|
|
|
|
|
| 集群健康 | Grafana 大盘 | 综合集群状态 |
|
|
|
|
|
|
|
|
|
|
|
|
**关键告警阈值(参考):**
|
|
|
|
|
|
|
|
|
|
|
|
| 告警级别 | 指标 | 阈值 | 动作 |
|
|
|
|
|
|
|---------|------|------|------|
|
|
|
|
|
|
| P1(紧急)| GPU 温度 | > 85°C | 立即降频/关机 |
|
|
|
|
|
|
| P1 | GPU ECC 错误数 | > 100/小时 | 标记节点下线 |
|
|
|
|
|
|
| P2(重要)| GPU 利用率 | < 10%(训练时)| 检查 NCCL 通信 |
|
|
|
|
|
|
| P2 | InfiniBand 端口误码 | > 10⁻⁶ | 更换光模块/线缆 |
|
|
|
|
|
|
| P3(一般)| CPU 利用率 | > 90% 持续 30 分钟 | 扩容/调优 |
|
|
|
|
|
|
| P3 | GPU 显存占用 | > 95% | 优化 Batch Size |
|
|
|
|
|
|
|
|
|
|
|
|
#### 4.7.2 NCCL 调优最佳实践
|
|
|
|
|
|
|
|
|
|
|
|
**上线前必须完成的验证清单:**
|
|
|
|
|
|
|
|
|
|
|
|
```bash
|
|
|
|
|
|
# 1. NVLink 连接验证
|
|
|
|
|
|
nvidia-smi nvlink --status
|
|
|
|
|
|
|
|
|
|
|
|
# 2. InfiniBand 物理层验证
|
|
|
|
|
|
ibstat # 检查端口状态
|
|
|
|
|
|
ibdiagnet -r # 检测线缆和光模块质量
|
|
|
|
|
|
|
|
|
|
|
|
# 3. NCCL 单节点带宽测试
|
|
|
|
|
|
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8
|
|
|
|
|
|
# 目标:AllReduce 带宽 > 850 GB/s(NVLink 域内)
|
|
|
|
|
|
|
|
|
|
|
|
# 4. NCCL 跨节点带宽测试
|
|
|
|
|
|
# (每个节点后台启动)
|
|
|
|
|
|
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 -N 1 -w 100 -n 100
|
|
|
|
|
|
# 目标:AllReduce 带宽 > 300 GB/s(IB 400G)
|
|
|
|
|
|
|
|
|
|
|
|
# 5. GPU Direct RDMA 验证
|
|
|
|
|
|
ib_write_bw -d mlx5_0 # 测试 IB 网卡到 GPU 内存直接带宽
|
|
|
|
|
|
# 目标:> 350 GB/s
|
|
|
|
|
|
|
|
|
|
|
|
# 6. 端到端训练基准测试
|
|
|
|
|
|
torchrun --nproc_per_node=8 /workspace/nccl_tests/resnet50/hello_world.py
|
|
|
|
|
|
# 验证 8-GPU 线性扩展效率 > 90%
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
### 4.8 机场智算中心集群配置推荐方案
|
|
|
|
|
|
|
|
|
|
|
|
#### 方案一:中等规模(千万级旅客机场,推理为主)
|
|
|
|
|
|
|
|
|
|
|
|
| 项目 | 配置 |
|
|
|
|
|
|
|------|------|
|
|
|
|
|
|
| **GPU 类型** | NVIDIA L40S × 4/节点 |
|
|
|
|
|
|
| **节点数量** | 32 节点 = 128 GPU |
|
|
|
|
|
|
| **主要负载** | 推理服务、视频分析、Agent |
|
|
|
|
|
|
| **集群算力** | ~256 TFLOPS(FP16)|
|
|
|
|
|
|
| **网络** | RoCE v2 200G + 以太网管理 |
|
|
|
|
|
|
| **存储** | JuiceFS + 对象存储,2 PB |
|
|
|
|
|
|
| **服务器形态** | 4U 液冷机架服务器 |
|
|
|
|
|
|
| **预估功耗** | 64 节点 × 4 kW = 256 kW |
|
|
|
|
|
|
| **国产化** | 可选昇腾 910B × 4 混部 |
|
|
|
|
|
|
|
|
|
|
|
|
#### 方案二:大规模(两千万级旅客机场,训练+推理)
|
|
|
|
|
|
|
|
|
|
|
|
|| 项目 | 配置 |
|
|
|
|
|
|
||------|------|
|
|
|
|
|
|
| **训练 GPU** | NVIDIA H100 SXM5 × 8/节点 |
|
|
|
|
|
|
| **训练节点数** | 32 节点 = 256 GPU |
|
|
|
|
|
|
| **训练算力** | ~1 PFLOPS(BF16 稀疏,约 2× 渲染)|
|
|
|
|
|
|
| **推理 GPU** | L40S × 4/节点 |
|
|
|
|
|
|
| **推理节点数** | 16 节点 = 64 GPU |
|
|
|
|
|
|
| **主要负载** | 大模型微调、航班调度 AI、推理 |
|
|
|
|
|
|
| **计算网络** | InfiniBand NDR 400G × 2(双上联)|
|
|
|
|
|
|
| **存储网络** | RoCE v2 200G + 全闪存存储 |
|
|
|
|
|
|
| **存储容量** | JuiceFS + 全闪存,10 PB |
|
|
|
|
|
|
| **服务器形态** | HGX H100 8-GPU 液冷服务器 |
|
|
|
|
|
|
| **预估功耗** | 训练:32 × 13 kW ≈ 416 kW + 推理:16 × 4 kW ≈ 64 kW + 存储/网络 ≈ 70 kW ≈ **550 kW** |
|
|
|
|
|
|
| **国产化** | 昇腾 910B 训练集群(备选)|
|
|
|
|
|
|
|
|
|
|
|
|
> **注**:原"~256 PFLOPS"存在歧义(未注明精度和稀疏性)。按 H100 官方标称 BF16 稀疏算力 1,979 TFLOPS/GPU(≈ 2 PFLOPS),32 节点 256 GPU × 2 PFLOPS ≈ **512 PFLOPS ≈ 0.5 EFLOPS**(BF16 稀疏),或 FP16 稠密约 256 PFLOPS。如原文档意指 FP16 稠密,则 256 PFLOPS 大致准确;如指 BF16 稀疏,则应为 ~0.5 EFLOPS。
|
|
|
|
|
|
|
|
|
|
|
|
#### 方案三:旗舰规模(三千万级以上,新建超大规模智算)
|
|
|
|
|
|
|
|
|
|
|
|
|| 项目 | 配置 |
|
|
|
|
|
|
||------|------|
|
|
|
|
|
|
| **训练 GPU** | NVIDIA H200/HH200 × 8/节点 |
|
|
|
|
|
|
| **训练节点数** | 128 节点 = 1024 GPU |
|
|
|
|
|
|
| **SuperPOD 架构** | 16 × 64 GPU SU,Fat-Tree 组网 |
|
|
|
|
|
|
| **训练算力** | ~2 EFLOPS(BF16 稀疏),~1 EFLOPS(BF16 稠密)|
|
|
|
|
|
|
| **推理 GPU** | H100/L40S 混合 |
|
|
|
|
|
|
| **计算网络** | InfiniBand NDR 400G,1:1 无收敛 |
|
|
|
|
|
|
| **超节点扩展** | 支持 Scale-Up 到 GB200 NVL72 |
|
|
|
|
|
|
| **存储** | 全闪存并行文件系统,50 PB+ |
|
|
|
|
|
|
| **预估功耗** | **~13 MW**(GPU ~10 MW + 服务器/网络/液冷 ~3 MW,详见注)|
|
|
|
|
|
|
| **PUE 目标** | ≤ 1.15(全液冷)|
|
|
|
|
|
|
|
|
|
|
|
|
> **功率测算注**:H200 GPU TDP ~700W/卡,1024 GPU 仅 GPU 即 ~717 kW;8-GPU 服务器整机功耗约 10-13 kW/台,128 台服务器约 1.3-1.7 MW;加上 InfiniBand 交换机、存储节点、液冷 CDU 二次侧水泵、冷却塔等辅助负载,总计 ~13 MW。2 MW 严重低估,仅够覆盖约 1/6 的 GPU 数量。
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 五、网络技术方案
|
|
|
|
|
|
|
|
|
|
|
|
### 5.1 智算中心网络架构
|
|
|
|
|
|
|
|
|
|
|
|
#### Spine-Leaf 架构(推荐大型机场)
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
Spine 层(核心)
|
|
|
|
|
|
├── Spine-A(400G)
|
|
|
|
|
|
└── Spine-B(400G,冗余)
|
|
|
|
|
|
↑
|
|
|
|
|
|
Leaf 层(接入)
|
|
|
|
|
|
├── Leaf-1(连接 GPU 服务器)
|
|
|
|
|
|
├── Leaf-2(连接 GPU 服务器)
|
|
|
|
|
|
├── Leaf-3(连接存储)
|
|
|
|
|
|
└── Leaf-4(连接通用服务器)
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
- **收敛比**:建议 1:1(无收敛)
|
|
|
|
|
|
- **东西向带宽**:全部东西向全速
|
|
|
|
|
|
- **400G 端口密度**:按需配置
|
|
|
|
|
|
|
|
|
|
|
|
#### GPU 集群专用网络(InfiniBand)
|
|
|
|
|
|
|
|
|
|
|
|
| 项目 | 参数 |
|
|
|
|
|
|
|------|------|
|
|
|
|
|
|
| 带宽 | 400 Gb/s NDR |
|
|
|
|
|
|
| 拓扑 | Fat-Tree 或 DragonFly+ |
|
|
|
|
|
|
| 端口数 | 按 GPU 卡数 × 1.6 配置 |
|
|
|
|
|
|
| 路由 | 自适应路由(AR)|
|
|
|
|
|
|
|
|
|
|
|
|
### 5.2 存储网络
|
|
|
|
|
|
|
|
|
|
|
|
| 类型 | 协议 | 带宽需求 |
|
|
|
|
|
|
|------|------|---------|
|
|
|
|
|
|
| 训练数据存储 | RoCE v2 + NVMe-oF | 200 Gb/s |
|
|
|
|
|
|
| 模型仓库 | RoCE v2 + 对象存储 | 100 Gb/s |
|
|
|
|
|
|
| 备份存储 | 以太网 + iSCSI | 25-100 Gb/s |
|
|
|
|
|
|
|
|
|
|
|
|
**存储性能目标:**
|
|
|
|
|
|
- 训练数据集读取带宽:≥ 500 GB/s
|
|
|
|
|
|
- 训练检查点写入:≤ 30 秒(100GB 检查点)
|
|
|
|
|
|
|
|
|
|
|
|
### 5.3 智算网络安全
|
|
|
|
|
|
|
|
|
|
|
|
| 安全措施 | 说明 |
|
|
|
|
|
|
|---------|------|
|
|
|
|
|
|
| 零信任网络(ZTNA)| 微隔离,按需授权 |
|
|
|
|
|
|
| DDoS 防护 | 清洗异常流量 |
|
|
|
|
|
|
| 算力隔离 | 训练/推理网络物理隔离 |
|
|
|
|
|
|
| 数据加密 | 传输加密(TLS)+ 存储加密 |
|
|
|
|
|
|
| 运维审计 | 全量日志留存,堡垒机访问 |
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 六、供电系统方案
|
|
|
|
|
|
|
|
|
|
|
|
### 6.1 智算中心供电架构
|
|
|
|
|
|
|
|
|
|
|
|
```
|
|
|
|
|
|
市电(双路10kV/35kV)
|
|
|
|
|
|
↓
|
|
|
|
|
|
自动转换开关 ATS
|
|
|
|
|
|
↓
|
|
|
|
|
|
高压配电
|
|
|
|
|
|
↓
|
|
|
|
|
|
SCALE-UP UPS(2N冗余,模块化)
|
|
|
|
|
|
↓
|
|
|
|
|
|
配电单元 PDU
|
|
|
|
|
|
↓
|
|
|
|
|
|
GPU服务器机柜(液冷CDU集成供电)
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
### 6.2 关键供电参数
|
|
|
|
|
|
|
|
|
|
|
|
| 项目 | 推荐值 |
|
|
|
|
|
|
|------|-------|
|
|
|
|
|
|
| 市电引入 | 双路 10kV 或 35kV(互为备用)|
|
|
|
|
|
|
| UPS 配置 | 2N 冗余(Tier IV)/ N+1(Tier III)|
|
|
|
|
|
|
| UPS 效率 | 模块化效率 ≥96% |
|
|
|
|
|
|
| 柴油发电机 | 1000-5000 kVA,启动时间 <10s |
|
|
|
|
|
|
| 储油时间 | 24 小时(关键负载)|
|
|
|
|
|
|
| 单柜功率密度 | 40-130 kW(液冷方案)|
|
|
|
|
|
|
| 总功耗估算 | GPU 单柜 100kW × 100柜 = 10 MW |
|
|
|
|
|
|
|
|
|
|
|
|
### 6.3 液冷对供电的影响
|
|
|
|
|
|
|
|
|
|
|
|
| 影响项 | 说明 |
|
|
|
|
|
|
|-------|------|
|
|
|
|
|
|
| 供电密度提升 | 单机柜功率从 10kW 升至 100kW+,对 PDU 配电模块要求更高 |
|
|
|
|
|
|
| 液冷 CDU 供电 | CDU 设备需独立配电回路 |
|
|
|
|
|
|
| 变压器容量 | 需提前规划,按 100kW/柜计算总容量 |
|
|
|
|
|
|
| 市电申请 | 大规模智算中心(10MW+)需与电力公司单独协商 |
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 七、智算中心运维与平台
|
|
|
|
|
|
|
|
|
|
|
|
### 7.1 算力调度平台
|
|
|
|
|
|
|
|
|
|
|
|
| 功能模块 | 说明 |
|
|
|
|
|
|
|---------|------|
|
|
|
|
|
|
| 作业调度 | Slurm / Kubernetes + Volcano |
|
|
|
|
|
|
| 算力编排 | 训练/推理任务自动调度到合适集群 |
|
|
|
|
|
|
| 配额管理 | 按部门/项目配额控制 |
|
|
|
|
|
|
| 计费 | 按 GPU 卡时、存储量计费 |
|
|
|
|
|
|
| 碳排放管理 | 实时碳排放统计(配合绿电)|
|
|
|
|
|
|
|
|
|
|
|
|
### 7.2 监控与运维
|
|
|
|
|
|
|
|
|
|
|
|
| 监控维度 | 工具 |
|
|
|
|
|
|
|---------|------|
|
|
|
|
|
|
| GPU 监控 | DCGM(NVIDIA)/ smi(昇腾)|
|
|
|
|
|
|
| 集群监控 | Prometheus + Grafana |
|
|
|
|
|
|
| 液冷监控 | CDU 自带系统 + 动环平台 |
|
|
|
|
|
|
| 网络监控 | 带内/带外分离,综合网管 |
|
|
|
|
|
|
| 告警 | 分级告警(P1-P4),短信/邮件/IM |
|
|
|
|
|
|
|
|
|
|
|
|
### 7.3 运维安全
|
|
|
|
|
|
|
|
|
|
|
|
- **堡垒机**:所有运维操作经堡垒机,留存完整审计日志
|
|
|
|
|
|
- **双人授权**:高危操作需双人确认
|
|
|
|
|
|
- **变更管理**:所有变更经审批,保留回滚方案
|
|
|
|
|
|
- **应急响应**:制定智算中心专项应急预案(SOP)
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 八、智算中心案例参考
|
|
|
|
|
|
|
|
|
|
|
|
### 8.1 典型智算中心案例
|
|
|
|
|
|
|
|
|
|
|
|
#### 中国电信临港智算谷
|
|
|
|
|
|
|
|
|
|
|
|
| 项目 | 内容 |
|
|
|
|
|
|
|------|------|
|
|
|
|
|
|
| 位置 | 上海临港新片区 |
|
|
|
|
|
|
| 规模 | 一期 119 亩,总规划 10 万卡 GPU 集群 |
|
|
|
|
|
|
| 机楼 | 10 栋数据机楼,最高单栋 >40 MW |
|
|
|
|
|
|
| 单柜功率 | 8 kW(风冷)/ 20-60 kW(冷板)/ 液冷浸没 |
|
|
|
|
|
|
| PUE | < 1.2(液冷方案)|
|
|
|
|
|
|
| 网络 | 接入国家超算互联网 |
|
|
|
|
|
|
|
|
|
|
|
|
#### 曙光数创浸没式液冷案例
|
|
|
|
|
|
|
|
|
|
|
|
- **相变浸没式**:单机柜功耗突破 **900 kW**
|
|
|
|
|
|
- **单相浸没式**:高密度部署,芯片全浸没于氟化液
|
|
|
|
|
|
- **代表项目**:多个国家级超算中心、运营商智算集群
|
|
|
|
|
|
|
|
|
|
|
|
#### 联想 × 吉利 HPC 智算集群
|
|
|
|
|
|
|
|
|
|
|
|
- **服务器**:联想 SD650 V3(海神温水水冷)
|
|
|
|
|
|
- **散热方式**:100% 冷板式液冷
|
|
|
|
|
|
- **PUE**:1.1 以下
|
|
|
|
|
|
- **节能效果**:节省 **45%** 电力成本
|
|
|
|
|
|
|
|
|
|
|
|
#### Vertiv × 英伟达 GB200 NVL72 参考设计
|
|
|
|
|
|
|
|
|
|
|
|
- **单机柜功率**:130 kW
|
|
|
|
|
|
- **能效提升**:减少 25% 能耗
|
|
|
|
|
|
- **空间节省**:减少 75% 机柜占地
|
|
|
|
|
|
- **适用场景**:超大规模智算中心
|
|
|
|
|
|
|
|
|
|
|
|
### 8.2 机场智算中心建设案例
|
|
|
|
|
|
|
|
|
|
|
|
| 机场 | 智算应用 | 基础设施 | 液冷情况 |
|
|
|
|
|
|
|------|---------|---------|---------|
|
|
|
|
|
|
| 大连金州湾(在建)| AI巡检、数字孪生 | BIM+数字孪生 | 预留风液融合 |
|
|
|
|
|
|
| 北京大兴机场 | 平台化 AI(19平台68系统)| 维谛 Liebert PEX+ | 风冷精密空调 |
|
|
|
|
|
|
| 迪拜机场 | 智能运维、预测性维护 | 华为预制模块化 | 行级变频空调 |
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 九、供应商与设备参考
|
|
|
|
|
|
|
|
|
|
|
|
### 9.1 液冷系统供应商
|
|
|
|
|
|
|
|
|
|
|
|
| 供应商 | 方案类型 | 代表产品/案例 |
|
|
|
|
|
|
|--------|---------|-------------|
|
|
|
|
|
|
| 维谛技术(Vertiv)| 冷板式(英伟达独家合作)| GB200 NVL72 参考设计,Liebert PEX+ |
|
|
|
|
|
|
| 英维克(Envicool)| 冷板式 + 浸没式 | 国产液冷龙头,多个 AIDC 项目 |
|
|
|
|
|
|
| 曙光数创 | 浸没式(相变/单相)| 国内浸没式液冷最大供应商 |
|
|
|
|
|
|
| 华为 | 冷板式 + 液冷 CDU | 临港智算谷项目 |
|
|
|
|
|
|
| Keydak 金盾 | 风液融合 | 2025 机场博览会发布 |
|
|
|
|
|
|
| 施耐德电气 | 冷板式液冷基础设施 | 132 kW/rack 方案 |
|
|
|
|
|
|
|
|
|
|
|
|
### 9.2 GPU 服务器供应商
|
|
|
|
|
|
|
|
|
|
|
|
| 供应商 | 产品系列 | GPU 支持 |
|
|
|
|
|
|
|--------|---------|---------|
|
|
|
|
|
|
| 浪潮信息 | NF5688M7 / NF5698M7 | H100/H200/L20 |
|
|
|
|
|
|
| 新华三 | R4900 G6 | H100/H200 |
|
|
|
|
|
|
| 华为 | 昇腾 910B 集群 | 昇腾 NPU |
|
|
|
|
|
|
| 联想 | ThinkSystem SR670 V2 | H100/H200 |
|
|
|
|
|
|
| 超聚变 | FusionPoD | 多元异构 |
|
|
|
|
|
|
|
|
|
|
|
|
### 9.3 网络设备供应商
|
|
|
|
|
|
|
|
|
|
|
|
| 设备 | 推荐供应商 | 规格 |
|
|
|
|
|
|
|------|---------|------|
|
|
|
|
|
|
| InfiniBand 交换机 | NVIDIA Quantum-2 | 400Gb/s NDR |
|
|
|
|
|
|
| 以太网交换机 | 华为 CloudEngine 16800 | 400G |
|
|
|
|
|
|
| RoCE 网卡 | NVIDIA ConnectX-7 | 400Gb/s |
|
|
|
|
|
|
| 光模块 | II-VI / 华为 | 400G DR4/FR4 |
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 十、技术方案总结
|
|
|
|
|
|
|
|
|
|
|
|
### 10.1 机场智算中心推荐配置
|
|
|
|
|
|
|
|
|
|
|
|
|| 层级 | 推荐技术选型 |
|
|
|
|
|
|
||------|------------|
|
|
|
|
|
|
| **算力芯片** | NVIDIA H100/H200(训练)+ L40S(推理),预留昇腾 910B 国产化 |
|
|
|
|
|
|
| **液冷方案** | 冷板式液冷为主(当前主流),PUE 目标 ≤1.25(典型),≤1.15(优秀)|
|
|
|
|
|
|
| **网络架构** | Spine-Leaf 400G + InfiniBand 400G(NDR)|
|
|
|
|
|
|
| **存储架构** | 全闪存分布式存储,≥500 GB/s 聚合带宽(需 20+ 存储节点前提)|
|
|
|
|
|
|
| **国产化** | 昇腾 910B + 曙光数创液冷 + 华为存储 |
|
|
|
|
|
|
| **运维平台** | Kubernetes + Volcano + DCGM + Prometheus |
|
|
|
|
|
|
| **PUE 目标** | ≤1.25(80%液冷)/ ≤1.15(全液冷+自然冷却配合)|
|
|
|
|
|
|
|
|
|
|
|
|
### 10.2 关键参数汇总
|
|
|
|
|
|
|
|
|
|
|
|
|| 参数 | 数值 |
|
|
|
|
|
|
||------|------|
|
|
|
|
|
|
|| 单机柜功率(训练)| 80-130 kW |
|
|
|
|
|
|
|| 单机柜功率(推理)| 40-80 kW |
|
|
|
|
|
|
|| GPU 互联带宽(节点内)| NVLink 900 GB/s(双向对等)|
|
|
|
|
|
|
|| 网络互联带宽(节点间)| IB 400G / 以太网 400G |
|
|
|
|
|
|
|| PUE | ≤1.25(典型),≤1.15(优秀,全液冷+自然冷却)|
|
|
|
|
|
|
|| 可用性(Tier III)| 99.982%,年均故障时间 ≤1.6 小时 |
|
|
|
|
|
|
|
|
|
|
|
|
### 10.3 实施建议
|
|
|
|
|
|
|
|
|
|
|
|
1. **液冷优先**:新建机场智算中心应直接采用冷板式液冷,避免后期改造成本
|
|
|
|
|
|
2. **弹性架构**:预留机柜电力容量和网络端口,适配未来芯片功率持续上升
|
|
|
|
|
|
3. **国产化路径**:可采用"主流国际芯片+国产化备用"的双轨策略
|
|
|
|
|
|
4. **建设运营一体化**:参考上海机场 BIM 经验,将数字孪生从设计阶段贯穿至运维
|
|
|
|
|
|
5. **分期建设**:首期部署推理集群满足当前需求,中期扩展训练集群能力
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
## 附录
|
|
|
|
|
|
|
|
|
|
|
|
### A. 术语表
|
|
|
|
|
|
|
|
|
|
|
|
| 缩写 | 全称 | 说明 |
|
|
|
|
|
|
|------|------|------|
|
|
|
|
|
|
| AIDC | Artificial Intelligence Data Center | 智算中心 |
|
|
|
|
|
|
| PUE | Power Usage Effectiveness | 电能利用效率 |
|
|
|
|
|
|
| CDU | Coolant Distribution Unit | 冷却液分配单元 |
|
|
|
|
|
|
| NCCL | NVIDIA Collective Communications Library | GPU集合通信库 |
|
|
|
|
|
|
| RoCE | RDMA over Converged Ethernet | 以太网远程直接内存访问 |
|
|
|
|
|
|
| NVLink | NVIDIA High-Speed GPU Interconnect | 英伟达高速GPU互连 |
|
|
|
|
|
|
| InfiniBand | High-Speed Network Architecture | 高速网络架构 |
|
|
|
|
|
|
| DCGM | Data Center GPU Manager | 数据中心GPU管理工具 |
|
|
|
|
|
|
| vLLM | Virtual Large Language Model Server | 开源LLM推理服务框架 |
|
|
|
|
|
|
| HBM | High Bandwidth Memory | 高带宽存储器 |
|
|
|
|
|
|
| BF16 | Brain Float 16 | AI训练常用浮点格式 |
|
|
|
|
|
|
| ZTNA | Zero Trust Network Architecture | 零信任网络架构 |
|
|
|
|
|
|
|
|
|
|
|
|
### B. 数据来源
|
|
|
|
|
|
|
|
|
|
|
|
1. **中国信通院**,《人工智能算力基础设施赋能研究报告(2025年)》
|
|
|
|
|
|
2. **国信证券**,《数据中心液冷专题报告:液冷:智算中心散热核心技术》
|
|
|
|
|
|
3. **头豹研究院**,《2025年中国AIDC产业发展白皮书》
|
|
|
|
|
|
4. **中国工业互联网研究院**,《工业智算发展研究报告(2025年)》
|
|
|
|
|
|
5. **中国基金报**,液冷市场专题报道(2025年8月)
|
|
|
|
|
|
6. **Vertiv**,《GB200 NVL72 参考架构白皮书》
|
|
|
|
|
|
7. **临港算力**,智算中心液冷实践(2025年6月,中国电信算力大会)
|
|
|
|
|
|
8. **联想集团**,海神温水水冷系统技术资料
|
|
|
|
|
|
9. **Keydak金盾**,2025国际机场博览会发布资料
|
|
|
|
|
|
|
|
|
|
|
|
### C. 相关标准与政策
|
|
|
|
|
|
|
|
|
|
|
|
- 《数据中心绿色低碳发展专项行动计划》(发改环资〔2024〕970号)
|
|
|
|
|
|
- 《数据中心设计规范》GB 50174-2017
|
|
|
|
|
|
- 《新型数据中心发展三年行动计划(2021-2023)》
|
|
|
|
|
|
- 《算力基础设施高质量发展行动计划》
|
|
|
|
|
|
- Uptime Institute Tier Standard
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
*本方案为技术方案参考文档,具体项目需结合机场业务规模、预算、国产化要求和所在地区政策进行定制化设计。建议在项目立项后委托专业设计院进行深化设计。*
|