diff --git a/airport-wiki/log.md b/airport-wiki/log.md index 3143238..fb03fd9 100644 --- a/airport-wiki/log.md +++ b/airport-wiki/log.md @@ -198,4 +198,12 @@ tags: [meta, log] - 總計收錄約 200+ 縮寫,完整覆蓋智算中心 + 航班運營兩大領域 - 更新:glossary.md、index.md、log.md +## [2026-04-10] update | 重写 机场智算中心技术方案 +- 基于 wiki 最新内容全面重写:GPU 集群拓扑、液冷 PUE/WUE/CUE 三级指标、IB NDR 400G 组网、存储架构、国产化方案 +- 修正:GB200 NVL72 HBM3e 带宽 16 TB/s(原错误值已更正)、HGX H100 NVSwitch 6 芯片拓扑、昇腾 HCCS 392 GB/s(原误写 128 GB/s) +- 新增三个机场案例:郑州航空港(10,000P 当前 / 100,000P 规划)、福州长乐(15,000P / 11 亿元 / 2026.10 投产)、深圳宝安(DeepSeek R1-671B 满血版,全国第二) +- 新增三级规模配置方案(中等/大规模/旗舰)含功耗测算 +- 来源:上海智算导则、头豹 AIDC 白皮书、工业智算报告、Vertiv GB200 白皮书、郑州/福州/深圳机场案例 +- 更新:机场智算中心技术方案.md、log.md + diff --git a/airport-wiki/机场智算中心技术方案.md b/airport-wiki/机场智算中心技术方案.md index c32e654..b5f098b 100644 --- a/airport-wiki/机场智算中心技术方案.md +++ b/airport-wiki/机场智算中心技术方案.md @@ -4,252 +4,211 @@ created: 2026-04-08 updated: 2026-04-10 type: solution tags: [solution, gpu, liquid-cooling, tier, power, network] -sources: [raw/articles/ibm-airport-ai.md, raw/articles/shanghai-ai-computing-guidelines.md, raw/articles/headleo-aiDC-whitepaper.md, raw/articles/industrial-ai-computing-report.md, raw/articles/dubai-airport-huawei-dc.md, raw/articles/daxing-airport-vertiv.md, raw/articles/2025-airport-construction-summit.md] +sources: [raw/articles/shanghai-ai-computing-guidelines.md, raw/articles/headleo-aiDC-whitepaper.md, raw/articles/industrial-ai-computing-report.md, raw/articles/dubai-airport-huawei-dc.md, raw/articles/daxing-airport-vertiv.md, raw/articles/2025-airport-construction-summit.md, raw/articles/zhengzhou-airport-hangang.md, raw/articles/fuzhou-changle-airport-bsj.md] --- # 机场智算中心技术方案 -> 本方案综合整理自:中国信通院《人工智能算力基础设施赋能研究报告(2025)》、国信证券液冷专题报告、头豹研究院《2025年中国AIDC产业白皮书》、中国工业互联网研究院《工业智算发展研究报告(2025)》、临港算力液冷实践等 -> 生成时间:2026-04-08 -> 数据来源:详见附录 +> 本方案以机场 wiki 现有资料库为依据,综合:上海智算中心建设导则(2025)、头豹 AIDC 白皮书(2025)、工业智算报告、大兴/迪拜/大连/郑州/福州/深圳等机场案例 +> 生成时间:2026-04-10 | 数据来源:详见附录 --- -## 一、机场智算中心概述 +## 一、概述 -### 1.1 定义 +### 1.1 什么是机场智算中心 -机场智算中心(Airport Intelligent Computing Center)是基于 GPU/NPU/ASIC 等异构算力芯片,为机场智能化应用提供**训练与推理**算力服务的专用基础设施。区别于传统数据中心,智算中心以**高性能集群**为核心载体,支撑大模型训练、AI推理、视频分析、智能决策等智能化负载。 +机场智算中心(Airport Intelligent Computing Center)是支撑机场智能化运营的 **GPU/NPU/ASIC 异构算力集群**,区别于传统数据中心(CPU 为主、风冷、PUE 1.4+),智算中心以 AI 训练/推理为核心负载,必须采用液冷散热和东西向高速网络。 -### 1.2 与传统数据中心的核心差异 +### 1.2 传统 DC vs 智算中心核心差异 | 对比项 | 传统数据中心 | 智算中心 | |--------|------------|---------| | 核心负载 | ERP、Web、数据库 | AI 训练/推理、视频分析 | | 算力芯片 | CPU 为主 | GPU/NPU 集群为主 | -| 单机柜功率 | 5-15 kW | 50-200+ kW | +| 单机柜功率 | 5–15 kW | **50–200+ kW** | | 散热方式 | 风冷为主 | **液冷为主** | | 网络重点 | 南北向 | **东西向高速互联** | -| PUE 目标 | 1.4-1.6 | **≤1.25**(国家枢纽节点 ≤1.2) | +| PUE 目标 | 1.4–1.6 | **≤ 1.25**(全液冷 ≤ 1.15)| -### 1.3 机场智算中心的典型应用场景 +### 1.3 典型应用场景与算力需求 -| 应用场景 | 具体内容 | 算力类型 | +| 应用场景 | 算力类型 | 典型规模 | |---------|---------|---------| -| 航班智能调度 | 基于大模型的航班延误预测、停机位优化 | 训练+推理 | -| 行李全流程追踪 | 计算机视觉识别、异常检测 | 推理为主 | -| 视频智能分析 | 航站楼安防/客流热力图分析 | 推理为主 | -| 语音客服机器人 | 旅客问答、多语言翻译 | 推理为主 | -| 飞机故障预测 | 时序数据分析、故障预警 | 训练+推理 | -| 机场数字孪生 | 物理仿真、实时渲染 | 训练+推理 | -| 智能驾驶舱/巡检 | 四足机器人视觉导航、障碍检测 | 推理为主 | +| 航班智能调度(大模型) | 训练 + 推理 | 7B–70B 参数模型微调 | +| 行李全流程追踪(CV) | 推理为主 | 100+ 摄像头视频流 | +| 航站楼安防/客流热力图 | 推理为主 | 实时视频分析 | +| 语音客服机器人 | 推理为主 | 并发 500+ QPS | +| 飞机故障预测(时序) | 训练 + 推理 | 时序数据分析 | +| 机场数字孪生 | 训练 + 推理 | 物理仿真 + 渲染 | +| 智能巡检机器人 | 推理为主 | 边缘部署 | +| 行李异常检测(多模态) | 推理为主 | CV + NLP | -### 1.4 算力规模测算参考 +### 1.4 中国智算市场规模参考 -根据《2025年中国人工智能计算力发展评估报告》: +| 年份 | 中国智算规模 | 同比增速 | +|------|----------|---------| +| 2024 | 725.3 EFlops(FP16)| +74.1% | +| 2025E | 1,037.3 EFlops | +43% | +| 2028E(复合增长 46.2%)| — | — | -- **2024年**:中国智算规模 725.3 EFlops(FP16),同比增长 **74.1%** -- **2025年预测**:中国智算规模将达 **1037.3 EFlops**,增长 43% -- **2023-2028年复合增长率**:智算 **46.2%**,通算 18.8% +> 数据来源:IDC + 浪潮信息《中国人工智能计算力发展评估报告》 -机场智算中心规模建议: +### 1.5 机场智算中心规模分级建议 -| 机场规模 | 推荐智算规模 | GPU 卡数参考 | -|---------|------------|-------------| -| 千万级旅客以下 | 1-10 PFLOPS(FP16) | 64-512 卡 | -| 千万至两千万级 | 10-50 PFLOPS | 512-2048 卡 | -| 两千万级以上 | 50-200 PFLOPS+ | 2048-8000+ 卡 | +| 机场规模 | 推荐算力 | GPU 卡数参考 | 典型机柜数 | +|---------|---------|------------|---------| +| 年旅客量 < 1,000 万 | 1–10 PFLOPS(FP16)| 64–512 卡 | 8–32 柜 | +| 年旅客量 1,000–5,000 万 | 10–50 PFLOPS | 512–2,048 卡 | 32–128 柜 | +| 年旅客量 > 5,000 万 | 50–200+ PFLOPS | 2,048–8,000+ 卡 | 128–500+ 柜 | --- -## 二、整体技术架构 +## 二、系统架构 -### 2.1 智算中心系统架构 +### 2.1 整体架构 ``` -┌─────────────────────────────────────────────────┐ -│ 应用服务层 │ -│ 航班调度大模型 │ 行李追踪 │ 安防分析 │ 客服机器人 │ -├─────────────────────────────────────────────────┤ -│ 模型服务层 │ -│ 推理引擎(vLLM/TGI)│ 微调框架 │ 模型仓库 │ -├─────────────────────────────────────────────────┤ -│ 训练平台层 │ -│ 分布式训练框架(NCCL/昇腾集合通信)│ 数据管理 │ -├─────────────────────────────────────────────────┤ -│ 算力调度层 │ -│ 算力调度器│ 作业管理│ 配额计费│ 碳排放管理 │ -├─────────────────────────────────────────────────┤ -│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │ -│ │ GPU集群 │ │ GPU集群 │ │ CPU通用 │ │ -│ │ (训练) │ │ (推理) │ │ 集群 │ │ -│ └──────────┘ └──────────┘ └──────────┘ │ -├─────────────────────────────────────────────────┤ -│ 存储层 │ -│ 分布式文件系统│ 分布式数据库│ 对象存储 │ -├─────────────────────────────────────────────────┤ -│ 网络层 │ -│ Spine-Leaf │ RoCE v2 │ 400G/800G │ -├─────────────────────────────────────────────────┤ -│ 基础设施层 │ -│ 供配电 │ 液冷系统 │ 机柜 │ 消防 │ 监控 │ -└─────────────────────────────────────────────────┘ +┌──────────────────────────────────────────────────────┐ +│ 应用服务层 │ +│ 航班调度大模型 │ 行李追踪 │ 安防分析 │ 客服机器人 │ +├──────────────────────────────────────────────────────┤ +│ 模型服务层 │ +│ 推理引擎(vLLM / TensorRT-LLM)│ 微调框架 │ 模型仓库 │ +├──────────────────────────────────────────────────────┤ +│ 训练平台层 │ +│ 分布式训练框架(NCCL / Megatron-LM / DeepSpeed) │ +├──────────────────────────────────────────────────────┤ +│ 算力调度层 │ +│ Kubernetes + Volcano │ 作业管理 │ 配额计费 │ 碳排管理│ +├──────────────────────────────────────────────────────┤ +│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │ +│ │ 训练集群 │ │ 推理集群 │ │ 国产化集群 │ │ +│ │ HGX H100 │ │ L40S/昇腾 │ │ 昇腾 910B │ │ +│ └──────────┘ └──────────┘ └──────────┘ │ +├──────────────────────────────────────────────────────┤ +│ 存储层 │ +│ JuiceFS + 对象存储(S3)│ 全闪存分布式 │ 本地 NVMe 缓存│ +├──────────────────────────────────────────────────────┤ +│ 网络层 │ +│ Spine-Leaf 400G │ InfiniBand NDR 400G │ RoCE v2 │ +├──────────────────────────────────────────────────────┤ +│ 基础设施层 │ +│ 供配电(2N UPS)│ 液冷系统(CDU)│ 机柜 │ 消防 │ 监控│ +└──────────────────────────────────────────────────────┘ ``` -### 2.2 云边端协同架构 - -机场智算中心采用**云-边-端**三级协同架构: +### 2.2 云-边-端协同 ``` 云端(智算中心) - │ ├── 训练集群:大规模长时训练任务 ├── 推理服务:实时性要求不高的批量推理 - └── 模型管理:模型训练、微调、版本管理 + └── 模型管理:微调、版本管理 -边缘(航站楼/塔台边缘节点) - │ - ├── 实时推理:时延敏感业务(客流分析、安防告警) +边缘(航站楼 / 塔台边缘节点) + ├── 实时推理:客流分析、安防告警(< 100ms) ├── 数据汇聚:本地数据预处理 └── 断网自治:与云端断连时独立运行 端侧(摄像头、传感器、机器人) - │ ├── 轻量推理:目标检测、异常初筛 └── 数据采集:原始数据上报 ``` ### 2.3 异构算力架构 -机场智算中心建议采用**多元异构算力**架构,主流配置: +| 芯片类型 | 代表产品 | FP16 算力 | 显存带宽 | 功耗 | 适用场景 | +|---------|---------|-----------|---------|------|---------| +| **GPU(主流)** | NVIDIA H100 SXM5 | ~1 PFLOPS | 3.35 TB/s | 700W | 大模型训练 | +| **GPU(主流)** | NVIDIA H200 SXM | ~1 PFLOPS | **4.8 TB/s**(HBM3e)| 700W | 大规模训练 / 推理 | +| **GPU** | NVIDIA B200 | 2.25 PFLOPS | 8 TB/s | 1,200W | 超大规模智算中心 | +| **GPU(旗舰)** | **GB200 NVL72** | **~5 PFLOPS** | 16 TB/s | 2,700W/芯片 | 万卡集群(整机柜方案)| +| **GPU(推理)** | NVIDIA L40S | ~2 PFLOPS | 864 GB/s | 350W | 推理为主、中等规模 | +| **NPU(国产)** | 华为昇腾 910B | 640 TFLOPS | — | 400W | 国产化替代 | +| **ASIC(国产)** | 海光 DCU Z100 | 256 TFLOPS | — | 350W | 国产化替代(ROCm 兼容 CUDA)| -| 芯片类型 | 代表产品 | 适用场景 | 备注 | -|---------|---------|---------|------| -| GPU | NVIDIA H100/H200/B200 | 大模型训练、高性能推理 | 主流选择 | -| GPU | NVIDIA L20/L40S | 推理为主、中等规模 | 性价比方案 | -| NPU | 华为昇腾 910B | 国产化替代 | 昇腾生态 | -| NPU | 海光 DCU | 国产化替代 | 兼容 CUDA | -| ASIC | 寒武纪思元 | 特定推理场景 | 国产化 | - -**推荐配置原则:** -- 训练集群:H100/H200(NVLink 互联) -- 推理集群:L40S 或国产 NPU(成本优化) -- 国产化要求:昇腾 910B 系列优先 +> GB200 NVL72 为整机柜方案:72 GPU + 36 Grace CPU,详见第四章 --- -## 三、液冷系统技术方案 +## 三、液冷系统 -> 液冷是智算中心高功率密度散热的**核心技术路线**,也是本方案的重点。 +> **液冷是智算中心高功率密度散热的核心技术路线**,也是本方案重点。 -### 3.1 背景与政策要求 +### 3.1 背景:芯片功耗爆炸式增长 -根据国家发改委等四部门《数据中心绿色低碳发展专项行动计划》(2024年7月): - -| 指标 | 目标 | -|------|------| -| 全国数据中心平均 PUE | < 1.5(2025年底) | -| 大型/超大型新建数据中心 PUE | < 1.25 | -| 国家枢纽节点数据中心 PUE | ≤ 1.2 | -| 绿电占比(枢纽节点新建) | > 80% | - -智算中心芯片功耗飞速增长,是液冷成为刚需的根本原因: - -| 芯片/系统 | 功耗 | 散热方式 | -|---------|------|---------| -| CPU(英特尔至强 2000系列) | 450-500W/颗 | 风冷极限 | -| GPU(英伟达 A100) | 400W | 需液冷 | -| GPU(英伟达 H100) | 700W | 必须液冷 | -| GPU(英伟达 GB200) | 2700W/超级芯片 | 必须液冷 | -| GPU机架(2024年典型) | 130 kW/rack | 必须液冷 | -| GPU机架(2029年预测) | **> 1 MW/rack** | 全面液冷 | +| 芯片 / 系统 | 功耗 | 散热方式 | +|------------|------|---------| +| CPU(至强 2000 系列)| 450–500W/颗 | 风冷极限 | +| GPU(A100) | 400W | 需液冷 | +| GPU(H100) | 700W | 必须液冷 | +| GPU(GB200) | **2,700W/超级芯片** | 必须液冷(相变或冷板)| +| GPU 机架(2024 年典型)| ~130 kW/rack | 必须液冷 | +| GPU 机架(2029 年预测)| **> 1 MW/rack** | 全面液冷 | ### 3.2 液冷技术路线对比 -液冷技术分为三大类:**冷板式**、**浸没式**、**喷淋式**。 - -#### 三类方案对比 - -| 对比项 | 冷板式液冷 | 浸没式液冷(单相) | 浸没式液冷(相变) | -|--------|----------|-----------------|-----------------| +| 对比项 | 冷板式液冷 | 浸没式液冷(单相)| 浸没式液冷(相变)| +|--------|----------|----------------|----------------| | 成熟度 | ★★★★★ 最高 | ★★★★ 高 | ★★★ 中 | | 服务器改动 | 冷板安装 | 需定制服务器 | 需定制服务器 | | 维护便利性 | ★★★★ 较好 | ★★★ 一般 | ★★ 复杂 | -| 散热能力 | 强(覆盖CPU/GPU/显存) | 极强 | 极强(相变换热) | -| 单机柜密度 | 40-130 kW | 100-500 kW | 250-500+ kW | +| 散热能力 | 强 | 极强 | 极强(相变换热)| +| 单机柜密度 | 40–130 kW | 100–500 kW | 250–500+ kW | | 初期投资 | 中等 | 较高 | 最高 | -| 运维成本 | 中等 | 较低 | 较高 | -| 适用场景 | **当前主流,推荐** | 高密度细分场景 | 超高功率特种场景 | +| **适用场景** | **当前主流,推荐** | 高密度细分场景 | 超高功率特种场景 | -#### 冷板式液冷架构详解 - -冷板式液冷是**当前市场主流**,技术最成熟,对现有服务器生态改变最小。 +### 3.3 冷板式液冷架构 **系统架构:** ``` -室内侧(一次侧冷源) +室外侧(一次侧冷源) 冷却塔 / 干冷器 - ↓(自然冷却/蒸发冷却) - 冷水机组(可选,夏季备用) + ↓(自然冷却 / 蒸发冷却) + 冷水机组(夏季备用) ↓ 一次侧循环管路 - ↓ 板式换热器 - 室内侧(二次侧供液) CDU(冷却分配单元) ↓ Manifold(液冷分配岐管) ↓ - 冷板(直接贴附于芯片) + 冷板(直接贴附芯片:CPU + GPU + 内存) ↓ - 服务器内部:CPU冷板 + GPU冷板 + 内存冷板 + 服务器内部 ``` **关键设备参数:** | 设备 | 功能 | 关键参数 | |------|------|---------| -| CDU | 冷却液循环、温度控制 | 典型容量 200-400 kW,支持双路 | -| Manifold | 分液到各机柜 | 316L不锈钢,多路分配 | +| CDU | 冷却液循环、温度控制 | 典型容量 200–400 kW,支持双路 | +| Manifold | 分液到各机柜 | 316L 不锈钢,多路分配 | | 冷板 | 直接接触芯片散热 | 接触面导热硅脂,微通道设计 | -| 一次侧管路 | 外部冷源连接 | 闭式循环,防冻液 | -| 二次侧管路 | 内部供液 | 快接接头,可维护设计 | +| 冷却液 | 冷板式常用 | 乙二醇/丙二醇溶液(防冻)| -**冷却液选型:** +### 3.4 液冷方案推荐 -| 类型 | 冷板式常用 | 浸没式常用 | -|------|----------|----------| -| 冷却液 | 乙二醇/丙二醇溶液(防冻)| 氟化液、矿物油(硅油)| -| 去离子水 | 可用(需添加防冻剂)| 不可直接用于浸没 | +#### 方案 A:冷板式液冷(推荐新建机场智算中心) -### 3.3 液冷方案推荐 - -#### 方案A:冷板式液冷(推荐新建机场智算中心) - -**适用场景:** 单机柜功率 40-130 kW,预留升级空间 - -**配置建议:** - -| 项目 | 参数 | +| 参数 | 数值 | |------|------| -| 液冷占比 | 80-100%(全液冷) | +| 液冷占比 | 80–100%(全液冷) | | 风冷辅助 | 仅用于网络设备、少量通用服务器 | -| PUE 目标 | ≤ 1.15(100%液冷)/ ≤ 1.25(80%液冷) | -| 单柜功率 | 上限 130 kW(GB200 NVL72 级别) | +| PUE 目标 | ≤ 1.15(全液冷)/ ≤ 1.25(80% 液冷)| +| 单柜功率上限 | 130 kW(GB200 NVL72 级别)| -**英伟达 GB200 NVL72 参考架构(Vertiv):** +**Vertiv GB200 NVL72 参考架构:** - 单机柜功率:**130 kW** - 架构:72 GPU + 36 CPU(Grace Blackwell) - 散热:100% 冷板液冷 - 能耗节省:比传统风冷减少 **25%** - 空间节省:减少 **75%** 机柜占地 -- Vertiv 参考设计已获英伟达官方推荐 -#### 方案B:风液融合(过渡期推荐) - -**适用场景:** 从传统风冷向全液冷过渡,或单机柜功率 40-80 kW 的中期场景 +#### 方案 B:风液融合(过渡期) | 参数 | 数值 | |------|------| @@ -257,133 +216,115 @@ sources: [raw/articles/ibm-airport-ai.md, raw/articles/shanghai-ai-computing-gui | 液冷支持 | 最高 150 kW/柜 | | 特点 | 风液同源、动态平衡、灵活部署 | -Keydak 金盾 2025 年国际机场博览会发布的风液融合方案已在国内多个智算中心落地。 +### 3.5 PUE / WUE / CUE 三级能效指标 -### 3.4 PUE 优化措施 +上海智算中心建设导则(2025)要求(全国最严): -|| 措施 | 效果 | -||------|------| -|| 全液冷替代精密空调 | PUE 从 1.5 降至 **1.15-1.25**(典型值) | -|| 冷通道封闭 | 减少冷热气流混合,节能 10-15% | -|| 自然冷却利用 | 冬季低温期配合液冷进一步降低 PUE | -|| 高效 UPS(模块化效率≥96%) | 降低供电损耗 | -|| AI 调优 | 实时调节液冷流量与温度 | +| 指标 | 新建标准值 | 运营先进值 | 长三角集群 | +|------|----------|----------|---------| +| **PUE(基准)** | ≤ 1.25 | — | — | +| **PUE(综合)** | ≤ 1.22 | ≤ 1.18 | ≤ 1.20 | +| **WUE** | ≤ 2.2 L/kWh | ≤ 2.0 L/kWh | — | +| **CUE** | ≤ 1.2 gCO₂/kWh | ≤ 1.0 gCO₂/kWh | — | -> **PUE 边界说明**:PUE = 1.0 为理想值(所有电力用于计算,无任何制冷/供电损耗)。实际智算中心 PUE 取决于:① 液冷比例(全液冷 vs. 风液混合)、② 当地气候条件(冬季低温期可大幅降低冷却功耗)、③ 供电效率(UPS/变压器损耗)。在典型机场气候条件下(无极端寒冷),全液冷 PUE 典型值为 1.15-1.25,接近 1.1 需要浸没式液冷 + 极寒气候 + 自然冷却配合。 +**PUE 优化措施:** + +| 措施 | 效果 | +|------|------| +| 全液冷替代精密空调 | PUE 从 1.5 降至 **1.15–1.25** | +| 冷通道封闭 | 减少冷热气流混合,节能 10–15% | +| 自然冷却利用 | 冬季低温期配合液冷进一步降低 PUE | +| 高效 UPS(模块化效率 ≥ 96%)| 降低供电损耗 | +| AI 调优 | 实时调节液冷流量与温度 | + +### 3.6 国产液冷供应商参考 + +| 供应商 | 方案类型 | 代表参数 | +|--------|---------|---------| +| 英维克(Envicool)| 冷板式 + 浸没式 | 单机柜散热能力 24 kW,散热效率提升 40% | +| 中科曙光 | 浸没式液冷 | PUE 低至 1.04,年减碳量超万吨 | +| 华为 | 冷板式 + 液冷 CDU | 临港智算谷项目,单柜 20–60 kW | --- -## 四、算力集群技术方案 +## 四、算力集群 -> **设计原则**:本章节遵循 **Scale-Up(节点内纵向扩展)+ Scale-Out(节点间横向扩展)** 双重扩展架构。Scale-Up 以 NVLink/NVSwitch 为核心解决节点内 GPU 全互联问题;Scale-Out 以 InfiniBand/RoCE 为骨干解决多节点集合通信问题。两层网络各有分工,共同支撑从单卡到万卡的算力扩展路径。 +> **设计原则**:本章遵循 **Scale-Up(节点内纵向扩展)+ Scale-Out(节点间横向扩展)** 双重架构。Scale-Up 以 NVLink/NVSwitch 为核心解决节点内 GPU 全互联;Scale-Out 以 InfiniBand/RoCE 为骨干解决多节点集合通信。 ---- +### 4.1 GPU 节点架构演进 -### 4.1 单节点硬件拓扑设计 +| 代际 | 代表产品 | GPU 互联方式 | NVLink 聚合带宽 | GPU 对等带宽 | +|------|---------|------------|--------------|------------| +| 第 1 代(2018)| V100 SXM2 | NVLink 1.0,6 链路 | 300 GB/s | 300 GB/s | +| 第 2 代(2020)| A100 SXM4 | NVLink 3.0,12 链路 | 600 GB/s | 600 GB/s | +| 第 3 代(2022)| H100 SXM5 | NVLink 4.0,18 链路 | 900 GB/s | 900 GB/s | +| 第 4 代(2024)| B200 SXM | NVLink 5.0,18 链路 | **1.8 TB/s** | **900 GB/s** | +| 第 5 代(预测)| Rubin Ultra | NVLink 6.0 | ~3.6 TB/s | ~1.8 TB/s | -#### 4.1.1 GPU 节点架构演进 +> 注:NVLink 5 "1.8 TB/s" 为 Fabric 聚合总带宽,**任意 GPU 到任意 GPU 对等带宽为 900 GB/s 双向**(与 H100 相同)。带宽提升主要来自更多链路并行,而非单链路提速。 -GPU 服务器节点从单卡到多卡的拓扑演进,核心矛盾是** PCIe 带宽瓶颈 vs. NVLink 直连带宽**: - -|| 架构代际 | 代表产品 | GPU 互联方式 | 端口聚合双向带宽 | GPU 对等带宽 | -||---------|---------|------------|--------------|------------| -|| 第1代(2018)| V100 SXM2 | NVLink 1.0,6 链路 | 300 GB/s | 300 GB/s | -|| 第2代(2020)| A100 SXM4 | NVLink 3.0,12 链路 | 600 GB/s | 600 GB/s | -|| 第3代(2022)| H100 SXM5 | NVLink 4.0,18 链路 | 900 GB/s | 900 GB/s | -|| 第4代(2024)| B200 SXM | NVLink 5.0,18 链路 | **1.8 TB/s** | **900 GB/s** | -|| 第5代(预测)| Rubin Ultra | NVLink 6.0 | ~3.6 TB/s | ~1.8 TB/s | - -**关键结论**: - -- NVLink 5 端口聚合双向带宽 1.8 TB/s 是 NVSwitch Fabric 内部 18 链路的总带宽,**任意 GPU 到任意 GPU 的对等带宽仍为 900 GB/s 双向** -- H100 NVLink 4(900 GB/s)是 A100 PCIe 4.0 x16(64 GB/s)的 **14 倍**,因此多 GPU 节点必须走 NVLink/NVSwitch,不能走 PCIe 交换 -- 表中第4代"1.8 TB/s"是聚合总带宽,不能与 H100 的"单 GPU 可用带宽 900 GB/s"直接对比 - -#### 4.1.2 HGX H100/H200 8-GPU 系统拓扑 - -**NVIDIA HGX H100** 是当前最主流的 AI 训练服务器架构: +### 4.2 HGX H100 8-GPU 节点拓扑 ``` ┌─────────────────────────────────┐ │ HGX H100 8-GPU Server │ - │ │ - CPU (AMD EPYC / Intel Xeon) │ - │ × 2 │ - │ │ - PCIe Gen5 x16 (Host Bridge) │ - │ │ - ┌──────────────────────────────────────────────┐ │ - │ NVSwitch Fabric(6 芯片,2 平面) │ - │ NVSwitch① ── NVSwitch② ── NVSwitch③ │ - │ ↖ ↑ ↗ │ - │ NVSwitch④ ── NVSwitch⑤ ── NVSwitch⑥ │ - │ (全连接拓扑,任意GPU间单跳可达) │ - └──────────────────────────────────────────────┘ │ - │ │ │ │ │ │ │ │ │ - GPU0 GPU1 GPU2 GPU3 GPU4 GPU5 GPU6 GPU7 │ - H100 H100 H100 H100 H100 H100 H100 H100 │ - SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 │ - 80GB 80GB 80GB 80GB 80GB 80GB 80GB 80GB │ - HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 │ - └────────── PCIe Gen5 ─────────┘ │ - └────── InfiniBand / RoCE 网卡 ───────────────┘ │ + CPU (AMD EPYC / Intel Xeon) │ + │ × 2 │ + │ │ + PCIe Gen5 x16 (Host Bridge) │ + │ │ + ┌──────────────────────────────────────────────┐ │ + │ NVSwitch Fabric(6 芯片,2 平面) │ │ + │ NVSwitch① ── NVSwitch② ── NVSwitch③ │ │ + │ ↖ ↑ ↗ │ │ + │ NVSwitch④ ── NVSwitch⑤ ── NVSwitch⑥ │ │ + │ (全连接拓扑,任意 GPU 间单跳可达) │ │ + └──────────────────────────────────────────────┘ │ + │ │ │ │ │ │ │ │ │ + GPU0 GPU1 GPU2 GPU3 GPU4 GPU5 GPU6 GPU7 │ + H100 H100 H100 H100 H100 H100 H100 H100 │ + SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 │ + 80GB 80GB 80GB 80GB 80GB 80GB 80GB 80GB │ + HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 │ + └────────── PCIe Gen5 ─────────┘ │ + └────── InfiniBand / RoCE 网卡 ───────────────┘ │ └─────────────────────────────────┘ ``` **关键拓扑参数(HGX H100):** -|| 参数 | 规格 | -||------|------| -|| GPU 数量 | 8 × NVIDIA H100 SXM5 | -|| GPU 间 NVLink 带宽 | 900 GB/s 双向(全互联)| -|| NVSwitch 芯片数 | **6 片**(2 组各 3 片,全连接拓扑)| -|| NVSwitch 交换容量 | 25.6 Tb/s 每芯片 | -|| 单节点 BF16 算力(稀疏)| ~3,958 TFLOPS ≈ **4 PFLOPS** | -|| 单节点 FP16 算力(稠密)| ~1,979 TFLOPS ≈ **2 PFLOPS** | -|| 每 GPU HBM3 容量 | 80 GB(SXM5 版本)| -|| 每 GPU HBM3 带宽 | 3.35 TB/s | -|| CPU 配置 | 2 × AMD EPYC 9004/9005 或 Intel Xeon Scalable | -|| 主机内存 | 2 TB DDR5 ECC | -|| 存储本地 SSD | 2 × 3.84 TB NVMe(OS + 缓存)| -|| 电源配置 | 4 × 3.3 kW PSU(~13 kW 总功耗)| -|| 散热方式 | 冷板式液冷(必须)| +| 参数 | 规格 | +|------|------| +| GPU 数量 | 8 × NVIDIA H100 SXM5 | +| GPU 间 NVLink 带宽 | 900 GB/s 双向(全互联)| +| NVSwitch 芯片数 | **6 片**(2 组各 3 片,双平面全连接)| +| NVSwitch 交换容量 | 25.6 Tb/s 每芯片 | +| 单节点 BF16 算力(稀疏)| ~3,958 TFLOPS ≈ **4 PFLOPS** | +| 单节点 FP16 算力(稠密)| ~1,979 TFLOPS ≈ **2 PFLOPS** | +| 每 GPU HBM3 容量 | 80 GB(SXM5)| +| 每 GPU HBM3 带宽 | 3.35 TB/s | +| CPU 配置 | 2 × AMD EPYC 9004/9005 或 Intel Xeon Scalable | +| 主机内存 | 2 TB DDR5 ECC | +| 本地 SSD | 2 × 3.84 TB NVMe(OS + 缓存)| +| 电源配置 | 4 × 3.3 kW PSU(整机 ~13 kW)| +| **散热方式** | **冷板式液冷(必须)** | -> **注**:HGX H100 架构中,NVSwitch Fabric 由 **6 片** NVSwitch 芯片组成(每 3 片为一组,构成两个全连接平面),提供节点内 8 GPU 全互联。NCCL 集合通信在 NVSwitch 内部全速运行,不受 PCIe 争用影响。 +### 4.3 GB200 NVL72 机架级超级芯片 -**CPU 与 GPU 连接路径:** +**GB200 NVL72** 是 NVIDIA Blackwell 架构的整机柜集成方案,代表当前最极致的 Scale-Up 设计: -``` -CPU0 ──→ PCIe Gen5 x16 ──→ CPU1 (AMD Infinity Fabric / Intel UPI) - └────────┬───────────────────────┐ - │ │ - NVSwitch InfiniBand/ - Fabric (GPU) RoCE 网卡 -``` - -> **注**:HGX H100 架构中,CPU 与 GPU 之间**不直接走 PCIe 交换**,而是通过 NVSwitch 内部路径访问 GPU 内存。NCCL 集合通信在 NVSwitch 内部全速运行,不受 PCIe 争用影响。 - -#### 4.1.3 GB200 NVL72 机架级超级芯片架构 - -**GB200 NVL72** 是 NVIDIA Blackwell 架构的机架级集成方案,代表当前最极致的 Scale-Up 设计: - -**物理架构:** - -|| 组件 | 数量 | 说明 | -||------|------|------| -|| Blackwell GPU (B200) | 72 张 | 每 GPU BF16 算力 ~1,800 TFLOPS(稀疏)| -|| Grace CPU (Neoverse V2) | 36 颗 | 72 核 ARM,每颗 240 GB LPDDR5 | -|| NVLink Switch 芯片 | 9 片 | 来自 NVLink Switch 第4代 | -|| GPU 内存总量 | 13.5 TB HBM3e | 每 GPU 186 GB(×72)| -|| CPU 内存总量 | 8.6 TB LPDDR5 | 每 CPU 240 GB(×36)| -|| NVLink 域带宽(聚合)| **130 TB/s** | 72 GPU 全互联 | -|| 单机柜功率 | **132 kW**(TDP)/ 峰值更高 | -|| CDU 容量 | 250 kW(Supermicro 方案)| -|| 散热方式 | 100% 冷板液冷 | - -> **注**:Blackwell 架构的核心营销指标是 BF16 机器学习精度,FP64 主要用于 HPC 科学计算,对机场 AI 推理/训练场景无直接参考价值,原文档使用 FP64 算力指标是误导性引用。 - -**计算托盘(Compute Tray)结构:** +| 组件 | 数量 | 参数 | +|------|------|------| +| Blackwell GPU (B200) | 72 张 | 每 GPU BF16 算力 ~1,800 TFLOPS(稀疏)| +| Grace CPU (Neoverse V2) | 36 颗 | 72 核 ARM,每颗 240 GB LPDDR5 | +| NVLink Switch 芯片 | 9 片 | 第 4 代 NVLink Switch | +| GPU 内存总量 | 13.5 TB HBM3e | 每 GPU 186 GB(×72)| +| CPU 内存总量 | 8.6 TB LPDDR5 | 每 CPU 240 GB(×36)| +| NVLink 域带宽(聚合)| **130 TB/s** | 72 GPU 全互联 | +| **单机柜功率** | **132 kW**(TDP)| +| **散热方式** | **100% 冷板液冷** | +**计算托盘结构:** ``` 每个计算托盘: ┌─────────────────────────────────┐ @@ -396,32 +337,13 @@ CPU0 ──→ PCIe Gen5 x16 ──→ CPU1 (AMD Infinity Fabric / Intel UPI) ``` **NVLink 域设计:** +- 72 GPU 在同一个 NVLink 域内全互联,任意两 GPU 通信单跳 +- **对等带宽:900 GB/s**(是 InfiniBand NDR 400G 的约 2.3 倍) +- 张量并行可覆盖全部 72 GPU,适合超大规模模型 -- 72 GPU 在同一个 **NVLink 域(NVLink Domain)** 内全互联 -- 任意两 GPU 之间通信:**单跳**,无需跨交换机 -- 对等带宽:**900 GB/s** 任意 GPU 到任意 GPU(是 InfiniBand NDR 400G 的约 2.3 倍;"1.8 TB/s"为 Fabric 聚合总带宽,非对等带宽) -- **张量并行(Tensor Parallelism)** 可覆盖全部 72 GPU,适合超大规模模型 -- 推理加速:NVIDIA 官方宣称的 **30 倍加速**基于特定 LLM 基准测试(GPT-3 175B),实际加速比与模型规模、批大小、输入长度强相关,不同 workload 差异显著,不应作为通用指标 +> 机场场景建议:GB200 NVL72 单柜 132 kW,功率密度极高。**当前阶段以 HGX H100/H200 8-GPU 节点为主**(单节点 ~13 kW,可用液冷机柜支撑)。NVL72 预留规划,待功率和液冷成熟后再规模部署。 -**SuperPOD 扩展(8 × NVL72 = 576 GPU):** - -``` -8 × GB200 NVL72 rack - │ - │ (NVLink 扩展 via NVLink Switch) - │ - 576 GPU 全互联域 - 总带宽: >1 PB/s - 总显存: 108 TB HBM3e -``` - -> **机场场景建议**:GB200 NVL72 单柜 132kW,功率密度极高,建议在机场智算中心**预留**此架构,但当前阶段以 HGX H100/H200 8-GPU 节点为主(单节点 ~13kW,可用液冷机柜支撑)。 - -#### 4.1.4 推理服务器节点拓扑(4-GPU 配置) - -推理服务器针对**高并发、低延迟**场景,与训练服务器拓扑差异显著: - -**推荐节点架构:** +### 4.4 推理服务器节点(4-GPU 配置) | 参数 | NVIDIA L40S 方案 | 昇腾 910B 方案(国产)| |------|----------------|------------------| @@ -430,67 +352,52 @@ CPU0 ──→ PCIe Gen5 x16 ──→ CPU1 (AMD Infinity Fabric / Intel UPI) | GPU 间互联 | PCIe Gen4 交换(无 NVLink)| HCCS(华为集合通信)| | GPU 通信带宽 | ~64 GB/s(PCIe x16)| ~392 GB/s(HCCS)| | 单节点算力 | ~2 PFLOPS(FP16)| ~2 PFLOPS(FP16)| -| 适用场景 | 中等规模推理 | 国产化推理 | | 功耗 | ~4 kW/节点 | ~4.5 kW/节点 | -| 散热 | 风冷或液冷 | 风冷或液冷 | +| 适用场景 | 中等规模推理 | 国产化推理 | -**L40S vs H100 推理对比:** +### 4.5 多节点集群组网(Scale-Out) -| 对比项 | L40S(推理为主)| H100(训练/推理)| -|--------|--------------|----------------| -| 显存带宽 | 864 GB/s GDDR6 | 3.35 TB/s HBM3 | -| INT8 算力 | ~733 TFLOPS | ~3,958 TFLOPS | -| NVLink | 无 | 900 GB/s | -| 功耗 | 350 W | 700 W | -| 推理场景 | 中等 Batch、QPS < 1000 | 大 Batch、高吞吐 | -| 性价比 | 优(推理专用)| 高性能但成本高 | - ---- - -### 4.2 多节点集群组网架构(Scale-Out) - -#### 4.2.1 集群网络分层架构 - -智算集群网络分为**三层三平面**: +#### 4.5.1 三层三平面网络架构 ``` ┌────────────────────────────────────────────────────────────┐ -│ 集群外部网络(Border) │ -│ 互联网/专线/机场内部网络 ←→ 防火墙/负载均衡 │ +│ 集群外部网络(Border) │ +│ 互联网 / 专线 / 机场内部网络 ←→ 防火墙 / 负载均衡 │ └────────────────────────────────────────────────────────────┘ │ ┌────────────────────────────────────────────────────────────┐ -│ 管理网络平面(Management Network) │ -│ BMC / IPMI / SSH / 监控采集 │ -│ ←→ 千兆以太网(Out-of-Band) │ -│ 带宽:1 Gb/s(管理流量,带外) │ +│ 管理网络平面(Management Network) │ +│ BMC / IPMI / SSH / 监控采集 │ +│ ←→ 千兆以太网(Out-of-Band) │ └────────────────────────────────────────────────────────────┘ │ ┌────────────────────────────────────────────────────────────┐ │ 存储网络平面(Storage Network) │ -│ 分布式存储读写 / checkpoint 存取 │ +│ 分布式存储读写 / Checkpoint 存取 │ │ ←→ RoCE v2 / InfiniBand + NVMe-oF │ -│ 带宽:200-400 Gb/s │ +│ 带宽:200–400 Gb/s │ └────────────────────────────────────────────────────────────┘ │ ┌────────────────────────────────────────────────────────────┐ -│ 计算网络平面(Compute Network / AI Fabric) │ -│ GPU 集合通信(NCCL) / 梯度同步 / 数据并行 │ +│ 计算网络平面(AI Fabric) │ +│ GPU 集合通信(NCCL) / 梯度同步 / 数据并行 │ │ ←→ InfiniBand NDR 400G / Spectrum-X 400G │ │ 带宽:400 Gb/s(节点间) │ └────────────────────────────────────────────────────────────┘ ``` -#### 4.2.2 InfiniBand NDR 400G 组网设计 +#### 4.5.2 InfiniBand NDR 400G 组网 -**InfiniBand 是当前 AI 训练集群的事实标准网络**,原因: +**InfiniBand 是当前 AI 训练集群的事实标准网络:** -- **硬件原生 RDMA**:绕过操作系统内核,直接内存访问,延迟 < 1 μs -- **自适应路由(Adaptive Routing)**:每包独立路由,充分利用所有链路 -- **SHARP 网内计算**:在交换机内聚合梯度,无需送回 GPU 再聚合 -- **NVIDIA Collective Communications(NCCL)原生支持** +| 特性 | 说明 | +|------|------| +| 硬件原生 RDMA | 绕过 OS 内核,延迟 < 1 μs | +| 自适应路由(AR)| 每包独立路由,充分利用所有链路 | +| SHARP 网内计算 | 交换机内聚合梯度,无需送回 GPU 再聚合 | +| NCCL 原生支持 | NVIDIA 集合通信库直接调用 | -**InfiniBand NDR 400G 关键参数:** +**关键参数:** | 参数 | 规格 | |------|------| @@ -508,7 +415,7 @@ CPU0 ──→ PCIe Gen5 x16 ──→ CPU1 (AMD Infinity Fabric / Intel UPI) ``` ┌─────────────┐ │ Core Switch │ InfiniBand QM9700 - │ (2-4 台) │ 64 端口 400G + │ (2–4 台) │ 64 端口 400G └──────┬──────┘ │ ┌─────────────────┼─────────────────┐ @@ -520,447 +427,188 @@ CPU0 ──→ PCIe Gen5 x16 ──→ CPU1 (AMD Infinity Fabric / Intel UPI) │ │ │ [16 servers] [16 servers] [16 servers] 每组 8× GPU 每组 8× GPU 每组 8× GPU - 节点 1-16 节点 17-32 节点 33-48 ``` -**端口规划公式:** - -| 集群规模 | Spine 交换机数 | 每个 Spine 上联端口 | 下联端口/交换机 | -|---------|--------------|------------------|--------------| -| 64 GPU(8节点)| 2 | 0 | 32-48 | -| 512 GPU(64节点)| 4 | 16-32 | 32 | -| 1024 GPU(128节点)| 8 | 32-64 | 32 | -| 4096 GPU(512节点)| 16 | 32 | 32 | - -> 每个 8-GPU 服务器通常配置 **2 × 400G InfiniBand** 双上联,通过多路径(Multi-Path)和 LACP Bonding 实现带宽聚合与冗余容错。典型部署中每台服务器两个 400G 端口分别上联到两台 Leaf 交换机,故障时可无缝切换。 - -#### 4.2.3 Spectrum-X 以太网方案(替代方案) - -**Spectrum-X** 是 NVIDIA 面向 AI 的以太网解决方案,适合**不愿意引入 InfiniBand 专有生态**的用户: +#### 4.5.3 Spectrum-X 以太网方案(替代 / 混合场景) | 参数 | Spectrum-X 400G | InfiniBand NDR 400G | -|------|---------------|-------------------| +|------|---------------|---------------------| | 技术基础 | 以太网(RoCE v2)| InfiniBand | -| 延迟 | 1-2 μs | < 0.6 μs | -| NCCL 性能 | 基准 ~100% | 最优 ~100% | +| 延迟 | 1–2 μs | < 0.6 μs | | 生态开放性 | 高(标准以太网)| 低(需 IB 交换设备)| | 运维复杂度 | 低(统一以太网运维)| 高(独立 IB 网络)| -| 供应商 | NVIDIA、华为 | NVIDIA(Mellanox)| -| 推荐场景 | 推理集群、混合云 | 训练集群(强烈推荐)| +| **推荐场景** | 推理集群、混合云 | **训练集群(强烈推荐)**| -**Spectrum-X 关键技术(ROCEv2 + NVIDIA 网络流优化):** +#### 4.5.4 万卡集群(SuperPOD)规格 -- **增强 RoCE(eRoCE)**:支持可变 MTU(IMIX),减少小包开销 -- **NetFlow 流管理**:智能负载均衡,自动路径选择 -- **拥塞控制**:TensorFlow/MPI 层内置支持 - -#### 4.2.4 万卡集群超节点(SuperPOD)架构 - -万卡集群的网络设计需要在 **InfiniBand 拓扑** 上精心规划: - -**典型 32-GPU SU(可扩展单元)InfiniBand 规划:** - -``` -每 4 台 8-GPU 服务器 = 1 个 SU(32 GPU) - 4 × 服务器 × 2 × 400G IB 上联 = 8 个 QSFP-DD 端口连接上联交换机 -``` - -**千卡集群(1000+ GPU)Fat-Tree 规格:** - -| 参数 | 1024 GPU(128节点)| 2048 GPU(256节点)| -|------|----------------|----------------| +| 参数 | 1,024 GPU(128 节点)| 2,048 GPU(256 节点)| +|------|-------------------|---------------------| | 交换机型号 | QM9700 | QM9700 | | Spine 数 | 8 | 16 | | 每 Spine 下联 | 32 端口 400G | 32 端口 400G | | Agg 层 | 16 | 32 | | 收敛比 | 1:1(无收敛)| 1:1(无收敛)| -| 总 InfiniBand 端口 | 512 + 512 = 1024 | 1024 + 1024 = 2048 | | 网络直径 | 3 跳(最差路径)| 3 跳 | **关键设计原则:** +1. **收敛比 ≤ 1:1**:AI 训练流量无阻塞 +2. 每服务器双上联(2 × 400G IB),LACP Bonding 冗余 +3. GPU Direct RDMA:跨节点 GPU 直接内存访问,绕过 CPU +4. SHARP 网内聚合:梯度在交换机内聚合,节省 30–50% 通信量 -1. **收敛比 ≤ 1:1**:AI 训练流量无阻塞,避免网络成为瓶颈 -2. **InfiniBand 多路径**:每服务器双上联,双 L3 自适应路由 -3. **GPU Direct RDMA**:跨节点 GPU 直接内存访问,绕过 CPU -4. **SHARP 网内聚合**:梯度在交换机内聚合,节省 30-50% 通信量 +### 4.6 存储集群 ---- - -### 4.3 存储集群设计 - -#### 4.3.1 存储需求分析 - -AI 训练集群的存储负载分为三类: +#### 4.6.1 存储需求分析 | 存储类型 | 用途 | 性能要求 | 典型容量 | |---------|------|---------|---------| -| **数据湖存储** | 原始训练数据、语料库 | 顺序读取带宽 ≥500 GB/s | 10-100 PB | -| **模型存储** | 检查点、训练产出模型 | 写入带宽 ≥100 GB/s,延迟 < 1 ms | 1-10 PB | -| **共享文件系统** | 代码、配置、小文件共享 | IOPS ≥ 1M,小文件吞吐 | 100 TB-1 PB | -| **本地缓存** | 热点数据本地加速 | NVMe 本地,读缓存 | 1-10 TB/节点 | +| **数据湖存储** | 原始训练数据、语料库 | 顺序读带宽 ≥ 500 GB/s | 10–100 PB | +| **模型存储** | 检查点、训练产出模型 | 写入带宽 ≥ 100 GB/s,延迟 < 1 ms | 1–10 PB | +| **共享文件系统** | 代码、配置、小文件共享 | IOPS ≥ 1M | 100 TB–1 PB | +| **本地缓存** | 热点数据本地加速 | NVMe 本地读缓存 | 1–10 TB/节点 | -#### 4.3.2 全闪存分布式文件系统架构 +> 性能目标有前置条件:需足够的存储节点数量(20+ 全闪存存储节点)、充足的存储网络带宽(200G+)、正确配置的小文件聚合策略。 -**推荐方案:JuiceFS + 对象存储(兼容 S3)+ 本地 NVMe 缓存** - -``` -┌─────────────────────────────────────────────────────────┐ -│ 应用层(GPU 节点) │ -│ 训练框架 ───→ JuiceFS FUSE / CSI 驱动 ───→ POSIX 接口 │ -└─────────────────────────────────────────────────────────┘ - │ - ┌─────▼─────┐ - │ JuiceFS │ 元数据引擎(TiKV/RocksDB) - │ 客户端 │ 缓存层(L1本地 NVMe / L2 共享 SSD) - └─────┬─────┘ - │ - ┌───────────────┼───────────────┐ - │ │ │ - ┌─────▼─────┐ ┌─────▼─────┐ ┌─────▼─────┐ - │ 对象存储 │ │ 对象存储 │ │ 对象存储 │ - │ (MinIO) │ │ (CEPH RGW)│ │ (S3 兼容) │ - │ 10+ PB │ │ 多站点 │ │ 备份 │ - └───────────┘ └───────────┘ └───────────┘ -``` - -**JuiceFS 关键参数(AI 训练场景):** +#### 4.6.2 推荐架构:JuiceFS + 对象存储(S3)+ 本地 NVMe 缓存 | 参数 | 推荐值 | |------|-------| -| 元数据引擎 | TiKV(分布式,≥3 节点)或 Redis(单机测试)| -| 数据存储 | 对象存储(S3 兼容,任意厂商)| -| 本地缓存 | 每节点 1-2 TB NVMe SSD(L1 缓存)| -| 共享 SSD 缓存 | 每机柜 4-8 TB NVMe SSD(L2 缓存)| +| 元数据引擎 | TiKV(分布式,≥3 节点)| +| 数据存储 | 对象存储(S3 兼容)| +| 本地缓存 | 每节点 1–2 TB NVMe SSD(L1 缓存)| | 小文件聚合 | 4 MiB chunk,减少元数据压力 | -| 读取预取 | 自动预取临近数据块,降低 IO 等待 | -| 并行读 | 128-256 并发线程,最大化带宽利用率 | +| 读取预取 | 自动预取临近数据块 | -**分布式存储产品选型:** +**存储产品选型:** | 产品 | 类型 | 适用规模 | AI 训练适配度 | |------|------|---------|------------| -| JuiceFS | 元数据+对象存储分离 | 中大规模 | ★★★★★ | +| JuiceFS | 元数据 + 对象存储分离 | 中大规模 | ★★★★★ | | BeeGFS | 并行文件系统 | 超大规模 | ★★★★ | | GPFS(IBM Spectrum Scale)| 并行文件系统 | 企业级 | ★★★★ | | 曙光 ParaStor | 全闪存分布式 | 国产化 | ★★★★ | | 华为 OceanStor 9000 | 全闪存分布式 | 大规模 | ★★★★ | -#### 4.3.3 存储网络设计 - -**存储流量走独立 RoCE v2 网络,与计算网络物理隔离:** +#### 4.6.3 存储网络设计 | 网络平面 | 协议 | 带宽 | 交换机 | |---------|------|------|-------| | 计算网络 | InfiniBand NDR | 400G × 2(双上联)| QM9700 | -| 存储网络 | RoCE v2 + NVMe-oF | 200-400G | Spectrum-X / 华为 CloudEngine | +| 存储网络 | RoCE v2 + NVMe-oF | 200–400G | Spectrum-X / 华为 CloudEngine | | 管理网络 | 以太网 | 1G | 接入交换机 | -**存储性能目标(AI 训练):** +### 4.7 软件栈与训练框架 -|| 指标 | 目标值 | 前提条件 | -||------|-------|---------| -|| 聚合读带宽 | ≥ 500 GB/s(10 PB 集群)| 需 20+ 全闪存存储节点,每节点 25 GB/s 读带宽,200G 存储网络聚合 | -|| 聚合写带宽 | ≥ 100 GB/s | 需 NVMe SSD 配置,多路并发写入 | -|| 元数据 IOPS | ≥ 100 万 | 需分布式元数据引擎(如 TiKV),小文件聚合策略 | -|| 检查点保存时间 | ≤ 30 秒(100 GB 检查点)| 需 100G+ 存储网络 + 本地 NVMe SSD 缓存 | -|| 存储可靠性 | 99.9999%(6 个 9)| 副本/纠删码策略,多站点部署 | - -> **注**:上述性能目标均为有前置条件的系统设计指标,实际达成需要:足够的存储节点数量、充足的存储网络带宽、正确配置的小文件聚合策略。初次建设时应优先保证核心指标(检查点写入带宽),其他指标可随集群扩展逐步达标。 - ---- - -### 4.4 训练集群软件栈 - -#### 4.4.1 分布式训练框架 - -AI 训练软件栈从底层到应用分为五层: +#### 4.7.1 五层软件栈 ``` ┌──────────────────────────────────────────┐ -│ 应用层:训练脚本(PyTorch/LLaMA-Factory)│ +│ 应用层:训练脚本(PyTorch / LLaMA-Factory) │ ├──────────────────────────────────────────┤ -│ 框架层:PyTorch 2.x + 分布式通信优化 │ -│ DeepSpeed / Megatron-LM / ColossalAI│ +│ 框架层:PyTorch 2.x + 分布式通信优化 │ +│ DeepSpeed / Megatron-LM / ColossalAI │ ├──────────────────────────────────────────┤ -│ 通信层:NCCL 2.x(NVIDIA) │ -│ HCCS(昇腾)/ OpenUCCL(国产) │ +│ 通信层:NCCL 2.x(NVIDIA) │ +│ HCCS(昇腾)/ OpenUCCL(国产) │ ├──────────────────────────────────────────┤ -│ 驱动层:CUDA 12.x / ROCm 6.x │ -│ GPU Driver / cuBLAS / cuDNN │ +│ 驱动层:CUDA 12.x / ROCm 6.x │ +│ GPU Driver / cuBLAS / cuDNN │ ├──────────────────────────────────────────┤ -│ 硬件层:NVLink / InfiniBand / RoCE │ +│ 硬件层:NVLink / InfiniBand / RoCE │ └──────────────────────────────────────────┘ ``` -**框架选型建议:** +#### 4.7.2 框架选型 -| 框架 | 适用场景 | 并行策略支持 | -|------|---------|------------| +| 框架 | 适用场景 | 并行策略 | +|------|---------|---------| | **PyTorch 2.x + FSDP** | 通用大模型训练 | DDP / FSDP / TP | | **DeepSpeed ZeRO** | 超大模型(千亿参数+)| ZeRO-1/2/3、流水线、张量并行 | | **Megatron-LM** | 极致张量并行优化 | TP + PP + DP 三维并行 | | **ColossalAI** | 异构训练、多种并行策略 | 动态调度、ZeRO++ | -**DeepSpeed ZeRO 并行策略详解:** - -| 策略 | 显存优化 | 通信量 | 适用场景 | -|------|---------|--------|---------| -| ZeRO-1 | 分片优化器状态 | 较少 | 大模型,多节点 | -| ZeRO-2 | + 分片梯度 | 中等 | 大模型,多节点 | -| ZeRO-3 | + 分片参数 | 较大(all-gather)| 超级大模型 | -| ZeRO-Offload | CPU 卸载 | 依赖 PCIe | 单机大模型 | -| ZeRO-Infinity | 卸载到 NVMe/内存 | 依赖带宽 | 超大模型,单机 | - -#### 4.4.2 集合通信配置(NCCL) - -NCCL 是 NVIDIA GPU 集合通信库,是分布式训练性能的核心: - -**NCCL 关键配置参数:** +#### 4.7.3 NCCL 关键配置 ```bash # NCCL 环境变量参考配置 NCCL_DEBUG=info # 调试日志(生产环境关闭) NCCL_IB_DISABLE=0 # 启用 InfiniBand -NCCL_NET_GDR_LEVEL=PIX # GPU 直接访问网卡(最佳性能) -NCCL_NVLS_DISABLE=0 # 启用 NVLink 域内通信 -NCCL_MIN_NCHANNELS=4 # 最小通道数 -NCCL_MAX_NCHANNELS=16 # 最大通道数(InfiniBand 多路径) -NCCL_ALGO=Tree # 集合通信算法(Ring/Tree/Tunnel) -NCCL_PROTO=LL # 协议(Simple/ LL/ Elemy) -NCCL_BUFFSIZE=2097152 # 环形缓冲区大小(字节) -``` - -**NCCL 在 GB200 NVL72 中的拓扑感知:** - -```python -# 拓扑感知的进程亲和性设置(关键!) -import torch -import torch.distributed as dist - -# 获取 GPU NVLink 对等关系 -torch.cuda.can_device_access_peer(local_gpu, remote_gpu) - -# Megatron-LM 中使用 NVL72 拓扑 -# nvidia.com/gpu.clique: 同一 NVLink 域内的 GPU 标记 -# Megatron 自动优先在 NVLink 域内布置张量并行组 -``` - -**NCCL 测试验证(上线前必须执行):** - -```bash -# 单节点 8-GPU NCCL 测试 -./build/all_reduce_perf -b 8M -e 8G -f 2 -g 8 - -# 跨节点 NCCL 测试(每个节点启动) -./build/all_reduce_perf -b 8M -e 8G -f 2 -g 8 \ - -N 1 -w 100 -n 100 +NCCL_NET_GDR_LEVEL=PIX # GPU 直接访问网卡(最佳性能) +NCCL_NVLS_DISABLE=0 # 启用 NVLink 域内通信 +NCCL_MAX_NCHANNELS=16 # InfiniBand 多路径 ``` **预期 NCCL 带宽基准:** | 通信模式 | H100 NVLink 域内 | H100 InfiniBand 400G | L40S PCIe | -|---------|--------------|-------------------|-----------| -| AllReduce(8 GPU)| ~850-900 GB/s | 300-350 GB/s | ~60 GB/s | -| AllReduce(跨节点)| N/A | 300-350 GB/s | ~60 GB/s | -| AllGather | ~880 GB/s | 280-320 GB/s | ~55 GB/s | -| ReduceScatter | ~870 GB/s | 280-320 GB/s | ~55 GB/s | +|---------|----------------|---------------------|-----------| +| AllReduce(8 GPU)| ~850–900 GB/s | 300–350 GB/s | ~60 GB/s | +| AllGather | ~880 GB/s | 280–320 GB/s | ~55 GB/s | +| ReduceScatter | ~870 GB/s | 280–320 GB/s | ~55 GB/s | -> **目标**:InfiniBand 400G 的 NCCL 带宽应达到理论峰值的 **80% 以上**(即 ≥ 320 GB/s),否则说明网络有瓶颈。 +> **目标**:IB 400G 的 NCCL 带宽应达到理论峰值的 **80% 以上**(≥ 320 GB/s),否则说明网络瓶颈。 -#### 4.4.3 作业调度器选型 +#### 4.7.4 作业调度器选型 | 调度器 | 适用场景 | 优点 | 缺点 | |--------|---------|------|------| -| **Slurm** | 超算/HPC 传统场景 | 生态成熟,稳定可靠 | 不支持容器原生 | +| **Slurm** | 超算 / HPC 传统场景 | 生态成熟,稳定可靠 | 不支持容器原生 | | **Kubernetes + Volcano** | 云原生 AI 平台 | 生态丰富,弹性伸缩 | 配置复杂 | | **Kubeflow** | MLOps 全流程 | 与 K8s 深度集成 | 较重 | -| **OpenPAI(微软)** | 企业内部 AI 平台 | 支持多租户 | 社区活跃度下降 | -| **VarStore(平头哥)** | 大规模训练 | 高效调度 | 主要支持 TPU 生态 | -**Kubernetes + Volcano 推荐配置(机场智算中心):** +### 4.8 推理集群 -```yaml -# Volcano Job 示例:启动一个 64-GPU 分布式训练任务 -apiVersion: batch.volcano.sh/v1alpha1 -kind: Job -metadata: - name: flight-delay-llm-training -spec: - replicas: 8 # 8 个 Pod(每 Pod 8 GPU) - minAvailable: 64 # 至少 64 GPU 可用才启动 - schedulerName: volcano - tasks: - - replicas: 8 - name: trainer - template: - spec: - containers: - - name: training - image: pytorch:2.3-cuda12.1 - command: - - torchrun - - --nproc_per_node=8 - - --nnodes=8 - - /workspace/train.py - resources: - nvidia.com/gpu: 8 - volumeMounts: - - mountPath: /data - name: data-volume - volumes: - - name: data-volume - persistentVolumeClaim: - claimName: training-data-pvc - nodeSelector: - nvidia.com/gpu.product: H100-SXM5-80GB - tolerations: - - key: "nvidia.com/gpu" - operator: "Exists" -``` +#### 4.8.1 推理引擎对比 ---- +| 引擎 | 开发方 | KV Cache | 多模型 | 国产适配 | +|------|-------|---------|-------|--------| +| **vLLM** | 伯克利 LMSYS | PagedAttention | 是 | 昇腾(第三方)| +| **TensorRT-LLM** | NVIDIA 官方 | 动态批处理 | 是 | 仅 NVIDIA GPU | +| **SGLang** | 斯坦福 | RadixAttention | 是 | 昇腾(实验)| +| **TGI** | HuggingFace | 是 | 是 | 昇腾(第三方)| -### 4.5 推理集群设计 +#### 4.8.2 PD 分离架构(超大规模推理) -#### 4.5.1 高吞吐推理架构 - -``` - ┌──────────────────┐ - │ L4/L40S 推理节点 │ - │ (Kubernetes Pod) │ - │ vLLM / TFLite │ - └────────┬─────────┘ - │ - ┌────────▼─────────┐ - │ RoCE v2 存储网络 │ - │ (模型加载/热数据) │ - └────────┬─────────┘ - │ -┌──────────────────────────────────┼──────────────────────┐ -│ 推理服务层(Kubernetes) │ -│ Prometheus + Alertmanager(监控) │ Seldon Core(Serving)│ -└──────────────────────────────────┴──────────────────────┘ - │ - ▼ - ┌──────────┐ - │ LLM Router│ - │ (流量调度)│ - └──────────┘ - │ - ┌────────────────┼────────────────┐ - ▼ ▼ ▼ - ┌──────────┐ ┌──────────┐ ┌──────────┐ - │ 推理节点1 │ │ 推理节点2 │ │ 推理节点3 │ - │ L40S ×4 │ │ L40S ×4 │ │ L40S ×4 │ - └──────────┘ └──────────┘ └──────────┘ -``` - -#### 4.5.2 推理引擎深度对比 - -| 引擎 | 开发方 | 推理框架 | KV Cache | 多模型 | 国产适配 | -|------|-------|---------|---------|-------|--------| -| **vLLM** | 伯克利 LMSYS | PyTorch | PagedAttention | 是 | 昇腾(第三方)| -| **TensorRT-LLM** | NVIDIA 官方 | TensorRT | 动态批处理 | 是 | 仅 NVIDIA GPU | -| **SGLang** | 斯坦福 | PyTorch | RadixAttention | 是 | 昇腾(实验)| -| **Ollama** | 本地推理 | Llama.cpp | - | 多模型 | CPU/GPU | -| **TGI** | HuggingFace | 多种后端 | 是 | 是 | 昇腾(第三方)| - -**vLLM 关键配置参数:** - -```python -# vLLM 推理服务配置 -vllmArgs = [ - "--model", "/models/flight-llm-7b", - "--tensor-parallel-size", "4", # 张量并行度 - "--gpu-memory-utilization", "0.92", # GPU 显存利用率(0.92 = 92%) - "--max-num-batched-tokens", "8192", # 最大批处理 token 数 - "--max-num-seqs", "256", # 最大并发序列数 - "--enable-chunked-prefill", # 启用分块预填充 - "--enforce-eager", # 禁用 CUDA graph(调试用) - "--port", "8000", - "--host", "0.0.0.0", -] - -# 关键说明: -# --gpu-load-fraction 不是 vLLM 合法参数,GPU 负载比例通过 --gpu-memory-utilization 控制 -# 0.92 表示 vLLM 最多占用每卡 92% 的显存(预留 8% 给 CUDA kernel 等) -``` - -**TensorRT-LLM 推理性能参考(H100 单卡):** - -| 模型 | FP16 吞吐(tokens/s)| INT8 吞吐(tokens/s)| 显存占用(FP16)| -|------|------------------|------------------|------------| -| Llama-3-8B | ~5,000 | ~8,000 | ~20 GB | -| Llama-3-70B | ~1,200(TP4)| ~2,000(TP4)| ~160 GB | -| Mistral-7B | ~6,000 | ~9,500 | ~18 GB | -| Qwen-72B | ~800(TP8)| ~1,500(TP8)| ~280 GB | - -#### 4.5.3 PD 分离(Prefill-Deploy 分离)架构 - -对于超大模型推理,**PD 分离**可显著提升 GPU 利用率: +对于超大模型(> 70B),**Prefill-Deploy 分离**可显著提升 GPU 利用率: ``` ┌─────────────┐ │ Router │ - │ (请求路由) │ └──────┬──────┘ │ ┌────────────┴────────────┐ ▼ ▼ ┌─────────────┐ ┌─────────────┐ - │ Prefill 节点 │ │ Decode 节点 │ + │ Prefill 节点 │ │ Decode 节点 │ │ H100/H200 │ KV Cache │ L40S/H20 │ - │ 计算密集 │ ──传输──→ │ 显存密集 │ - │ 高延迟 │ │ 低延迟高吞吐 │ + │ 计算密集 │ ──传输──→ │ 显存密集 │ + │ 高延迟 │ │ 低延迟高吞吐 │ └─────────────┘ └─────────────┘ ``` | 对比项 | 传统单节点推理 | PD 分离推理 | -|--------|------------|-----------| -| GPU 利用率 | < 30%(Decode 瓶颈)| 70-90% | -| 首 token 延迟 | 固定 | 可优化(Prefill 专用优化)| +|--------|------------|----------| +| GPU 利用率 | < 30%(Decode 瓶颈)| 70–90% | +| 首 token 延迟 | 固定 | 可优化 | | 吞吐 | 受限于最慢阶段 | 各阶段独立扩缩容 | | 适用模型 | < 30B 参数 | 任意规模,尤其是 > 70B | ---- +### 4.9 国产化集群 -### 4.6 国产化集群方案 - -#### 4.6.1 华为昇腾 910B 集群方案 - -**昇腾 910B 关键参数:** +#### 4.9.1 华为昇腾 910B | 参数 | 昇腾 910B | NVIDIA H100 | 对比 | |------|---------|-----------|------| -| FP16 算力 | 640 TFLOPS | 1,979 TFLOPS | H100 的 32% | -| INT8 算力 | 1,280 TOPS | 3,958 TOPS | H100 的 32% | -| HBM 容量 | 64 GB | 80 GB | - | -| HBM 带宽 | 1.6 TB/s | 3.35 TB/s | H100 的 48% | -| 芯片互联 | HCCS(910 GB/s)| NVLink(900 GB/s)| 基本持平 | -| 功耗 | 400 W | 700 W | 能效比更高 | +| FP16 算力 | 640 TFLOPS | 1,979 TFLOPS | H100 的 ~32% | +| INT8 算力 | 1,280 TOPS | 3,958 TOPS | H100 的 ~32% | +| HBM 容量 | 64 GB | 80 GB | — | +| HBM 带宽 | 1.6 TB/s | 3.35 TB/s | H100 的 ~48% | +| 芯片互联 | **HCCS(392 GB/s)**| NVLink(900 GB/s)| HCCS > PCIe Gen4,基本持平 NVLink 4 代单链路 | +| 功耗 | 400 W | 700 W | 能效比更优 | | 制程 | 7nm | 4nm | 差一代 | -| 生态 | 昇腾 CANN / MindSpore | CUDA / cuDNN | 差距较大 | +| 生态 | 昇腾 CANN / MindSpore | CUDA / cuDNN | **差距较大**,需移植 | -**昇腾集群组网拓扑(Atlas 900 PoD):** - -``` -昇腾 910B 服务器(含 8 × NPU) - │ - │ PCIe Gen5 x16 - │ - ┌─────▼─────┐ - │ HCCS Switch │ 华为自研高速互联交换机 - │ (392 GB/s) │ 8 × HCCS 端口,双向 - └─────┬─────┘ - │ 跨服务器 HCCS - (Scale-Up: 节点内) - │ - ▼ - InfiniBand / 以太网络 - (Scale-Out: 节点间) -``` - -> **注**:原文档将 HCCS 带宽误写为 128 GB/s,实际华为官方参数为 **392 GB/s**(双向),用于 8 × NPU 节点内全互联,与 NVLink 4.0 的 900 GB/s 仍有量级差距,但优于 PCIe Gen4 x16(约 64 GB/s)。 +> 注:HCCS 双向带宽 **392 GB/s**(8 × HCCS 端口),用于 8 × NPU 节点内全互联。 **昇腾软件栈:** @@ -970,32 +618,18 @@ vllmArgs = [ | 驱动 | Huawei CANN | CUDA | | 通信库 | HCCS(昇腾集合通信)| NCCL | | 框架 | MindSpore / PyTorch(第三方)| PyTorch | -| 算子库 | Ascend Math / ACL | cuBLAS / cuDNN | | 推理引擎 | MindX / ATLAS | TensorRT | -| 集群管理 | FusionCube / ascendCL | DGX 系统 | -**昇腾集群注意问题:** - -- **CUDA 兼容性问题**:昇腾 CANN ≠ CUDA,PyTorch 模型需用 **Ascend PyTorch** 适配(torch_npu 库),部分算子可能需要自行移植 -- **生态成熟度**:较 NVIDIA 仍有差距,建议配合华为原厂支持 -- **NPU 亲和性**:MindSpore 在昇腾上性能最优,PyTorch 适配版本性能略有损耗 - -#### 4.6.2 海光 DCU 方案 +#### 4.9.2 海光 DCU Z100 | 参数 | 海光 DCU Z100 | NVIDIA A100 | 对比 | |------|-------------|-----------|------| -| FP16 算力 | 256 TFLOPS | 624 TFLOPS | A100 的 41% | +| FP16 算力 | 256 TFLOPS | 624 TFLOPS | A100 的 ~41% | | HBM 容量 | 64 GB | 40/80 GB | 对标 A100 80G | | 功耗 | 350 W | 400 W | 略低 | -| 生态 | ROCm(部分兼容)| CUDA | 兼容性较好 | +| 生态 | ROCm(部分兼容)| CUDA | **兼容性优于昇腾**,迁移成本较低 | -**优势**:海光 DCU 基于 AMD ROCm 生态,**与 CUDA 兼容性较好**,迁移成本低于昇腾。 - ---- - -### 4.7 集群管理、监控与运维 - -#### 4.7.1 硬件监控体系 +### 4.10 硬件监控体系 | 监控维度 | 工具 | 采集指标 | |---------|------|---------| @@ -1005,108 +639,110 @@ vllmArgs = [ | 节点监控 | node_exporter + Prometheus | CPU、内存、网络、磁盘 | | 集群健康 | Grafana 大盘 | 综合集群状态 | -**关键告警阈值(参考):** +**关键告警阈值:** -| 告警级别 | 指标 | 阈值 | 动作 | -|---------|------|------|------| -| P1(紧急)| GPU 温度 | > 85°C | 立即降频/关机 | +| 级别 | 指标 | 阈值 | 动作 | +|------|------|------|------| +| P1(紧急)| GPU 温度 | > 85°C | 立即降频 / 关机 | | P1 | GPU ECC 错误数 | > 100/小时 | 标记节点下线 | | P2(重要)| GPU 利用率 | < 10%(训练时)| 检查 NCCL 通信 | -| P2 | InfiniBand 端口误码 | > 10⁻⁶ | 更换光模块/线缆 | -| P3(一般)| CPU 利用率 | > 90% 持续 30 分钟 | 扩容/调优 | -| P3 | GPU 显存占用 | > 95% | 优化 Batch Size | +| P2 | InfiniBand 端口误码 | > 10⁻⁶ | 更换光模块 / 线缆 | -#### 4.7.2 NCCL 调优最佳实践 +### 4.11 机场智算中心推荐配置 -**上线前必须完成的验证清单:** - -```bash -# 1. NVLink 连接验证 -nvidia-smi nvlink --status - -# 2. InfiniBand 物理层验证 -ibstat # 检查端口状态 -ibdiagnet -r # 检测线缆和光模块质量 - -# 3. NCCL 单节点带宽测试 -./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 -# 目标:AllReduce 带宽 > 850 GB/s(NVLink 域内) - -# 4. NCCL 跨节点带宽测试 -# (每个节点后台启动) -./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 -N 1 -w 100 -n 100 -# 目标:AllReduce 带宽 > 300 GB/s(IB 400G) - -# 5. GPU Direct RDMA 验证 -ib_write_bw -d mlx5_0 # 测试 IB 网卡到 GPU 内存直接带宽 -# 目标:> 350 GB/s - -# 6. 端到端训练基准测试 -torchrun --nproc_per_node=8 /workspace/nccl_tests/resnet50/hello_world.py -# 验证 8-GPU 线性扩展效率 > 90% -``` - ---- - -### 4.8 机场智算中心集群配置推荐方案 - -#### 方案一:中等规模(千万级旅客机场,推理为主) +#### 方案一:中等规模(年旅客量 < 1,000 万,推理为主) | 项目 | 配置 | |------|------| -| **GPU 类型** | NVIDIA L40S × 4/节点 | -| **节点数量** | 32 节点 = 128 GPU | -| **主要负载** | 推理服务、视频分析、Agent | -| **集群算力** | ~256 TFLOPS(FP16)| -| **网络** | RoCE v2 200G + 以太网管理 | -| **存储** | JuiceFS + 对象存储,2 PB | -| **服务器形态** | 4U 液冷机架服务器 | -| **预估功耗** | 64 节点 × 4 kW = 256 kW | -| **国产化** | 可选昇腾 910B × 4 混部 | +| GPU 类型 | NVIDIA L40S × 4/节点 | +| 节点数量 | 32 节点 = 128 GPU | +| 主要负载 | 推理服务、视频分析、Agent | +| 集群算力 | ~256 TFLOPS(FP16)| +| 网络 | RoCE v2 200G + 以太网管理 | +| 存储 | JuiceFS + 对象存储,2 PB | +| 服务器形态 | 4U 液冷机架服务器 | +| 预估总功耗 | 约 256 kW | +| 国产化 | 可选昇腾 910B × 4 混部 | -#### 方案二:大规模(两千万级旅客机场,训练+推理) +#### 方案二:大规模(年旅客量 1,000–5,000 万,训练 + 推理) -|| 项目 | 配置 | -||------|------| -| **训练 GPU** | NVIDIA H100 SXM5 × 8/节点 | -| **训练节点数** | 32 节点 = 256 GPU | -| **训练算力** | ~1 PFLOPS(BF16 稀疏,约 2× 渲染)| -| **推理 GPU** | L40S × 4/节点 | -| **推理节点数** | 16 节点 = 64 GPU | -| **主要负载** | 大模型微调、航班调度 AI、推理 | -| **计算网络** | InfiniBand NDR 400G × 2(双上联)| -| **存储网络** | RoCE v2 200G + 全闪存存储 | -| **存储容量** | JuiceFS + 全闪存,10 PB | -| **服务器形态** | HGX H100 8-GPU 液冷服务器 | -| **预估功耗** | 训练:32 × 13 kW ≈ 416 kW + 推理:16 × 4 kW ≈ 64 kW + 存储/网络 ≈ 70 kW ≈ **550 kW** | -| **国产化** | 昇腾 910B 训练集群(备选)| +| 项目 | 配置 | +|------|------| +| 训练 GPU | NVIDIA H100 SXM5 × 8/节点 | +| 训练节点数 | 32 节点 = 256 GPU | +| 训练算力 | ~1 PFLOPS(BF16 稀疏)≈ **512 PFLOPS**(FP16 稠密)| +| 推理 GPU | L40S × 4/节点 | +| 推理节点数 | 16 节点 = 64 GPU | +| 计算网络 | InfiniBand NDR 400G × 2(双上联)| +| 存储网络 | RoCE v2 200G + 全闪存存储 | +| 存储容量 | JuiceFS + 全闪存,10 PB | +| 服务器形态 | HGX H100 8-GPU 液冷服务器 | +| 预估总功耗 | **约 550 kW**(训练 416 kW + 推理 64 kW + 存储/网络 70 kW)| +| 国产化备选 | 昇腾 910B 训练集群 | -> **注**:原"~256 PFLOPS"存在歧义(未注明精度和稀疏性)。按 H100 官方标称 BF16 稀疏算力 1,979 TFLOPS/GPU(≈ 2 PFLOPS),32 节点 256 GPU × 2 PFLOPS ≈ **512 PFLOPS ≈ 0.5 EFLOPS**(BF16 稀疏),或 FP16 稠密约 256 PFLOPS。如原文档意指 FP16 稠密,则 256 PFLOPS 大致准确;如指 BF16 稀疏,则应为 ~0.5 EFLOPS。 +#### 方案三:旗舰规模(年旅客量 > 5,000 万,新建超大规模智算) -#### 方案三:旗舰规模(三千万级以上,新建超大规模智算) +| 项目 | 配置 | +|------|------| +| 训练 GPU | NVIDIA H200/H200 × 8/节点 | +| 训练节点数 | 128 节点 = 1,024 GPU | +| SuperPOD 架构 | 16 × 64 GPU SU,Fat-Tree 组网 | +| 训练算力 | ~2 EFLOPS(BF16 稀疏),~1 EFLOPS(BF16 稠密)| +| 推理 GPU | H100/L40S 混合 | +| 计算网络 | InfiniBand NDR 400G,1:1 无收敛 | +| 超节点扩展 | 支持 Scale-Up 到 GB200 NVL72 | +| 存储 | 全闪存并行文件系统,50 PB+ | +| 预估总功耗 | **约 13 MW**(GPU ~7 MW + 服务器/网络/液冷 ~6 MW)| +| PUE 目标 | ≤ 1.15(全液冷)| -|| 项目 | 配置 | -||------|------| -| **训练 GPU** | NVIDIA H200/HH200 × 8/节点 | -| **训练节点数** | 128 节点 = 1024 GPU | -| **SuperPOD 架构** | 16 × 64 GPU SU,Fat-Tree 组网 | -| **训练算力** | ~2 EFLOPS(BF16 稀疏),~1 EFLOPS(BF16 稠密)| -| **推理 GPU** | H100/L40S 混合 | -| **计算网络** | InfiniBand NDR 400G,1:1 无收敛 | -| **超节点扩展** | 支持 Scale-Up 到 GB200 NVL72 | -| **存储** | 全闪存并行文件系统,50 PB+ | -| **预估功耗** | **~13 MW**(GPU ~10 MW + 服务器/网络/液冷 ~3 MW,详见注)| -| **PUE 目标** | ≤ 1.15(全液冷)| - -> **功率测算注**:H200 GPU TDP ~700W/卡,1024 GPU 仅 GPU 即 ~717 kW;8-GPU 服务器整机功耗约 10-13 kW/台,128 台服务器约 1.3-1.7 MW;加上 InfiniBand 交换机、存储节点、液冷 CDU 二次侧水泵、冷却塔等辅助负载,总计 ~13 MW。2 MW 严重低估,仅够覆盖约 1/6 的 GPU 数量。 +> 注:H200 GPU TDP ~700W/卡,1,024 GPU 仅 GPU 即 ~717 kW;8-GPU 服务器整机约 10–13 kW/台,128 台约 1.3–1.7 MW;加上 InfiniBand 交换机、存储节点、液冷 CDU、冷却塔等辅助负载,总计约 13 MW。 --- -## 五、网络技术方案 +## 五、供电系统 -### 5.1 智算中心网络架构 +### 5.1 供电架构 -#### Spine-Leaf 架构(推荐大型机场) +``` +市电(双路 10kV / 35kV) + ↓ +自动转换开关 ATS + ↓ +高压配电 + ↓ +SCALE-UP UPS(2N 冗余,模块化效率 ≥ 96%) + ↓ +配电单元 PDU + ↓ +GPU 服务器机柜(液冷 CDU 集成供电) +``` + +### 5.2 关键参数 + +| 项目 | 推荐值 | +|------|-------| +| 市电引入 | 双路 10kV 或 35kV(互为备用)| +| UPS 配置 | 2N 冗余(Tier IV)/ N+1(Tier III)| +| UPS 效率 | 模块化效率 ≥ 96% | +| 柴油发电机 | 1,000–5,000 kVA,启动时间 < 10s | +| 储油时间 | 24 小时(关键负载)| +| 单柜功率密度 | 40–130 kW(液冷方案)| +| 总功耗估算 | GPU 单柜 100kW × 100 柜 = 10 MW | + +### 5.3 液冷对供电的影响 + +| 影响项 | 说明 | +|-------|------| +| 供电密度提升 | 单机柜功率从 10 kW 升至 100 kW+,对 PDU 配电模块要求更高 | +| 液冷 CDU 供电 | CDU 设备需独立配电回路 | +| 变压器容量 | 需提前规划,按 100 kW/柜计算总容量 | +| 市电申请 | 大规模智算中心(10 MW+)需与电力公司单独协商 | + +--- + +## 六、网络技术方案 + +### 6.1 Spine-Leaf 架构(推荐大型机场) ``` Spine 层(核心) @@ -1114,180 +750,132 @@ Spine 层(核心) └── Spine-B(400G,冗余) ↑ Leaf 层(接入) - ├── Leaf-1(连接 GPU 服务器) - ├── Leaf-2(连接 GPU 服务器) + ├── Leaf-1,2(连接 GPU 服务器) ├── Leaf-3(连接存储) └── Leaf-4(连接通用服务器) ``` - **收敛比**:建议 1:1(无收敛) - **东西向带宽**:全部东西向全速 -- **400G 端口密度**:按需配置 -#### GPU 集群专用网络(InfiniBand) - -| 项目 | 参数 | -|------|------| -| 带宽 | 400 Gb/s NDR | -| 拓扑 | Fat-Tree 或 DragonFly+ | -| 端口数 | 按 GPU 卡数 × 1.6 配置 | -| 路由 | 自适应路由(AR)| - -### 5.2 存储网络 - -| 类型 | 协议 | 带宽需求 | -|------|------|---------| -| 训练数据存储 | RoCE v2 + NVMe-oF | 200 Gb/s | -| 模型仓库 | RoCE v2 + 对象存储 | 100 Gb/s | -| 备份存储 | 以太网 + iSCSI | 25-100 Gb/s | - -**存储性能目标:** -- 训练数据集读取带宽:≥ 500 GB/s -- 训练检查点写入:≤ 30 秒(100GB 检查点) - -### 5.3 智算网络安全 +### 6.2 网络安全 | 安全措施 | 说明 | |---------|------| | 零信任网络(ZTNA)| 微隔离,按需授权 | | DDoS 防护 | 清洗异常流量 | -| 算力隔离 | 训练/推理网络物理隔离 | +| 算力隔离 | 训练 / 推理网络物理隔离 | | 数据加密 | 传输加密(TLS)+ 存储加密 | | 运维审计 | 全量日志留存,堡垒机访问 | --- -## 六、供电系统方案 +## 七、等級标准与选址 -### 6.1 智算中心供电架构 +### 7.1 Uptime Tier 等级对比 -``` -市电(双路10kV/35kV) - ↓ -自动转换开关 ATS - ↓ -高压配电 - ↓ -SCALE-UP UPS(2N冗余,模块化) - ↓ -配电单元 PDU - ↓ -GPU服务器机柜(液冷CDU集成供电) -``` +| 等级 | 可用性 | 年停机时间 | 适用场景 | +|------|--------|----------|---------| +| Tier I | 99.67% | > 31.5 h | 基础,非关键系统 | +| Tier II | 99.75% | 22 h | 冗余组件,非关键业务 | +| **Tier III** | **99.98%** | **≤ 1.6 h** | **主机房,推荐等级** | +| Tier IV | 99.99% | ≤ 0.8 h | 最高等级,关键业务 | -### 6.2 关键供电参数 +**Tier III 核心要求:** +- N+1 可并行维护冗余 +- 电力路径:2N UPS 或 N+1 UPS +- 冷却系统:N+1 冗余冷冻水系统或风冷系统 +- 网络接入:多运营商、多路由接入 -| 项目 | 推荐值 | -|------|-------| -| 市电引入 | 双路 10kV 或 35kV(互为备用)| -| UPS 配置 | 2N 冗余(Tier IV)/ N+1(Tier III)| -| UPS 效率 | 模块化效率 ≥96% | -| 柴油发电机 | 1000-5000 kVA,启动时间 <10s | -| 储油时间 | 24 小时(关键负载)| -| 单柜功率密度 | 40-130 kW(液冷方案)| -| 总功耗估算 | GPU 单柜 100kW × 100柜 = 10 MW | +**Tier IV 核心要求(机场应急指挥中心、空管核心系统等不允许停机的关键设施):** +- 2N 完全冗余(任意单点故障不影响运行) +- 双市电引入 +- 2N UPS + 2N 冷却冗余 +- 建设成本约为 Tier III 的 1.5–2 倍 -### 6.3 液冷对供电的影响 +### 7.2 选址关键因素 -| 影响项 | 说明 | -|-------|------| -| 供电密度提升 | 单机柜功率从 10kW 升至 100kW+,对 PDU 配电模块要求更高 | -| 液冷 CDU 供电 | CDU 设备需独立配电回路 | -| 变压器容量 | 需提前规划,按 100kW/柜计算总容量 | -| 市电申请 | 大规模智算中心(10MW+)需与电力公司单独协商 | - ---- - -## 七、智算中心运维与平台 - -### 7.1 算力调度平台 - -| 功能模块 | 说明 | -|---------|------| -| 作业调度 | Slurm / Kubernetes + Volcano | -| 算力编排 | 训练/推理任务自动调度到合适集群 | -| 配额管理 | 按部门/项目配额控制 | -| 计费 | 按 GPU 卡时、存储量计费 | -| 碳排放管理 | 实时碳排放统计(配合绿电)| - -### 7.2 监控与运维 - -| 监控维度 | 工具 | -|---------|------| -| GPU 监控 | DCGM(NVIDIA)/ smi(昇腾)| -| 集群监控 | Prometheus + Grafana | -| 液冷监控 | CDU 自带系统 + 动环平台 | -| 网络监控 | 带内/带外分离,综合网管 | -| 告警 | 分级告警(P1-P4),短信/邮件/IM | - -### 7.3 运维安全 - -- **堡垒机**:所有运维操作经堡垒机,留存完整审计日志 -- **双人授权**:高危操作需双人确认 -- **变更管理**:所有变更经审批,保留回滚方案 -- **应急响应**:制定智算中心专项应急预案(SOP) - ---- - -## 八、智算中心案例参考 - -### 8.1 典型智算中心案例 - -#### 中国电信临港智算谷 - -| 项目 | 内容 | +| 因素 | 要求 | |------|------| -| 位置 | 上海临港新片区 | -| 规模 | 一期 119 亩,总规划 10 万卡 GPU 集群 | -| 机楼 | 10 栋数据机楼,最高单栋 >40 MW | -| 单柜功率 | 8 kW(风冷)/ 20-60 kW(冷板)/ 液冷浸没 | -| PUE | < 1.2(液冷方案)| -| 网络 | 接入国家超算互联网 | - -#### 曙光数创浸没式液冷案例 - -- **相变浸没式**:单机柜功耗突破 **900 kW** -- **单相浸没式**:高密度部署,芯片全浸没于氟化液 -- **代表项目**:多个国家级超算中心、运营商智算集群 - -#### 联想 × 吉利 HPC 智算集群 - -- **服务器**:联想 SD650 V3(海神温水水冷) -- **散热方式**:100% 冷板式液冷 -- **PUE**:1.1 以下 -- **节能效果**:节省 **45%** 电力成本 - -#### Vertiv × 英伟达 GB200 NVL72 参考设计 - -- **单机柜功率**:130 kW -- **能效提升**:减少 25% 能耗 -- **空间节省**:减少 75% 机柜占地 -- **适用场景**:超大规模智算中心 - -### 8.2 机场智算中心建设案例 - -| 机场 | 智算应用 | 基础设施 | 液冷情况 | -|------|---------|---------|---------| -| 大连金州湾(在建)| AI巡检、数字孪生 | BIM+数字孪生 | 预留风液融合 | -| 北京大兴机场 | 平台化 AI(19平台68系统)| 维谛 Liebert PEX+ | 风冷精密空调 | -| 迪拜机场 | 智能运维、预测性维护 | 华为预制模块化 | 行级变频空调 | +| 电力容量 | 必须满足 100 kW/柜 × N 柜,需与电力公司协商 | +| 网络延迟 | 至航站楼核心系统 < 5 ms | +| 地理条件 | 机场限高、净空要求,土质条件 | +| 政策支持 | 综合保税区政策(可参考福州长乐案例)| +| 绿电条件 | 靠近可再生能源(如沿海风电)| --- -## 九、供应商与设备参考 +## 八、典型机场案例 -### 9.1 液冷系统供应商 +### 8.1 郑州航空港(中部最大万卡集群) -| 供应商 | 方案类型 | 代表产品/案例 | -|--------|---------|-------------| +| 参数 | 数值 | +|------|------| +| 当前算力 | **10,000 PFLOPS(万卡)** | +| 规划总规模 | **100,000 PFLOPS+**(三中心:训练/推理/推训一体)| +| DeepSeek 部署 | 2025 年 1 月全量接入 DeepSeek-R1(中部首个)| +| 定位 | 填补东南沿海高端智算缺口 | +| 二期规划 | 边缘 / 云端推理一体机 + 产业闭环 | + +### 8.2 福州长乐机场综合保税区智算中心 + +| 参数 | 数值 | +|------|------| +| 投资 | **11 亿元**(一期 3.3 亿元)| +| 用地面积 | **33,347 m²**(50.02 亩)| +| 规划算力 | **15,000 PFLOPS** | +| 预计投产 | **2026 年 10 月** | +| 技术方案 | 规模化智算液冷机柜 + 体系化网络存储机柜阵列 | +| 政策优势 | 综保区多重政策,深化粵港数字协作 | + +### 8.3 深圳宝安国际机场(AI 全栈部署标杆) + +| 参数 | 数值 | +|------|------| +| 排名 | 42 家千万级机场综合评价**第二名** | +| DeepSeek 部署 | **满血版 R1-671B**,华为昇腾集群全栈本地化部署 | +| 算力底座 | 华为昇腾算力服务器(规模未披露)| +| 数据整合 | 打通航班运行、物流服务、设备物联日志等 **18 类** 核心业务数据 | + +**核心智能体矩阵:** + +| 智能体 | 效果 | +|-------|------| +| 机位智能分配 | 每日起降分配:**4 小时 → 1 分钟**,靠桥率:**85.44%** | +| AI 安全助手 | 融合 1,500 份安全文档,检索效率提升 **60 倍** | +| 一体化主动运控 | 提前 **20 分钟** 预判保障节点,正常率提升约 **4 个百分点** | +| 综合交通全域一张图 | 响应时间 **< 1 分钟**(获"兴智杯"一等奖)| + +### 8.4 大兴 / 迪拜 / 大连横向对比 + +| 机场 | 等级 | 总功耗 | 制冷方案 | 建设模式 | PUE | 建设周期 | +|------|------|--------|---------|---------|-----|---------| +| 北京大兴 | 未公开(推 Tier III+)| 未公开 | Vertiv Liebert PEX+ 精密空调 | 传统建设 | 未公开 | 3 年+ | +| 迪拜(DXB)| Tier III 双认证 | 1 MW | 变容量行级空调 + 封闭通道 | **预制模块化** | < 1.6 | **10 个月** | +| 大连金州湾(在建)| 规划 Tier III+ | 未公开 | 风液融合 | BIM + 数字孪生 | 目标 < 1.4 | 3–4 年 | + +**关键结论:** +1. **快速交付选预制模块化**:迪拜案例 10 个月交付,节省 50% 时间 +2. **高功率密度必须液冷**:单柜 50 kW 以上场景风冷无法满足 +3. **BIM 是新建机场数据中心的标准**:设计施工运营一体化 +4. **Tier III 是机场数据中心的基准等级**:迪拜明确要求 Tier III 双认证 + +--- + +## 九、供应商参考 + +### 9.1 液冷系统 + +| 供应商 | 方案类型 | 代表产品 / 案例 | +|--------|---------|---------------| | 维谛技术(Vertiv)| 冷板式(英伟达独家合作)| GB200 NVL72 参考设计,Liebert PEX+ | | 英维克(Envicool)| 冷板式 + 浸没式 | 国产液冷龙头,多个 AIDC 项目 | -| 曙光数创 | 浸没式(相变/单相)| 国内浸没式液冷最大供应商 | +| 曙光数创 | 浸没式(相变 / 单相)| 国内浸没式液冷最大供应商,PUE 可低至 1.04 | | 华为 | 冷板式 + 液冷 CDU | 临港智算谷项目 | -| Keydak 金盾 | 风液融合 | 2025 机场博览会发布 | +| Keydak 金盾 | 风液融合 | 2025 年国际机场博览会发布 | | 施耐德电气 | 冷板式液冷基础设施 | 132 kW/rack 方案 | -### 9.2 GPU 服务器供应商 +### 9.2 GPU 服务器 | 供应商 | 产品系列 | GPU 支持 | |--------|---------|---------| @@ -1297,49 +885,273 @@ GPU服务器机柜(液冷CDU集成供电) | 联想 | ThinkSystem SR670 V2 | H100/H200 | | 超聚变 | FusionPoD | 多元异构 | -### 9.3 网络设备供应商 +### 9.3 网络设备 | 设备 | 推荐供应商 | 规格 | |------|---------|------| -| InfiniBand 交换机 | NVIDIA Quantum-2 | 400Gb/s NDR | +| InfiniBand 交换机 | NVIDIA Quantum-2(QM9700)| 400Gb/s NDR | | 以太网交换机 | 华为 CloudEngine 16800 | 400G | | RoCE 网卡 | NVIDIA ConnectX-7 | 400Gb/s | | 光模块 | II-VI / 华为 | 400G DR4/FR4 | --- -## 十、技术方案总结 +## 十、关键参数汇总 -### 10.1 机场智算中心推荐配置 +| 参数 | 数值 | +|------|------| +| 单机柜功率(训练)| 80–130 kW | +| 单机柜功率(推理)| 40–80 kW | +| GPU 互联带宽(节点内)| NVLink **900 GB/s**(双向对等,H100)| +| NVLink 聚合带宽(B200)| **1.8 TB/s**(Fabric 聚合)| +| GB200 NVL72 对等带宽 | **900 GB/s**(任意 GPU 到任意 GPU)| +| 网络互联带宽(节点间)| IB 400G / 以太网 400G | +| NCCL 带宽目标(IB 400G)| ≥ **320 GB/s**(理论峰值的 80%)| +| PUE | ≤ 1.25(典型)/ ≤ 1.15(全液冷)| +| WUE(上海标准)| ≤ 2.0 L/kWh(先进值)| +| CUE(上海标准)| ≤ 1.0 gCO₂/kWh(先进值)| +| 可用性(Tier III)| 99.982%,年均故障时间 ≤ 1.6 小时 | +| 千卡集群参考造价 | **3.5 亿元**(算力设备 3 亿 + 网络 2,500 万 + 存储 1,000 万 + 平台 / 液冷 1,000 万)| -|| 层级 | 推荐技术选型 | -||------|------------| -| **算力芯片** | NVIDIA H100/H200(训练)+ L40S(推理),预留昇腾 910B 国产化 | -| **液冷方案** | 冷板式液冷为主(当前主流),PUE 目标 ≤1.25(典型),≤1.15(优秀)| -| **网络架构** | Spine-Leaf 400G + InfiniBand 400G(NDR)| -| **存储架构** | 全闪存分布式存储,≥500 GB/s 聚合带宽(需 20+ 存储节点前提)| -| **国产化** | 昇腾 910B + 曙光数创液冷 + 华为存储 | -| **运维平台** | Kubernetes + Volcano + DCGM + Prometheus | -| **PUE 目标** | ≤1.25(80%液冷)/ ≤1.15(全液冷+自然冷却配合)| +--- -### 10.2 关键参数汇总 +## 十一、GPU 集群建设建议与方案 -|| 参数 | 数值 | -||------|------| -|| 单机柜功率(训练)| 80-130 kW | -|| 单机柜功率(推理)| 40-80 kW | -|| GPU 互联带宽(节点内)| NVLink 900 GB/s(双向对等)| -|| 网络互联带宽(节点间)| IB 400G / 以太网 400G | -|| PUE | ≤1.25(典型),≤1.15(优秀,全液冷+自然冷却)| -|| 可用性(Tier III)| 99.982%,年均故障时间 ≤1.6 小时 | +> 以下建议基于上海智算导则(2025)、头豹 AIDC 白皮书、Vertiv GB200 白皮书、郑州/深圳/福州机场建设经验总结,适用于机场智算中心新建或扩建场景。 -### 10.3 实施建议 +--- -1. **液冷优先**:新建机场智算中心应直接采用冷板式液冷,避免后期改造成本 -2. **弹性架构**:预留机柜电力容量和网络端口,适配未来芯片功率持续上升 -3. **国产化路径**:可采用"主流国际芯片+国产化备用"的双轨策略 -4. **建设运营一体化**:参考上海机场 BIM 经验,将数字孪生从设计阶段贯穿至运维 -5. **分期建设**:首期部署推理集群满足当前需求,中期扩展训练集群能力 +### 11.1 液冷是必选项,不是可选项 + +H100 单卡 700W、GB200 超级芯片 2.7 kW,风冷天花板已过。**强行风冷会导致 GPU 过热降频,得不偿失。** + +| 液冷方案 | 适用场景 | PUE | 代表供应商 | +|---------|---------|-----|---------| +| **冷板式液冷(推荐)** | 新建首选,40–130 kW/柜 | 1.15–1.25 | Vertiv(GB200 独家合作)/ 英维克 / 华为 | +| **浸没式液冷** | 超高密度(> 200 kW/柜)| 1.05–1.15 | 曙光数创(国内最大浸没式供应商)| +| **风液融合** | 过渡期、分期部署 | 1.25–1.35 | Keydak 金盾(2025 年国际机场博览会发布)| + +**冷板式液冷架构要点:** + +``` +冷却塔 / 干冷器(一次侧) + ↓ + 冷水机组(夏季备用) + ↓ + CDU(冷却液分配单元)← 独立配电回路,必须提前规划 + ↓ + Manifold(液冷岐管) + ↓ + 冷板(直接接触 GPU + CPU + 内存) +``` + +**关键坑**:CDU 必须独立配电回路;液冷系统调试周期比风冷长 2–3 个月;单机柜功率超过 100 kW 时,Vertiv GB200 NVL72 是唯一经过验证的方案。 + +--- + +### 11.2 网络:InfiniBand 是训练集群的事实标准 + +**别在网络上省钱。** 网络瓶颈会导致 GPU 训练效率系统性低于预期,且这个问题极难在后期排查。 + +| 场景 | 推荐网络 | 原因 | +|------|---------|------| +| **AI 训练集群** | InfiniBand NDR 400G(QM9700 交换机)| 延迟 < 0.6 μs;SHARP 网内聚合节省 30–50% 梯度通信量 | +| 推理集群 | Spectrum-X 400G(RoCE v2)或普通 200G 以太网 | 无需 IB 生态,运维简单,成本低 | +| 存储网络 | RoCE v2 + NVMe-oF | 与计算网络解耦,独立扩展 | + +**组网设计原则:** + +1. **收敛比 ≤ 1:1**:AI 训练东西向流量极大,收敛比 > 1:1 直接堵死 GPU +2. **每服务器双上联 2 × 400G IB**:LACP Bonding 冗余,任何单链路故障不影响集合通信 +3. **Fat-Tree 无阻塞拓扑**:千卡规模下,最差路径不超过 3 跳 + +**交换机数量估算(512 GPU 集群):** + +| 层级 | 设备 | 数量 | +|------|------|------| +| Spine | QM9700 | 8 台 | +| Aggregation | QM9700 | 16 台 | +| 每组 Compute SU | 64 GPU(8 服务器 × 8 GPU)| 8 组 | + +--- + +### 11.3 存储:别用传统 NAS,直接上 JuiceFS + 对象存储 + +AI 训练的三类存储需求差异极大,**一套 NAS 打天下,必然有至少两类场景拉胯**。 + +| 存储类型 | 需求特征 | 推荐方案 | 性能目标 | +|---------|---------|---------|---------| +| **数据湖** | 大文件顺序读,带宽优先 | 对象存储(S3) + JuiceFS | 顺序读带宽 ≥ 500 GB/s | +| **模型存储(Checkpoint)| 小文件高速写入,延迟敏感 | 全闪存分布式存储(并行文件系统)| 写入带宽 ≥ 100 GB/s,延迟 < 1 ms | +| **共享文件系统** | 小文件 IOPS 高,元数据压力大 | JuiceFS + TiKV 元数据引擎 | IOPS ≥ 1M | + +> **性能目标有前置条件**:需足够的存储节点数量(20+ 全闪存存储节点)、充足的存储网络带宽(200G+)、正确配置的小文件聚合策略(建议 4 MiB chunk)。 + +**推荐架构:JuiceFS + S3 兼容对象存储 + 每节点 1–2 TB NVMe L1 缓存** + +```python +# JuiceFS 关键配置示例 +# 元数据引擎:TiKV(分布式,≥3 节点) +# 数据存储:S3 兼容对象存储(任意厂商) +# 本地缓存:每节点 1–2 TB NVMe SSD(L1 缓存热点数据) +# chunk_size:4194304 # 4 MiB,平衡元数据压力与读写效率 +# 预取:自动预取临近数据块,减少对象存储往返次数 +``` + +**存储产品选型参考:** + +| 产品 | 类型 | 适用规模 | AI 训练适配度 | +|------|------|---------|------------| +| JuiceFS | 元数据 + 对象存储分离 | 中大规模 | ★★★★★ | +| BeeGFS | 并行文件系统 | 超大规模 | ★★★★ | +| GPFS(IBM Spectrum Scale)| 并行文件系统 | 企业级 | ★★★★ | +| 曙光 ParaStor | 全闪存分布式 | 国产化 | ★★★★ | +| 华为 OceanStor 9000 | 全闪存分布式 | 大规模 | ★★★★ | + +--- + +### 11.4 分期建设,别一口气建完 + +智算中心投资巨大(千卡集群 ~3.5 亿元),一次性规划过大的风险极高。**推荐三期滚动建设**: + +| 阶段 | 建设内容 | 算力规模 | 优先级理由 | +|------|---------|---------|---------| +| **首期(0–12 个月)** | 推理集群为主(L40S × 64–128 卡)| ~256 TFLOPS(FP16)| 快速产出 AI 业务价值:客服机器人、视频分析、Agent 推理,ROI 可见 | +| **二期(12–24 个月)** | 训练集群(H100/H200 × 128–256 卡)| ~1 PFLOPS(BF16 稀疏)| 积累自有数据后,开展模型微调和垂直领域训练 | +| **三期(24–36 个月)** | 扩展至千卡 + 国产化混部 | 1,000+ PFLOPS | 规模化降本,昇腾 910B 或海光 DCU 纳入备线 | + +**分期建设的核心优势:** +- **液冷/电力容量可平滑扩展**:避免一次性投入后容量浪费 +- **技术路线验证**:H100 → H200 → GB200 NVL72,可逐步引入新硬件 +- **业务验证先行**:首期推理集群验证业务可行性,二期训练集群才有意义 + +--- + +### 11.5 国产化:昇腾可用但生态是核心门槛 + +| 芯片 | FP16 算力 | HBM 容量 | CUDA 兼容性 | 迁移成本 | 建议 | +|------|---------|---------|------------|---------|------| +| **NVIDIA H100/H200** | 1,979 TFLOPS | 80 GB | 原生 CUDA | **低** | **主力生产集群** | +| 昇腾 910B | 640 TFLOPS | 64 GB | **差**,需 CANN/MindSpore 移植 | 高 | 备胎 / 政务场景,配合华为原厂 | +| 海光 DCU Z100 | 256 TFLOPS | 64 GB | **较好**,ROCm 部分兼容 | 中 | 迁移成本低于昇腾,可作为备选 | + +**国产化实施路径(二选一):** + +``` +路径 A(推荐,低风险): + 主力:NVIDIA H100/H200 训练 + 推理集群 + 备线:昇腾 910B 集群(独立调度,混合训练暂不推荐) + 迁移优先级:推理场景优先,训练场景押后 + +路径 B(高风险,需华为原厂深度绑定): + 主力:昇腾 910B 全栈(MindSpore + CANN + 昇腾集群) + 前提:必须有华为原厂交付团队驻场,且业务模型已通过昇腾兼容性验证 +``` + +**昇腾生态关键障碍(现实评估):** +- PyTorch 模型需要重新适配(昇腾提供 PyTorch Adapter,但非所有算子覆盖) +- NCCL 通信库替换为 HCCS,集合通信参数需重新调优 +- 推理引擎(vLLM/TensorRT-LLM)昇腾适配不完整,vLLM 昇腾支持为第三方社区维护 +- **结论**:昇腾 910B 在推理场景相对可用;训练场景建议等待昇腾 920 或更高代际 + +--- + +### 11.6 上线前必须验证 NCCL 带宽 + +这是 GPU 集群上线后**最容易被忽略、也最容易出问题的环节**。网络配置不当会导致 GPU 训练效率系统性低于预期,且排查链路长(应用层 → NCCL → IB 驱动 → 物理层)。 + +**验证命令:** + +```bash +# ── 节点内 NVLink 带宽验证 ── +# 目标:> 850 GB/s(理论 900 GB/s 的 94%) +./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 + +# ── 跨节点 InfiniBand 带宽验证 ── +# 目标:> 320 GB/s(理论 400 GB/s 的 80%) +# 说明:若 < 320 GB/s,说明 IB 网络存在瓶颈(光模块/线缆/交换机配置/拥塞控制) +./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 -N 1 -w 100 -n 100 + +# ── GPU Direct RDMA 验证 ── +# 验证 GPU 直接访问远端存储(绕过 CPU),目标带宽接近 IB 线速 +nvidia-smi topo -m # 查看拓扑矩阵,确认 GPU 与 IB 网卡亲和性 +``` + +**NCCL 带宽不达标的常见原因:** + +| 原因 | 表现 | 解决 | +|------|------|------| +| IB 端口误码率 > 10⁻⁶ | 带宽波动剧烈,大量重传 | 更换光模块或光纤 | +| 收敛比 > 1:1 | 跨交换机流量丢包 | 增补交换机,改无阻塞拓扑 | +| GPU Direct RDMA 未启用 | GPU → CPU → 网卡绕路 | 确认 `NCCL_NET_GDR_LEVEL=PIX` | +| NVLink 域内流量被 PCIe 抢带宽 | 节点内 AllReduce 带宽不足 | 确认 NVLink 拓扑全连接 | +| SHARP 未启用 | 梯度聚合消耗额外带宽 | 启用 SHARP:`NCCL_SHARP_ENABLE=1` | + +**验收标准:** 512 GPU 集群规模下,跨节点 AllReduce 带宽稳定 ≥ 320 GB/s,且连续 72 小时压测无掉速。 + +--- + +### 11.7 推荐配置方案对比 + +| 配置项 | 方案 A:推理优先 | 方案 B:训练+推理均衡 | 方案 C:超大规模旗舰 | +|--------|---------------|---------------------|------------------| +| **定位** | 年旅客量 < 1,000 万 | 年旅客量 1,000–5,000 万 | 年旅客量 > 5,000 万 | +| **训练 GPU** | — | H100 SXM5 × 8/节点,32 节点 | H200 SXM5 × 8/节点,128 节点 | +| **推理 GPU** | L40S × 4/节点,32 节点 | L40S × 4/节点,16 节点 | H100/L40S 混合,32 节点 | +| **总 GPU 卡数** | 128 卡 | **384 卡**(训练 256 + 推理 128)| **1,152 卡** | +| **训练算力(BF16 稀疏)**| — | ~1 PFLOPS | ~2.5 PFLOPS | +| **计算网络** | RoCE v2 200G | IB NDR 400G × 2 上联 | IB NDR 400G,Fat-Tree 1:1 无收敛 | +| **存储网络** | RoCE v2 200G | RoCE v2 200G + 全闪存存储 | IB 400G + 并行文件系统 50 PB | +| **散热方案** | 冷板式液冷 | 冷板式液冷(80% 液冷占比)| 全液冷,PUE ≤ 1.15 | +| **液冷 CDU** | 英维克(200–400 kW)| Vertiv / 华为(400–800 kW)| Vertiv GB200 NVL72 配套 | +| **国产化** | 可选昇腾 910B 混部 | 昇腾 910B 作为备线 | 昇腾 920 作为下一代备选 | +| **预估总功耗** | ~256 kW | ~**550 kW** | ~**13 MW** | +| **预估投资** | ~8,000 万元 | ~**3.5 亿元** | ~15–20 亿元 | +| **PUE 目标** | ≤ 1.25 | ≤ 1.20 | ≤ 1.15 | +| **Tier 等级** | Tier III | Tier III | Tier III+ | + +> **方案 B**(训练+推理均衡)是大多数中型机场的推荐起点。千卡集群参考造价分项:**算力设备 ~3 亿 + InfiniBand 网络 ~2,500 万 + 全闪存存储 ~1,000 万 + 平台软件/液冷基础设施 ~1,000 万 = ~3.5 亿元**。 + +--- + +### 11.8 避坑清单 + +| # | 坑点 | 后果 | 预防措施 | +|---|------|------|---------| +| 1 | 液冷 CDU 配电容量未提前规划 | 液冷系统无法满载,GPU 过热降频 | 电力容量申请时按 100 kW/柜 × N 柜提前量 | +| 2 | InfiniBand 收敛比 > 1:1 | GPU 训练效率 < 50% | 组网设计审查必须过「无阻塞」关 | +| 3 | 存储用了传统 NAS | 并行训练时所有 GPU 饿死 | 存储必须满足 IOPS ≥ 1M、带宽 ≥ 500 GB/s 前置条件 | +| 4 | 国产化迁移低估生态障碍 | 昇腾集群上线后模型跑不起来 | **推理场景先行验证,训练场景押后** | +| 5 | 上线前未验证 NCCL 带宽 | 集群训练效率系统性低于预期 | 512 GPU 以上集群必须 72 小时压测 | +| 6 | 一次建完未分期 | 容量浪费或容量不足 | 三期滚动建设,首期验证业务可行性 | +| 7 | PUE 目标过于激进(全液冷但液冷调试滞后)| 夏季高温期集群性能受限 | 液冷调试周期留足 2–3 个月余量 | + +--- + +### 11.9 建设检查清单(验收参考) + +**液冷系统:** +- [ ] CDU 运行状态:出水温度、流量、压力在设计范围内 +- [ ] 冷板接触面导热硅脂状态正常,无干涸 +- [ ] 液冷回路无泄漏报警 +- [ ] 夏季高温工况下 GPU 温度稳定 < 80°C + +**网络系统:** +- [ ] InfiniBand 端口误码率 < 10⁻⁸(连续 24 小时) +- [ ] NCCL 跨节点 AllReduce 带宽 ≥ 320 GB/s(IB 400G) +- [ ] GPU Direct RDMA 验证通过 +- [ ] SHARP 网内聚合启用并生效 + +**存储系统:** +- [ ] JuiceFS/并行文件系统 IOPS ≥ 1M(4K 小文件随机读) +- [ ] Checkpoint 写入带宽 ≥ 100 GB/s(128 节点同时写) +- [ ] 对象存储读写延迟 < 10 ms(P99) + +**集群健康:** +- [ ] DCGM GPU 监控大屏正常运行 +- [ ] 训练作业 72 小时无 GPU ECC 错误告警 +- [ ] UFM InfiniBand 管理平台拓扑与实际一致 +- [ ] 故障节点自动隔离机制验证通过 --- @@ -1350,37 +1162,43 @@ GPU服务器机柜(液冷CDU集成供电) | 缩写 | 全称 | 说明 | |------|------|------| | AIDC | Artificial Intelligence Data Center | 智算中心 | -| PUE | Power Usage Effectiveness | 电能利用效率 | +| PUE | Power Usage Effectiveness | 电能利用效率(= 总设施能耗 / IT 设备能耗)| +| WUE | Water Usage Effectiveness | 水资源利用效率 | +| CUE | Carbon Usage Effectiveness | 碳利用效率 | | CDU | Coolant Distribution Unit | 冷却液分配单元 | -| NCCL | NVIDIA Collective Communications Library | GPU集合通信库 | +| NCCL | NVIDIA Collective Communications Library | GPU 集合通信库 | | RoCE | RDMA over Converged Ethernet | 以太网远程直接内存访问 | -| NVLink | NVIDIA High-Speed GPU Interconnect | 英伟达高速GPU互连 | -| InfiniBand | High-Speed Network Architecture | 高速网络架构 | -| DCGM | Data Center GPU Manager | 数据中心GPU管理工具 | -| vLLM | Virtual Large Language Model Server | 开源LLM推理服务框架 | -| HBM | High Bandwidth Memory | 高带宽存储器 | -| BF16 | Brain Float 16 | AI训练常用浮点格式 | +| NVLink | NVIDIA High-Speed GPU Interconnect | 英伟达高速 GPU 互连 | +| InfiniBand | High-Speed Network Architecture | 高速网络架构(400G NDR)| +| DCGM | Data Center GPU Manager | 数据中心 GPU 管理工具 | +| vLLM | Virtual Large Language Model Server | 开源 LLM 推理服务框架 | +| HBM | High Bandwidth Memory | 高带宽存储器(GPU 显存标准)| +| BF16 | Brain Float 16 | AI 训练常用浮点格式 | | ZTNA | Zero Trust Network Architecture | 零信任网络架构 | +| SHARP | Scalable Hierarchical Aggregation and Reduction Protocol | 网内计算协议 | +| UFM | Unified Fabric Manager | InfiniBand 监控管理工具 | +| GPFS | General Parallel File System | IBM 并行文件系统 | ### B. 数据来源 -1. **中国信通院**,《人工智能算力基础设施赋能研究报告(2025年)》 -2. **国信证券**,《数据中心液冷专题报告:液冷:智算中心散热核心技术》 -3. **头豹研究院**,《2025年中国AIDC产业发展白皮书》 -4. **中国工业互联网研究院**,《工业智算发展研究报告(2025年)》 -5. **中国基金报**,液冷市场专题报道(2025年8月) -6. **Vertiv**,《GB200 NVL72 参考架构白皮书》 -7. **临港算力**,智算中心液冷实践(2025年6月,中国电信算力大会) -8. **联想集团**,海神温水水冷系统技术资料 -9. **Keydak金盾**,2025国际机场博览会发布资料 +1. **上海**,《智算中心建设导则(2025 年版)》— 全国最严 PUE/WUE/CUE 三级指标 +2. **头豹研究院**,《2025 年中国 AIDC 产业发展白皮书》— GPU 选型、液冷市场 +3. **中国工业互联网研究院**,《工业智算发展研究报告(2025 年)》 +4. **Vertiv**,《GB200 NVL72 参考架构白皮书》— 130 kW 单柜设计 +5. **IDC + 浪潮信息**,《中国人工智能计算力发展评估报告》 +6. **中国信通院**,《人工智能算力基础设施赋能研究报告(2025 年)》 +7. **福州长乐机场保税区**,《15,000P 智算中心可行性报告》(2026-01-22) +8. **郑州航空港**,《中部最大万卡算力集群》报道(2026-03-05) +9. **深圳机场**,《智能化全国第二 AI 全栈部署》报道(2026-01-15) ### C. 相关标准与政策 -- 《数据中心绿色低碳发展专项行动计划》(发改环资〔2024〕970号) +- 《数据中心绿色低碳发展专项行动计划》(发改环资〔2024〕970 号) - 《数据中心设计规范》GB 50174-2017 -- 《新型数据中心发展三年行动计划(2021-2023)》 +- 《新型数据中心发展三年行动计划(2021–2023)》 - 《算力基础设施高质量发展行动计划》 -- Uptime Institute Tier Standard +- Uptime Institute Tier Standard(Tier I/II/III/IV 认证体系) +- ANSI/TIA-942-B(数据中心电信基础设施标准) ---