试验原型 — RDMA驱动的广域智算网络传输增强系统原型验证拓扑

关键节点 普通节点 200Gbps 100Gbps 10Gbps

测试结果

测试结果经中国信通院泰尔实验室检测认证!
方案 丢包率统计结果 (%)
1ms 5ms 10ms 20ms 30ms 50ms
DCQCN (w/o PFC) 48.79% 47.98% 46.30% 41.25% 44.76% 48.79%
DCQCN (w/ PFC) 0.00% 0.00% 0.00% 0.00% 0.00% 0.00%
TIMELY 0.00% 23.74% 31.02% 34.80% 30.65% 28.54%
本项目方案 0.00% 0.01% 0.20% 0.56% 0.62% 0.76%
方案 流完成时间统计结果 (ms)
1ms 5ms 10ms 20ms 30ms 50ms
PFC 57588.581 64717.822 72197.821 79930.282 86215.188 90182.281
本项目方案 11928.281 13486.506 15349.169 17291.911 23749.796 26718.121
方案 单 QP 长距吞吐统计结果 (Gbps)
1ms 5ms 10ms 20ms 30ms 50ms
DCQCN 2.270 4.220 7.280 11.360 12.220 10.550
TIMELY 80.930 39.320 32.430 28.310 24.120 16.370
本项目方案 89.700 71.970 65.280 56.080 53.230 49.340
方案 P90 尾流完成时间统计结果 (ms)
1ms 5ms 10ms 20ms 30ms 50ms
PFC 197884.12 188186.465 221847.829 252742.218 252386.193 321271.176
本项目方案 32819.874 37599.987 38285.37 42911.921 58811.636 57882.129
方案 All to All 吞吐统计结果 (GB)
1ms 5ms 10ms 20ms 30ms 50ms
DCQCN 8.75 8.44 4.45 4.12 2.88 1.77
TIMELY 8.50 8.18 4.30 3.99 2.77 1.70
本项目方案 11.00 8.64 5.22 5.34 3.97 2.68

应用验证

应用1:GPT-2 Large 全量微调实验

图1 通信模式
三卡 All-Reduce 通信模式:反向传播阶段 NCCL All-reduce 突发流量
表1 微调参数
GPU数 3
并行方法 DDP + FP16
max_batch_size 1
max_length 256
grad_accum 1
max_steps 30
optim paged_adamw_8bit
拥塞控制方案 Train Runtime (s)
0ms 5ms 10ms 20ms 30ms 50ms
PFC 60.2 114.8 191.6 326.4 547.1 1034.6
本项目方案 61.9 77.5 84.4 102.2 156.4 194.1

应用2:四节点遥感文件汇交2016年-2018年中国2米高分遥感影像数据集

拥塞控制方案 有效吞吐统计结果 (Gbps)
0ms 5ms 10ms 20ms 30ms 50ms
DCQCN 11.39 5.80 5.25 3.77 3.47 2.43
TIMELY 8.33 8.41 11.25 6.26 4.94 6.52
本项目方案 22.71 13.04 13.32 11.21 13.48 10.14