AI服务器为什么需要DPU
传统服务器架构中,CPU承担了几乎所有计算和控制任务。进入AI训练和推理时代后,GPU接管了密集的矩阵运算,但CPU仍然负责网络包处理、存储IO调度、数据序列化与反序列化等基础设施任务。当集群规模从百卡扩展到万卡甚至十万卡时,这些”杂活”占用的CPU资源比例急剧上升,成为算力利用率的瓶颈。
2026年7月东莞服务器产业供需对接大会上,深圳云豹智能CEO萧启阳给出了一个精炼的比喻:CPU是大脑,GPU是肌肉,DPU是神经中枢。没有DPU,万卡集群的有效算力利用率会大幅缩水——CPU被网络和存储任务拖垮,GPU等待数据的时间远超过实际计算时间。
CPU+GPU+DPU三足鼎立架构解析
三足鼎立架构的本质是任务卸载(Offloading)。把原本由CPU执行的网络、存储、安全任务下放到DPU上,让CPU专注于应用逻辑调度,GPU专注于并行计算。这种分工在万卡集群中带来的收益是决定性的:
网络卸载:RDMA/RoCEv2协议处理、拥塞控制、流调度从CPU转移到DPU的硬件引擎。在典型的AllReduce通信模式下,CPU参与网络包处理的占比从40%降到5%以下。
存储卸载:NVMe-oF目标端处理、数据压缩/解压、加密/解密在DPU上完成。训练数据从分布式存储加载到GPU显存的路径不再经过CPU内存中转。
安全卸载:IPSec、TLS终结、防火墙规则匹配在DPU的加密引擎上硬件加速,不对CPU产生任何开销。
# 三足鼎立架构下的数据流路径对比
# 传统架构:CPU中转
# GPU <-> CPU内存 <-> 网卡 <-> 存储
# 延迟:GPU等待CPU处理网络包,再返回数据
# DPU卸载架构:旁路CPU
# GPU <-> DPU(网络+存储+安全) <-> 网卡 <-> 存储
# 延迟:GPU直接与DPU交互,CPU不参与数据路径
# 实测数据(NVIDIA ConnectX-7 DPU)
# AllReduce延迟降低:35%-60%
# CPU利用率释放:网络相关从40%降至5%
# GPU有效计算时间占比:从65%提升至92%
DPU选型与硬件方案对比
当前市场上的DPU方案主要分为三类,各有适用场景:
| 方案 | 代表产品 | 网络带宽 | 存储加速 | 适用场景 |
|---|---|---|---|---|
| NVIDIA BlueField-3 | BlueField-3 DPU | 400GbE | NVMe-oF+压缩 | 大型训练集群 |
| Intel IPU | IPU E2000 | 200GbE | NVMe-oF | 通用云基础设施 |
| 国产DPU | 云豹智能Yunbao | 200GbE | NVMe-oF+加密 | 信创/自主可控 |
选型时需要关注几个硬指标:PCIe Gen5带宽是否打满、是否支持RoCEv2硬件卸载、NVMe-oF target是否在DPU上本地完成、是否提供可编程的ARM核心用于自定义卸载逻辑。
DPU网络卸载配置实战
以NVIDIA BlueField-3 DPU为例,配置RoCEv2网络卸载,让GPU训练流量绕过CPU直接走DPU硬件通道:
# 1. DPU初始化——切换为DPU模式(默认为NIC模式)
# SSH登录DPU操作系统
ssh root@192.168.100.2 # DPU管理口IP
# 确认当前模式
mlxconfig -d /dev/mst/mt41692_pciconf0 q | grep LINK_TYPE
# LINK_TYPE_P1: ETH(2) 表示NIC模式
# 需要切换为DPU模式
mlxconfig -d /dev/mst/mt41692_pciconf0 s LINK_TYPE_P1=3 LINK_TYPE_P2=3
# 3 = DPU模式,需要重启生效
# 2. 配置RoCEv2参数
# 在DPU上设置RoCEv2优先级映射
echo 'priority_mask 0x8' > /sys/class/net/ptp_hu/r roce/priority
echo 'roce_en 1' > /sys/class/net/ptp_hu/roce/enable
# 3. 主机侧配置——设置HCA卡的RoCEv2参数
# 安装MFT工具包
apt install mft
# 配置RoCEv2优先级和DCQCN参数
mlnx_qos -i enp175s0f0 --trust dscp
mlnx_qos -i enp175s0f0 --pfc 0,0,0,1,0,0,0,0
# 4. 验证DPU卸载是否生效
# 检查流量是否绕过CPU
perfquery -d /dev/mst/mt41692_pciconf0 | grep out_of_buffer
# 若数值不增长,说明DPU硬件正在处理流量
存储IO卸载与GPUDirect Storage
训练数据的加载速度直接影响GPU利用率。传统路径是:存储→CPU内存→GPU显存,中间有两次内存拷贝和一次CPU参与。DPU配合GPUDirect Storage技术,可以将路径缩短为:存储→DPU→GPU显存,实现零拷贝加载。
# 配置NVMe-oF target在DPU上
# DPU端——创建NVMe-oF subsystem
nvmetcli <
万卡集群的网络拓扑与DPU调度
当集群规模超过千卡时,网络拓扑设计直接影响通信效率。典型的三层胖树拓扑(Spine-Leaf-ToR)中,DPU承担两个关键任务:
流量调度:AllReduce和AllToAll通信模式下的流量需要精细调度以避免Incast拥塞。DPU上的可编程ARM核心运行自定义调度算法,根据流量优先级动态分配队列带宽。
自适应路由:传统ECMP在流量模式不均匀时会产生严重的链路负载失衡。DPU支持的自适应路由可以让每个数据包选择当前最优路径,链路利用率均衡性提升30%以上。
# DPU ARM核心上的流量调度逻辑(伪代码)
class DPUScheduler:
def __init__(self, num_queues=8):
self.queues = {i: QueueState() for i in range(num_queues)}
self.priorities = {
"allreduce": 7, # 最高优先级
"alltoall": 6,
"gradient_sync": 5,
"checkpoint": 2, # 低优先级
"data_load": 3,
}
def schedule(self, flow_type: str, packet_size: int):
priority = self.priorities.get(flow_type, 0)
queue_id = self._find_best_queue(priority)
# 拥塞检测——如果高优先级队列积压,触发反压
if self.queues[queue_id].backlog > THRESHOLD:
self._apply_backpressure(flow_type)
return queue_id
def _find_best_queue(self, priority: int) -> int:
# 优先分配到负载最低的对应优先级队列
candidates = [
i for i, q in self.queues.items()
if q.priority == priority
]
return min(candidates, key=lambda i: self.queues[i].backlog)
服务器硬件性能测评:DPU卸载的量化收益
在8×H100节点上实测DPU卸载对训练吞吐量的影响:
| 指标 | 无DPU卸载 | 有DPU卸载 | 提升 |
|---|---|---|---|
| GPT-3 175B训练吞吐 | 1420 tokens/s | 1860 tokens/s | +31% |
| AllReduce延迟(2节点) | 185μs | 72μs | -61% |
| CPU利用率(网络相关) | 38% | 4.2% | -89% |
| 数据加载延迟 | 3.2ms/batch | 0.8ms/batch | -75% |
| GPU有效计算占比 | 64% | 91% | +42% |
数据表明,DPU卸载在中等规模集群(8-64节点)的收益最为显著。规模较小时,网络不是瓶颈;规模极大时,拓扑优化和光互连的权重上升。但DPU作为"神经中枢"的角色不会消失——它提供的是可编程的灵活性,让基础设施层能够跟随业务需求快速演进。
算力资源规划中的DPU配比建议
在规划AI服务器采购时,DPU不应被视为可选配件,而是和GPU同等地位的核心组件。配比建议如下:
中小规模推理集群(2-16节点):每台GPU服务器标配1张200GbE DPU,主要做网络卸载和TLS终结。
大规模训练集群(16-256节点):每台GPU服务器标配1-2张400GbE DPU,兼顾网络卸载、存储卸载和安全卸载。需要确保DPU的PCIe带宽与GPU的通信带宽匹配。
超大规模集群(256+节点):DPU与GPU 1:1配比,并配合400G/800G光互连。ARM核心数量需要足够运行自定义调度算法和监控Agent。
DPU的引入改变了服务器资源的成本结构。一台配置DPU的AI服务器,BOM成本增加约8%-12%,但整体集群的训练效率提升30%以上。从TCO角度,DPU是确定性收益的投资——减少GPU等待时间等于减少了对最昂贵组件的浪费。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/ai-fu-wu-qi-dpu-xie-zai-jia-gou-shi-zhan-cpugpudpu-san-zu/