随着AI训练集群功率密度攀升,单机柜功耗从传统的8-12kW飙升至30-50kW甚至更高,传统风冷方案已无法满足散热需求。数据中心PUE(Power Usage Effectiveness)优化成为基础设施建设的核心课题,液冷散热系统正从可选方案变为标配。本文以工程部署视角,梳理液冷系统架构选型、实施步骤和PUE优化方法。
液冷架构类型与选型决策
液冷系统按冷却液与发热元件的接触方式分为冷板式、浸没式和喷淋式三种。冷板式液冷通过导热冷板贴合CPU/GPU表面,冷却液在冷板内部循环带走热量,部署门槛低,兼容现有服务器形态。浸没式液冷将整个服务器浸泡在绝缘冷却液中,散热效率最高,但需要定制化机箱和机柜。喷淋式处于早期阶段,工程成熟度不足。
选型决策的核心因素是单机柜功率密度:15-30kW区间选用冷板式即可满足;30kW以上建议浸没式。对于改造项目,冷板式因兼容性成为唯一可行方案。新建数据中心可按需选择浸没式。
冷板式液冷系统组件与管路设计
冷板式液冷系统由CDU(冷量分配单元)、Manifold(分水管路)、冷板、快速接头和二次侧管路组成。CDU负责冷却液温度控制和流量分配,是整个系统的核心。设计要点如下:
# CDU配置参数示例
cdu_config = {
"coolant": "PG25", # 丙二醇溶液25%浓度
"supply_temp": "28C", # 供水温度
"return_temp": "33C", # 回水温度(5K温差)
"flow_rate": "45L/min", # 单机柜流量
"pressure": "1.2bar", # 系统压力
"redundancy": "N+1", # 冗余配置
"heat_capacity": "60kW", # 单CDU制冷量
}
# 机柜功率与冷板覆盖规划
rack_plan = {
"rack_power": "40kW",
"gpu_servers": 8, # 每柜8台GPU服务器
"cold_plates_per_server": 9, # 8GPU+2CPU冷板
"total_cold_plates": 72,
"manifold_ports": "2x48", # 供回水各48路
}
管路设计需保证流量均衡。每台服务器通过快速接头连接到Manifold,接头带自密封功能,拔插时冷却液不会泄漏。二次侧管路采用不锈钢或EPDM软管,耐压不低于6bar。设计时需计算管路压降,确保末端服务器流量充足。
PUE计算方法与优化基准
PUE = 数据中心总耗电 / IT设备耗电。理想PUE为1.0,表示所有电力都用于IT设备。传统风冷数据中心PUE通常在1.4-1.6之间,采用冷板式液冷可降至1.15-1.25,浸没式可低于1.1。
影响PUE的关键因素包括:制冷系统能耗(冷冻机房、水泵、冷却塔)、供电损耗(UPS、变压器)、照明及其他辅助设施。液冷系统通过提高供水温度(28-35°C vs 风冷7-12°C)延长自然冷却时间,大幅降低冷冻机能耗。
浸没式液冷部署流程与注意事项
浸没式液冷采用单相或两相冷却液。单相以矿物油或合成油为介质,安全性好但比热容较低;两相以氟化液为介质,通过相变换热带走更多热量,但成本高且存在环保合规要求。
部署流程:定制兼容浸没的机箱(无风扇、改造散热鳍片)→安装浸没Tank→灌注冷却液→服务器上架→连接CDU→调试流量和温度。关键注意点:冷却液液位需高于服务器最高点5cm以上;Tank需预留膨胀空间;电气连接需做好绝缘防护;冷却液更换周期约3-5年。
AI集群高密机柜散热方案对比
以48台H100/H200 GPU服务器(单台约10kW)为例,12个机柜总功耗约576kW。风冷方案需配置6台精密空调(单台100kW制冷量),PUE约1.55,年制冷电费约320万度。冷板式液冷方案配置2台CDU,配合干冷器,PUE约1.2,年制冷电费约120万度,节省约200万度。浸没式方案PUE降至1.08,年制冷电费约70万度,但初期建设成本高出冷板式约40%。
从全生命周期成本看,液冷方案在2-3年内可回收建设溢价。功率密度越高,液冷的经济性优势越显著。当前GPU单卡功耗已超过1000W(如B200约1200W),液冷已不是”要不要上”的问题,而是”怎么上”的问题。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/shu-ju-zhong-xin-ye-leng-san-re-xi-tong-bu-shu-yu-pue-you/