星河基地的核心参数
2026年8月6日,远景科技集团宣布乌兰察布星河基地正式投产。这个项目刷新了AI基础设施的多项纪录:12万平方米建筑体量(约20个标准足球场)、百万卡并行能力、百万P(PFLOPS)算力规模、园区总规划容量2GW、绿电直连比例超80%。它不仅是全球最大的AI算力超级单体,也是目前Token产出能力最强的单体AI数据中心。
从服务器运维角度看,这个项目的规模对传统数据中心运维提出了全新挑战。百万卡并行意味着GPU集群的网络拓扑、供电架构、散热方案都需要重新设计,不能照搬传统IDC的运维手册。
绿电直连的供电架构
星河基地选址乌兰察布的核心逻辑是绿电资源。乌兰察布风能资源丰富,年等效利用小时数超过2400小时,远景在当地布局了大规模风电场。绿电直连比例超过80%,意味着基地的电力供应大部分来自就地风光发电,不经过电网传输,减少线损和变压损耗。
这种供电架构对运维的影响是:电力供应存在波动性。风速和光照的变化导致发电功率在短时间内可能波动30%-50%。智算中心如果按传统方式运行,GPU集群在功率波动时会出现欠压重启。远景的解决方案是在基地内部署大规模储能系统,用电池储能平抑绿电波动,为GPU集群提供稳定的电力输入。
运维团队需要监控的关键指标包括:实时发电功率与负载功率的差值、储能SOC(荷电状态)、各区域PDU(电源分配单元)的电流均衡度。绿电直连模式下,这些指标的告警阈值设置需要比传统IDC更宽松的容错范围,否则频繁告警会让值班人员疲劳响应。
百万卡并行的网络拓扑
百万卡GPU集群的网络架构是决定训练效率的关键因素。传统数据中心用的是Spine-Leaf架构,但对于大规模分布式训练,这种架构的跨交换机延迟会成为瓶颈。星河基地大概率采用基于InfiniBand或RoCEv2的Fat-Tree拓扑,配合同轨(co-located)设计减少跨交换机通信。
在实际运维中,百万卡集群的网络故障定位是个难点。一张网卡掉速、一根光纤衰耗偏大,都可能导致某个AllReduce操作的超时,进而拖慢整个训练任务。运维团队需要部署逐卡、逐链路的网络健康监测,包括IB链路的Symbol Error计数、RC(Reliable Connection)重传率、以及跨交换机的尾延迟(Tail Latency)分布。
散热方案与PUE控制
2GW总规划容量的数据中心,散热能耗占比极大。乌兰察布年均气温4.3℃,年均风速3.5m/s,天然适合自然冷却。星河基地大概率采用”冷水机组+自然冷却”混合方案:冬季和过渡季利用乌兰察布低温空气直接冷却冷却水,夏季启动冷水机组补充制冷。
对于GPU集群的散热,百万卡规模的散热方案大概率是液冷——冷板式液冷或浸没式液冷。风冷方案在单机柜功率超过30kW后基本不可行,而百万P算力规模的单机柜功率可能在50-100kW。运维团队需要关注液冷回路的流量均衡、CDU(冷水分配单元)的进出口温差、以及漏液检测探头的响应灵敏度。
算力资源规划的实际建议
如果你的企业也在规划大规模算力集群部署,从星河基地的设计中可以提取几个可复用的经验:第一,选址优先考虑绿电资源丰富且气温低的地区,电价和PUE直接决定运营成本;第二,供电架构上做”绿电+储能+市电备源”的三级设计,而不是完全依赖电网;第三,网络拓扑的扁平化比带宽总量更重要,减少一层交换机就能把AllReduce的尾延迟降低20%-30%;第四,散热方案从设计阶段就锁定液冷路线,不要给风冷预留空间,否则后期改造的成本远超初期投入差异。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/quan-qiu-zui-da-ai-suan-li-dan-ti-tou-chan-yuan-jing-xing/