SpaceX Terafab晶圆厂算力部署:超大规模AI集群电力与冷却工程方案

Terafab晶圆厂规模:9.3万平方米厂房的算力密度设计

SpaceX位于德州休斯顿西北格莱姆斯县的Terafab晶圆厂,占地9.3万平方米,距星舰基地约七小时车程。这座被称为史上规模最大的晶圆制造与AI计算综合体,设计目标是在2027年底前新增超过10GW算力。研究机构SemiAnalysis在最新报告中指出,SpaceX有望由此撬动高达3000亿美元的年度经常性收入(ARR),微软将成为其最大客户。

10GW算力对应的GPU数量在百万张量级。以当前H100/B200级加速卡的功耗计算,仅GPU芯片的电力需求就达到数GW级别,加上配套的CPU、内存、网络和存储设备,整个设施的总电力需求可能超过5GW——这相当于一个中型城市的全部用电量。

在算力密度设计上,Terafab采用了不同于传统数据中心的机柜布局策略。标准数据中心的机柜功率密度通常在8-15kW,而AI训练集群的机柜密度可达100-150kW,需要从建筑结构层面重新规划配电和散热通道。

电力供给方案:超大规模AI集群的MW级配电架构

5GW级别的电力供给面临三个核心挑战:供电容量获取、配电层级简化、备用电源成本控制。

在供电容量方面,Terafab选址德州具有战略意义。德州拥有独立的电网(ERCOT),电价在美国各州中处于较低水平,且可再生能源(风能和太阳能)装机容量大。SpaceX通过与本地电厂签订长期购电协议(PPA),锁定基础负荷电力,同时利用德州丰富的风电资源降低电费成本。

在配电架构方面,传统数据中心采用变电站-主配电柜-列头柜-机柜PDU的四层配电结构,每层都有2%-3%的电力损耗。Terafab采用了变电站直连机柜母线排的扁平配电设计,将配电层级压缩为两层,电力损耗从8%-12%降低至3%-5%。对于5GW总负荷,3%的效率提升意味着每年节省数千万美元电费。

备用电源方案同样需要重新设计。传统的柴油发电机方案在5GW规模下不现实——需要数百台2MW级柴油机组,占地面积和燃料储备都是问题。Terafab采用了天然气涡轮机组作为主备电源,启动时间在10分钟级别,同时配备超大容量电池储能系统(BESS)覆盖燃气轮机启动期间的电力缺口。

液冷与风冷混合散热:10万卡GPU集群的热管理实践

10GW算力集群的热功率密度远超传统风冷方案的散热极限。单张B200级GPU的热设计功耗(TDP)已达1000W,一个装满8卡GPU的AI服务器节点TDP超过8kW,机柜总TDP达100-150kW。这个热密度下,风冷的气流组织已无法有效散热。

Terafab采用冷板式液冷作为主要散热手段。每个GPU节点配备铜质冷板,冷却液通过微通道带走芯片表面热量。液冷系统的供回水温差设计为15-20度,供水温度45度,回水温度60-65度。较高的供水温度有两个好处:减少制冷机组的运行能耗,同时可以利用高温回水进行余热回收。

在混合散热架构中,GPU、CPU等高热密度组件采用液冷,内存、SSD、网络适配器等低热密度组件仍由风冷覆盖。这种混合方案避免了全液冷系统的高额改造成本,同时确保了散热系统的冗余性——液冷系统故障时,风冷可以维持降频运行。

室外侧散热采用闭式冷却塔加冷水机组的组合。在冬季和过渡季,闭式冷却塔可以完全满足散热需求(free cooling),冷水机组仅在夏季高温时段运行。对于德州气候,全年free cooling时长可达3000小时以上,显著降低PUE。

网络拓扑设计:InfiniBand与RoCEv2在超大规模集群的选型

AI训练集群对网络带宽和延迟的要求极为苛刻。大模型分布式训练需要频繁进行AllReduce和All-to-All通信,网络带宽直接决定训练效率。在万卡以上规模,传统以太网难以满足低延迟要求。

InfiniBand(IB)网络仍是当前超大规模AI训练集群的首选。NVIDIA Quantum-2交换机提供64个400Gb/s端口,三级Fat-Tree拓扑可以支撑超过10万个节点的无损通信。但IB网络的成本极高——每端口价格是同等带宽以太网的3-5倍。

RoCEv2(RDMA over Converged Ethernet)提供了成本更低的替代方案。在100G/400G以太网上运行RDMA,配合DCQCN拥塞控制算法和PFC优先级流控,可以达到接近IB的延迟表现。Meta的RoCEv2实践表明,在万卡规模下RoCEv2与IB的训练效率差距在2%-3%以内,但网络成本降低60%以上。

Terafab的网络架构可能采用混合策略:核心训练集群使用IB网络确保最大训练效率,推理集群和存储网络使用RoCEv2降低总体成本。两种网络通过网关节点互联,训练数据和模型权重通过异步拷贝在两个网络域之间传输。

运维监控体系:百万级硬件指标采集与故障自愈

10万张GPU意味着数万台服务器、数千台交换机和数百个配电单元。硬件故障率在万卡规模下不再是偶发事件,而是常态——日均故障设备数可能在数十台级别。运维体系的核心目标是从发现故障-人工处理转向自动检测-自动隔离-自动恢复。

指标采集层采用Prometheus加VictoriaMetrics的架构,每个节点暴露GPU温度、功耗、显存利用率、ECC错误计数等指标,采集间隔15秒。告警规则覆盖GPU温度超限、ECC错误累积、训练loss异常跳变等场景,触发后自动执行节点隔离脚本。

故障自愈流程设计为三级:第一级是GPU重置(reset),适用于偶发的ECC错误或驱动异常,耗时约2分钟;第二级是节点重启,适用于操作系统级别故障;第三级是节点标记故障并从训练集群中移除,触发弹性缩容。三级自愈均通过Ansible playbook自动化执行,无需人工介入。

原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/spacexterafab-jing-yuan-chang-suan-li-bu-shu-chao-da-gui-mo/

(0)
小编小编
上一篇 2小时前
下一篇 2小时前

相关推荐