全国产十万卡AI超集群落成投用
2026年7月,中科曙光宣布中国首个全国产10万卡AI超集群「曙光8000(登峰)」正式落成并接入国家超算互联网。该集群部署于国家超算互联网郑州核心节点,采用10万张国产AI加速卡,峰值算力相当于全人类不间断计算近两个世纪,上线首周即满载运行,日均处理作业超15万个,单日峰值作业量超50万个,已完成近千项应用适配。
对服务器运维和算力资源规划从业者而言,曙光8000的投用标志着国产算力基础设施建设从万卡级正式迈入十万卡级部署新阶段,其技术架构和运维体系值得深入拆解。
曙光8000核心技术架构拆解
曙光8000采用全链路国产化方案,核心技术栈包括:
计算层:海光AI加速芯片。10万张国产AI加速卡通过网络、存储、调度系统连接成逻辑上统一的超级计算机。这些芯片不是普通显卡,而是专门为大规模并行计算设计的AI加速处理器。系统支持FP64到INT8全精度覆盖,实现科学计算与智能计算的融合。
网络层:scaleFabric高速互联网络。十万卡集群的核心难点不在芯片本身,而在于如何让10万张卡高效协同。scaleFabric提供高带宽低延迟的节点间通信能力,是支撑大规模模型训练和分布式计算的关键基础设施。
存储层:ParaStor并行存储系统。大规模AI训练的数据吞吐需求极高,传统NAS/SAN架构无法满足。ParaStor提供面向AI负载优化的并行存储能力,支撑高并发数据读取。
散热层:浸没式液冷。10万张加速卡满载运行的散热功率极为可观。曙光8000采用浸没式液冷方案,PUE低至1.04,远优于传统风冷机房的1.3-1.5。服务器硬件被「浸泡」在特制冷却液中,气泡不断向上翻腾。
十万卡集群的运维挑战与解法
从万卡到十万卡,不只是规模放大,运维复杂度呈指数级增长:
故障域管理。10万张卡意味着日均故障的硬件数量显著增加。假设单卡月故障率为0.1%,则每月有约100张卡需要替换。集群必须具备细粒度故障隔离能力——单卡故障不应导致整组训练任务中断。曙光8000通过冗余设计和热插拔维护解决这一问题。
调度系统复杂度。日均15万个作业、峰值50万个作业的调度密度,要求调度器具备亚秒级决策能力和全局资源感知能力。传统Slurm等HPC调度器在AI场景下面临吞吐瓶颈,曙光8000采用定制的超智融合调度系统。
能耗管理。十万卡集群满载功耗在数十兆瓦量级,相当于一个小型城市的用电量。PUE 1.04的实现依赖浸没式液冷+智能功耗调节,但在非满载时段如何降低能耗同样关键。动态功耗调节和作业编排优化是必须的运维手段。
与SpaceX算力扩张路线的对比
与曙光8000投用几乎同步,SemiAnalysis发布报告称SpaceX 2027年新增AI算力或超10GW,ARR可达3000亿美元。马斯克在SpaceX首次财报电话会上确认,2026年末总算力将突破2GW,2027年末趋近10GW。两条算力建设路线形成鲜明对比:
技术路线差异。SpaceX基于英伟达GPU集群,追求最大算力密度;曙光8000走全国产化路线,强调自主可控和超智融合。前者服务于xAI等商业模型训练,后者服务于国家科研和产业算力需求。
部署策略差异。SpaceX采用集中式超大规模数据中心,马斯克规划的20GW电力上限意味着单体数据中心规模将达人类历史之最;曙光8000则接入国家超算互联网,算力以分布式方式在全国调度。
客户结构差异。微软预计将成为SpaceX最大客户,签署约3GW、总价值约1500亿美元的算力合同;曙光8000面向国内科研机构、高校和企业,已支撑新材料、创新药、AI等26个领域超300种计算任务。
服务器运维从业者的行动建议
曙光8000的投用对服务器运维领域有三点实操启示:
1. 液冷方案必须纳入规划。PUE 1.04的能效表现证明浸没式液冷已经从实验技术变为生产级方案。新建数据中心应将液冷作为标配选项预留,而非事后改造。
2. 国产化硬件栈的运维能力需要提前建设。海光芯片、scaleFabric网络、ParaStor存储都有与x86/英伟达生态不同的运维工具链和故障模式,运维团队需要提前学习和适配。
3. 超算互联网接入是中小型算力中心的出路。不是每个机构都需要自建十万卡集群。接入国家超算互联网,按需使用集中算力,是更经济的选择。运维重点从硬件维护转向算力调度和成本优化。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/shu-guang-8000-shi-wan-ka-ji-qun-tou-yong-guo-chan-ai-suan/