分布式训练
-
大模型训练分布式优化ZeRO-3与DeepSpeed Zero阶段显存分配策略实战配置
大模型训练过程中,显存瓶颈是最常遇到的工程问题。一个百亿参数模型用FP16精度存储就需要近200GB显存,单张A100 80GB根本无法装下。ZeRO(Zero Redundanc…
-
大模型MoE混合专家架构原理与稀疏激活分布式训练工程实战
大模型MoE(Mixture of Experts)混合专家架构通过稀疏激活机制,在不增加推理计算量的前提下大幅扩展模型参数规模,已成为GPT-4、Mixtral、DeepSeek…