大模型训练
-
字节去蒸馏化与全球AI算力军备赛:中国大模型调用量登顶背后的产业变局
大模型训练范式的分水岭 2026年8月,两则看似矛盾的消息同时搅动AI产业。一则是字节跳动创始人张一鸣向Seed团队下达停止蒸馏、加强原创预训练的内部指令,同时启动参数量最高达10…
-
MoE架构在大模型训练中的参数效率优化与工程实践
MoE架构如何提升大模型训练效率 大模型训练成本持续攀升,Mixture of Experts(MoE)架构成为参数效率优化的核心方案。传统稠密模型中,每个输入都要激活全部参数,训…
-
Anthropic 460亿美元算力交易落地:AI大模型训练如何构建算力供应链
Anthropic算力交易的背景与规模 2026年8月5日,人工智能企业Anthropic接连落地两笔巨额算力合作,合计交易规模达460亿美元,标志着全球AI算力军备竞赛正式进入资…