2.8万亿参数开源与自研芯片量产:国产算力双线突破
2026年7月27日,月之暗面正式开放Kimi K3完整模型权重,2.8万亿参数MoE架构、原生支持百万Token超长上下文与多模态理解、适配昇腾与平头哥国产算力芯片——这是迄今参数规模最大的开源大模型。与此同时,腾讯云在7月21日WAIC大会上发布第六代自研AI芯片紫霄2.0,宣布训练性能提升4倍、推理吞吐提升3倍,并计划于第四季度落地NPO近封装光学超级节点。一边是软件侧的开源突破,一边是硬件侧的芯片量产,国产算力正在从两端同时撕开替代缺口。
Kimi K3开源:打破参数规模的天花板
Kimi K3的核心技术特征集中在三个方面:MoE架构实现2.8万亿参数下的高效推理、百万Token超长上下文的原生支持、多模态图文理解的跨模态对齐。其中MoE架构的门控网络为每个Token动态选择激活约470亿参数,推理算力消耗接近一个470亿Dense模型,却拥有万亿级参数的知识容量。这种”大参数、低激活”的设计思路,让中小企业在8×A100-80GB集群上即可完成本地部署,大幅降低了自研大模型的门槛。
商用授权方面,Kimi K3采用Apache 2.0许可证,允许商业使用和衍生模型发布。这意味着国内AI创业公司可以基于Kimi K3进行垂直领域微调,无需从零训练基础模型,算力成本可压缩至API调用模式的25%左右。瑞银分析报告指出,中国头部模型训练成本约为海外领先模型的十分之一,API价格为海外同类模型的10%-20%,国内模型厂商仍能维持20%-40%的毛利率——开源模型将进一步压缩这一利润空间,倒逼厂商转向增值服务。
国产芯片适配是Kimi K3的重要差异化特性。官方支持昇腾910B和平头哥倚天710两类平台,前者通过CANN工具链实现PyTorch算子到NPU的映射,后者通过GGML量化格式在ARM CPU上运行。实测数据显示,8卡昇腾910B集群的推理吞吐约为A100的70%,已达到可用水平。
紫霄2.0与国产AI芯片生态
腾讯云紫霄2.0芯片在WAIC 2026上正式发布,定位大模型训练与推理场景。这是紫霄系列芯片的第六代迭代,与前代相比训练性能提升4倍、推理吞吐提升3倍。腾讯云同时宣布将大规模部署国产化算力,计划于2026年第四季度落地NPO超级节点——NPO(Near Package Optics,近封装光学)将光互连从板级推进到封装级,显著降低GPU集群间的通信延迟和功耗。
腾讯云还联合燧原科技、天数智芯、沐曦等多家国产芯片厂商建立算力生态联盟,试图统一不同芯片的软件栈接口。当前国产AI芯片最大的障碍不是单卡性能——昇腾910B和燧原T20的算力指标已接近A100的60%-80%——而是软件生态的碎片化。每家芯片厂商提供独立的SDK和编译工具链,模型迁移成本高。如果生态联盟能推动统一的中间表示(IR)层,开发者只需一次模型转换即可适配多种国产芯片,这将从根本上改变国产算力的可用性。
AMD Zen6 EPYC Venice:2nm服务器CPU的产业信号
7月22日AMD在Advancing AI 2026大会上发布Zen6架构EPYC Venice处理器,这是全球首款台积电2nm工艺服务器CPU。旗舰型号256核,原生支持MRDIMM内存模组,PCIe 6.0和CXL 3.1全面升级。2nm工艺将单核性能提升约22%,同功耗下性能提升35%,直接冲击Intel在服务器CPU市场的份额。
对国产算力产业链的影响在于:2nm工艺的成熟将带动先进封装产能扩张,为国产芯片的代工合作创造更多窗口期。东方算芯在7月14日发布首颗软件定义近存计算3D AI芯片DF1000,正是采用3D封装技术将计算单元与存储单元紧密集成,绕过了先进制程的瓶颈。这种”封装创新补位制程差距”的技术路线,正在成为国产算力芯片的主流策略。
长鑫科技上市:半导体产业链的里程碑节点
7月,长鑫科技正式登陆科创板,成为中国存储芯片领域的首个上市标的。长鑫聚焦DRAM存储芯片,产品覆盖DDR4、DDR5和LPDDR5,已实现19nm工艺量产,17nm工艺在研。上市首日市值突破3000亿元,市场对其国产替代逻辑的认可度极高。
存储芯片是服务器和AI算力的关键配套组件。MRDIMM的推广需要高质量的DRAM颗粒供应,长鑫的量产能力直接影响国产服务器平台的内存成本和供货稳定性。当前全球DRAM市场由三星、SK海力士和美光三家主导,长鑫的市场份额不足5%,但增速超过30%/年。如果长鑫能持续缩小与三大厂的技术代差,国产服务器平台从CPU到内存的全栈自主将成为现实。
资本市场:算力板块的冷热分化
与产业端的乐观形成对比的是资本市场的谨慎。上周美股半导体板块遭遇猛烈抛售,费城半导体指数单周跌幅超5%。知名做空投资者迈克尔·伯里加码做空英伟达、美光科技和费城半导体指数ETF,警告半导体板块可能面临30%回调。A股科技板块同样震荡加剧,资金从科技成长板块转向红利资产,多只红利ETF近一月规模增长超128亿元。
分化的核心逻辑是:短期AI算力的资本开支增速超过收入增速,市场对投资回报周期存疑;但长期来看,大模型的开源普及正在加速AI应用的落地,推理算力的需求增长确定性高于训练算力。腾讯云大规模部署国产算力压低推理成本的战略,正是基于这一判断。
国产算力替代的临界点
综合7月以来的产业动态,国产算力替代正在接近一个临界点:软件侧Kimi K3开源降低了大模型的获取成本,硬件侧紫霄2.0、昇腾910B、DF1000等芯片逐步补齐算力供给,存储侧长鑫科技上市保障了DRAM供应链安全,生态侧腾讯云联合多厂商推动统一软件栈。当国产AI芯片的推理性能达到A100的70%、软件迁移成本降低到1周以内、内存等配套组件实现国产替代时,海外算力的性价比优势将被大幅压缩。
这个临界点不会在某个季度突然到来,而是以季度为单位逐步显现。企业IT决策者现在应该做的准备是:新采购的GPU服务器预留CXL扩展接口以兼容未来的国产内存方案,大模型推理集群评估昇腾910B的部署可行性,内部AI平台保持模型格式的开放性以避免被单一芯片厂商锁定。算力自主不是替换芯片的单一动作,而是涉及芯片、内存、互连、软件栈、运维体系的系统工程,需要提前18-24个月规划。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/guo-chan-suan-li-jia-su-ti-dai-kimik3-kai-yuan-yu-zi-xiao/