高盛报告揭示:开源模型以不足8%训练成本实现更优性能
高盛顶级TMT交易员Peter Callahan在8月9日发布的科技板块研究报告中指出一组关键数据:开源大模型正在以不足闭源模型8%的训练成本,在多项基准测试中实现相当甚至更优的性能表现。这组数据来自对DeepSeek、Qwen等开源模型与GPT-5.6、Claude等闭源模型的系统性对比,结果直接冲击了算力堆叠决定模型能力的行业共识。
报告同时揭示了一个结构性趋势——AI投资逻辑正在发生三重转变:智能体(硅基)流量超越人类(碳基)流量、光学元器件跑赢存储芯片、开源模型碾压闭源成本。其中开源模型的成本效率突破,正在重塑企业AI部署的ROI计算方式。
DeepSeek技术路线:MoE架构与强化学习驱动推理能力
DeepSeek的开源策略建立在两条技术主线之上:混合专家(MoE)架构与强化学习驱动的推理能力。MoE架构的核心优势在于参数激活效率——DeepSeek-R1总参数量达671B,但每次推理仅激活37B参数,计算量相当于一个中等规模Dense模型,训练和推理成本大幅降低。
在训练方法上,DeepSeek-R1跳过了传统的监督微调(SFT)阶段,直接通过大规模强化学习(RL)培养推理能力。模型在数学推理、代码生成等任务上表现出的Chain-of-Thought能力并非来自人类标注数据,而是通过RL过程中的自我探索涌现产生。这一训练范式大幅降低了数据标注成本,同时证明了推理能力可以通过RL自发生成的技术假设。
DeepSeek的调用量数据同样支撑了成本效率论点——其API调用量已达到OpenAI的三倍规模,但定价远低于闭源竞品。这种以规模摊薄成本的策略,与MoE架构的参数激活效率形成了双重成本优势。
Qwen3.8-Max的自主编程实践:16天独立完成代码项目
阿里云发布的Qwen3.8-Max提供了一个更具冲击力的案例:该模型在测试中独立完成了一个持续16天的代码编写项目,无需人类干预。这个实验不是简单的代码补全或单元测试生成,而是从需求理解、架构设计、模块编码到调试修复的全流程自主编程。
Qwen3.8-Max的技术实现依赖于Agent框架与工具调用能力的深度集成。模型能够自主读取文件系统、执行代码、分析报错日志并迭代修复,整个循环完全闭环运行。这一能力使AI独立完成中等复杂度软件项目从理论讨论进入工程验证阶段。
对于企业用户而言,Qwen3.8-Max的自主编程能力意味着一个关键变化:AI编程工具的定位从编码助手向自主开发者跃迁。当模型能够独立完成数天的编码工作时,开发团队的工作流、代码审查流程和项目管理方式都需要相应调整。
成本差距的根源:训练效率vs算力堆叠的路线分野
开源模型与闭源模型的成本差距并非来自硬件折扣,而是来自训练范式的根本差异。闭源模型的训练路径倾向于算力堆叠——更大的集群、更多的GPU、更长的训练时间。OpenAI、Anthropic等公司的训练算力投入已达到GW级别,GPT-5.6和Claude的训练成本估计在数亿美元量级。
开源模型选择了另一条路径——通过架构创新和训练策略优化来提升训练效率。MoE架构减少了冗余计算,RL驱动推理减少了对标注数据的依赖,数据质量筛选替代了数据量堆叠。DeepSeek的技术报告显示,其V3模型的训练成本仅557万美元,而同等能力闭源模型的训练成本通常在1亿美元以上。
这种效率差距在推理阶段进一步放大。MoE架构的稀疏激活使单次推理的FLOPS仅为Dense模型的5%-6%,直接转化为GPU使用时长和API定价的显著差异。企业在大规模部署时,推理成本往往是训练成本的10倍以上,因此推理效率的影响远大于训练成本本身。
企业落地选择:闭源API与开源私有化部署的ROI对比
从企业实际部署的角度,开源与闭源的选择正在从能力差距转向成本效率。当前闭源API在复杂推理、多模态理解和安全性上仍有优势,但差距在快速收窄。对于大多数企业级应用场景——RAG问答、文档处理、代码辅助、数据分析——开源模型已具备足够的任务完成能力。
成本对比的关键变量在于调用量规模。当日均token消耗低于百万级别时,闭源API的即用性和免运维优势更明显;当日均token消耗达到千万级别时,开源私有化部署的算力成本仅为API调用的10%-20%。加上数据隐私合规的考量,金融、医疗、政务等敏感行业对开源私有化部署的需求持续增长。
高盛报告的结论指向一个明确的投资方向:开源模型生态的基础设施供应商——包括GPU云服务、推理优化引擎、模型微调平台——正在成为AI投资的新焦点。当模型能力趋于同质化时,部署效率和成本结构将成为企业决策的主导因素。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/kai-yuan-da-mo-xing-8-cheng-ben-tiao-zhan-bi-yuan-deepseek/