英伟达cuFile开源与SCADA架构发布:GPU存储直连时代的IO性能重构

GPU存储IO瓶颈正成为AI算力释放的关键制约

AI推理和训练场景中,GPU的计算能力持续翻倍增长,但存储IO带宽的增长速度远远落后。传统架构下,GPU读写存储数据必须经由CPU中转,每一次512字节的微小IO请求都需要CPU介入调度。在LLM推理的KV Cache加载、RAG向量检索、多模态推理分块加载等场景中,CPU中转导致的微秒级延迟累积,使得GPU实际利用率长期徘徊在50-60%。

2026年8月5日,英伟达在FMS 2026闪存峰会上正式发布SCADA(Storage Compute Acceleration Direct Architecture)全新存储架构,同时宣布GPU存储加速API cuFile全面开源。这一组合拳直接瞄准AI推理场景的IO瓶颈——让GPU绕过CPU,直接与存储设备通信。

SCADA架构如何实现GPU对存储设备的直连访问

SCADA在GPU芯片内部新增了一个存储调度单元(Storage Scheduler Unit),该单元直接挂载在NVLink总线上,具备自主IO提交、批量IO合并和自适应路径选择三项核心能力。

自主IO提交是指GPU线程通过cuFile API直接向SSU提交IO请求,SSU将请求翻译为NVMe命令通过PCIe总线发送至存储设备,CPU全程不参与。批量IO合并是SSU将大量小IO请求(AI推理典型场景中多为512字节的随机读)合并为大块传输,有效块大小从512字节提升至4KB-64KB级别,大幅减少PCIe总线事务次数。自适应路径选择则根据IO大小自动决定走GDS的RDMA直连路径还是SCADA的PCIe直连路径,应用层无需关心路由逻辑。

英伟达公布的基准测试数据显示,在70B参数模型的KV Cache加载场景中,传统CPU中转模式的IOPS约为120K,SCADA模式下达到580K,提升4.8倍,首token延迟从1.2秒降至0.3秒。在RAG向量数据库检索场景中,IOPS从85K提升至420K,端到端延迟降低约60%。多模态推理中的Vision Transformer图像分块加载场景IOPS提升5.2倍。

cuFile开源对GPU存储生态的深层影响

cuFile API的开源是此次发布中影响最深远的决策。此前英伟达的GPUDirect Storage(GDS)方案对Mellanox RDMA网卡有强依赖,生态封闭。存储厂商想适配GDS必须与英伟达逐一商务对接,周期长、成本高。

开源后,华为、浪潮、宁畅等国产服务器厂商的存储方案可以自主适配cuFile接口,Broadcom的PCIe Switch芯片也能原生支持SCADA直连模式。云服务商无需等待英伟达的认证流程,直接在自研存储控制器中集成SCADA支持。AWS和阿里云预计在2026年Q4上线支持SCADA的GPU实例类型。

对运维团队而言,cuFile开源直接降低了部署门槛。此前GDS需要配置复杂的RDMA环境(Mellanox ConnectX网卡、NVMe-oF target、RoCEv2交换机),SCADA模式下只需升级英伟达驱动至550版本、GPU固件更新至最新版本即可启用,无需额外硬件采购。

卫星互联网低轨星座加速组网

8月4日16时52分,我国在海南商业航天发射场使用长征八号甲运载火箭,成功将卫星互联网低轨23组卫星发射升空。这是长八甲火箭完成性能完整升级后的首次全系统验证飞行,标志着我国低轨卫星互联网组网进入高频发射阶段。

低轨卫星互联网的核心优势在于低延迟(20-40ms vs 同步轨道600ms)和全球覆盖能力,对偏远地区宽带接入、航空航海通信、应急救灾等场景意义重大。我国规划的GW星座和G60星链合计发射卫星超过12000颗,目前23组卫星已发射完成初步覆盖验证。

地面设备端,华为、中兴已推出低轨卫星通信终端样机,支持Ka/Ku频段相控阵天线,终端成本目标降至5000元以内。运营商侧,中国移动和中国电信已完成地面信关站的选址和建设,预计2027年上半年面向普通用户提供卫星互联网接入服务。

港股硬科技板块走强背后的AI商业化逻辑

8月5日港股硬科技板块集体走强,海致科技集团大涨超28%,滴普科技涨超14%,智谱涨超9%,联想集团涨超7%。中芯国际、壁仞科技涨超6%。恒生互联网ETF华夏(513330)上涨1.22%,港股通信息技术ETF招商(526050)涨超3%。

这轮硬科技行情的核心驱动力是AI商业化加速。阿里云近日公布AI相关收入连续三个季度保持三位数增长,商业化路径从模型API调用扩展到行业解决方案。智谱作为大模型厂商直接受益于企业端AI支出增长。壁仞科技和国产GPU产业链受益于算力国产化替代的确定性趋势。

联想集团涨幅超7%的逻辑则来自AI终端——搭载NPU的AI PC出货量在2026年Q2环比增长45%,联想作为全球PC出货量第一的厂商直接受益。南向资金8月持续净流入港股科技板块,8月前4个交易日累计净买入超200亿港元,显示内地资金对港股硬科技估值修复的持续看好。

黄仁勋判断马斯克掌控AI三大关键战场

英伟达CEO黄仁勋近日公开表示,AI竞赛的最终赢家不是OpenAI、Anthropic或Google,而是马斯克。他的判断依据不是个人偏好,而是对算力基础设施与数据资源的结构性分析。黄仁勋将马斯克的业务版图划为三个AI关键战场:算力(xAI的Colossus超算集群10万卡H100规模)、数据(特斯拉Fleet数据加X平台用户数据)、应用场景(自动驾驶加人形机器人加脑机接口加社交推荐)。

这三个战场恰好覆盖了AI产业的价值链上游到下游。OpenAI和Anthropic只覆盖了模型层,缺乏自有算力和场景数据。Google有算力也有数据,但业务场景分散。马斯克的三个战场形成了算力-数据-应用的闭环。xAI的Grok模型直接在Colossus上训练,特斯拉车辆数据直接反哺FSD和Optimus,这种垂直整合在效率上超越松耦合的产学研合作模式。

不过,黄仁勋的判断也有局限——AI竞赛的胜负不仅取决于资源堆叠,模型架构创新、开源生态、监管合规都可能改变格局。DeepSeek的开源策略和中国的算力集群建设同样是不可忽视的变量。

原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/ying-wei-da-cufile-kai-yuan-yu-scada-jia-gou-fa-bu-gpu-cun/

(0)
小编小编
上一篇 16小时前
下一篇 16小时前

相关推荐