AI推理芯片进入NVLink Fusion生态:GPU服务器算力格局生变

AI推理芯片与英伟达GPU生态的关系正在从”替代”转向”嵌入”。9月10日,AI推理芯片初创公司d-Matrix宣布加入英伟达NVLink Fusion生态系统,其机架级XPU系统将采用英伟达MGX通用机架参考架构,下一代Raptor推理XPU将接入英伟达数据中心服务器体系,相关产品预计2027年可用。这一动向在AI芯片行业引发广泛关注,被视为推理算力分工的新样本。

合作内容与产品规划

d-Matrix本次公布的合作包含一项多年产品路线图,核心是一套支持NVLink Fusion的机架级系统。该系统面向AI实验室、超大规模数据中心和新型云平台,提供超低延迟的token服务。d-Matrix创始人兼CEO Sid Sheth表示,通过NVLink Fusion集成,XPU可以作为英伟达AI工厂生态中的推理节点,纵向与横向扩展都保持与GPU一致的互联能力。

技术细节上,d-Matrix自”Raptor”起的下一代推理XPU将同时整合英伟达MGX通用机架参考架构与NVLink Fusion互联协议,聊天机器人、代码助手、语音Agent等低延迟任务是其目标场景。相比当前以FPGA/ASIC卡形式存在的独立推理加速器,接入NVLink后,推理芯片与训练集群的数据搬运路径大幅缩短,端到端延迟有望进一步下降。

NVLink Fusion生态对推理芯片的意义

NVLink是英伟达GPU间高速互联总线,Fusion体系把多个芯片的NVLink域融合为一个统一内存域,允许不同厂商的加速器以对等节点身份接入。对推理芯片公司来说,加入该生态意味着两件事:其一,推理卡无需通过PCIe旁路,可以直接共享GPU集群的显存与内存资源,模型分片加载与KV缓存交换都在高速链路上完成;其二,英伟达AI工厂的存量用户可以在不改变数据中心机架布局、网络架构的前提下插卡使用,降低了推理芯片的部署门槛。

此前推理芯片与英伟达生态的关系主要是”用CUDA生态但走PCIe”,带宽受限于PCIe 5.0的128GB/s量级。NVLink Fusion链路的带宽以TB/s计,推理场景中大批量小数据交换的瓶颈被明显缓解。这一模式对AI芯片初创公司的商业意义大于技术意义:获得英伟达生态的”通行证”,意味着进入主流云厂商与大型AI实验室采购清单的概率显著增加。

推理芯片市场格局与国产厂商的参照

全球推理算力市场仍在高速增长。x86 CPU与GPU之外,专用推理芯片(XPU/NPU)的出货量与数据中心占比都在提升。d-Matrix的技术路线与英伟达生态绑定,实际推理芯片厂商与GPU巨头从竞争关系走向竞合关系。对国内AI芯片厂商而言,这一案例提示了两条路径:一是自建高速互连体系(如国内厂商的RoCE+开放互连方案)承担推理加速;二是在国际生态之外构建自主可控的推理算力标准,并在国产GPU集群上优先适配,避免对外部生态的路径依赖。

行业观察普遍认为,AI基础设施的竞争焦点正从”单一芯片算力”转向”集群互联与生态兼容”。芯片厂商能提供的,不只是峰值算力,还包括与既有AI集群的即插即用能力。d-Matrix与英伟达的合作,把推理芯片的竞争力赛道拉向了互联带宽、软件栈兼容性和部署成本三个维度,这三点也正是2026年AI算力采购方评估时的核心指标。

对数据中心运维与算力规划的启示

对技术团队而言,这一变化会逐步传导到算力资源规划。推理节点与训练集群共享NVLink Fabric后,机房机柜、网络带宽、供电制冷规划都要按”统一互连域”重新测算:推理卡不再只是PCIe插槽上的加速器,而是与GPU共享同一套机架级网络,集群拓扑和故障域设计需要同步更新。另一方面,推理芯片可插拔部署的趋势,让”训练卡+推理卡”混合机柜成为新的机柜形态,这对标准化机架参考架构MGX的普及也有推动作用。

推理需求持续增长、推理成本持续下降的背景下,算力供给端的生态合作会越来越多。技术决策者关注的不再是单一芯片的算力指标,而是它能否融入现有算力池、能否在不改动集群结构的情况下扩展。d-Matrix与英伟达的合作在2027年落地后是否真的兑现低延迟推理承诺,值得技术团队保持跟踪。

原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/ai-tui-li-xin-pian-jin-ru-nvlinkfusion-sheng-tai-gpu-fu-wu/

(0)
小编小编
上一篇 4小时前
下一篇 3小时前

相关推荐