AI SSD智能存储架构:计算靠近数据的服务器基础设施重构

大模型时代存储架构的底层逻辑变革

传统服务器架构中,存储是数据的仓库,计算是CPU和GPU的事情,两者通过PCIe总线连接。大模型的训练和推理彻底打破了这个分工边界。参数规模从百亿走向万亿,上下文窗口从几千Token扩展到百万级,检查点(Checkpoint)文件动辄数百GB——存储不再是被动等待读取的仓库,而是需要主动参与计算的智能节点。

2026年沙利文峰会上,忆芯科技首席科学家薛立成博士明确指出:AI SSD将是下一代AI基础设施的核心组件。让计算靠近数据,把部分计算逻辑下推到存储设备内部执行,是解决大模型场景下数据搬运瓶颈的关键路径。

传统存储架构在大模型场景的瓶颈

大模型训练和推理过程中,存储瓶颈体现在三个层面:

带宽瓶颈:GPU显存容量有限,模型参数和KV Cache需要频繁与主存交换。PCIe 5.0 x16双向带宽64 GB/s,8卡GPU服务器通过NVLink互联时,跨节点数据搬运仍依赖InfiniBand网络,端到端延迟在微秒级。当Checkpoint写入或模型加载时,存储IO成为整个流水线的瓶颈。

延迟瓶颈:推理场景下,KV Cache的换入换出对延迟极其敏感。SSD的随机读延迟在100微秒量级,而GPU等待数据的容忍窗口在10微秒以内。中间隔着PCIe控制器、NVMe驱动、文件系统等多层抽象,延迟叠加后远超GPU的等待预算。

CPU开销:数据从SSD搬运到GPU的过程中,CPU需要参与DMA调度、页表映射、数据校验等工作。在千亿参数模型的Checkpoint写入中,CPU占用率可达30%以上,挤占了数据预处理和梯度聚合的算力。

AI SSD的核心技术原理

AI SSD在传统SSD的控制器上增加了可编程计算单元,使存储设备具备数据预处理和过滤能力。架构上分为三层:

存储层:NAND闪存颗粒,与普通SSD相同。容量从4TB到30TB,支持TLC和QLC两种颗粒类型。

计算层:在SSD控制器上集成轻量级计算引擎(ARM核或FPGA),可执行用户自定义的数据处理逻辑。计算能力约2-4 TOPS,功耗低于5W。

接口层:NVMe协议扩展,新增Compute指令集。Host通过NVMe Submit Queue下发计算任务到SSD内部执行,结果就地写入指定LBA,或通过CQ返回状态。

核心优势是「数据不动计算动」——过滤、聚合、压缩等操作在数据所在位置就地执行,只有结果需要通过PCIe返回Host,大幅减少数据搬运量。

AI SSD在大模型场景的典型应用

Checkpoint增量写入:大模型训练的Checkpoint是全量快照,每次写入数百GB。AI SSD可以在内部实现增量检测——对比前后两次Checkpoint的差异块,只写入变化的LBA,全量数据在SSD内部组装。写入放大从3x降低到1.2x,Checkpoint时间缩短60%。

KV Cache换入预处理:推理时从SSD加载KV Cache到GPU前,AI SSD可以在内部完成数据解压缩和格式转换。原本需要CPU执行的反序列化操作下推到SSD控制器,Host收到的已经是可直接DMA到GPU显存的数据格式。

向量检索加速:RAG场景中,文档的Embedding向量存储在SSD上。AI SSD在控制器内实现HNSW图遍历,直接返回Top-K相似向量。避免将全量向量数据搬运到Host内存再做检索,IO量减少90%以上。

训练数据实时预处理:大模型训练的数据流水线中,Tokenize和动态Batching通常在CPU上执行。AI SSD可以在数据读出时完成Token切分和长度排序,CPU只需做最小化的调度工作。

服务器架构适配AI SSD的改造要点

在现有服务器架构中引入AI SSD,需要从硬件拓扑和软件栈两个维度进行适配:

PCIe拓扑优化:AI SSD应直连CPU的PCIe Root Port,避免经过PCIe Switch增加延迟。8卡GPU服务器中,建议将AI SSD插在靠近GPU的PCIe Slot上,缩短DMA路径。如果GPU通过NVLink Switch互联,考虑通过GPU Direct Storage(GDS)让AI SSD直接DMA到GPU显存。

NVMe驱动扩展:标准Linux NVMe驱动不支持Compute指令集,需要安装SSD厂商提供的扩展驱动。驱动负责将用户态的计算任务封装为NVMe Command提交到SSD,并处理完成通知。内核版本建议5.15以上,确保io_uring的完整性支持。

文件系统适配:AI SSD的计算功能通过ioctl或自定义syscall调用,不依赖特定文件系统。但Checkpoint写入建议用裸设备(Raw Device)直接操作,跳过文件系统的元数据开销。XFS在顺序大块写入场景性能最佳,ext4在随机读写场景更稳定。

AI SSD选型与部署实践

当前市场上AI SSD产品选择还比较有限,主要厂商和产品线:

忆芯科技:国内AI SSD的先行者,产品支持可编程计算引擎和NVMe Compute扩展。主打Checkpoint加速和向量检索场景,已在国内头部云厂商部署验证。

Samsung SmartSSD:基于FPGA的计算型SSD,支持用户自定义逻辑。生态成熟,Xilinx Vitis开发套件可直接编译计算Bitstream到SSD。缺点是功耗偏高(8-12W),FPGA开发门槛高。

NVIDIA Magnum IO:不是独立SSD产品,而是NVIDIA在存储IO路径上的软件优化方案。配合GDS技术实现GPU直连存储,可与非计算型SSD配合使用。

部署建议:初期用2-4块AI SSD做Checkpoint写入专用盘,其余数据盘仍用普通NVMe SSD。验证效果后再逐步扩大AI SSD的比例。不要一开始就全面替换,避免引入不必要的运维复杂度。

成本与ROI分析

AI SSD的单位容量价格约为普通企业级NVMe SSD的1.5-2倍。以4TB容量为例,普通NVMe SSD价格约4000元,AI SSD约6000-8000元。增量成本2000-4000元/块。

ROI计算以大模型训练场景为例:每4小时一次Checkpoint,每次写入500GB,普通SSD耗时约15分钟,AI SSD增量写入约5分钟。单次节省10分钟,每天6次Checkpoint节省60分钟。按8卡A100服务器的小时成本约200元计算,单台服务器每天节省200元,全年节省73000元。2块AI SSD的增量成本约12000元,投资回收期约2个月。

推理场景的ROI更显著:KV Cache换入延迟降低50%以上,直接转化为首Token延迟的改善和并发能力的提升。

技术演进方向

AI SSD的下一步演进方向是Computational Storage Drive(CSD)标准化。NVMe.org正在制定的NVMe Computational Programs规范将统一各厂商的计算指令接口,解决当前生态碎片化的问题。规范预计2027年正式发布,届时AI SSD的软件栈将从厂商私有走向行业标准,降低用户的切换成本和开发门槛。

另一个趋势是CXL内存扩展与AI SSD的融合。CXL 3.0支持内存池化和共享,AI SSD的计算结果可以直接写入CXL扩展内存,供多个GPU共享访问。这条路径将存储计算和内存访问统一到一个一致性协议下,从根本上消除数据搬运的瓶颈。

原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/aissd-zhi-neng-cun-chu-jia-gou-ji-suan-kao-jin-shu-ju-de-fu/

(0)
小编小编
上一篇 21小时前
下一篇 21小时前

相关推荐