AI SSD正推动大模型推理基础设施发生范式跃迁:它不再仅是数据搬运工,而是深度嵌入推理数据路径、具备感知与调度能力的核心组件。以Mooncake架构和NVIDIA CMX平台为代表,业界正将KV Cache等动态推理状态视为独立资源进行组织与调度;AI SSD则将这一理念下沉至单节点内部,构建起覆盖HBM/VRAM(热)、DRAM/高性能Flash(温)、大容量SSD(冷)的精细化分层存储体系。其技术门槛远超主控参数或峰值带宽——关键在于打通NAND介质、FTL、固件、驱动、中间件、推理框架及整机验证的全栈协同能力。寅谱-联芸方案聚焦MoE专家权重、KV Cache与数值精度三维切分,实现冷热分层、并行搬运与预测预取,在最小化框架侵入前提下适配多芯片平台。这标志着AI SSD正从外围设备升维为AI Infra中可编程、可调度、面向Token成本优化的智能存储层级。
来源:量子位
