AI推理驱动存储需求爆发的核心机制
大模型推理的解码阶段本质是memory-bound,核心存储负载包括模型权重、KV Cache、激活值、RAG向量库等。KV Cache是随上下文长度和并发数动态膨胀的张量数据,推理性能(TTFT/TPS)高度依赖对KV Cache的保存和管理效率。在传统冯·诺依曼架构下,大模型推理时的大量高维张量数据和Transformer的自注意力机制加剧了内存墙问题,数据搬运成本高,严重拖慢推理效率。因此,提升存储带宽和容量可以显著增强推理性能、降低推理成本,“以存代算”是必然趋势。
存储范式的改进与架构演进
面对大模型推理的访存受限问题,产业界从模型优化和硬件优化双线推进。存储体系正从单一层级向高带宽+大容量+分级管理的协同架构演进。1)高带宽存储器解决方案:包括HBM、WOW 3D堆叠DRAM、HBF。HBM向更高带宽、更大容量升级,HBF通过堆叠NAND闪存提供巨大容量兼具成本优势,定位是HBM的补充。2)优化存储分级管理系统:CXL内存池化技术实现内存资源的整合与统一调度;英伟达GTC2026推出的最新方案将Prefill和Decode阶段分机柜部署,实现物理分离,优化资源利用。
供需状况与长协签订拉长周期能见度
2026年存储器下游需求中,服务器占比有望提升至40%左右,DRAM下游需求中服务器占比有望提升至50%-60%。本轮周期由AI需求驱动,供需高度紧张,预计26年全年价格上涨,27年至少保持高位。现货价占市场10%左右,近期有回调;合约价占90%左右,北美CSP因担心拿不到产能,陆续与原厂签订3-5年长约,国内模组厂也有签。客户与原厂基本达成价格共识,周期能见度拉长。LTA(长期供货协议)锁定高底价,要求高额预付款,违约成本高,议价权完全逆转至供应商,使存储厂商利润率维持在更高且更稳定的水平。