星光澄海 | BLOG

华为推独立KV Cache存储,专用SSD规格尚未落地

华为全联接大会刚推出的OceanStor M900,和英伟达不久前发布的CMX Context Memory Storage,都是瞄准AI推理里的KV Cache做的专属存储产品——这在行业里已经成了共识:推理过程里那些可能重复用的KV缓存,已经大到不能随便丢或挤在服务器内部资源里了。

为什么要把KV Cache单独拎出来存?核心是算一笔「以存换算力」的账。长期研究存储的学者章衡算过:KV Cache命中率从90%提到95%,需要重新计算的部分会从10%降到5%,等于算力开销直接减半。但命中率每往上提一点,要存的历史KV就越多——尤其到95%以上的高命中率区间,为了覆盖最后几个百分点的长尾数据,存储容量需求会明显跳涨。

现实是DRAM既贵又缺,和SSD的替换比例不是1:1,而是1:5甚至1:10,同容量成本差能到数十倍。原来的内存卸载只是资源不足时的兜底手段,现在已经慢慢融入新系统的初始设计了。企业先把服务器里的DRAM、本地SSD用满,不够再考虑外置存储。

但有了专属存储产品,不代表配套的SSD就成熟了。现在行业都在聊面向KV Cache优化的SSD,但客户实际买的还是普通企业级SSD——三星、闪迪、美光的传统产品为主。

问题出在KV Cache的负载还没摸透。某头部存储厂商负责人李辉说,最早有方案对SSD耐写能力要求是3 DWPD,后来涨到9,现在可能又变12或5。DWPD是SSD每天承受的整盘写入次数,指标变来变去,全看KV要存多久:如果只存几分钟,写入压力大,耐写要高;如果存几周,写入降下来,容量需求就成了重点。

加上不同业务的KV生命周期差很大,从分钟、小时到天、周不等,存储厂商也没法提前定死指标。要做大规模的标准化产品,得等实际负载收敛。李辉估算,行业形成共识还要6到12个月,就算定了标准,产品开发验证优化还要约1年。目前北美市场已有客户加单,中国市场的KV Cache需求还在方案阶段,大头还是训练和常规推理。

存得下了,但数据搬运的开销还在。外置KV缓存直接缓解了DRAM压力——不用买那么贵的内存,多买SSD就行,但对HBM的影响没那么大。HBM管着生成Token的速度,历史KV从外部调回来的速度,只影响首Token的延迟,生成过程里的速度还是靠高速显存。

AI芯片公司创始人顾淮说,存算一体(CIM)能减少模型权重和数据的搬运开销,比如高并发Prefill阶段,同一组参数能给多个请求复用,不用每个请求都搬一遍。但CIM替代不了历史KV的存储需求——那些对话产生的大量KV,还是得存在SSD这类大容量介质里,等后续请求命中再调出来。

大模型的「记忆」开始需要基础设施买单,但现在的成本账还没算清。KV要存多久、能复用多少次、用什么介质、调数据要花多少搬运成本,每一项都影响决策。当KV Cache的存储规格落地时,会不会成为企业级SSD的重要增量?


素材来源:雷峰网 · AI情报、AI芯片与算力、AI政策与监管、AI基础设施
查看报道原文

发表第一条评论吧

支持 Markdown