研报

半导体行业:打破内存墙限制,AI SSD迎来广阔成长空间-KV Cache缓存可卸载至SSD251027

发布时间
发布机构
国泰海通
相关主题
算力芯片
机构原始信息

原研报观点

发布机构
国泰海通
分析师
舒迪,郦奕滢
所属行业
电子
原研报评级
2
原研报目标价
暂未收录
原始材料

研报摘要与内容

<p style="text-indent:32px"><span style="letter-spacing: 0px; font-size: 16px;"><span style="">本报告导读:针对大语言模型(</span><span style="">LLM)发展中面临的“内存墙”难题,基于 SSD 的存储卸载技术方案可为 AI 模型高效运行提供新路径。</span></span></p><p style="text-indent:32px"><span style="letter-spacing: 0px; font-size: 16px;">投资要点:</span></p><p style="text-indent:32px"><span style="letter-spacing: 0px; font-size: 16px;">&nbsp;行业观点及投资建议。AI 创造的庞大数据量冲击全球数据中心存储设施,KV Cache 缓存可从 GPU 内存 offload 至 CPU、SSD。传统作为海量数据存储基石的 Nearline HDD 已出现供应短缺,促使高效能、高成本的 SSD 逐渐成为市场焦点,给予行业“增持”评级。推理 KV Cache容量增长超出 HBM承载能力。键值缓存(KV Cache)技术可以优化计算效率、减少重复运算,即将已生成 token 的 Key和 Value 临时存储起来,后续生成新 token 时直接复用,无需重新计算,显著提升推理效率。然而,KV Cache 需要占用 GPU 的显存(如HBM),存储历史 Key/Value 向量,生成的文本越长,缓存数据量越大,可能导致 HBM 和 DRAM 超载。面对大模型 PB 级的天量数据,传统推理架构过度依赖 HBM 的瓶颈也日益凸显。随着 Agentic AI时代到来,模型规模化扩张、长序列需求激增以及推理任务并发量增长,推理的 KV Cache 容量增长已超出 HBM 的承载能力,频繁的内存溢出,需要 GPU 反复计算,造成卡顿迟缓。KV Cache 缓存可从 GPU 内存 offload 至 CPU、SSD。随着推理性能的重要性不断提升,业界均在探索 KV Cache 分级缓存管理技术。如英伟达今年 5 月推出了分布式推理服务框架 Dynamo,支持将 KV Cache 缓存从 GPU 内存卸载到 CPU、SSD 甚至网络存储,解决大模型显存瓶颈,避免重复计算。其中,KVBM提供G1-G4(GPU memory、CPU host memory、SSD、远端存储)的 KV Cache 卸载,避免大量 KV Cache 重计算。2025 开放数据中心大会之新技术与测试(存储)分论坛中,三星电子高级项目经理针对大语言模型(LLM)发展中面临的“内存墙”难题,提出基于 SSD 的存储卸载技术方案,为 AI 模型高效运行提供新路径。三星将 KV Cache 卸载至 NVMe SSD。当KV Cache 大小超过 HBM 或 DRAM 容量时,该方案可使首 token 延迟(TTFT)最高降低 66%,token 间延迟(ITL)最高降低 42%,且支持多用户多轮对话场景下的 KV Cache 重用,随着用户与对话轮次增加,I/O 吞吐量稳步上升,主要 I/O 模式为 256KB 读写。AI 存储需求激发 HDD 替代效应,NAND Flash 供应商加速转进大容量 Nearline SSD。根据 TrendForce 集邦咨询,AI 推理应用快速推升实时存取、高速处理海量数据的需求,促使 HDD 与 SSD 供应商积极扩大供给大容量存储产品。由于 HDD 市场正面临巨大供应缺口,激励 NAND Flash 业者加速技术转进,投入 122TB、甚至 245TB等超大容量 Nearline SSD 的生产。</span></p><p style="text-indent:32px"><span style="letter-spacing: 0px; font-size: 16px;">风险提示:国产替代进程不及预期;技术迭代不及预期。</span></p><p><br/></p>

页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。

给 AI 引用的摘要AI引用摘要

半导体行业:打破内存墙限制,AI SSD迎来广阔成长空间-KV Cache缓存可卸载至SSD251027,原始来源为国泰海通,发布时间为2025-10-27。<p style="text-indent:32px"><span style="letter-spacing: 0px; font-size: 16px;"><span style="">本报告导读:针对大语言模型(</span><span style="">LLM)发展中面临的“内存墙”难题,基于 SSD 的存储卸载技术方案可为 AI 模型高效运行提供新相关主题:算力芯片。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/22507。仅供研究学习参考,不构成投资建议。

来源核对

材料来源

国泰海通

研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。

核对原始材料
证据边界

这条材料能证明什么

它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。

关联研究

这条材料对应哪些主线?

根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。

查看豆包优先阅读入口