已往几年,,,,,AI 基础设施的竞争主要围绕 GPU 和高带宽内存(HBM)睁开。。随着模子规模一直扩大,,,,,训练和推理需要越来越多的算力,,,,,GPU 集群、HBM 容量和互连带宽成为权衡系统能力的主要指标。。
但进入长上下文、多轮对话和 AI 智能体时代,,,,,推理系统面临的问题最先爆发转变。。一次请求往往不但涉及模子盘算,,,,,还需要加载模子权重、读取历史上下文、检索知识、挪用工具,,,,,再将效果返回模子继续推理。。数据需要在 GPU、CPU、内存、存储和网络之间一连流动,,,,,只要其中任何一个环节无法实时供应数据,,,,,再强的 GPU 也只能期待。。
因此,,,,,企业评估 AI 基础设施的方式也最先改变。。浚浚??突д嬲褐玫,,,,,并不是一块 GPU ,,,,,而是系统能够一连、稳固地完成推理并天生效果的能力。。关于在线推理来说,,,,,真正被交付的产品,,,,,着实是 Token。。
企业最先关注的不再只是拥有几多 GPU,,,,,而是相同硬件在单位时间内能够交付几多切合服务质量要求(SLO)的 Token,,,,,以及完成这些 Token 所需要支付的本钱。。
然而,,,,,一个 Token 的本钱已经不但由 GPU 决议,,,,,还受到 CPU、HBM、DRAM、SSD(固态硬盘)、网络、电力、散热以及软件和运维等整个推理系统的影响。。与此同时,,,,,也不是所有 Token 都具有同样价值。。只有知足首 Token 延迟(TTFT)、天生速率(TPOT)、响应质量和稳固性要求的 Token,,,,,才是真正能够交付给客户的有用 Token。。
当评价标准从“买了几多 GPU”转向“交付了几多有用 Token”时,,,,,存储在推理系统中的角色也最先爆发转变,,,,,其中最具代表性的即是 SSD。。它正从古板的数据存储装备,,,,,逐渐成为 AI 推理基础设施的主要组成部分。。
AI SSD,,,,,最先重写存储价值
相比内存,,,,,SSD 拥有更低的容量本钱;;相比远端工具存储,,,,,又离盘算节点更近,,,,,可以生涯那些暂时放不进内存、但很快还会再次使用的模子和上下文数据。。
一方面,,,,,它能够肩负更多模子权重、KV Cache、MoE 专家参数等运行数据,,,,,镌汰系统为了扩容而增添内存或 GPU 的压力;;另一方面,,,,,又能够提前完成模子加载、复用已经盘算过的内容,,,,,镌汰重复盘算和期待时间,,,,,让同样数目的 GPU 在相同时间内完成更多推理请求。。
这种思绪已经泛起在越来越多的推理系统中。。例如,,,,,月之暗面(Moonshot AI)开源的 Mooncake,,,,,把 CPU、内存、外地 SSD 和高速网络组织成共享的 KV Cache 池,,,,,让差别 GPU 可以直接复用已经盘算好的上下文,,,,,而不必重新盘算。。
(泉源:月之暗面)
尚有 ServerlessLLM 将外地 SSD 纳入模子调理,,,,,在模子启动条件前完成加载,,,,,镌汰冷启动期待;;TensorRT-LLM、vLLM 和 CachedAttention 等推理框架,,,,,则通过复用已经盘算好的 KV Cache 或共享 Prefix,,,,,阻止相同内容重复执行 Prefill。。从某种意义上说,,,,,这些系统缓存的不但是数据,,,,,也是在生涯已经支付过的盘算效果。。
虽然,,,,,把 SSD 放进推理系统,,,,,并不料味着 Token 本钱一定会下降。。若是缓存没有掷中,,,,,系统仍然需要重新读取甚至重新盘算;;预取战略不对理,,,,,还可能占用名贵的 PCIe 带宽和内存空间。。因此,,,,,评价 AI SSD 不可只看带宽、IOPS 等古板存储指标,,,,,更主要的是它是否能够缩短模子启动时间、提高缓存掷中率、镌汰 GPU 期待,,,,,并最终让整个推理系统以更低本钱交付更多知足服务要求的 Token。。
消耗级和企业级,,,,,AI SSD 是两种生意
不过,,,,,AI SSD 的价值并不会体现为一种统一的产品形态。。差别的安排情形和客户群体,,,,,面临的瓶颈并不相同,,,,,对存储的需求自然也会有所差别。。
从现在来看,,,,,AI SSD 很可能沿着两条市场蹊径生长:一条面向消耗级市场,,,,,服务 AI PC、事情站等端侧装备;;另一条面向企业级市场,,,,,服务边沿盘算和云端 AI 推理基础设施。。
关于消耗级用户来说,,,,,最大的挑战是在有限的内存和功耗条件下,,,,,让装备运行更大的模子、生涯更多外地知识,,,,,并在离线状态下继续使用 AI。。消耗级 AI SSD 最现实的形态,,,,,仍然是一块装置在 AI PC、事情站等装备中的固态硬盘。。它依然肩负系统盘和数据盘的功效,,,,,但会进一步加入面向 AI 的数据治理能力,,,,,让模子、缓存和用户数据能够更高效地生涯在外地,,,,,而不需要改变现有 PC 的硬件架构。。
苹果在《LLM in a Flash》中展示过一种思绪:把大部分模子参数生涯在 Flash 存储中,,,,,需要盘算时再按需加载到内存。。沿着这一思绪,,,,,AI SSD 不但可以存放大模子自己,,,,,还可以生涯多个专业模子、个人知识库、AI 助手的恒久影象,,,,,以及暂时不必的数据,,,,,让系统凭证差别使命动态组合所需内容,,,,,而不必一直占用名贵的内存。。
消耗级 AI SSD 带来的首先是外地 AI 的可用性。;>刍峒吐肌⑽牡导焖鳌⒋胩焐⒏鋈酥犊獾仁姑,,,,,不需要每次都重新从云端下载模子或上传数据,,,,,在网络较差甚至离线的情形下,,,,,仍然能够完成一部分事情,,,,,同时镌汰网络传输和云端推理本钱。。虽然,,,,,数据生涯在外地并不料味着自然清静,,,,,权限治理、数据加密和清静删除等机制仍然不可或缺。。
企业级市场则完全是另一套逻辑。。企业客户购置的不是一块 SSD,,,,,而是整个 AI 推理系统的效率。。无论安排在企业边沿节点照旧云端数据中心,,,,,更主要的问题都是怎样镌汰 GPU 期待、提高 GPU 使用率,,,,,并一连降低每个 Token 的天生本钱。。
在企业边沿,,,,,AI SSD 可以资助装备在弱网甚至离线情形下运行模子,,,,,支持工厂、门店、医院等场景的外地 AI 应用;;而在云端数据中心,,,,,它肩负的角色则越发主要。。外地 SSD 可以缓存模子和检查点(Checkpoint),,,,,镌汰重复从远端工具存储加载;;机架或服务器集群中的共享 Flash 存储,,,,,则可以生涯仍有复用价值的推理数据,,,,,让差别 GPU 在处理相似请求时直接使用已有用果,,,,,而不必重复盘算。。
图|消耗级与企业级AI SSD在端侧和云侧的典范角色。。
这一思绪也已经最先进入商业产品。。英伟达推出的 CMX Context Memory Storage,,,,,就在 GPU 高带宽内存(HBM)、主机内存和共享存储之间增添了一层基于 Flash 的上下文存储,,,,,用来生涯暂时放不下、但仍有复用价值的数据。。它并不是让每一次推理都会见 SSD,,,,,而是只管把这些数据保保存离 GPU 更近的位置,,,,,需要时能够快速取回,,,,,从而镌汰数据搬运带来的期待时间。。
图|CMX Context Memory Storage(泉源:英伟达)
虽然都叫 AI SSD,,,,,但消耗级和企业级产品解决的是两类完全差别的问题。。消耗级 AI SSD 关注的是外地 AI 能力,,,,,让装备能够运行更大的模子、生涯更多个人知识,,,,,并提升离线体验;;企业级 AI SSD 关注的则是整个推理系统的效率,,,,,通过镌汰模子加载和数据期待,,,,,提高 GPU 使用率,,,,,降低每个 Token 的天生本钱。。未来,,,,,这两条蹊径很可能恒久并存,,,,,并划分沿着端侧装备和云端推理基础设施一直演进。。
AI SSD,,,,,最先泛起差别的工业路径
面临差别的应用场景,,,,,厂商们也最先沿着各自善于的偏向进入这一市场。。有人希望提供完整的 AI 安排方案,,,,,有人从 SSD 控制器出发,,,,,让存储自动加入推理,,,,,也有人实验同时买通盘算和存储两侧,,,,,配合界说下一代 AI SSD。。
群联(Phison)选择的是第一条路径。。其 aiDAPTIV 将 SSD、中心件和安排工具组合在一起,,,,,通太过层治理模子权重,,,,,让凌驾显存容量的大模子也能够运行在消耗级 GPU 上。。相比单独销售一块 SSD,,,,,它交付的是一整套 AI 安排方案,,,,,客户不需要从裸装备重新搭建推理情形。。最终,,,,,这类产品的竞争力仍然要落到可运行模子规模、启动时间、Token 吞吐、兼容性和整体安排本钱等指标上。。
江波龙则把重点放在 SSD 自己。。其提出的 SPU+iSA 架构,,,,,希望把压缩、缓存、混淆介质治理和智能预取等能力进一步放到存储侧,,,,,让 SSD 从被动响应 I/O,,,,,逐渐成为能够加入运行时数据治理的自动存储组件。。进一步来看,,,,,这一思绪也指向一种越发自动的 AI 存储节点:存储不但认真生涯数据,,,,,也最先加入模子、KV Cache 和专家参数等数据工具的组织、迁徙与调理。。虽然,,,,,现在果真的数据主要来自厂商资料,,,,,差别方案之间仍缺乏统一的第三方评测,,,,,因此更适相助为一种产品偏向来视察。。
寅谱(Infplane)与联芸科技(Maxio Technology)的相助,,,,,则更强调盘算和存储的协同设计。。
联芸恒久深耕 SSD 控制器、固件和闪存治理,,,,,并果真提出 AI 推理的价值标准正逐渐从容量和价钱,,,,,转向每 Token 本钱和系统能效;;寅谱则从 AI 芯片、Runtime 和操作系统切入,,,,,希望把模子运行历程中的调理信息更快转达到控制器和固件。。
在之条件到的几种方案中,,,,,寅谱也是唯一从 AI 盘算与系统软件出发的 AI Native 企业,,,,,其优势在于能够把模子和 Runtime 的需求直接映射到控制器、固件、NAND 治理以及 OEM 参考设计,,,,,让存储系统与推理框架形成更细密的协同,,,,,而不但仅停留在存储性能优化层面。。
图|推理加入型AI SSD探索:群联aiDAPTIV、江波龙SPU+iSA
另一类产品则更靠近古板企业级 SSD 的演进蹊径。。英韧科技(InnoGrit)的洞庭 N3X、华为(Huawei)OceanDisk LC 560 等产品,,,,,主要围绕 AI 场景强化性能、容量密度、耐久性和服务质量(QoS),,,,,为模子加载、KV Cache、向量数据库和推理数据层提供越发稳固的存储基础。。它们并没有改变 SSD 在系统中的基本角色,,,,,而是在现有架构下进一步提升企业级存储能力。。
图|英韧科技洞庭N3X与华为OceanDisk LC 560。。
这些探索并不是相互取代,,,,,而是划分笼罩 AI 推理系统的差别条理。。有人认真把 AI 更容易安排起来,,,,,有人认真让存储更自动地加入推理,,,,,也有人继续夯实底层存储能力。。随着 AI 推理规模一连扩大,,,,,这些能力很可能在统一套系统中融合,,,,,配合服务于一个目的:让相同的算力交付更多有用 Token。。
从现在的生长来看,,,,,AI SSD 的价值正在一直延伸。。最初,,,,,它资助内存有限的装备运行更大的模子;;随后,,,,,它最先生涯模子缓存、上下文和其他可复用的数据,,,,,镌汰重复盘算和数据搬运;;未来,,,,,它还可能进一步成为端侧和云侧 AI 存储节点中的焦点组成部分,,,,,在模子加载、上下文治理和推理调理中肩负越发自动的角色。。不过,,,,,无论产品形态怎样转变,,,,,兼容现有硬件和软件生态,,,,,仍然是 AI SSD 大规模普及的主要条件。。
它在端侧和云侧的生长重点也会有所差别。。在端侧,,,,,AI SSD 的价值主要体现在支持更大的外地模子、更富厚的个人知识库、更好的离线体验,,,,,以及镌汰对云端推理的依赖;;在云侧,,,,,它更关注模子冷启动、上下文复用、GPU 使用率以及每 Token 本钱等推理基础设施指标。。随着端、边、云协同一直成熟,,,,,未来盘算使命也可能凭证本钱、时延、隐私和数据位置,,,,,在终端装备、边沿节点和云端之间动态分配。。
从更久远的角度来看,,,,,AI SSD 争取的并不但仅是存储市场中的一个新品类,,,,,而是 AI 推理基础设施中的一个新角色。。它既要以远低于内存的本钱生涯更大的智能事情集,,,,,又要比传总共享存储更高效地服务模子推理,,,,,把模子加载、上下文复用和弹性启动带来的效率提升,,,,,最终转化为更多有用 Token。。
已往,,,,,人们评价一块 SSD,,,,,看的是容量、带宽和 IOPS;;未来,,,,,权衡 AI SSD 的标准可能会酿成另一组指标:它是否能够让相同数目的 GPU,,,,,在相同的时间和功耗下,,,,,交付更多知足服务要求的 Token。。若是能够证实这一点,,,,,AI SSD 才有时机从一块“面向 AI 的高端硬盘”,,,,,真正成为下一代 AI 推理基础设施的主要组成部分。。
1.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/
2.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
3.https://www.usenix.org/conference/fast25/presentation/qin
4.https://kvcache-ai.github.io/Mooncake/design/ssd-offload.html
5.https://www.usenix.org/conference/osdi24/presentation/fu
6.https://www.usenix.org/conference/atc24/presentation/gao-bin-cost
7.https://machinelearning.apple.com/research/efficient-large-language
8.https://developer.nvidia.com/blog/5x-faster-time-to-first-token-with-nvidia-tensorrt-llm-kv-cache-early-reuse/
9.https://docs.vllm.ai/en/stable/design/prefix_caching/
10.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/
11.https://cn.longsys.com/about/news/13353.html
12.https://www.maxio-tech.com/news/11645/13048.html
13.https://www.eeo.com.cn/2025/1222/774317.shtml
14.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/
15.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7
运营/排版:何晨龙
注:封面/首图由 AI 辅助天生