已往几年,,,,AI 基础设施的竞争主要围绕 GPU 和高带宽内存(HBM)睁开。。。。。。随着模子规模一直扩大,,,,训练和推理需要越来越多的算力,,,,GPU 集群、HBM 容量和互连带宽成为权衡系统能力的主要指标。。。。。。
但进入长上下文、多轮对话和 AI 智能体时代,,,,推理系统面临的问题最先爆发转变。。。。。。一次请求往往不但涉及模子盘算,,,,还需要加载模子权重、读取历史上下文、检索知识、挪用工具,,,,再将效果返回模子继续推理。。。。。。数据需要在 GPU、CPU、内存、存储和网络之间一连流动,,,,只要其中任何一个环节无法实时供应数据,,,,再强的 GPU 也只能期待。。。。。。
因此,,,,企业评估 AI 基础设施的方式也最先改变。。。。。。???突д嬲褐玫,,,,并不是一块 GPU ,,,,而是系统能够一连、稳固地完成推理并天生效果的能力。。。。。。关于在线推理来说,,,,真正被交付的产品,,,,着实是 Token。。。。。。
企业最先关注的不再只是拥有几多 GPU,,,,而是相同硬件在单位时间内能够交付几多切合服务质量要求(SLO)的 Token,,,,以及完成这些 Token 所需要支付的本钱。。。。。。
然而,,,,一个 Token 的本钱已经不但由 GPU 决议,,,,还受到 CPU、HBM、DRAM、SSD(固态硬盘)、网络、电力、散热以及软件和运维等整个推理系统的影响。。。。。。与此同时,,,,也不是所有 Token 都具有同样价值。。。。。。只有知足首 Token 延迟(TTFT)、天生速率(TPOT)、响应质量和稳固性要求的 Token,,,,才是真正能够交付给客户的有用 Token。。。。。。
当评价标准从“买了几多 GPU”转向“交付了几多有用 Token”时,,,,存储在推理系统中的角色也最先爆发转变,,,,其中最具代表性的即是 SSD。。。。。。它正从古板的数据存储装备,,,,逐渐成为 AI 推理基础设施的主要组成部分。。。。。。
AI SSD,,,,最先重写存储价值
相比内存,,,,SSD 拥有更低的容量本钱;;相比远端工具存储,,,,又离盘算节点更近,,,,可以生涯那些暂时放不进内存、但很快还会再次使用的模子和上下文数据。。。。。。
一方面,,,,它能够肩负更多模子权重、KV Cache、MoE 专家参数等运行数据,,,,镌汰系统为了扩容而增添内存或 GPU 的压力;;另一方面,,,,又能够提前完成模子加载、复用已经盘算过的内容,,,,镌汰重复盘算和期待时间,,,,让同样数目的 GPU 在相同时间内完成更多推理请求。。。。。。
这种思绪已经泛起在越来越多的推理系统中。。。。。。例如,,,,月之暗面(Moonshot AI)开源的 Mooncake,,,,把 CPU、内存、外地 SSD 和高速网络组织成共享的 KV Cache 池,,,,让差别 GPU 可以直接复用已经盘算好的上下文,,,,而不必重新盘算。。。。。。
(泉源:月之暗面)
尚有 ServerlessLLM 将外地 SSD 纳入模子调理,,,,在模子启动条件前完成加载,,,,镌汰冷启动期待;;TensorRT-LLM、vLLM 和 CachedAttention 等推理框架,,,,则通过复用已经盘算好的 KV Cache 或共享 Prefix,,,,阻止相同内容重复执行 Prefill。。。。。。从某种意义上说,,,,这些系统缓存的不但是数据,,,,也是在生涯已经支付过的盘算效果。。。。。。
虽然,,,,把 SSD 放进推理系统,,,,并不料味着 Token 本钱一定会下降。。。。。。若是缓存没有掷中,,,,系统仍然需要重新读取甚至重新盘算;;预取战略不对理,,,,还可能占用名贵的 PCIe 带宽和内存空间。。。。。。因此,,,,评价 AI SSD 不可只看带宽、IOPS 等古板存储指标,,,,更主要的是它是否能够缩短模子启动时间、提高缓存掷中率、镌汰 GPU 期待,,,,并最终让整个推理系统以更低本钱交付更多知足服务要求的 Token。。。。。。
消耗级和企业级,,,,AI SSD 是两种生意
不过,,,,AI SSD 的价值并不会体现为一种统一的产品形态。。。。。。差别的安排情形和客户群体,,,,面临的瓶颈并不相同,,,,对存储的需求自然也会有所差别。。。。。。
从现在来看,,,,AI SSD 很可能沿着两条市场蹊径生长:一条面向消耗级市场,,,,服务 AI PC、事情站等端侧装备;;另一条面向企业级市场,,,,服务边沿盘算和云端 AI 推理基础设施。。。。。。
关于消耗级用户来说,,,,最大的挑战是在有限的内存和功耗条件下,,,,让装备运行更大的模子、生涯更多外地知识,,,,并在离线状态下继续使用 AI。。。。。。消耗级 AI SSD 最现实的形态,,,,仍然是一块装置在 AI PC、事情站等装备中的固态硬盘。。。。。。它依然肩负系统盘和数据盘的功效,,,,但会进一步加入面向 AI 的数据治理能力,,,,让模子、缓存和用户数据能够更高效地生涯在外地,,,,而不需要改变现有 PC 的硬件架构。。。。。。
苹果在《LLM in a Flash》中展示过一种思绪:把大部分模子参数生涯在 Flash 存储中,,,,需要盘算时再按需加载到内存。。。。。。沿着这一思绪,,,,AI SSD 不但可以存放大模子自己,,,,还可以生涯多个专业模子、个人知识库、AI 助手的恒久影象,,,,以及暂时不必的数据,,,,让系统凭证差别使命动态组合所需内容,,,,而不必一直占用名贵的内存。。。。。。
消耗级 AI SSD 带来的首先是外地 AI 的可用性。。。。。;>刍峒吐肌⑽牡导焖鳌⒋胩焐⒏鋈酥犊獾仁姑,,,,不需要每次都重新从云端下载模子或上传数据,,,,在网络较差甚至离线的情形下,,,,仍然能够完成一部分事情,,,,同时镌汰网络传输和云端推理本钱。。。。。。虽然,,,,数据生涯在外地并不料味着自然清静,,,,权限治理、数据加密和清静删除等机制仍然不可或缺。。。。。。
企业级市场则完全是另一套逻辑。。。。。。企业客户购置的不是一块 SSD,,,,而是整个 AI 推理系统的效率。。。。。。无论安排在企业边沿节点照旧云端数据中心,,,,更主要的问题都是怎样镌汰 GPU 期待、提高 GPU 使用率,,,,并一连降低每个 Token 的天生本钱。。。。。。
在企业边沿,,,,AI SSD 可以资助装备在弱网甚至离线情形下运行模子,,,,支持工厂、门店、医院等场景的外地 AI 应用;;而在云端数据中心,,,,它肩负的角色则越发主要。。。。。。外地 SSD 可以缓存模子和检查点(Checkpoint),,,,镌汰重复从远端工具存储加载;;机架或服务器集群中的共享 Flash 存储,,,,则可以生涯仍有复用价值的推理数据,,,,让差别 GPU 在处理相似请求时直接使用已有用果,,,,而不必重复盘算。。。。。。
图|消耗级与企业级AI SSD在端侧和云侧的典范角色。。。。。。
这一思绪也已经最先进入商业产品。。。。。。英伟达推出的 CMX Context Memory Storage,,,,就在 GPU 高带宽内存(HBM)、主机内存和共享存储之间增添了一层基于 Flash 的上下文存储,,,,用来生涯暂时放不下、但仍有复用价值的数据。。。。。。它并不是让每一次推理都会见 SSD,,,,而是只管把这些数据保保存离 GPU 更近的位置,,,,需要时能够快速取回,,,,从而镌汰数据搬运带来的期待时间。。。。。。
图|CMX Context Memory Storage(泉源:英伟达)
虽然都叫 AI SSD,,,,但消耗级和企业级产品解决的是两类完全差别的问题。。。。。。消耗级 AI SSD 关注的是外地 AI 能力,,,,让装备能够运行更大的模子、生涯更多个人知识,,,,并提升离线体验;;企业级 AI SSD 关注的则是整个推理系统的效率,,,,通过镌汰模子加载和数据期待,,,,提高 GPU 使用率,,,,降低每个 Token 的天生本钱。。。。。。未来,,,,这两条蹊径很可能恒久并存,,,,并划分沿着端侧装备和云端推理基础设施一直演进。。。。。。
AI SSD,,,,最先泛起差别的工业路径
面临差别的应用场景,,,,厂商们也最先沿着各自善于的偏向进入这一市场。。。。。。有人希望提供完整的 AI 安排方案,,,,有人从 SSD 控制器出发,,,,让存储自动加入推理,,,,也有人实验同时买通盘算和存储两侧,,,,配合界说下一代 AI SSD。。。。。。
群联(Phison)选择的是第一条路径。。。。。。其 aiDAPTIV 将 SSD、中心件和安排工具组合在一起,,,,通太过层治理模子权重,,,,让凌驾显存容量的大模子也能够运行在消耗级 GPU 上。。。。。。相比单独销售一块 SSD,,,,它交付的是一整套 AI 安排方案,,,,客户不需要从裸装备重新搭建推理情形。。。。。。最终,,,,这类产品的竞争力仍然要落到可运行模子规模、启动时间、Token 吞吐、兼容性和整体安排本钱等指标上。。。。。。
江波龙则把重点放在 SSD 自己。。。。。。其提出的 SPU+iSA 架构,,,,希望把压缩、缓存、混淆介质治理和智能预取等能力进一步放到存储侧,,,,让 SSD 从被动响应 I/O,,,,逐渐成为能够加入运行时数据治理的自动存储组件。。。。。。进一步来看,,,,这一思绪也指向一种越发自动的 AI 存储节点:存储不但认真生涯数据,,,,也最先加入模子、KV Cache 和专家参数等数据工具的组织、迁徙与调理。。。。。。虽然,,,,现在果真的数据主要来自厂商资料,,,,差别方案之间仍缺乏统一的第三方评测,,,,因此更适相助为一种产品偏向来视察。。。。。。
寅谱(Infplane)与联芸科技(Maxio Technology)的相助,,,,则更强调盘算和存储的协同设计。。。。。。
联芸恒久深耕 SSD 控制器、固件和闪存治理,,,,并果真提出 AI 推理的价值标准正逐渐从容量和价钱,,,,转向每 Token 本钱和系统能效;;寅谱则从 AI 芯片、Runtime 和操作系统切入,,,,希望把模子运行历程中的调理信息更快转达到控制器和固件。。。。。。
在之条件到的几种方案中,,,,寅谱也是唯一从 AI 盘算与系统软件出发的 AI Native 企业,,,,其优势在于能够把模子和 Runtime 的需求直接映射到控制器、固件、NAND 治理以及 OEM 参考设计,,,,让存储系统与推理框架形成更细密的协同,,,,而不但仅停留在存储性能优化层面。。。。。。
图|推理加入型AI SSD探索:群联aiDAPTIV、江波龙SPU+iSA
另一类产品则更靠近古板企业级 SSD 的演进蹊径。。。。。。英韧科技(InnoGrit)的洞庭 N3X、华为(Huawei)OceanDisk LC 560 等产品,,,,主要围绕 AI 场景强化性能、容量密度、耐久性和服务质量(QoS),,,,为模子加载、KV Cache、向量数据库和推理数据层提供越发稳固的存储基础。。。。。。它们并没有改变 SSD 在系统中的基本角色,,,,而是在现有架构下进一步提升企业级存储能力。。。。。。
图|英韧科技洞庭N3X与华为OceanDisk LC 560。。。。。。
这些探索并不是相互取代,,,,而是划分笼罩 AI 推理系统的差别条理。。。。。。有人认真把 AI 更容易安排起来,,,,有人认真让存储更自动地加入推理,,,,也有人继续夯实底层存储能力。。。。。。随着 AI 推理规模一连扩大,,,,这些能力很可能在统一套系统中融合,,,,配合服务于一个目的:让相同的算力交付更多有用 Token。。。。。。
从现在的生长来看,,,,AI SSD 的价值正在一直延伸。。。。。。最初,,,,它资助内存有限的装备运行更大的模子;;随后,,,,它最先生涯模子缓存、上下文和其他可复用的数据,,,,镌汰重复盘算和数据搬运;;未来,,,,它还可能进一步成为端侧和云侧 AI 存储节点中的焦点组成部分,,,,在模子加载、上下文治理和推理调理中肩负越发自动的角色。。。。。。不过,,,,无论产品形态怎样转变,,,,兼容现有硬件和软件生态,,,,仍然是 AI SSD 大规模普及的主要条件。。。。。。
它在端侧和云侧的生长重点也会有所差别。。。。。。在端侧,,,,AI SSD 的价值主要体现在支持更大的外地模子、更富厚的个人知识库、更好的离线体验,,,,以及镌汰对云端推理的依赖;;在云侧,,,,它更关注模子冷启动、上下文复用、GPU 使用率以及每 Token 本钱等推理基础设施指标。。。。。。随着端、边、云协同一直成熟,,,,未来盘算使命也可能凭证本钱、时延、隐私和数据位置,,,,在终端装备、边沿节点和云端之间动态分配。。。。。。
从更久远的角度来看,,,,AI SSD 争取的并不但仅是存储市场中的一个新品类,,,,而是 AI 推理基础设施中的一个新角色。。。。。。它既要以远低于内存的本钱生涯更大的智能事情集,,,,又要比传总共享存储更高效地服务模子推理,,,,把模子加载、上下文复用和弹性启动带来的效率提升,,,,最终转化为更多有用 Token。。。。。。
已往,,,,人们评价一块 SSD,,,,看的是容量、带宽和 IOPS;;未来,,,,权衡 AI SSD 的标准可能会酿成另一组指标:它是否能够让相同数目的 GPU,,,,在相同的时间和功耗下,,,,交付更多知足服务要求的 Token。。。。。。若是能够证实这一点,,,,AI SSD 才有时机从一块“面向 AI 的高端硬盘”,,,,真正成为下一代 AI 推理基础设施的主要组成部分。。。。。。
1.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/
2.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
3.https://www.usenix.org/conference/fast25/presentation/qin
4.https://kvcache-ai.github.io/Mooncake/design/ssd-offload.html
5.https://www.usenix.org/conference/osdi24/presentation/fu
6.https://www.usenix.org/conference/atc24/presentation/gao-bin-cost
7.https://machinelearning.apple.com/research/efficient-large-language
8.https://developer.nvidia.com/blog/5x-faster-time-to-first-token-with-nvidia-tensorrt-llm-kv-cache-early-reuse/
9.https://docs.vllm.ai/en/stable/design/prefix_caching/
10.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/
11.https://cn.longsys.com/about/news/13353.html
12.https://www.maxio-tech.com/news/11645/13048.html
13.https://www.eeo.com.cn/2025/1222/774317.shtml
14.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/
15.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7
运营/排版:何晨龙
注:封面/首图由 AI 辅助天生