Meta tags:
keywords= AI 工作负载,AI 解决方案,KV 缓存;
description= 了解 NVIDIA ICMSP 如何利用 Solidigm SSD 等闪存设备,在 AI 推理中通过 KV 缓存存储上下文,减少重复计算,最大化效率。;
Headings (most frequently used words):
icmsp, ai, solidigm, dpu, 推理上下文内存存储平台, 为何, 推理正逐渐成为闪存问题, 推理内存墙, nvidia, 推理内存层级中的, g3, 上下文层, 推理基础设施的细分模型, 在上下文卸载时代的定位, 相关文章, 计算节点, 机柜本地上下文层级, 数据湖, 数据处理器, icms, 中的作用, 一种全新的推理内存容量规划方式, 级系统的形态, 驱动对上下文内存需求的工作负载, ssd, 需求的影响, 价值体现, 成本与功耗, 整体展望, 关于作者, 资料来源, 使用, 固态硬盘优化, 工作负载, 数据大放异彩时刻, 网络附加存储正驱动, 浪潮加速奔涌, 原生分布式弹性存储解决方案, 企业计算向边缘迁移, 内存使用量减少, 57, 查询速度提高, 50, 这怎么可能,
Text of the page (most frequently used words):
nvidia (32), #solidigm (27), gpu (20), icmsp (18), icms (12), ssd (11), 2026 (10), bluefield (8), 解决方案 (7), jeff (5), 技术洞察 (4), https (4), com (4), spectrum (4), 保修检查 (3), 工作机会 (3), 团队介绍 (3), 关于我们 (3), 发展历程 (3), dpu (3), 工作负载 (3), ces (3), harthorn (3), p5336 (3), hbm (3), eccn (2), hts (2), 徽标均为 (2), inc (2), 的商标 (2), 已在美国 (2), 中华人民共和国 (2), 中国台湾 (2), 中国香港 (2), 新加坡 (2), 墨西哥及其他国家 (2), 地区注册 (2), 条款与条件 (2), 隐私声明 (2), 保留所有权利 (2), 855 (2), 765 (2), 4301 (2), 10951 (2), white (2), rock (2), rancho (2), cordova (2), 95670 (2), 行为准则 (2), 电子邮件订阅 (2), 首选项中心 (2), 已停产产品 (2), 帮助中心 (2), 实用链接 (2), 行业解决方案 (2), storage (2), for (2), the (2), next (2), frontier (2), blog (2), tensorrt (2), llm (2), ps1010 (2), 的技术描述中 (2), rdma (2), 推理上下文内存存储平台 (2), 上分享此文章 (2), january (2), 合作伙伴 (2), 固态硬盘 (2), 洞察主页 (2), 特色产品 (2), mysolidigm (2), 我的個人資料 (2), 有关产品属性和功能的正式界定, 请参阅规格表, 技术可能需要启用硬件, 软件或服务激活, 没有任何产品或组件能保证绝对安全, 您的开支和结果可能会有所不同, 性能因用途, 配置和其他因素而异, 文中涉及的其他名称及品牌属于各自所有者的财产, 参阅我们完整的法律声明和免责声明, 尊重人权并避免与侵犯人权者同流合污, 产品和软件仅用于不导致或促成侵犯国际公认的人权行为的应用, 提供的信息可随时更改而不事先通知, 可能会随时更改制造生命周期, 规格和产品描述, 恕不另行通知, 此处所列信息系按, 对这些信息的准确性, 所列产品的特性, 可用性, 功能或兼容性不作任何形式的声明或保证, 请联系系统厂商, 了解关于上述特定产品或系统的更多信息, 分类仅供参考, 由出口管制分类编号, 和协调关税表, 编号组成, 分类的任何使用情况均对, 无追索权, 并且不应解释为对, 的陈述或保证, 贵公司作为进口商和, 或出口商, 负责确定贵方交易的正确分类, 内存使用量减少, 查询速度提高, 这怎么可能, 企业计算向边缘迁移, 原生分布式弹性存储解决方案, 数据大放异彩时刻, 网络附加存储正驱动, 浪潮加速奔涌, 固态硬盘优化, 全部新闻, 相关文章, newsroom, 新闻稿, 为新一代, 原生存储基础设施提供动力, nvidianews, news, powers, new, class, native, infrastructure, 技术博客, 驱动的推理上下文内存存储平台, developer, introducing, powered, inference, context, memory, platform, rubin, 开放模型, 自动驾驶, blogs, special, presentation, docs, 缓存定义, github, latest, features, kvcache, html, 资料来源, 数据基础设施营销分析师, 在解决方案架构, 产品规划和市场营销方面拥有丰富的实践经验, 他负责制定企业人工智能信息, 包括液冷式, 固态硬盘的竞争研究, 为我们的客户和合作伙伴将极客级细节转化为清晰的商业价值, 拥有加州州立大学萨克拉门托分校计算机工程理学学士学位, 关于作者, 基础设施建设方紧密合作, 让闪存技术适配这些新兴需求, 在推理规模不断扩展的过程中, 保障推理上下文可访问, 高效且具备成本效益, 请访问, 了解更多, 在这种环境下, 存储从被动容量转变为主动型基础设施, 为推理上下文选择闪存时, 需要密切关注在持续的实际负载下的密度, 功耗效率以及可预测的行为表现, 越来越多的解决方案是, 在内存容量耗尽的地方部署闪存, 并使其足够靠近, 从而表现得如同机柜的一部分, 随着这一模式普及, 存储将成为决定, 推理成本与经济性的核心杠杆之一, 指明了, 基础设施的发展方向, 迈向机架规模系统, 对计算, 网络与存储围绕推理效率进行协同设计, 随着推理变得更加持久且具有智能体特性, 核心挑战转变为当上下文规模超出靠近, 的内存容量时, 系统如何优雅地处理这些上下文, 整体展望, 实际上, 上下文层级的价值体现在减少停滞, 提高利用率以及在固定延迟目标下增加并发性, 这些效果会直接转化为每个交付令牌的成本降低, 时间比存储容量昂贵得多, 在其公告材料中, 给出了明确的性能与效率指标, 例如与, 传统存储, 每秒处理的令牌数最多可提高, 功耗效率最多可提高, 取决于基准与负载, 数据来自, 官方声明, 价值体现, 成本与功耗, 随着需求不断成熟, 的选择将取决于, 生命周期中重用与更新的占比, 以及规模化部署下时延要求的严格程度, 单机架容量优先场景下的极致密度, 面向超高容量, 最高可达, 122tb, 可在有限机架空间与功耗约束下实现密度最大化, 时延余量紧张场景下的极致性能, 是一款, pcie, gen5, 专为高吞吐量与真实输入, 输出场景设计, 通过覆盖两大设计方向的, 产品支撑这一转变, 机架级本地上下文层级的出现印证了一个清晰趋势, 随着推理变得更持久, 更多轮交互, 大容量闪存正不断向, 侧靠近, 以在规模化场景中保证上下文可访问, 可预测且具备成本效益, 在上下文卸载时代的定位, 耐久性也必须与上下文的行为相匹配, 部分工作负载会重度复用, 另一些则会因会话不断创建与淘汰而频繁更新, 在依赖外部, 缓存层级的推理架构中, 在真实持续负载下的表现, 比峰值基准测试性能更为重要, 将闪存作为上下文内存, 会改变买家的优化方向, 由于机柜空间有限, 且上下文规模随, 数量增加而增大, 密度变得至关重要, 能效至关重要是因为, 算力中心不仅受空间限制, 更受功耗限制, 可预测时延与服务质量也很重要, 因为读取缓慢会直接导致, 需求的影响, 在这些环境中, 上下文成为首要考虑的容量因素, 的需求, 正是由塑造现代推理的相同工作负载所推动的, 智能体系统以循环方式运行, 行动和反思, 其上下文保持活跃的时间远长于单个响应的时间, 即便模型本身能轻松装入, 长上下文推理仍会使, 缓存不断增大, 高并发部署使得尾部行为和可预测性与原始吞吐量同样重要, 驱动对上下文内存需求的工作负载, 从硬件角度看, 这是一套成熟易懂的基础设施, 但角色已完全转变, 它不再提供文件或对象服务, 而是在负载下以稳定可预测的性能, 存储并提供推理衍生上下文, 高带宽, 低延迟以太网, 将该层级与机柜的其他部分连接起来, 实现方案中为, 部署于这些存储池前端, 负责处理上下文放置和数据移动功能, 密集的非易失性内存, nvme, 存储架提供了大规模池化闪存容量, 级系统在形态上接近常见的存储构建块, 但用途已变, 新用途, 并非组件本身, 而是以接近内存的响应速度与可预测性能为推理负载提供, 缓存上下文服务, 而非为通用应用提供文件或对象服务, 级系统的形态, 这为推理引入了全新的, 闪存乘数效应, 部署对机柜内部, 或紧邻机柜, 部署的高密度, 高能效, 的需求日益增长, 层级为每个, 机柜提供数, 的共享容量, 用于存储推理上下文, 将存储层级扩展到, dram, 同时位置仍远低于传统共享存储, 延迟更低, 最具重大意义的影响之一, 是推理基础设施的容量规划方式发生了演变, 推理上下文成为机架规模, 机柜规模的资源, 而非每个加速器附带的固定内存量, 一种全新的推理内存容量规划方式, 总体而言, 所描述的这些架构选择旨在使上下文处理更靠近, 且更具确定性, 减少推理负载下因等待上下文而产生的停滞和耗时, 还声称, 能够实现硬件加速的, 缓存放置, 减少元数据开销和数据移动, 以太网则作为访问, 缓存的高性能网络架构, 不仅仅是通过增加, 容量来发挥作用, 它还引入了一个用于推理上下文的专用处理层, 发布的资料强调, 该平台由, 数据处理器驱动, 并搭配, 以太网, 以支持基于, 的高效, 缓存数据访问, 数据处理器, 中的作用, 机柜的, 支持这一模型需要的不仅仅是容量, 还需要一种在机柜规模上高效管理推理上下文的方法, 在机柜层级之外是数据湖, 它依然是模型, 数据集, 日志和工件等持久化记录系统, 这一层级至关重要, 但它并非为每个令牌的响应能力而设计, 通过减轻将低延迟敏感的, 数据推入主要为持久性设计的存储基础设施的压力, 从而对数据湖起到补充作用, 数据湖, 与之并行的是, 机柜本地上下文层, 该层用于存放数据量过大, 无法永久驻留在, 近侧内存中, 但仍需快速, 可预测访问的推理状态, 将其描述为一个在搭配, 以太网时, 具备可预测, 低延迟, 基于远程直接内存访问, 特性的机柜级上下文层, 机柜本地上下文层级, 最靠近, 的是计算节点, 其将即时工作集存储在, 系统内存和本地, 这里会生成令牌, 并且对延迟最为敏感, 计算节点, 的一种方法是将推理基础设施视为三个不同的区域, 推理基础设施的细分模型, 从概念上讲, 这就在, 高带宽内存, 与数据湖之间创建了一个中间层级, 它并非要取代现有的存储系统, 而是改变了活跃推理状态的处理方式和存储位置, 用于活跃引用的新层级, 在实际部署中, 定位为机架, 机柜本地闪存层, 专门为推理衍生状态, 本质为临时数据, 上下文块可在多个服务间存储, 复用与编排, 无需在每个节点上独立重新生成相同的历史信息, 并可在需要时向上分阶段传回, 这一方案新增了, 一层专为, 缓存优化的以太网连接闪存层级, 其设计容量足够大, 可承载共享, 动态变化, 多轮智能体上下文, 同时位置足够近, 可频繁预先分阶段传回, 主机内存, 不会造成解码停滞, 将推理上下文内存存储平台描述为一种完全集成的存储基础设施, 它利用, 数据处理器创建一个专为特定用途设计的, 在机柜层级运行的上下文内存层级, 旨在弥合高速, 内存与可扩展共享存储之间的差距, 推理内存层级中的, 上下文层, 缓存既需要存储级的容量, 又需要内存级的响应速度, 设计理念正是为了弥补这一缺口, 一种常见的做法是将上下文推送到数据中心已有的共享存储系统中, 对于活跃的推理过程而言, 这会带来新的延迟和流量挑战, 传统文件系统和对象存储主要针对持久性和共享性进行优化, 而非针对直接位于令牌生成关键路径上的低延迟读取操作, 流量在网络中南北方向流动, 延迟变得难以预测, 拥塞加剧, 最终结果是, 推理服务在达到计算能力上限之前, 往往会先达到内存容量上限, 仍有可用的计算周期, 也可能因等待上下文读取或重新计算而停滞, 这种现象在真实业务场景中尤为明显, 尤其是对尾部延迟敏感, 负载动态波动的环境, 智能体工作流会延长会话生命周期, 使上下文保持活跃的时间远超单次提示, 响应交互, 更高的并发性会使用户间的总内存占用成倍增加, 更长的上下文窗口会增大单会话缓存大小, 缓存对性能至关重要, 但它会同时在多个维度上增长, 在过去十年的大部分时间里, 基础设施的讨论焦点都集中在如何为, 供给数据, 随着推理负载不断演进, 关注点也扩展到上下文如何随时间累积, 模型能力越强, 推理过程就越需要保留状态, 而非直接丢弃, 推理内存墙, 年国际消费电子展, 线上活动中, 首席执行官黄仁勋正式推出了, 该平台将机柜级, 由闪存支持的上下文层级定位为原生适配, 缓存层, 可在机架规模上实现共享与复用, 当这些上下文信息无法再容纳于最靠近, 的内存层级中时, 性能就会下降, 时延上升, 吞吐量下降, 数据中心里最昂贵的硬件之一也开始出现闲置, 这些工作内存存放在键值, 缓存中, 该缓存会存储先前计算出的键值对, 以便在生成过程中重复使用, 从而避免重复计算, 试想一下, 同时为数千个对话应用, 智能助手和自主智能体提供服务, 单次交互看似轻量, 但汇聚在一起, 就会形成不断增长的, 工作内存, 这些信息必须被保留, 才能维持连贯, 高效的响应, 随着现代, 系统所承载的上下文信息量远超其设计时在处理器附近所能容纳的范围, 推理正遭遇一道全新的内存墙, 从单次提示交互转向长时对话与智能体工作流, 推理的内存占用正在快速扩大, 这暴露了基础设施堆栈中的一个新瓶颈, 推理正逐渐成为闪存问题, linkedin, twitter, 已复制, 复制链接, 数据中心, 联系我们, 新闻中心, 供应商, 创建工单, 文档管理, 支持和资源, 常见问题解答, 支持主页, 固态硬盘技术, s4520, p5520, p5810, 购买渠道, csal, 产品主页, 利用浸没式冷却存储革新边缘, 和地震数据处理, 精选客户案例, 边缘解决方案, 解决方案主页, 全部清除, 最近的搜尋, qlc, 企业级固态硬盘, faqs, 热门关键词, 缓存中存储上下文, 实现更大规模的,
Text of the page (random words):
icmsp 借助 solidigm ssd 在 kv 缓存中存储上下文 实现更大规模的 ai 扩展 解决方案 ai 解决方案 洞察主页 产品 zh 中文 英语 韩语 日语 歡迎 我的個人資料 mysolidigm 设置 登出 登入 登入 清除 热门关键词 faqs 企业级固态硬盘 ai 解决方案 支持 qlc 固态硬盘 最近的搜尋 全部清除 歡迎 我的個人資料 mysolidigm 设置 登出 登入 解决方案 解决方案 解决方案主页 ai 解决方案 边缘解决方案 精选客户案例 利用浸没式冷却存储革新边缘 ai 和地震数据处理 产品 产品 产品主页 csal 购买渠道 特色产品 d7 ps1010 d7 p5810 d7 p5520 d5 p5336 d3 s4520 特色产品 d5 p5336 洞察 洞察 洞察主页 固态硬盘技术 ai 工作负载 边缘 ai 固态硬盘 支持 支持 支持主页 保修 常见问题解答 支持和资源 文档管理 保修检查 创建工单 公司 公司 发展历程 关于我们 团队介绍 工作机会 合作伙伴 合作伙伴 供应商 方法 新闻中心 搜索 联系我们 语言 中文 英语 韩语 日语 登入 技术 solidigm 数据中心 技术洞察 jeff harthorn 27 january 2026 jeff harthorn 27 january 2026 书签 分享 复制链接 已复制 在 twitter 上分享此文章 在 linkedin 上分享此文章 推理上下文内存存储平台 icmsp 为何 ai 推理正逐渐成为闪存问题 随着现代 ai 系统所承载的上下文信息量远超其设计时在处理器附近所能容纳的范围 推理正遭遇一道全新的内存墙 随着 ai 从单次提示交互转向长时对话与智能体工作流 推理的内存占用正在快速扩大 这暴露了基础设施堆栈中的一个新瓶颈 试想一下 一排 gpu 同时为数千个对话应用 智能助手和自主智能体提供服务 单次交互看似轻量 但汇聚在一起 就会形成不断增长的 工作内存 累积 这些信息必须被保留 才能维持连贯 高效的响应 这些工作内存存放在键值 kv 缓存中 该缓存会存储先前计算出的键值对 以便在生成过程中重复使用 从而避免重复计算 1 然而 当这些上下文信息无法再容纳于最靠近 gpu 的内存层级中时 性能就会下降 时延上升 吞吐量下降 数据中心里最昂贵的硬件之一也开始出现闲置 在 2026 年国际消费电子展 ces 2026 的 nvidia 线上活动中 nvidia 首席执行官黄仁勋正式推出了 nvidia 推理上下文内存存储平台 icmsp 简称 icms 该平台将机柜级 由闪存支持的上下文层级定位为原生适配 ai 的 kv 缓存层 可在机架规模上实现共享与复用 2 3 4 推理内存墙 在过去十年的大部分时间里 ai 基础设施的讨论焦点都集中在如何为 gpu 供给数据 随着推理负载不断演进 关注点也扩展到上下文如何随时间累积 模型能力越强 推理过程就越需要保留状态 而非直接丢弃 kv 缓存对性能至关重要 但它会同时在多个维度上增长 更长的上下文窗口会增大单会话缓存大小 更高的并发性会使用户间的总内存占用成倍增加 智能体工作流会延长会话生命周期 使上下文保持活跃的时间远超单次提示 响应交互 最终结果是 推理服务在达到计算能力上限之前 往往会先达到内存容量上限 即便 gpu 仍有可用的计算周期 也可能因等待上下文读取或重新计算而停滞 这种现象在真实业务场景中尤为明显 尤其是对尾部延迟敏感 负载动态波动的环境 一种常见的做法是将上下文推送到数据中心已有的共享存储系统中 然而 对于活跃的推理过程而言 这会带来新的延迟和流量挑战 传统文件系统和对象存储主要针对持久性和共享性进行优化 而非针对直接位于令牌生成关键路径上的低延迟读取操作 随着 kv 流量在网络中南北方向流动 延迟变得难以预测 拥塞加剧 kv 缓存既需要存储级的容量 又需要内存级的响应速度 nvidia 的 icms icmsp 设计理念正是为了弥补这一缺口 3 4 nvidia 推理内存层级中的 g3 5 上下文层 nvidia 将推理上下文内存存储平台描述为一种完全集成的存储基础设施 它利用 nvidia bluefield 4 数据处理器创建一个专为特定用途设计的 在机柜层级运行的上下文内存层级 旨在弥合高速 gpu 内存与可扩展共享存储之间的差距 3 4 在 nvidia 的技术描述中 这一方案新增了 g3 5 层 一层专为 kv 缓存优化的以太网连接闪存层级 其设计容量足够大 可承载共享 动态变化 多轮智能体上下文 同时位置足够近 可频繁预先分阶段传回 gpu 主机内存 不会造成解码停滞 3 在实际部署中 nvidia 将 icms icmsp 定位为机架 机柜本地闪存层 专门为推理衍生状态 本质为临时数据 优化 上下文块可在多个服务间存储 复用与编排 无需在每个节点上独立重新生成相同的历史信息 并可在需要时向上分阶段传回 3 图 1 icmsp 用于活跃引用的新层级 从概念上讲 这就在 gpu 高带宽内存 hbm 与数据湖之间创建了一个中间层级 它并非要取代现有的存储系统 而是改变了活跃推理状态的处理方式和存储位置 推理基础设施的细分模型 了解 icms icmsp 的一种方法是将推理基础设施视为三个不同的区域 计算节点 最靠近 gpu 的是计算节点 其将即时工作集存储在 hbm 系统内存和本地 ssd 中 这里会生成令牌 并且对延迟最为敏感 机柜本地上下文层级 与之并行的是 icms icmsp 机柜本地上下文层 该层用于存放数据量过大 无法永久驻留在 gpu 近侧内存中 但仍需快速 可预测访问的推理状态 nvidia 将其描述为一个在搭配 spectrum x 以太网时 具备可预测 低延迟 基于远程直接内存访问 rdma 特性的机柜级上下文层 3 4 数据湖 在机柜层级之外是数据湖 它依然是模型 数据集 日志和工件等持久化记录系统 这一层级至关重要 但它并非为每个令牌的响应能力而设计 icms icmsp 通过减轻将低延迟敏感的 kv 数据推入主要为持久性设计的存储基础设施的压力 从而对数据湖起到补充作用 3 支持这一模型需要的不仅仅是容量 还需要一种在机柜规模上高效管理推理上下文的方法 图 2 gpu 机柜的 kv 缓存 数据处理器 dpu 在 icms icmsp 中的作用 icms icmsp 不仅仅是通过增加 ssd 容量来发挥作用 它还引入了一个用于推理上下文的专用处理层 nvidia 发布的资料强调 该平台由 nvidia bluefield 4 数据处理器驱动 并搭配 spectrum x 以太网 以支持基于 rdma 的高效 kv 缓存数据访问 3 4 nvidia 还声称 bluefield 4 能够实现硬件加速的 kv 缓存放置 减少元数据开销和数据移动 而 spectrum x 以太网则作为访问 ai 原生 kv 缓存的高性能网络架构 4 总体而言 nvidia 所描述的这些架构选择旨在使上下文处理更靠近 gpu 且更具确定性 减少推理负载下因等待上下文而产生的停滞和耗时 一种全新的推理内存容量规划方式 icms icmsp 最具重大意义的影响之一 是推理基础设施的容量规划方式发生了演变 推理上下文成为机架规模 机柜规模的资源 而非每个加速器附带的固定内存量 在 nvidia 的技术描述中 g3 5 层级为每个 gpu 机柜提供数 pb 的共享容量 用于存储推理上下文 将存储层级扩展到 hbm dram 本地 ssd 之外 同时位置仍远低于传统共享存储 延迟更低 3 这为推理引入了全新的 闪存乘数效应 gpu 部署对机柜内部 或紧邻机柜 部署的高密度 高能效 ssd 的需求日益增长 icmsp 级系统的形态 早期 icmsp 级系统在形态上接近常见的存储构建块 但用途已变 新用途 并非组件本身 而是以接近内存的响应速度与可预测性能为推理负载提供 kv 缓存上下文服务 而非为通用应用提供文件或对象服务 3 4 密集的非易失性内存 nvme 存储架提供了大规模池化闪存容量 dpu 在 nvidia 实现方案中为 bluefield 4 部署于这些存储池前端 负责处理上下文放置和数据移动功能 3 4 高带宽 低延迟以太网 nvidia 主推 spectrum x 将该层级与机柜的其他部分连接起来 3 4 从硬件角度看 这是一套成熟易懂的基础设施 但角色已完全转变 它不再提供文件或对象服务 而是在负载下以稳定可预测的性能 存储并提供推理衍生上下文 驱动对上下文内存需求的工作负载 对 icms icmsp 的需求 正是由塑造现代推理的相同工作负载所推动的 智能体系统以循环方式运行 观察 规划 行动和反思 其上下文保持活跃的时间远长于单个响应的时间 即便模型本身能轻松装入 gpu 内存 长上下文推理仍会使 kv 缓存不断增大 高并发部署使得尾部行为和可预测性与原始吞吐量同样重要 在这些环境中 上下文成为首要考虑的容量因素 icmsp 对 ssd 需求的影响 将闪存作为上下文内存 会改变买家的优化方向 由于机柜空间有限 且上下文规模随 gpu 数量增加而增大 密度变得至关重要 能效至关重要是因为 ai 算力中心不仅受空间限制 更受功耗限制 可预测时延与服务质量也很重要 因为读取缓慢会直接导致 gpu 闲置 耐久性也必须与上下文的行为相匹配 部分工作负载会重度复用 kv 数据 另一些则会因会话不断创建与淘汰而频繁更新 在依赖外部 kv 缓存层级的推理架构中 ssd 在真实持续负载下的表现 比峰值基准测试性能更为重要 solidigm 在上下文卸载时代的定位 对 solidigm 而言 机架级本地上下文层级的出现印证了一个清晰趋势 随着推理变得更持久 更多轮交互 大容量闪存正不断向 gpu 侧靠近 以在规模化场景中保证上下文可访问 可预测且具备成本效益 solidigm 通过覆盖两大设计方向的 ssd 产品支撑这一转变 时延余量紧张场景下的极致性能 solidigm d7 ps1010 是一款 pcie gen5 ssd 专为高吞吐量与真实输入 输出场景设计 单机架容量优先场景下的极致密度 solidigm d5 p5336 ssd 面向超高容量 最高可达 122tb 可在有限机架空间与功耗约束下实现密度最大化 随着需求不断成熟 ssd 的选择将取决于 kv 生命周期中重用与更新的占比 以及规模化部署下时延要求的严格程度 价值体现 成本与功耗 nvidia 在其公告材料中 对 icms icmsp 给出了明确的性能与效率指标 例如与 传统存储 相比 每秒处理的令牌数最多可提高 5 倍 功耗效率最多可提高 5 倍 取决于基准与负载 数据来自 nvidia 官方声明 2 4 实际上 上下文层级的价值体现在减少停滞 提高利用率以及在固定延迟目标下增加并发性 这些效果会直接转化为每个交付令牌的成本降低 因为 gpu 时间比存储容量昂贵得多 整体展望 icms icmsp 指明了 ai 基础设施的发展方向 迈向机架规模系统 对计算 网络与存储围绕推理效率进行协同设计 随着推理变得更加持久且具有智能体特性 核心挑战转变为当上下文规模超出靠近 gpu 的内存容量时 系统如何优雅地处理这些上下文 越来越多的解决方案是 在内存容量耗尽的地方部署闪存 并使其足够靠近 gpu 从而表现得如同机柜的一部分 随着这一模式普及 存储将成为决定 ai 推理成本与经济性的核心杠杆之一 在这种环境下 存储从被动容量转变为主动型基础设施 为推理上下文选择闪存时 需要密切关注在持续的实际负载下的密度 功耗效率以及可预测的行为表现 solidigm 与 ai 基础设施建设方紧密合作 让闪存技术适配这些新兴需求 在推理规模不断扩展的过程中 保障推理上下文可访问 高效且具备成本效益 请访问 solidigm com 了解更多 关于作者 jeff harthorn 是 solidigm 的 ai 数据基础设施营销分析师 jeff 在解决方案架构 产品规划和市场营销方面拥有丰富的实践经验 他负责制定企业人工智能信息 包括液冷式 e1 s 固态硬盘的竞争研究 为我们的客户和合作伙伴将极客级细节转化为清晰的商业价值 jeff 拥有加州州立大学萨克拉门托分校计算机工程理学学士学位 资料来源 nvidia tensorrt llm docs kv 缓存定义 行为 https nvidia github io tensorrt llm latest features kvcache html nvidia 博客 2026 年 1 月 5 日 ces 回顾 nvidia rubin 平台 开放模型 自动驾驶 https blogs nvidia com blog 2026 ces special presentation nvidia 技术博客 2026 年 1 月 6 日 推出 nvidia bluefield 4 驱动的推理上下文内存存储平台 https developer nvidia com blog introducing nvidia bluefield 4 powered inference context memory storage platform for the next frontier of ai nvidia newsroom 新闻稿 2026 年 1 月 5 日 nvidia bluefield 4 为新一代 ai 原生存储基础设施提供动力 https nvidianews nvidia com news nvidia bluefield 4 powers new class of ai native storage infrastructure for the next frontier of ai ai 解决方案 ai 工作负载 kv 缓存 相关文章 全部新闻 技术洞察 使用 solidigm 固态硬盘优化 ai 工作负载 行业解决方案 数据大放异彩时刻 网络附加存储正驱动 ai 浪潮加速奔涌 行业解决方案 dpu 原生分布式弹性存储解决方案 技术洞察 企业计算向边缘迁移 技术洞察 内存使用量减少 57 查询速度提高 50 这怎么可能 10951 white rock rd rancho cordova ca 95670 us 1 855 765 4301 solidigm 2026 保留所有权利 公司 公司 发展历程 关于我们 团队介绍 工作机会 发展历程 关于我们 团队介绍 工作机会 实用链接 实用链接 帮助中心 保修检查 已停产产品 首选项中心 帮助中心 保修检查 已停产产品 首选项中心 电子邮件订阅 行为准则 电子邮件订阅 行为准则 10951 white rock rd rancho cordova ca 95670 us 1 855 765 4301 solidigm 2026 保留所有权利 隐私声明 条款与条件 solidigm 及 solidigm s 徽标均为 solidigm inc 的商标 已在美国 中华人民共和国 中国台湾 中国香港 新加坡 欧盟 英国 墨西哥及其他国家 地区注册 隐私声明 条款与条件 solidigm 及 solidigm s 徽标均为 solidigm inc 的商标 已在美国 中华人民共和国 中国台湾 中国香港 新加坡 欧盟 英国 墨西哥及其他国家 地区注册 提供的信息可随时更改而不事先通知 solidigm 可能会随时更改制造生命周期 规格和产品描述 恕不另行通知 此处所列信息系按 原样 提供 solidigm 对这些信息的准确性 所列产品的特性 可用性 功能或兼容性不作任何形式的声明或保证 请联系系统厂商 了解关于上述特定产品或系统的更多信息 solidigm 分类仅供参考 由出口管制分类编号 eccn 和协调关税表 hts 编号组成 solidigm 分类的任何使用情况均对 solidigm 无追索权 并且不应解释为对 eccn 或 hts 的陈述或保证 贵公司作为进口商和 或出口商 负责确定贵方交易的正确分类 有关产品属性和功能的正式界定 请参阅规格表 solidigm 技术可能需要启用硬件 软件或服务激活 没有任何产品或组件能保证绝对安全 您的开支和结果可能会有所不同 性能因用途 配置和其他因素而异 文中涉及的其他名称及品牌属于各自所有者的财产 参阅我们完整的法律声明和免责声明 solidigm 尊重人权并避免与侵犯人权者同流合污 solidigm 产品和软件仅用于不导致或促成侵犯国际公认的人权行为的应用
|