从存得下到分得清:AI存储正在经历一场范式革命

科技IT 2026-07-30 user6946

  存力,正在成为AI基础设施的下一个关键变量。

  随着AI技术的不断演进及应用场景的持续拓展,数据流动的方向正在被改写。AI不仅是数据的使用者,更是数据的创造者,训练、推理与每一次迭代,都在源源不断地生成新的数据资产。根据IDC报告,受生成式AI等技术驱动,预计2028年全球新生成数据量规模将达到393.9ZB,其中企业数据规模和增速尤为凸显。

  这不仅对存储容量提出了持续扩张的刚性需求,更推动存储架构发生深层变革:不同阶段的AI工作负载对存储的诉求差异极大,训练阶段需高吞吐处理海量原始数据,推理阶段需低延迟实时响应,归档阶段需成本效益更优的长期留存。用一套存储逻辑打天下的时代,正在终结。

  如何构建适配AI全生命周期的存储架构,在性能、容量与成本之间实现最优平衡?这已成为横亘在每一家AI企业面前的现实命题。

智能数据分层重构存储架构

  7月17日至20日,2026世界人工智能大会(WAIC 2026)在上海举行。期间,西部数据举办了“面向AI时代的数据存储架构创新”分论坛,西部数据开发工程高级副总裁Tim Rausch带来的《面向规模化AI的存储革新》主题演讲,正是对这一命题的系统性回应。

西部数据开发工程高级副总裁Tim Rausch

  Tim Rausch开宗明义:“AI不仅是计算系统,更是数据系统。GPU会循环处理数据,但数据本身会持续累积。”他从AI模型的完整生命周期出发,揭示了存储架构必须走向分层的根本逻辑:AI的一切始于数据摄取,海量的报纸、期刊、图片、视频等原始训练数据被收集并存储于HDD,整体呈现低访问频次的静态留存特征;随后进入数据准备阶段,完成清洗与偏差校验;再到模型训练环节,数据从HDD、SSD复制至训练系统,热度逐步上升;最终到推理环节实现价值落地,而生成的内容又会沿存储层级向下迁移,最终沉淀至HDD持久保存。更关键的是,自动驾驶路测数据、用户交互数据、生成式内容等新数据会持续回流,成为下一代模型的训练养料,让数据总量在循环中不断扩容。

  对应到具体工作负载,不同环节对存储的要求截然不同。训练数据多为一次写入、周期性读取,首要诉求是EB级扩展能力与单位容量成本优势,也是HDD的主力承载场景;在线推理伴随海量随机小数据读取与上下文缓存需求,高度依赖高带宽、高IOPS的SSD承载;而推理输出的内容、日志、合规记录与元数据,则会从HBM、DRAM逐步沉降,最终交由HDD实现成本效益更优的长期留存。

  因此,在AI的驱动下,存储栈正在从传统云应用的“NAND(闪存)+HDD”两层体系,演进为专业的四层分层架构:最顶层是紧邻GPU的HBM/DRAM高性能内存,持续向算力供给数据;第二层是作为AI短期记忆的KV缓存,由DRAM与SSD协同承载;第三层是运行于SSD之上的语义数据库,存放向量、嵌入与RAG检索数据;最底层则是HDD大容量存储,承担训练数据集、用户生成内容副本、日志归档等温冷数据的长期留存。

  一次真实的AI请求,生动印证了这种分层调用的日常性。Tim Rausch现场分享了自己的实验:他用一款常用AI工具生成一段电影质感短片,并要求其报告所使用的内存和存储类型。结果显示,单个请求就调用了三个存储层级:HBM/DRAM负责提示词分析、文本编码器权重、KV缓存、扩散模型权重和VAE解码权重;闪存保存部分工作数据批次和KV缓存溢出数据;HDD则提供品牌规范和参考场景库。这次请求最终交付的视频仅3.97MB,但约有44GB数据经由GPU处理;请求完成后,AI留存的编码输出、推理追踪、合规记录、会话日志与元数据合计约509MB,留存数据量约为最终交付内容的130倍。而当内容在终端、云服务、社交平台间流转复制时,数据副本还会进一步增长,形成显著的数据放大效应。

  不仅如此,分层的必要性,更被成本账进一步放大。Tim Rausch算了一笔账:对于管理着百EB级数据的超大规模企业而言,假设每GB存储成本仅相差1美分,总成本就会相差约10亿美元。2026年第一季度SSD成本已上涨约80%,Gartner预计DRAM和SSD成本到年底可能上涨130%,将数据放置在错误存储层级的代价正持续走高。由此可见,分层不是选择题,而是必答题。在存储成本快速上涨的周期中,数据分层能力直接决定了AI企业的成本竞争力。

性能优化型HDD技术,夯实存力底座

  智能分层架构的规模化落地,高度依赖底层存储介质的技术迭代。围绕AI规模化部署需求,西部数据布局了ePMR与HAMR两条并行的技术演进路径,既满足当下规模化落地的成熟度要求,也为未来预留技术空间。

  今年2月的创新日活动上,西部数据正式公布了这一双轨路线图:ePMR延续了过去约二十年占据主导地位的垂直磁记录技术,商业化成熟、供应链稳定、可靠性经过充分产业验证,能够快速响应当下AI温冷数据层的大容量部署需求;HAMR则是面向未来的技术布局,通过激光局部加热盘片的方式突破传统磁记录的物理密度瓶颈,为更高容量 HDD 提供技术基础,支撑大规模数据留存与长期容量增长需求。 尤为关键的是,两条路线构建于同一通用平台之上,采用相同架构、同样的11碟平台,区别主要在介质与记录磁头。这意味着客户在过渡期内可以通过任一路径获得大致相当的容量,按照自己的节奏平滑迁移,而无须重构基础设施。目前,西部数据已向部分客户提供40TB HAMR与40TB ePMR硬盘样品,并计划于今年晚些时候提供44TB HAMR样品;按照当前路线图,西部数据正推动两条技术路径向更高容量演进,并朝着 100TB 级 HAMR 硬盘的长期目标持续推进。

  容量跃升的背后,是提升单盘面密度与增加盘片数量双杠杆的共同作用:一方面通过缩小磁性晶粒尺寸提升面密度,单盘片容量可从当前的4TB逐步提升至7TB乃至10TB;另一方面通过缩小激光头组件体积腾挪空间,盘片数量可从11片提升至14片,从容量扩展路径看,提高单盘片容量并在硬盘中容纳更多盘片,是推动 HDD 向 100TB 级乃至更高容量演进的重要方向。 容量之外,性能与功耗同样是AI场景下的关键变量。面向 AI 相关工作负载对容量、性能与能效的综合需求,西部数据也介绍了多项 业界首创的HDD 技术创新方向。高带宽硬盘技术(High Bandwidth Drive Technology)通过主执行器、微型执行器与毫米级执行器协同的三级定位,实现多磁道并发读写,将随机读写吞吐量提升至传统HDD的1.7倍、顺序读写吞吐量提升至2倍,并规划了扩展至8条并发磁道的路径。

  双枢轴技术(Dual Pivot Technology)则将磁头分布在安装于2个独立枢轴上的2个独立执行器上,将顺序I/O性能提升至2倍,与高带宽硬盘技术组合使用可使硬盘顺序I/O性能整体提升至4倍。

  此外,面向重视容量与TCO的客户,西部数据还在开发功耗优化型HDD。通过降低主轴转速使运行功耗减少约20%,结合高带宽硬盘技术后性能预计仅下降约5%至10%,还可能带来约10%的容量提升。

  如果说上述技术描绘的是HDD的未来形态,那么着眼当下,西部数据还带来了两项客户当下即可落地的容量优化方案,直接改善存储TCO:

  其一是叠瓦式磁记录(SMR),通过磁道像瓦片一样重叠排布的设计,可比传统CMR硬盘提升约20%的容量。虽然写入需要按分区顺序执行并配套主机端垃圾回收机制,在读取方面,SMR 与 CMR 一样可以按需读取指定磁道,主要差异集中在写入和管理方式上 ,垃圾回收时机也可由主机根据负载灵活控制。在论坛演讲所示的简化五年TCO模型中,SMR可使单位TB的TCO降低约8.4%,实现容量与成本的双重优化。

  其二是可变容量技术,打破传统硬盘固定容量档位的限制,根据每块硬盘实际的介质可用容量交付使用,初始即可带来约3%的容量提升;随着制造工艺持续成熟,同一款硬盘设计的平均可用容量在一年内最高可提升10%,客户无须重新认证硬件,即可在后续采购中持续获得制造工艺改进带来的容量增益,进一步摊薄TCO。该技术同时适用于CMR与SMR产品,目前已可面向具备条件的客户提供。

  不难发现,AI浪潮下的HDD技术创新早已跳出单一容量竞赛的旧框架,转向容量密度、读写性能、功耗效率与总体拥有成本的多维度协同优化。而成熟方案即刻落地、前沿技术稳步迭代的阶梯式布局,既避免了技术换代的架构断层,也让企业能在AI发展的每个阶段都获得与之匹配的存储方案。

开放生态协同拓宽价值边界

  单盘介质的技术突破,构成了智能分层的硬件基础,但要真正实现数据在不同层级间的无感流转、高效调度,还需要系统级的平台能力作为桥梁。在AI基础设施向存算分离、资源池化演进的大背景下,存储不再是孤立的硬件单元,而是需要与算力、网络、安全深度协同的系统级资源。

  基于这一判断,西部数据还构建了从JBOD混合存储平台到EBOF存储平台的完整产品矩阵:

  Ultrastar Data60 3000 混合存储平台专为高密度数据中心打造,为AI温冷数据、分层存储及备份归档提供经济高效的存储基石。

  OpenFlex™ Data24 4200 NVMe-oF存储平台则专为AI、高性能计算的严苛需求设计,通过搭配高性能SSD构建共享存储资源池,打破存储与算力之间的边界,释放极致性能。

  RapidFlex™ C2000 网络交换桥接适配器可支持构建高性能NVMe-oF连接存储和可组合分离式基础架构,为AI存储基础设施的构建提供有力支持。

  值得一提的是,西部数据在上海世博展览馆的展台不仅集中呈现了上述完整的技术与产品矩阵,更设置了合作伙伴联合展区,将前沿存储技术与行业解决方案同台展示,直观呈现出从底层硬件到生态协同的全链路布局。

  至此,智能分层架构已经完成了从介质技术到系统平台、再到产业生态的完整落地闭环:底层磁记录技术筑牢容量与性能的硬件根基,丰富的平台解决方案实现存储资源的轻松扩展与灵活利用,成熟生态则让存储能力深度融入AI基础设施体系,三者共同支撑起AI规模化发展的体系化存力需求。

写在最后

  当AI步入千行百业的规模化商用周期,产业的竞争逻辑不再局限于峰值算力与模型参数的比拼,更延伸到数据资产全链路的运营效率与成本可控性。存力的价值也早已跳出容量堆砌的单一维度,成为决定AI业务盈利边界与规模化扩张的重要支撑。

  随着AI向更深层次的产业应用渗透,数据量的增长还将持续加速,对存储架构的挑战也会不断升级。西部数据的技术路线,既扎根于存储行业数十年的技术积累,又贴合AI场景的真实需求,代表了AI存储架构的重要演进方向,也为AI产业的规模化、低成本落地提供了坚实的底座。

来源:比特网
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

Copyright © 2099 搜索科技

苏ICP备2023036119号-10 |——:

|—— TXT地图 | 网站地图 |