存储评论网

Qumulo 和 Cisco 携手推出升级版云 AI 加速器,提升 GPU 流动性

云端  ◇  企业版

Qumulo 发布了 Cloud AI Accelerator,这是一种旨在通过消除数据传输瓶颈来提高企业 AI 基础设施效率的全新架构。该平台无需复制或暂存,即可跨区域、云和混合环境实时向 GPU 资源提供分布式数据集。

此次发布旨在解决企业人工智能基础设施中一个众所周知的效率低下问题。Qumulo 援引 Cast AI 的《2026 年 Kubernetes 优化现状报告》指出,企业平均 GPU 利用率仅为 5% 左右,其余 95% 的加速计算资源处于闲置状态,因为数据必须经过暂存、复制和迁移才能启动工作负载。Qumulo 首席执行官 Doug Gourlay 在公告中阐述了这一问题:“我们接触的每一家企业都关注 GPU 的可用性,但可用性只是问题的一半。更深层次的问题是利用率,而罪魁祸首是数据引力。”

重新思考人工智能工作负载的数据放置方式

传统的AI基础设施方案将存储与GPU集群置于同一位置,通常使用与计算紧密耦合的高性能闪存系统。虽然这种模式在训练或推理期间非常有效,但它无法处理数据准备期间的空闲时间。此外,由于企业需要在不同环境中复制数据集以使其靠近计算资源,这种模式还会造成存储孤岛的碎片化。

Qumulo 的方法通过将数据位置与计算位置解耦来改变模型。云端 AI 加速器无需将数据移动到 GPU,而是让 GPU 直接访问数据。这是通过分布式数据架构实现的,该架构提供对数据集的一致、实时访问,而无需考虑数据集的物理位置。

Qumulo云数据平台图形

该公司将这项功能称为实现“GPU流动性”,允许根据可用计算能力而非数据位置限制来调度工作负载。实际上,这使得企业无需预先部署数据即可跨多个云或区域使用GPU资源。

架构:数据架构和缓存层

Cloud AI Accelerator 是 Qumulo 三款此前独立发布的产品的集成。Cloud Native Qumulo (CNQ) 是 Qumulo 的文件系统,可原生运行于 AWS、Azure、Google Cloud 和 Oracle Cloud Infrastructure 等云平台。Cloud Data Fabric (CDF) 于 2025 年 2 月发布,提供中央文件和对象存储库,并在边缘部署一致性缓存。NeuralCache 于 2025 年 4 月添加到 CDF 中,将机器学习应用于预测性读写缓存,Qumulo 声称它可以将 GPU 数据加载时间缩短高达 64%。Cloud AI Accelerator 本身于 2025 年 11 月首次亮相;5 月 26 日的版本新增了与 Microsoft AI Foundry、AWS Bedrock 和 Google Vertex AI 的直接连接,正式确立了“GPU 流动性”定位,并将该产品与 Cisco 集成,以支持混合部署。

Qumulo 云数据架构

数据路径以块级方式运行,从源站点(本地集群、云区域、跨区域副本或 CNQ S3 支持的存储)进入加速器的 CPU DRAM 缓存,然后直接发送到 GPU。该架构在本地、边缘和多云环境中维护单一数据源,并避免了批量复制,从而降低了存储开销和同步复杂性。

该设计还支持与托管式 AI 服务集成。企业无需将数据复制到 Microsoft AI Foundry、AWS Bedrock 和 Google Vertex AI 等环境中,即可将现有数据集直接连接到这些平台。

运营影响:减少空闲时间和复杂性

其主要运营优势在于消除了数据准备延迟。在许多人工智能工作流程中,数据准备可能需要数天甚至数周时间,这会延缓模型训练并降低GPU的有效利用率。通过实现对数据集的即时访问,云人工智能加速器允许工作负载在计算资源可用时立即启动。

这也减少了维护多个存储环境的需求。企业无需为每个 GPU 集群或云区域创建单独的数据孤岛,而是可以基于单一的逻辑数据集开展工作。这简化了数据管理,并减少了基础设施的蔓延。

从成本角度来看,该模型旨在降低GPU的闲置功耗。通过消除将数据预加载到GPU连接存储设备的需求,企业可以减少GPU等待数据的时间,从而提高加速计算的整体投资回报率。

思科集成以实现混合人工智能基础设施

思科是Qumulo混合部署方案的联合市场合作伙伴,其中思科UCS提供本地计算资源,思科网络和安全解决方案则负责数据架构的构建。Qumulo和思科共同将该方案定位为能够快速适应GPU可用性变化的基础设施,他们认为这正是企业级GPU流动性得以实现的关键所在。

这种配对在两个方面都至关重要。它为 Qumulo 提供了一条进入 Cisco UCS 环境的可靠途径,同时也为 Cisco 提供了一种存储解决方案,以满足混合 AI 客户的需求,这些客户希望数据保留在本地,而计算资源则可在超大规模数据中心进行扩展。高吞吐量、低延迟的网络是这里的关键,因为数据访问依赖于站点间一致的传输。

可用性和部署模型

Qumulo Cloud AI Accelerator 现已在 AWS、Microsoft Azure、Google Cloud 和 Oracle Cloud Infrastructure 上推出,并支持在 Cisco UCS 环境中进行混合部署。Qumulo 和 Cisco 将于 5 月 31 日至 6 月 4 日在拉斯维加斯举行的 Cisco Live 2026 大会上亮相,展位号为 4018,届时将展示双方的联合产品。

此次发布反映了人工智能基础设施设计向以数据为中心的架构转变的趋势。随着加速计算能力持续超越支撑其运行的基础设施,提高利用率的关键在于减少GPU等待数据的时间。Qumulo认为,与其为每个GPU集群增加闪存,不如让数据集普遍可访问(而非仅限于移动设备),这才是更持久有效的方案。

参与 StorageReview

资讯订阅 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter(现为X) | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。