AI推升存储器需求 存储技术扮演更关键角色 智能应用 影音
DIGITIMES Logo
231
DIGITIMES Logo
Event

AI推升存储器需求 存储技术扮演更关键角色

  • 赖品如台北

NVIDIA Vera BlueField-4 STX 存储处理器。NVIDIA
NVIDIA Vera BlueField-4 STX 存储处理器。NVIDIA

人工智能(AI)需求激增,带动对大量数据集与情境窗口的需求,其规模已突破系统存储器的容量限制。

然而,单纯增加存储容量,并不足以因应日益成长的需求。真正需要的是来自AI工厂、实用且符合现实需要的洞察,以及能够实现这些洞察的高效、安全存储架构。

AI推升存储器需求,存储技术扮演更关键角色。NVIDIA

AI推升存储器需求,存储技术扮演更关键角色。NVIDIA

在日前登场的Future of Memory and Storage(FMS)大会上,NVIDIA发表多项存储技术进展,并展示AI的下一波跃进,不仅取决于运算能力本身,也同样仰赖为加速运算供应数据的存储基础架构。

随着AI代理消耗大量数据,加上GPU现在已能够直接发出存储请求,并产生数千项并行作业,存储基础架构所承受的压力也持续加剧。为了处理这些请求,存储系统必须持续对数据进行加密、压缩、验证与重建。当数千个代理同时存取存储空间时,这些关键数据服务可能成为瓶颈。

NVIDIA技术博客所列出的基准测试显示,作为NVIDIA Vera BlueField-4 STX一部分的NVIDIA Vera CPU,在两阶段压缩与加密管道中,其输送量最高可达x86 CPU的3.21倍。这代表采用Vera后,存储平台能更有效率地承接大量涌入的AI数据,在大幅减少所需运算基础架构的同时,提供更高的输送量。

透过加速运算,存储不再只是被动保存数据的空间,而是成为数据路径中的主动环节。

这彻底颠覆了过往关于何时应该将数据存放于存储器(应用程序可更快读取)或存储装置(能以较低成本提供充裕容量)的成本效益逻辑。这项取舍在40年前首次被提出,当时存取数据的时间以分钟计。如今,搭配NVIDIA与合作夥伴的AI存储解决方案,GPU已能在微秒尺度内处理相同的取舍。

要弥合AI需求与存储器不足之间的差距,必须在整个生态系进行极致协同设计,涵盖存储器与存储设备制造商,以及基于这些硬件所开发的软件。

开源的NVIDIA cuFile API  实现存储解决方案的互通性

NVIDIA于FMS大会宣布,将开源其cuFile应用程序界面(API)及其下层垂直整合的存储软件堆叠,让 GPU不再只能透过CPU,而是能直接读取存储装置中的数据,或将数据写入存储装置。cuFile是NVIDIA GPUDirect Storage的开源套件。

运用数十万个GPU执行绪、高速高带宽存储器及其他技术方法,cuFile让系统能在短短数微秒内安全地存取存储装置中的数据。这体现业界如何依循Linux最佳实务,打造以安全为优先的统一存储堆叠,实现GPU与数据间的互通性。

此外,快速且安全的数据与存储存取,也是推动预防性与侦测性网安措施的基础要素。cuFile开放使用后,将有助于以AI防御所需的速度,存取安全情境信息、数据与存储资源。此类开放技术也能支持新成立的开放安全AI联盟(Open Secure AI Alliance)等计划。

此网站将成为这些API的全新平台,开放社群贡献,并由Google、Intel、NVIDIA与Meta担任首批维护者。这些API可针对各种软硬件平台进行最佳化,进而为开发人员与企业推动创新并提升效率。

NVIDIA与业界领袖共同推进AI存储新前沿

此外,NVIDIA与存储产业领导厂商正透过名为Storage-Next的计划,共同最佳化存储器与存储解决方案。这项由NVIDIA推动的计划汇集存储设备制造商、控制器供应商、散热设计、冷却与调度管理业者,以及标准制定组织,共同确立GPU驱动存储空间应有的运作方式,再将相关技术进展转化为具互通性且开放的产业标准。

Storage-Next汇集超过40家领先的存储与快闪存储器供应商,包括DDN、KIOXIA与美光科技。各家业者皆与NVIDIA共同投入下一代AI存储技术的发展。

这项计划的核心在于加速大型AI数据集的存取。为支持此目标,NVIDIA推出了SCADA(规模化加速数据存取;全称为scaled, accelerated data access)框架,让具大规模平行处理能力的GPU,仅将应用程序所需的数据直接从存储装置读取至自身高速存储器。

例如,DDN正将SCADA整合至Infinia。Infinia是一套软件定义、AI原生的数据智能平台,旨在大规模消除存储瓶颈。

DDN技术长Sven Oehme表示:「AI的成功将不取决于组织拥有多少基础设施,而是取决于能多有效率地运用这些资源。我们与NVIDIA的合作,正协助GPU与数据之间建立更直接、更高效的连结,确保加速运算资源维持高效运作、缩短取得洞察所需时间,并协助客户从AI投资中获得更强劲的业务与财务回报。」

Storage-Next与SCADA进一步拓展了NVIDIA长期投入AI存储基础架构的成果,其中包括NVIDIA Vera BlueField-4 STX。这是一套由NVIDIA Vera Rubin平台、NVIDIA Vera BlueField-4存储处理器与NVIDIA Spectrum-X以太网络技术驱动的模块化机架级基础平台。

NVIDIA STX定义一种新型的AI原生数据平台,透过统一的NVIDIA DOCA安全堆叠,让企业能在AI数据路径中持续执行政策控管。

此外,基于NVIDIA STX打造的NVIDIA CMX情境记忆存储平台,为长情境、多轮互动与代理型AI推论提供AI原生情境层。

SCADA实现高速且安全的AI存储

提升存储层的速度也伴随一定风险。让应用程序直接与存储装置通讯固然快速,但若处理不慎,应用程序可能覆写其他程序的存储器,形成安全漏洞,而非一项优势。

NVIDIA SCADA将任务分成两部分,以安全且稳健的方式实现大规模直接存取:1. 应用程序中需要原始速度的使用者端部分,维持在可信任运算基础之外。2. 一个具特权权限的独立元件,会在初始设定阶段,于使用者应用程序与其获准存取的存储资源之间配置受保护的存取机制。该元件遵循标准 Linux 协定落实安全控管,同时有效保护数据。

这些进展共同推动高速、大规模平行、高效率且安全的AI存储基础架构,为应用程序与AI工厂提供更优质的数据,从而使其能够大规模产出更实用、更精准且更符合实际需求的智能成果。

深入了解NVIDIA AI存储技术的最新信息。

关键字