AI算力不只看GPU AMD Helios、ROCm全方位布局 破解NVIDIA生态锁定 智能应用 影音
DIGITIMES Logo
231
DIGITIMES Logo
Event
member

AI算力不只看GPU AMD Helios、ROCm全方位布局 破解NVIDIA生态锁定

  • 孙昌华/台北

企业AI进入规模部署阶段后,基础设施的竞争重点正由单一芯片效能转向整体系统配置。Agentic AI让工作流程同时牵涉任务规划、工具呼叫、数据查询、权限确认、记忆存取与模型推论,使CPU、GPU、网络与软件之间的分工也更细。

这项趋势让企业在规划AI基础设施时,不能只看单一加速器的峰值效能,还要同时考量工作负载、资源配置与实际部署条件。而当AI应用从技术验证走向长时间、大规模运行,企业的算力规划也会延伸到训练、推论、网络与软件协同。整体平台能否稳定支撑不同工作负载,并兼顾效能与资源利用率,也成为AI部署规模扩大后的重要考量。

随着Agentic AI升温,AMD市值近期首度突破1万亿美元,AMD持续从单一芯片供应商拓展至完整AI基础设施的布局,也成为市场关注的焦点之一。AMD不再只提供单颗芯片,而是整合CPU、GPU、网络与软件,协助数据中心以系统方式建置大规模AI基础设施。

对企业来说, AI应用进入规模部署阶段后,首先要厘清实际使用情境,包括模型规模、Agent数量、并发量、延迟要求,以及数据所在位置。这些条件会直接影响CPU与GPU配置比例、存储器带宽、网络架构,也会决定工作负载应部署在云端、地端或边缘。大型模型训练、高效能运算、企业推论与Agent执行各有不同资源需求,因此基础设施规划必须先从工作负载出发,再决定硬件组合与部署方式。

AMD以「全方位算力(Full-Stack Compute)」概括AI基础设施发展方向,涵盖CPU、GPU、网络、软件与机柜级系统,对应不同工作负载与部署环境。针对大型模型训练、高效能运算、企业推论与Agentic AI各自的资源需求,AMD提供EPYC CPU、Instinct GPU、Pensando网络技术与ROCm软件,并透过Helios机柜级架构整合运算、网络与软件,将原本分散的资源纳入系统层级规划。

其中,CPU与GPU分工是AI基础设施配置的基础。在Agentic AI工作流程中,任务协调、工具呼叫、数据查询与既有企业应用会增加CPU端的运算需求,大型模型训练与推论则主要交由GPU加速。

AMD以EPYCCPU负责通用运算与GPU主机端工作负载,InstinctGPU则针对大型AI训练、高效能运算与企业推论等场景提供不同选项。实际配置时,仍要回到模型规模、并发量与延迟需求,再决定CPU与GPU比例,让不同工作负载取得相对合适的硬件组合。

系统层级的整合则由Helios机柜级架构承接。AMD Helios整合72颗Instinct MI455X GPU、18颗第6代EPYC "Venice" CPU、Pensando网络与ROCm开放软件,将运算、网络与软件放进同一个机柜级架构中,并采用业界开放标准设计机柜与网络互连,让企业可搭配不同厂商的设备,降低对单一供应商专有技术的依赖。

相较于NVIDIA Vera Rubin NVL72机柜,Helios可提供15%的峰值FP4效能提升、50%的HBM容量提升、6%的HBM带宽与50%的向外扩展带宽提升,且每美元可处理的token数量最高提升30%。

而这种机柜级设计也反映大型AI基础设施的评估方式正在改变,随着GPU数量增加,企业除了比较单颗芯片效能,也必须同时考量供电、散热、网络互连与软件成熟度。因此,整柜系统的运算效率、部署难度与扩充能力,会比单一元件规格更接近实际营运需求。

软件成熟度与维运成本,也是AI进入规模部署后必须考量的项目。企业导入Agentic AI后,往往需要串接不同模型、数据来源与既有应用。若底层架构过度依赖特定硬件或工具链,容易形成「供应商锁定」,后续更换模型、扩充系统或调整供应商时,都可能增加移转与维运成本。

AMD透过ROCm、HIP,以及对PyTorch、TensorFlow等主流框架与Hugging Face等AI生态的支持,提高不同模型与硬件之间的兼容性。透过开放的软件生态,企业得以降低对单一软件平台的依赖,在扩充AI应用时保留较大的架构选择空间,也有助于降低后续平台转换与维运的复杂度。

实际部署案例也反映出大型AI工作负载对整体架构的要求。根据AMD在AAI 2026公布的案例数据,电信大厂AT&T已采用AMD Instinct GPU与开放式ROCm软件平台,支持电信AI模型的训练与应用,并透过依任务调度模型的机制,AI成本最高可降低80%。

在大型AI运算部署方面,OpenAI规划自2026年第4季起部署Helios机柜系统,并于2027年持续扩大部署。Anthropic也宣布将于AMD Helios机柜级解决方案中部署最高达2GW的AMD Instinct MI450系列GPU。

这些案例显示,当AI使用规模持续扩大,基础设施评估也会延伸到算力配置、网络、软件成熟度与长期运行成本。这些案例也显示,当AI从模型开发走向长时间、大规模运行,企业评估基础设施的单位正逐渐从单一元件,延伸至包含运算、网络、软件与部署条件的整体系统。

除了大型AI运算与数据中心级部署,AMD在AAI 2026的产品布局也延伸到边缘与嵌入式运算,锁定机器人、工业自动化与Physical AI等场景。对2027年的AI基础设施规划而言,企业需要同时处理数据中心、地端与边缘等不同环境的算力配置,也更重视整体平台能否稳定支撑不同工作负载。

AMD则透过EPYC、Instinct、Pensando、ROCm与Helios,整合运算、网络、软件与系统能力,回应AI基础设施由单一元件评估走向整体平台配置的趋势,并持续布局新一代MI500系列GPU与下一代Helios产品路线,强化涵盖数据中心到边缘端的AI平台能力。