DIGITIMES

LLM推理驱动Scale-up规模扩张 单层Switch全互连架构渐成巿场共识

目前巿场对LLM的焦点已多转向应用面,而推理型的推论因其深度思考能得到较佳答案而大受欢迎,DIGITIMES认为,推理与推论需求大幅成长,将成为大型云端业者采用或自...

目录
  • 当代大型语言模型有5种主要平行运算方式
  • All-to-All、All-Reduce型集合通讯常见于LLM训练与推论的平行运算中
  • All-to-All与All-Reduce帶寬为Scale-up关键指标 NVIDIA数年来已提升百倍以上
  • LLM推论中的平行运算对延迟容忍度更低 大多需在Scale-up網絡中处理
  • LLM推论中的Prefill为运算瓶颈 Decode为存儲器瓶颈
  • 以不同加速器处理Prefill与Decode为目前分工趋势
  • 动态单层全连接与静态环形網絡为主流Scale-up拓扑型态
  • NVIDIA采单层全互聯網路 以取得最佳All-to-All、All-Reduce表现
  • Google以3D环形網絡建构TPU Scale-up網絡 透过OCS可将Scale-up扩张至9216颗TPU
  • 亚马逊Trainium 2/3将从环形網絡转向单层全互连  将采PCIe 6并与Astera Labs合作
  • 结语:LLM推论Scale-up互连发展三大重点
相关报告
关键字
购物车
0件商品
智能应用 影音