当高帶寬存儲器(High Bandwidth Memory;HBM)在GPU-HBM CoWoS成本的百分比已接近一半时,存儲器还可以被视为AI的被动、零组件吗?
一切都要从存儲器墙(memory wall)说起,而这一状况的塑造就是半部半导体史。
计算机的架构自冯纽曼(von Neumann)创始之后就没有主要的变化,主要元件包含处理器及存儲器。
将处理器与存儲器分开处理是冯纽曼架构最令人惊异的创新,因为人脑的记忆、「运算」与信息传导都同时发生在神经元(neurons)与突触(synapses)之上,量子计算机也不是冯纽曼架构:记忆量子状态与执行量子计算都发生在量子位元之上。自然计算的本质不依照冯纽曼架构运作的!
半导体自1960年起发展迄今逾60年。在大部分时间中,存儲器产品大致约占芯片市场的3成,逻辑处理器居次。
存儲器的积体线路型态高度重复,核心存儲器单元部分可想像为成长方形地砖铺成的重复图形,其面积占芯片总面积超过一半。存儲器容量就是这重复图形中的存儲器单元的数量。
由于存儲器长期的营业额较大,对于良率及密度的要求也特别高。在半导体产业发展的前四十几年中,存儲器一直都是整个产业的技术驱动者(technology driver)。在半导体产业中稍有资历的,也许还记得臺湾的第一座8吋厂、第一条DUV量产线、第一座12吋厂,都是存儲器业者先行的。
到了2000年中期,由于DRAM是由电容储存电荷来表达信息状态的机制,存儲器单元面积的微缩会导致电容里的平行电板面积跟著微缩,进而会让电荷保存不易,所以DRAM制程的推进变得非常困难。DRAM制程遂逐渐被用以制造处理器的逻辑制程超越,而且差距持续扩大。
延伸报导DRAM 制程发展方向:DRAM结构在制程微缩中的挑战
差距到底有多大呢?DRAM从20納米以后的制程是1x、1y、1z、1a、1b、1c、1d,迄今共计7个時代,但都通通停留在10納米時代范畴的龟步前进。换成是逻辑制程,从22納米、14納米、10納米一步到位,甚至直接掠过到7納米。
存儲器制程严重落后于逻辑制程,导致存儲器的效能与容量无法与同一时代的处理器匹配协作,这就是存儲器墙。在目前AI核心运作芯片设计所遭遇的种种问题中,大部分都跟存儲器墙相关。
虽然现在半导体产业的主要注意力放在數字AI(digital AI)——包括训练、推论及代理式AI(agentic AI)上,但是实体AI(physical AI)逐渐要上场,而且其市场预计要远大于AI服務器數據中心。
在數字AI的应用中,逻辑制程的能力无疑是核心;但是到实体AI,存儲器华丽转身成为主角。
实体AI大抵只需要推论,也不太能容许高能耗的应用,因此成为存儲器处理(Processing In Memory;PIM)的应用场景。PIM讲究的是尽量将处理器靠近存儲器,省却數據传输的延迟和功耗,方法包括将处理器置于存儲器模塊中、先进封装中,甚至置于存儲器晶粒之内。
以SK海力士(SK Hynix)的LPDDR5-AiM(Accelerator in Memory)为例,此即使用其LPDDR5制程于核心存儲器单元的周边设计,能执行通用矩阵—矢量乘法(General Matrix-Vector Multiplication;GEMV)的处理器。模型中的权重通常储存于DRAM中,执行推论时,处理器从DRAM中提取,并作为矩阵的一部分使用。
将处理器与存儲器置于同一芯片中制造,虽然因为存儲器的制程不是为处理器专门最佳化的,牺牲处理器部分效能,但由于二者的邻近,功耗、连线、信号传导问题得以大幅改善。
在这样应用的场景中,存儲器技术显然是主导方,其中的逻辑线路其实也毋需太先进。
再进一步的进展就是回复计算的自然本质,将计算能力置于存儲器之中,这就是存儲器运算(Compute In Memory;CIM)。
PIM与CIM最大的不同是PIM只是试图将处理器尽量和存儲器单元摆邻近,但是存儲器单元并未参与數據处理的过程,即使处理器用存儲器的制程做在与存儲器单元的同一晶粒之中;CIM则是让存儲器单元也直接参与计算,特别是目前AI所执行的矩阵—矢量乘法(Matrix-Vector Multiplication;MVM)。
CIM使用的存儲器主要包括SRAM、DRAM、ReRAM和MRAM。
SRAM目前已经少量使用在边缘计算,多的是下推论的用途,应用包括鏡頭的影像識別、物件傳感、语音識別、IoT(Internet of Things)sensor AI、工业设备的异常侦测、小型 CNN(Convolutional Neural Network)、Transformer /小型语言模型的部分矩阵乘法等。
SRAM是成熟制程,速度快、写入耐久度(endurance)也很高,但其面积较大,让它注定无法成为GPU级别的计算元件。这个制约也可以从它目前的起始应用中一览无余。
DRAM的密度较高,而且将来有3D DRAM的前景可期,被寄予厚望。
DRAM的储存单元是电容,电容没法用来计算。DRAM的计算都依赖于核心储存单之外的周边线路来执行,主要的工具是位元线(bitline)和傳感放大器(sense amplifier)。
DRAM是數字元件,用来执行0与1的數字逻辑运算比较容易。如果要执行类比(analog)运算,则需要较复杂的线路来组成,并将數字/逻辑转换器(Digital-to-Analog Converter;DAC)置于周边线路之中。
ReRAM(Resistive Random Access Memory)的结构有些部分像人脑,被认为天生适合用于执行神经網絡型态的计算元件。它用于储存數據状态的导电细丝(conductive filament)的性质可以是类比的——不只是断开/导电两种状态,导电性(conductance)还可以有大有小,可以直接用来记录大语言模型中的权重。结构中的交叉阵列(cross bar array)更可以直接用来执行矩阵乘法和加法。ReRAM是永久存儲器,模型中的权重就储存在存儲器单元之中,计算时不必像SRAM或DRAM从其他永久存儲器中再搬运过来,计算运作更接近非冯诺伊曼架构的本意。
ReRAM的技术很早就被开发出来,之前主要用于嵌入式非挥发性存儲器(eNVM;embedded Nonvolatile Memory),用以替代难以继续微缩的嵌入式快闪存儲器(eFLASH;embedded FLASH)。目前研究的主力集中于细丝材料的改善,以及适宜计算结构的最佳化。
MRAM也是永久存儲器,与ReRAM的主要差异是记忆单元的储存机制不同,它利用两个铁磁层磁化的方向是平行或反平行来记录数据,这意味著它储存的數據是數字的0与1,所以在类比计算中它所遭遇的问题也与DRAM类似。
MRAM依工作机制分STT(Spin Torque Transfer)和SOT(Spin Orbit Torque)两者,后者是较近发展出来的新机制。MRAM值得注意的地方是,SOT MRAM的写入耐久性上限已接近DRAM相同等级,这是大型计算元件必须具备的特质。ReRAM、PCRAM等永久记忆虽有其他优点,但其写入机制牵涉结构反复的破坏与重组,因此耐久性很难提高到同等水准。
PIM概念的发展大概与集成電路的发明时间相近,而严格意义的CIM则萌芽于2010年之后。
从机器学习乃至于生成式AI这一波的半导体产业大竞争之中,有领先逻辑制程的厂商获利至巨,且主导发展。其他厂商花大力气去追赶先进逻辑制程,成功的机率不是很高;另外还有业务型态的屏障,所费不赀也是重要考量。
如果计算机出现非冯纽曼架构的典范转移等级变化,竞争的规则和赛道都将重设,变成一场一切归零、重返起跑线的竞赛。这是为什么近几年连逻辑厂商都已开始在存儲器下功夫的真实理由。