Google(GOOG-US)此次參與SEMICON記憶體高峰論壇,供應鏈基礎架構資深總監Nikhil Cherian指出,DRAM供給相當緊張,Google已開始把退役伺服器中的DDR4重新回收利用,讓DDR4整合進最新世代的AI伺服器中,更坦言即便這樣還是不夠,呼籲記憶體廠必須快速擴產。業界解讀,此舉不僅驗證DDR4及整體DRAM缺口非同小可,更可讓DDR4擁有更長的生命週期。
業界看好,台廠DDR4業者南亞科(2408-TW)、華邦電(2344-TW)、力積電(6770-TW)都可望直接受惠。
Nikhil Cherian指出,隨著AI模型規模快速膨脹,產業目前已經從過去的「算力受限(Compute-bound)」正式轉向「記憶體受限(Memory-constrained)」,坦言即便 GPU/TPU可能已經夠快,問題是資料餵不進去,因此關鍵瓶頸還在記憶體。
尤其大型模型逐步導入混合專家模型 (MoE)、Agentic AI及長上下文,加上KV Cache規模持續擴張,各類技術都在互相競爭記憶體的容量,也因此帶動記憶體需求快速增加,目前高效能記憶體已占AI伺服器硬體物料清單(BOM)成本的75%以上。
Nikhil Cherian直言,對雲端服務業者而言,若投入數十億美元建置的AI處理器,因等待記憶體頻寬而閒置,就等同大量運算資本支出遭到浪費,因此Google現階段不是單純在意記憶體價格,而是更在意有沒有足夠的記憶體,讓昂貴的AI晶片持續維持高度運算。
為突破記憶體瓶頸,Google在軟、硬體雙管齊下。硬體方面,Google今年首度在同一年推出兩款針對不同工作負載設計的客製化晶片TPU-8I/8T,分別鎖定訓練的TPU-8T,以及針對推論的TPU-8I。其中,TPU-8I為降低推論延遲,將晶片內SRAM容量提高3倍,HBM容量也增加50%,希望盡可能將活躍的KV Cache留在高速記憶體中,降低資料搬移造成的效能損失。
軟體方面,Google也持續從底層函式庫、模型架構與KV Cache壓縮著手,試圖降低單位算力所需要的記憶體容量。不過Nikhil Cherian強調,即使Google透過演算法大幅壓縮記憶體使用量,仍遠遠無法滿足公司的AI發展需求,還是沒有足夠的記憶體支撐Google的企圖心。
值得注意的是,面對記憶體供給瓶頸,Google甚至已開始將過去退役的伺服器重新拆解,回收其中仍可使用的元件,建立內部循環供應鏈;同時更進一步設計特殊硬體介面轉接器,讓DDR4等舊世代記憶體,也能整合進新一世代AI伺服器。
Nikhil Cherian坦言,過去Google也沒有預期會需要採取這類做法,但面對AI帶來的龐大記憶體需求,公司必須設法突破實體供應限制。除此之外,Google也正與記憶體供應商建立長期合作,直接參與產能投資,以確保未來所需的記憶體供給。
業界人士指出,Google身為全球最大Hyperscaler之一,現階段甚至必須回收退役伺服器中的DDR4,並設法將其重新導入最新AI伺服器,凸顯此波DRAM供需緊張程度非同小可;另一方面,AI伺服器原先市場焦點主要集中在HBM與DDR5,但在供應吃緊之下,舊世代DDR4也出現重新利用的需求,讓DDR4產品生命週期進一步拉長。
對台廠而言,DDR4生命週期持續延長,將有利南亞科、華邦電與力積電等台廠,尤其在 AI、伺服器及其他應用對DDR4需求比預期更強,供需缺口可望維持高檔,報價與產能利用率也可望獲得支撐。
Nikhil Cherian最後更直接向記憶體供應鏈喊話,儘管Google已從硬體架構、軟體壓縮、舊元件回收等各種方式降低記憶體壓力,但需求仍持續攀升。他呼籲記憶體業者加速並擴大擴產。
從Google此次釋出的訊號來看,AI帶動的記憶體需求已不再僅限於最先進的HBM,龐大的系統建置需求正逐步外溢至一般DRAM甚至舊世代DDR4。隨著雲端服務業者(CSP)持續擴建AI基礎設施,DDR4退場時間可能比市場原先預期更晚,也讓仍具DDR4產能的台灣記憶體廠迎來另一波供需紅利。