Google突破AI記憶體牆!TPU v8首度訓練、推論分流 KV Cache壓縮6倍仍不夠 【記者呂承哲/台北報導】AI模型規模邁向兆級參數,運算瓶頸也從算力逐步轉向記憶體。Google供應鏈基礎設施資深總監Nikhil Cherian於SEMICON Taiwan 2026記憶體高峰論壇表示,Google已從受限於FLOPS算力,轉向受記憶體頻寬限制,記憶體更成為AI伺服器總持有成本(TCO)的主要驅動因素。為突破「記憶體牆」,Google同步從硬體、軟體及供應鏈著手,今年更首度同年推出訓練、推論兩款TPU,並透過TurboQuant演算法將KV Cache記憶體需求壓縮6倍。
閱讀全文