
引言
2018 年國際電腦架構研討會上,John Hennessy 與 David Patterson 以「電腦架構新黃金時代」為題發表圖靈講座,指出自 1980 年代單執行緒 CPU 效能年增 52% 以來,隨著摩爾定律與 Dennard Scaling(功耗隨尺寸縮小而等比例下降)的終結,效能提升已跌至約 3%。他們預言「未來十年將迎來新生代電腦架構的坎布里亞式大爆發」,而事實正如其所言。
背景與技術演進
為了突破通用 CPU 的瓶頸,業界開始大量研發 領域專屬架構(DSA)。Google 的 TPU v1 已在生產環境中展現 29 倍於 CPU 的推論吞吐量與 80 倍的能源效率。此後,GPU、TPU、LPU、NPU、DPU、ASIC、晶圓級引擎(Wafer‑Scale Engine)等多樣化架構如雨後春筍般湧現,皆聚焦於 AI 計算需求。
主流 AI 專用架構
- GPU(NVIDIA、AMD):以大規模平行運算聞名,已成為 AI 訓練與推論的主力。
- Systolic‑array 加速器(Google TPU、Trainium):以矩陣乘法為核心的流水線設計,效能與能效皆優於通用處理器。
- Cerebras Wafer‑Scale Engine:單顆晶圓即容納上千億個晶體管,專為大型模型推論而建。
- Groq LPU:以低延遲資料流為設計哲學,已於近期被 NVIDIA 以 200 億美元收購。
OpenAI 與 Meta 分別承諾 6 GW 電力供應,TPU 族群則支援 Gemini 與 Anthropic 的千萬級晶片部署。
計算核心:矩陣乘法
AI 工作負載的核心是 矩陣乘法(Matrix Multiplication)。Transformer 模型的每層皆由 Q/K/V 投影、注意力機制、輸出投影與前饋網路(FFN)等矩陣乘法組成,並穿插正規化、激活與殘差相加等逐元素運算。
- 訓練:一次前向與反向傳播會同時處理上千個 token,形成大規模的 GEMM(General Matrix‑Matrix Multiply),屬於計算密集型(compute‑bound)。
- 推論 Prefill:在輸入完整序列前一次性投射,亦為 GEMM。
- 解碼(Decode):模型逐 token 產生,每步僅投射單一 token,轉為 GEMV(Matrix‑Vector Multiply),需遍歷全部權重與 KV Cache,算力密度大幅下降。
訓練前沿模型的運算量已突破 10^25 次乘加(multiply‑accumulate),凸顯高效矩陣運算硬體的重要性。
未來展望
隨著 AI 計算需求 持續擴張,硬體設計正從「提升單位晶片效能」轉向「系統級規模化」:透過 scale‑up(單晶片擴大)與 scale‑out(多晶片互聯)雙管齊下,同時打造支援 CUDA、TensorFlow、JAX 等軟體堆疊的完整生態系。未來十年,若能在能效、延遲與可程式化程度上取得平衡,AI 專用架構將進一步滲透雲端、邊緣與終端設備,真正實現 Hennessy 與 Patterson 所預見的「新黃金時代」。