Samsung's Processing-in-Memory (PIM)
Samsung 推出 LPDDR5X‑PIM:把運算搬進記憶體
在 In‑Memory Compute(記憶體內運算) 的概念已經酝酿多年之後,Samsung 於 2026 年 Hot Chips 大會正式展示其最新的 LPDDR5X‑PIM(Processing‑in‑Memory) 方案。此方案在每顆 LPDDR5X‑9600 記憶體晶片的 16 個 bank(記憶體子區) 內嵌入 MAC(乘加)單元,同時保留與標準記憶體控制器的相容介面,讓系統既能使用傳統 DRAM 讀寫,又能直接在記憶體內完成向量運算。
為何需要「記憶體內運算」?
傳統 DRAM 的外部介面頻寬受限,即使控制器同時啟動多個 bank,也只能在 76.8 GB/s 的上限下取得資料。相較之下,Samsung 的 PIM 區塊不受外部匯流排限制,能直接存取所屬 bank,將 16 個 bank 的內部頻寬合併至 614 GB/s,提升近 8 倍。
PIM 區塊的結構與運算能力
每個 PIM 區塊由一棵 MAC 樹、多組暫存檔(register file)與控制邏輯組成:
| 暫存檔 | 容量 | 功能說明 | |--------|------|----------| | 指令暫存檔 | 1024 bit | 可容納 64 條 16 bit 指令 | | 來源暫存檔 | 4 kbit | 儲存啟動向量,提供 MAC 的一個運算元 | | 比例暫存檔 | 2 kbit | 儲存縮放係數,允許在乘加前對權重做比例調整 |
在運算時,模型權重會事先寫入 DRAM,PIM 區塊從相鄰的 DRAM bank 讀取第二個運算元。MAC 陣列支援多種低精度格式,根據 Samsung 的簡報,每個區塊在 INT8(8 位元整數)或 FP8(8 位元浮點)模式下,可在每個資料時鐘完成 四次乘加(若不計算 DDR 雙倍速則為八次),4 位元權重時吞吐量再翻倍,整顆晶片的峰值運算量達 2.4 TOPS(每秒兆次運算)。
整體效能與成本考量
單顆 LPDDR5X‑PIM 的 2.4 TOPS 看似 modest,但若以多顆晶片組成的記憶體子系統來看,效能會呈指數增長。以八顆 16 GB LPDDR5X‑PIM 為例,總運算能力可達 9.6 INT8 TOPS,與 Intel Meteor Lake 內建的 NPU(神經網路處理單元)相當。然而,這樣的配置需要 128 GB 系統記憶體,成本與功耗亦相對提升。
標準相容性:特殊 Row 位址的巧思
Samsung 的一大亮點是 保持 LPDDR5X 標準協定,同時透過預留的 特殊 Row 位址(類似 MMIO 記憶體映射 I/O)向控制器暴露運算功能。每條通道都有兩組預設的 Row 位址用於模式控制,啟動其中之一即可切換至 PIM 模式,無需額外硬體或協定修改。
未來展望
LPDDR5X‑PIM 展示了「記憶體即運算」的可行路徑,特別適合需要大量向量乘加的 AI 推論工作負載。隨著低精度演算法的成熟與模型壓縮技術的進步,未來可能出現更多以 PIM 為核心 的系統架構,將記憶體頻寬瓶頸徹底打破。對於資料中心與高效能嵌入式裝置而言,如何在效能、功耗與成本之間取得平衡,將是下一波技術競賽的關鍵。