
LLM推理的硬體危機,比你想的嚴重得多
Google DeepMind工程師論文揭露,針對訓練優化的GPU/TPU無法應付記憶體密集的LLM推理解碼,導致成本飆升。MoE與長上下文趨勢放大差距,記憶體頻寬遠落後運算。他們提出HBF、PNM與3D堆疊解決核心痛點。
Tag: #memory-bandwidth11 results

Google DeepMind工程師論文揭露,針對訓練優化的GPU/TPU無法應付記憶體密集的LLM推理解碼,導致成本飆升。MoE與長上下文趨勢放大差距,記憶體頻寬遠落後運算。他們提出HBF、PNM與3D堆疊解決核心痛點。

Sandisk 與 SK hynix 正式推出 HBF 規格,這是一種旨在讓 GPU 存取數 TB 額外 NAND 容量的記憶體架構。該規格以最高 16-Hi NAND 堆疊、最終達 3 TB/s 的頻寬,以及 UCIe 連接為目標。

SK hynix 與 SanDisk 發表 High Bandwidth Flash(HBF)標準,旨在解決 AI 推論中的記憶體頻寬瓶頸。該標準目標頻寬最高可達 3TB/s,若成本下降並廣泛採用,可能加速大型模型推論。

NVIDIA 承認 Rubin GPU 在最大吞吐量下相較前代僅有 2 倍效能提升,儘管記憶體頻寬達 3 倍、FP4 效能達 5 倍。此蘋果對蘋果比較顯示 R200 (2300W) 比 B200 (1000W) 耗電 2.3 倍僅換來些微增益。生產環境效能效率引發疑慮。

NVIDIA 據報正開發 GeForce RTX 5050 的 9GB 顯存變體,以區別於現有 8GB 版本。升級改用 GDDR7 記憶體,帶來小幅帶寬提升。爆料者 MEGAsizeGPU 以準確揭露 NVIDIA 產品聞名。

AI 基礎設施成本傳統上強調 Nvidia GPU,但記憶體正逐漸重要起來。運行 AI 模型越來越依賴記憶體容量與效率。
Project Zero 是一個以零相依性 C99 開發的 1.58-bit BitNet 推論引擎,在四執行緒 Intel Xeon 上達到每秒 36.25 個 Token。其主要發現是,批次大小為 1 的解碼瓶頸在 DRAM 記憶體頻寬,而非計算吞吐量。

文章指出,HBM 產能限制正推動市場對 AI SSD 的需求增加。文章將 AI SSD 定位為即將快速成長的新興基礎設施領域,但摘要未提供具體產品、供應商或效能數據。

NVIDIA 指出,快速成長的 AI 工作負載正推升對大型資料集與超越系統記憶體容量之上下文視窗的需求。文章主張,儲存系統不能只增加容量,還必須為 AI 工廠提供具備依據的洞察,以及高效且安全的架構。

硬體測試顯示,將 Steam Machine 從單通道記憶體升級為雙通道,在特定工作負載下性能提升可達 20%。儘管 Valve 曾表示影響可忽略,但測試證明記憶體頻寬限制對 CPU 密集型任務與部分 3A 遊戲影響顯著。