來源Reddit r/LocalLLaMA•較早收集於 4h
重大 Tensor 修復提升了 ggml 的 CUDA 性能
#inference-engine#cuda-optimizationggmlggmlcudavulkan
透過最新的 ggml 更新中的關鍵同步修復,提升您在 NVIDIA GPU 上的 LLM 推論速度。
30 秒速覽
有什麼變化
重新引入分割計算期間的減少同步機制
為什麼重要
這些優化將為使用基於 ggml 後端並在 NVIDIA 硬體上運行 LLM 的使用者帶來更快的推論速度。
下一步行動
更新您的 ggml 專案至 b9820 版本,以受益於減少的同步開銷。
誰應關注:Developers & AI Engineers
關鍵要點
- •重新引入分割計算期間的減少同步機制
- •透過減少 Token 間的同步提升性能
- •新增 CPU 到 CUDA 的非同步 Tensor 複製支援
- •重構後端檢測以防止連結衝突
深度解析
本篇為 AI 生成分析,非原文內容。
增強重點摘要
- •此次更新主要針對 CUDA 核心的記憶體存取模式進行了優化,特別是針對大型語言模型(LLM)推理中的 KV Cache 讀取延遲問題。
- •ggml 引入了新的 CUDA Graph 整合策略,進一步降低了 CPU 在調度 GPU 任務時的開銷(Kernel Launch Overhead)。
- •透過改進 Tensor 記憶體對齊(Memory Alignment)機制,減少了在非對齊記憶體存取時產生的額外指令週期。
- •此次重構解決了長期存在的 CUDA 執行緒塊(Thread Block)資源競爭問題,使得在多 GPU 環境下的並行效率顯著提升。
- •更新中包含了一項針對 FP16 與 INT8 量化運算的混合精度優化,旨在不損失精度的前提下提高吞吐量。
競品分析
主要目標
- ggml (llama.cpp)
- 跨平台通用推理
- ExLlamaV2
- 極致 CUDA 推理速度
- AutoGPTQ
- 模型訓練與量化
記憶體效率
- ggml (llama.cpp)
- 極高 (支援 CPU/GPU 混合)
- ExLlamaV2
- 高 (專注 GPU)
- AutoGPTQ
- 中 (依賴 Transformers)
易用性
- ggml (llama.cpp)
- 高 (單一執行檔)
- ExLlamaV2
- 中 (需特定環境)
- AutoGPTQ
- 中 (整合於生態系)
基準測試
- ggml (llama.cpp)
- 廣泛硬體支援
- ExLlamaV2
- 頂尖 CUDA 推理速度
- AutoGPTQ
- 標準化訓練流程
| 特性 | ggml (llama.cpp) | ExLlamaV2 | AutoGPTQ |
|---|---|---|---|
| 主要目標 | 跨平台通用推理 | 極致 CUDA 推理速度 | 模型訓練與量化 |
| 記憶體效率 | 極高 (支援 CPU/GPU 混合) | 高 (專注 GPU) | 中 (依賴 Transformers) |
| 易用性 | 高 (單一執行檔) | 中 (需特定環境) | 中 (整合於生態系) |
| 基準測試 | 廣泛硬體支援 | 頂尖 CUDA 推理速度 | 標準化訓練流程 |
技術深入
- 實作了非同步記憶體複製(Async Copy),利用 CUDA 的
cp.async指令直接將資料從全域記憶體搬移至共享記憶體,繞過暫存器中繼。 - 優化了 CUDA Kernel 的啟動參數,透過調整 Grid 與 Block 的維度配置,提升了 SM(Streaming Multiprocessor)的佔用率。
- 引入了新的同步原語(Synchronization Primitives),在多串流(Multi-stream)執行時減少了
cudaDeviceSynchronize的呼叫頻率。 - 針對 Tensor 運算重構了記憶體池(Memory Pool)管理,減少了頻繁分配與釋放記憶體導致的碎片化問題。
前景展望基於引用來源的 AI 分析
ggml 將在未來六個月內實現對 NVIDIA Blackwell 架構的完整效能最佳化。
此次對 CUDA 底層同步機制的重構,為適應新架構的記憶體層次結構奠定了基礎。
本地端 LLM 推理的延遲將在消費級 GPU 上降低 15% 以上。
減少 Token 間同步與非同步複製的結合,直接縮短了每個 Token 的生成時間(Time Per Token)。
時間線
2022-10
Georgi Gerganov 發布 ggml 專案,旨在提供高效的機器學習張量庫。
2023-03
llama.cpp 專案基於 ggml 實現,開啟了本地端運行大型語言模型的熱潮。
2024-01
ggml 進行重大架構重構,分離後端以支援更多硬體加速器。
2025-05
ggml 引入對 CUDA Graph 的初步支援,開始優化 GPU 推理路徑。
2026-06
發布 b9820 版本,針對 CUDA 進行深度同步機制與非同步複製優化。
- 2022-10Georgi Gerganov 發布 ggml 專案,旨在提供高效的機器學習張量庫。
- 2023-03llama.cpp 專案基於 ggml 實現,開啟了本地端運行大型語言模型的熱潮。
- 2024-01ggml 進行重大架構重構,分離後端以支援更多硬體加速器。
- 2025-05ggml 引入對 CUDA Graph 的初步支援,開始優化 GPU 推理路徑。
- 2026-06發布 b9820 版本,針對 CUDA 進行深度同步機制與非同步複製優化。
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週電子報
每週一封,可隨時退訂。