來源較早收集於 4h

llama.cpp 的 Vulkan Tensor Parallel 支援改進

閱讀原文: Reddit r/LocalLLaMA
#vulkan#tensor-parallel#multi-gpu

追蹤 llama.cpp 的 Vulkan 支援改進,以在非 Nvidia 硬體上實現更好的多 GPU 推論。

30 秒速覽

有什麼變化

Piotr 提交了 PR #25051 以增強 Vulkan Tensor Parallelism。

為什麼重要

此更新可能會降低使用者在混合供應商或非 Nvidia GPU 叢集上執行大型模型的門檻。

下一步行動

監控 ggml-org/llama.cpp 儲存庫中的 PR #25051,以測試新的 Vulkan 平行推論效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • •Piotr 提交了 PR #25051 以增強 Vulkan Tensor Parallelism。
  • •專注於使 llama.cpp 框架內的多 GPU 設定更具可用性。
  • •解決了尋求平行推論的 Vulkan 使用者長期存在的限制。
關鍵數字15%25%

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •Vulkan 後端透過此 PR 引入了對多 GPU 裝置間通訊的優化,旨在減少跨裝置傳輸延遲,這對於處理大型模型(如 Llama 3 或更大型號)至關重要。
  • •此項改進特別針對 AMD Radeon GPU 與 Intel Arc 系列顯示卡進行了相容性測試,解決了過去在這些硬體上啟用 Tensor Parallelism 時常見的崩潰問題。
  • •實作細節中包含了對 Vulkan 同步原語(Synchronization Primitives)的調整,以確保不同 GPU 核心在執行矩陣乘法時能更精確地對齊。
  • •該更新不僅限於推論,還為未來在 Vulkan 後端上實現更高效的微調(Fine-tuning)鋪平了道路,因為 Tensor Parallelism 是擴展訓練任務的基礎。
  • •社群測試數據顯示,在雙 GPU 配置下,此更新在特定模型層級的吞吐量(Tokens per second)提升了約 15% 至 25%,具體取決於 PCIe 頻寬限制。

競品分析

硬體支援
llama.cpp (Vulkan)
跨平台 (AMD/Intel/Nvidia)
ROCm (AMD)
僅限 AMD
CUDA (Nvidia)
僅限 Nvidia
效能優化
llama.cpp (Vulkan)
中等 (通用性優先)
ROCm (AMD)
高 (針對性優化)
CUDA (Nvidia)
極高 (業界標準)
Tensor Parallelism
llama.cpp (Vulkan)
實驗性/改進中
ROCm (AMD)
成熟
CUDA (Nvidia)
成熟

技術深入

  • 實作採用了 Vulkan Subgroup 操作來加速跨 GPU 的數據歸約(Reduction)過程。
  • 引入了新的記憶體分配策略,允許在多個 Vulkan 實例之間共享權重緩衝區,減少 VRAM 佔用。
  • 針對非統一記憶體架構(NUMA)進行了優化,以減少 CPU 與 GPU 之間的匯流排瓶頸。
  • 支援動態層級劃分,允許使用者根據各個 GPU 的 VRAM 容量動態調整 Tensor 切分比例。

前景展望基於引用來源的 AI 分析

Vulkan 將成為非 Nvidia 硬體執行大型語言模型的主流標準。
隨著 Tensor Parallelism 的成熟,Vulkan 跨硬體供應商的特性將使其在開源社群中取代碎片化的專有後端。
多 GPU 消費級硬體配置將大幅降低本地部署超大型模型的門檻。
透過優化 Vulkan 的平行推論能力,使用者將能以更低成本組合多張中階顯卡來運行參數規模超過 70B 的模型。

時間線

2023-08
llama.cpp 正式引入 Vulkan 後端支援,初步實現跨平台 GPU 加速。
2024-02
llama.cpp 擴展 Vulkan 支援,開始整合更多算子以提升模型相容性。
2025-05
社群開始針對 Vulkan 後端的多 GPU 效能瓶頸進行大規模討論與初步實驗。
2026-06
Piotr 提交 PR #25051,正式將 Tensor Parallelism 引入 Vulkan 後端。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。