🤖最新收集於 50m

ShardFlow 搭配 Qwen2.5 跨 WAN 達到每秒 28 個 token

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#speculative-decoding#wan-latency#t4-gpushardflowshardflowqwen2.5-7bqwen2.5-14bcuda-graphs

💡看實作如何用推測解碼與 CUDA Graphs,將 86 毫秒 WAN 延遲轉化為 28 TPS。

⚡ 30-Second TL;DR

有什麼變化

在愛荷華州與奧勒岡州的兩個 T4 節點上,Qwen2.5-7B 從未使用推測解碼時的 4.92 TPS,提升至平均 20.31 TPS、峰值 28.10 TPS。

為什麼重要

ShardFlow 顯示,當推測解碼能攤銷網路延遲時,跨地理區域、使用一般 GPU 的模型分片仍具可用性。這項基準測試也凸顯,GPU 利用率與 kernel 啟動開銷,而不只是頻寬,可能主導分散式推論效能。

下一步行動

複製 ShardFlow,使用 K=8 推測解碼與 CUDA Graphs,在你自己的 WAN 延遲環境中測試 Qwen2.5-7B。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在愛荷華州與奧勒岡州的兩個 T4 節點上,Qwen2.5-7B 從未使用推測解碼時的 4.92 TPS,提升至平均 20.31 TPS、峰值 28.10 TPS。
  • 使用 K=8 草稿生成後,每次 WAN 往返平均可提交約 4.07 個 token,而不是只能提交一個。
  • CUDA Graph 將約 1,500 個由 Python 啟動的 kernel 改為一次重播呼叫,使 0.5B 草稿模型前向傳播延遲從 112 毫秒降至 25 毫秒。
  • 系統採用經由 Ohio 的零拷貝 Rust TCP relay、StaticCache、原地 KV rewind,以及 meta-device 模型切片。
  • 在相同雙節點配置下,使用 NF4 四位元量化的 Qwen2.5-14B 平均達到 14.43 TPS。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • ShardFlow 的架構演進經歷了三個主要版本,從 v1 的 2.27 TPS 提升至 v2.1 的 27 TPS,展現了針對高延遲環境的顯著優化能力。
  • 該專案利用 Kaggle 免費提供的 T4 GPU 資源作為分散式節點,透過自建的 Rust TCP relay 解決了 Kaggle 環境對外部連線的限制。
  • 早期版本因將閘道器(Gateway)置於解碼迴圈內導致效能瓶頸,後續改為節點間點對點(P2P)通訊,成功將閘道器移出關鍵路徑。
  • 為解決 CUDA Graphs 在動態記憶體分配下的指標失效問題,系統導入了 StaticCache 與原地(In-place)記憶體操作機制,確保圖形重播的穩定性。
  • ShardFlow 定位為開源分散式推論基礎設施專案,專注於解決跨廣域網路(WAN)進行 LLM 推論時的延遲與頻寬限制問題。

🛠️ 技術深入

  • 採用 Rust 編寫的零拷貝 TCP relay 作為中繼節點,部署於 AWS t3.micro 等雲端實例以繞過網路限制。
  • 實作神經推測解碼(Speculative Decoding),使用 0.5B 參數模型作為草稿模型(Drafter)。
  • 利用 CUDA Graphs 捕捉前向傳播過程,將 Python 核心啟動開銷從 112 毫秒大幅縮減至 25 毫秒。
  • 採用 meta-device 模型切片技術,將模型權重分散至不同地理位置的 GPU 節點。
  • 透過 StaticCache 取代 DynamicCache,避免在 CUDA Graph 重播時因指標變動導致的記憶體存取錯誤。

🔮 前景展望AI analysis grounded in cited sources

分散式推論將降低對昂貴高頻寬互連(NVLink)的依賴
ShardFlow 證明了透過軟體層面的推測解碼與 CUDA 優化,即使在公網 WAN 環境下也能達到接近單機的推論效能。
免費雲端 GPU 資源將成為分散式 LLM 推論的算力池
該專案成功整合 Kaggle 等免費 GPU 資源,顯示分散式架構能有效聚合零散的消費級硬體以執行大型模型。

時間線

2026-05
ShardFlow v1 發布,初步實現跨 WAN 分散式推論,效能約 2.27 TPS。
2026-06
發布 v2 版本,透過優化閘道器位置與 P2P 通訊,效能提升至 14.3 TPS。
2026-08
發布 v2.1 版本,導入 CUDA Graphs 與 StaticCache,達到 27.08 TPS 峰值。

📎 來源 (5)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. reddit.com
  2. reddit.com
  3. reddit.com
  4. github.com
  5. gopenai.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。

ShardFlow Reaches 28 TPS Across WAN with Qwen2.5 | Reddit r/MachineLearning | SetupAI | SetupAI