🤖Reddit r/MachineLearning•最新收集於 50m
ShardFlow 搭配 Qwen2.5 跨 WAN 達到每秒 28 個 token
#speculative-decoding#wan-latency#t4-gpushardflowshardflowqwen2.5-7bqwen2.5-14bcuda-graphs
💡看實作如何用推測解碼與 CUDA Graphs,將 86 毫秒 WAN 延遲轉化為 28 TPS。
⚡ 30-Second TL;DR
有什麼變化
在愛荷華州與奧勒岡州的兩個 T4 節點上,Qwen2.5-7B 從未使用推測解碼時的 4.92 TPS,提升至平均 20.31 TPS、峰值 28.10 TPS。
為什麼重要
ShardFlow 顯示,當推測解碼能攤銷網路延遲時,跨地理區域、使用一般 GPU 的模型分片仍具可用性。這項基準測試也凸顯,GPU 利用率與 kernel 啟動開銷,而不只是頻寬,可能主導分散式推論效能。
下一步行動
複製 ShardFlow,使用 K=8 推測解碼與 CUDA Graphs,在你自己的 WAN 延遲環境中測試 Qwen2.5-7B。
誰應關注:Developers & AI Engineers
關鍵要點
- •在愛荷華州與奧勒岡州的兩個 T4 節點上,Qwen2.5-7B 從未使用推測解碼時的 4.92 TPS,提升至平均 20.31 TPS、峰值 28.10 TPS。
- •使用 K=8 草稿生成後,每次 WAN 往返平均可提交約 4.07 個 token,而不是只能提交一個。
- •CUDA Graph 將約 1,500 個由 Python 啟動的 kernel 改為一次重播呼叫,使 0.5B 草稿模型前向傳播延遲從 112 毫秒降至 25 毫秒。
- •系統採用經由 Ohio 的零拷貝 Rust TCP relay、StaticCache、原地 KV rewind,以及 meta-device 模型切片。
- •在相同雙節點配置下,使用 NF4 四位元量化的 Qwen2.5-14B 平均達到 14.43 TPS。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
- •ShardFlow 的架構演進經歷了三個主要版本,從 v1 的 2.27 TPS 提升至 v2.1 的 27 TPS,展現了針對高延遲環境的顯著優化能力。
- •該專案利用 Kaggle 免費提供的 T4 GPU 資源作為分散式節點,透過自建的 Rust TCP relay 解決了 Kaggle 環境對外部連線的限制。
- •早期版本因將閘道器(Gateway)置於解碼迴圈內導致效能瓶頸,後續改為節點間點對點(P2P)通訊,成功將閘道器移出關鍵路徑。
- •為解決 CUDA Graphs 在動態記憶體分配下的指標失效問題,系統導入了 StaticCache 與原地(In-place)記憶體操作機制,確保圖形重播的穩定性。
- •ShardFlow 定位為開源分散式推論基礎設施專案,專注於解決跨廣域網路(WAN)進行 LLM 推論時的延遲與頻寬限制問題。
🛠️ 技術深入
- 採用 Rust 編寫的零拷貝 TCP relay 作為中繼節點,部署於 AWS t3.micro 等雲端實例以繞過網路限制。
- 實作神經推測解碼(Speculative Decoding),使用 0.5B 參數模型作為草稿模型(Drafter)。
- 利用 CUDA Graphs 捕捉前向傳播過程,將 Python 核心啟動開銷從 112 毫秒大幅縮減至 25 毫秒。
- 採用 meta-device 模型切片技術,將模型權重分散至不同地理位置的 GPU 節點。
- 透過 StaticCache 取代 DynamicCache,避免在 CUDA Graph 重播時因指標變動導致的記憶體存取錯誤。
🔮 前景展望AI analysis grounded in cited sources
分散式推論將降低對昂貴高頻寬互連(NVLink)的依賴
ShardFlow 證明了透過軟體層面的推測解碼與 CUDA 優化,即使在公網 WAN 環境下也能達到接近單機的推論效能。
免費雲端 GPU 資源將成為分散式 LLM 推論的算力池
該專案成功整合 Kaggle 等免費 GPU 資源,顯示分散式架構能有效聚合零散的消費級硬體以執行大型模型。
⏳ 時間線
2026-05
ShardFlow v1 發布,初步實現跨 WAN 分散式推論,效能約 2.27 TPS。
2026-06
發布 v2 版本,透過優化閘道器位置與 P2P 通訊,效能提升至 14.3 TPS。
2026-08
發布 v2.1 版本,導入 CUDA Graphs 與 StaticCache,達到 27.08 TPS 峰值。
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。
