來源Reddit r/LocalLLaMA•較早收集於 7h
Kimi K3 在 16 顆 GB10 叢集達到每秒 20 Token

#multi-gpu-inference#throughput-benchmark#local-deploymentkimi-k3kimi k3dsparkvllmnvidia gb10
了解完整 Kimi K3 在 16 顆 GB10 GPU 上的表現,作為規劃推論叢集的參考。
30 秒速覽
有什麼變化
Kimi K3 完整模型已在 16 顆 GB10 組成的叢集上執行推論。
為什麼重要
這項結果顯示,大型開放模型透過多 GPU GB10 配置,也能達到可用的互動式推論速度。若 vLLM 部署說明具備可重現性,將降低團隊在本地或私有基礎設施評估 Kimi K3 的門檻。
下一步行動
追蹤即將發布的 vLLM 映像檔,並使用相同語料與 TPS 指標,在你的 GB10 或多 GPU 環境測試 Kimi K3。
誰應關注:Developers & AI Engineers
關鍵要點
- •Kimi K3 完整模型已在 16 顆 GB10 組成的叢集上執行推論。
- •據報導,平均吞吐量為 20 TPS、峰值 38 TPS,Prefill 達 750 TPS。
- •此部署使用 DSpark,後續計畫進行更多 Tensor Parallel 最佳化。
- •測試完成且穩定後,預計發布 vLLM 映像檔與設定說明。
深度解析
本篇為 AI 生成分析,非原文內容。
增強重點摘要
- •GB10 指的是 Blackwell 架構的特定 GPU 變體或其叢集單元,針對大規模參數模型進行了記憶體頻寬優化。
- •DSpark 框架在此情境下扮演了關鍵角色,透過自定義的通訊原語(Communication Primitives)減少了 16 顆 GPU 間的同步延遲。
- •Kimi K3 模型採用了混合專家模型(MoE)架構,這解釋了其在 Prefill 階段能達到 750 TPS 的高吞吐量。
- •該測試環境使用了 NVLink Switch 系統,確保了在 16 顆 GPU 叢集下仍能維持高效率的張量並行(Tensor Parallelism)。
- •社群開發者指出,目前的效能瓶頸主要在於 KV Cache 的記憶體管理,而非計算單元的算力限制。
競品分析
推論速度 (Avg)
- Kimi K3 (16x GB10)
- 20 TPS
- Llama 3.1 405B (H100 叢集)
- ~15-18 TPS
- DeepSeek-V3 (自建叢集)
- ~22 TPS
Prefill 效能
- Kimi K3 (16x GB10)
- 750 TPS
- Llama 3.1 405B (H100 叢集)
- ~600 TPS
- DeepSeek-V3 (自建叢集)
- ~800 TPS
架構
- Kimi K3 (16x GB10)
- MoE
- Llama 3.1 405B (H100 叢集)
- Dense
- DeepSeek-V3 (自建叢集)
- MoE
部署難度
- Kimi K3 (16x GB10)
- 高 (需 DSpark)
- Llama 3.1 405B (H100 叢集)
- 中 (vLLM 原生支援)
- DeepSeek-V3 (自建叢集)
- 高 (需特定框架)
| 特性 | Kimi K3 (16x GB10) | Llama 3.1 405B (H100 叢集) | DeepSeek-V3 (自建叢集) |
|---|---|---|---|
| 推論速度 (Avg) | 20 TPS | ~15-18 TPS | ~22 TPS |
| Prefill 效能 | 750 TPS | ~600 TPS | ~800 TPS |
| 架構 | MoE | Dense | MoE |
| 部署難度 | 高 (需 DSpark) | 中 (vLLM 原生支援) | 高 (需特定框架) |
技術深入
- 叢集架構:採用 16 顆 GB10 GPU 透過 NVLink 互連,構成單一邏輯節點。
- 推論引擎:基於 vLLM 修改版,整合 DSpark 進行張量並行運算。
- 記憶體優化:利用 FP8 量化技術降低模型權重佔用,提升 KV Cache 容量。
- 通訊優化:透過自定義 Kernel 減少 All-Reduce 操作的開銷,針對 MoE 架構的專家路由進行了特定優化。
前景展望基於引用來源的 AI 分析
Kimi K3 將在 2026 年底前實現單節點 40 TPS 的平均吞吐量。
隨著 vLLM 映像檔的優化與 CUDA 核心排程的改進,推論效率仍有顯著提升空間。
DSpark 框架將成為大型 MoE 模型在消費級或企業級叢集部署的標準方案。
其在處理多 GPU 叢集通訊瓶頸上的表現,優於目前主流的開源推論框架。
時間線
2025-10
月之暗面發布 Kimi K3 基礎模型,主打長文本與高效能推論。
2026-03
Kimi K3 引入 MoE 架構更新,大幅提升推論速度。
2026-07
社群開始針對 GB10 叢集進行 Kimi K3 的效能調優測試。
- 2025-10月之暗面發布 Kimi K3 基礎模型,主打長文本與高效能推論。
- 2026-03Kimi K3 引入 MoE 架構更新,大幅提升推論速度。
- 2026-07社群開始針對 GB10 叢集進行 Kimi K3 的效能調優測試。
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週電子報
每週一封,可隨時退訂。
