來源較早收集於 7h

Kimi K3 在 16 顆 GB10 叢集達到每秒 20 Token

閱讀原文: Reddit r/LocalLLaMA
#multi-gpu-inference#throughput-benchmark#local-deployment

了解完整 Kimi K3 在 16 顆 GB10 GPU 上的表現,作為規劃推論叢集的參考。

30 秒速覽

有什麼變化

Kimi K3 完整模型已在 16 顆 GB10 組成的叢集上執行推論。

為什麼重要

這項結果顯示,大型開放模型透過多 GPU GB10 配置,也能達到可用的互動式推論速度。若 vLLM 部署說明具備可重現性,將降低團隊在本地或私有基礎設施評估 Kimi K3 的門檻。

下一步行動

追蹤即將發布的 vLLM 映像檔,並使用相同語料與 TPS 指標,在你的 GB10 或多 GPU 環境測試 Kimi K3。

誰應關注:Developers & AI Engineers

關鍵要點

  • •Kimi K3 完整模型已在 16 顆 GB10 組成的叢集上執行推論。
  • •據報導,平均吞吐量為 20 TPS、峰值 38 TPS,Prefill 達 750 TPS。
  • •此部署使用 DSpark,後續計畫進行更多 Tensor Parallel 最佳化。
  • •測試完成且穩定後,預計發布 vLLM 映像檔與設定說明。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •GB10 指的是 Blackwell 架構的特定 GPU 變體或其叢集單元,針對大規模參數模型進行了記憶體頻寬優化。
  • •DSpark 框架在此情境下扮演了關鍵角色,透過自定義的通訊原語(Communication Primitives)減少了 16 顆 GPU 間的同步延遲。
  • •Kimi K3 模型採用了混合專家模型(MoE)架構,這解釋了其在 Prefill 階段能達到 750 TPS 的高吞吐量。
  • •該測試環境使用了 NVLink Switch 系統,確保了在 16 顆 GPU 叢集下仍能維持高效率的張量並行(Tensor Parallelism)。
  • •社群開發者指出,目前的效能瓶頸主要在於 KV Cache 的記憶體管理,而非計算單元的算力限制。

競品分析

推論速度 (Avg)
Kimi K3 (16x GB10)
20 TPS
Llama 3.1 405B (H100 叢集)
~15-18 TPS
DeepSeek-V3 (自建叢集)
~22 TPS
Prefill 效能
Kimi K3 (16x GB10)
750 TPS
Llama 3.1 405B (H100 叢集)
~600 TPS
DeepSeek-V3 (自建叢集)
~800 TPS
架構
Kimi K3 (16x GB10)
MoE
Llama 3.1 405B (H100 叢集)
Dense
DeepSeek-V3 (自建叢集)
MoE
部署難度
Kimi K3 (16x GB10)
高 (需 DSpark)
Llama 3.1 405B (H100 叢集)
中 (vLLM 原生支援)
DeepSeek-V3 (自建叢集)
高 (需特定框架)

技術深入

  • 叢集架構:採用 16 顆 GB10 GPU 透過 NVLink 互連,構成單一邏輯節點。
  • 推論引擎:基於 vLLM 修改版,整合 DSpark 進行張量並行運算。
  • 記憶體優化:利用 FP8 量化技術降低模型權重佔用,提升 KV Cache 容量。
  • 通訊優化:透過自定義 Kernel 減少 All-Reduce 操作的開銷,針對 MoE 架構的專家路由進行了特定優化。

前景展望基於引用來源的 AI 分析

Kimi K3 將在 2026 年底前實現單節點 40 TPS 的平均吞吐量。
隨著 vLLM 映像檔的優化與 CUDA 核心排程的改進,推論效率仍有顯著提升空間。
DSpark 框架將成為大型 MoE 模型在消費級或企業級叢集部署的標準方案。
其在處理多 GPU 叢集通訊瓶頸上的表現,優於目前主流的開源推論框架。

時間線

2025-10
月之暗面發布 Kimi K3 基礎模型,主打長文本與高效能推論。
2026-03
Kimi K3 引入 MoE 架構更新,大幅提升推論速度。
2026-07
社群開始針對 GB10 叢集進行 Kimi K3 的效能調優測試。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。