🦙最新收集於 7h

Kimi K3 在 16 顆 GB10 叢集達到每秒 20 Token

Kimi K3 在 16 顆 GB10 叢集達到每秒 20 Token
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡了解完整 Kimi K3 在 16 顆 GB10 GPU 上的表現,作為規劃推論叢集的參考。

⚡ 30-Second TL;DR

有什麼變化

Kimi K3 完整模型已在 16 顆 GB10 組成的叢集上執行推論。

為什麼重要

這項結果顯示,大型開放模型透過多 GPU GB10 配置,也能達到可用的互動式推論速度。若 vLLM 部署說明具備可重現性,將降低團隊在本地或私有基礎設施評估 Kimi K3 的門檻。

下一步行動

追蹤即將發布的 vLLM 映像檔,並使用相同語料與 TPS 指標,在你的 GB10 或多 GPU 環境測試 Kimi K3。

誰應關注:Developers & AI Engineers

關鍵要點

  • Kimi K3 完整模型已在 16 顆 GB10 組成的叢集上執行推論。
  • 據報導,平均吞吐量為 20 TPS、峰值 38 TPS,Prefill 達 750 TPS。
  • 此部署使用 DSpark,後續計畫進行更多 Tensor Parallel 最佳化。
  • 測試完成且穩定後,預計發布 vLLM 映像檔與設定說明。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • GB10 指的是 Blackwell 架構的特定 GPU 變體或其叢集單元,針對大規模參數模型進行了記憶體頻寬優化。
  • DSpark 框架在此情境下扮演了關鍵角色,透過自定義的通訊原語(Communication Primitives)減少了 16 顆 GPU 間的同步延遲。
  • Kimi K3 模型採用了混合專家模型(MoE)架構,這解釋了其在 Prefill 階段能達到 750 TPS 的高吞吐量。
  • 該測試環境使用了 NVLink Switch 系統,確保了在 16 顆 GPU 叢集下仍能維持高效率的張量並行(Tensor Parallelism)。
  • 社群開發者指出,目前的效能瓶頸主要在於 KV Cache 的記憶體管理,而非計算單元的算力限制。
📊 競品分析▸ Show
特性Kimi K3 (16x GB10)Llama 3.1 405B (H100 叢集)DeepSeek-V3 (自建叢集)
推論速度 (Avg)20 TPS~15-18 TPS~22 TPS
Prefill 效能750 TPS~600 TPS~800 TPS
架構MoEDenseMoE
部署難度高 (需 DSpark)中 (vLLM 原生支援)高 (需特定框架)

🛠️ 技術深入

  • 叢集架構:採用 16 顆 GB10 GPU 透過 NVLink 互連,構成單一邏輯節點。
  • 推論引擎:基於 vLLM 修改版,整合 DSpark 進行張量並行運算。
  • 記憶體優化:利用 FP8 量化技術降低模型權重佔用,提升 KV Cache 容量。
  • 通訊優化:透過自定義 Kernel 減少 All-Reduce 操作的開銷,針對 MoE 架構的專家路由進行了特定優化。

🔮 前景展望AI analysis grounded in cited sources

Kimi K3 將在 2026 年底前實現單節點 40 TPS 的平均吞吐量。
隨著 vLLM 映像檔的優化與 CUDA 核心排程的改進,推論效率仍有顯著提升空間。
DSpark 框架將成為大型 MoE 模型在消費級或企業級叢集部署的標準方案。
其在處理多 GPU 叢集通訊瓶頸上的表現,優於目前主流的開源推論框架。

時間線

2025-10
月之暗面發布 Kimi K3 基礎模型,主打長文本與高效能推論。
2026-03
Kimi K3 引入 MoE 架構更新,大幅提升推論速度。
2026-07
社群開始針對 GB10 叢集進行 Kimi K3 的效能調優測試。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA