🦙Reddit r/LocalLLaMA•最新收集於 8h
Kimi K3 以八張 B300 GPU 達到每秒 92 Token

#gpu-inference#quantization#throughput#serving-costkimi-k3kimi k3modalvllmunslothllama.cpp
💡了解為何較快的 B300 推理,在每 Token 成本上勝過較便宜的 A100 託管。
⚡ 30-Second TL;DR
有什麼變化
在 Modal 上使用八張 B300 GPU,可達到穩定每秒 92 Token,TTFT 為 0.92–1.02 秒。
為什麼重要
這項基準測試顯示,當吞吐量大幅下降時,較低的 GPU 時租不一定能帶來較低的單 Token 成本。對大型模型服務而言,高階 GPU 的吞吐量與量化支援可能比單純的機器價格更重要。
下一步行動
使用可取得的 GPU 等級,以 vLLM 對目標工作負載進行基準測試,並比較每個輸出 Token 的成本,而不只是每小時機器價格。
誰應關注:Developers & AI Engineers
關鍵要點
- •在 Modal 上使用八張 B300 GPU,可達到穩定每秒 92 Token,TTFT 為 0.92–1.02 秒。
- •部署採用 vLLM、八路 Tensor Parallel 與原生 MXFP4,冷啟動約需 27 分鐘。
- •1-bit UD-IQ1_S GGUF 可在八張 A100-80GB GPU 上執行,但速度僅每秒 9 Token,TTFT 為 7–60 秒。
- •B300 推理成本約為每百萬輸出 Token 190 美元;較慢的 A100 GGUF 配置約為 620 美元。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 15 個來源。
🔑 增強重點摘要
- •Kimi K3 採用混合專家模型 (MoE) 架構,擁有 896 個專家模組,每個 Token 激活參數為 1040 億。
- •該模型支援高達 100 萬 Token 的上下文視窗,並引入了專有的「Kimi Delta Attention (KDA)」機制以優化長序列推理效率。
- •模型權重總量約為 1.56 TB,因此單一部署單元至少需要 8 張具備 288GB VRAM 的 GPU(如 B300 或 MI350X)。
- •在 Artificial Analysis 智能指數中,Kimi K3 目前排名全球前三,特別在編碼與代理任務表現優於多數封閉模型。
- •除了 vLLM,SGLang 亦提供原生支援,並透過名為「DSpark」的推測解碼技術進一步提升推理吞吐量。
📊 競品分析▸ Show
| 模型 | 參數規模 | 關鍵技術 | 推理成本 (每百萬 Token) |
|---|---|---|---|
| Kimi K3 | 2.8T MoE | KDA, MXFP4 | 約 $190 (B300 部署) |
| Claude Fable 5 | 未公開 | 專有架構 | 依 API 定價 |
| GPT-5.6 Sol | 未公開 | 專有架構 | 依 API 定價 |
🛠️ 技術深入
- 架構:2.8 兆參數混合專家模型 (MoE)。
- 專家配置:896 個路由專家,每 Token 激活 104B 參數。
- 注意力機制:Kimi Delta Attention (KDA) 與注意力殘差 (Attention Residuals)。
- 記憶體需求:約 1.56 TB 權重佔用,需高頻寬記憶體 (HBM) 支援。
- 優化技術:原生 MXFP4 量化、vLLM 張量並行 (Tensor Parallel)、DSpark 推測解碼。
🔮 前景展望AI analysis grounded in cited sources
MXFP4 將成為超大規模模型推理的標準格式。
Kimi K3 在 MXFP4 下的效能證明了在不顯著犧牲精度的前提下,大幅降低記憶體頻寬瓶頸的可行性。
自託管 2T+ 參數模型將導致企業對雲端 API 的依賴度下降。
隨著 B300 等高密度 GPU 的普及,自行部署 frontier-level 模型在成本效益上已優於部分雲端 API 方案。
⏳ 時間線
2026-07
Moonshot AI 於 7 月 16 日發布 Kimi K3 API。
2026-07
Moonshot AI 於 7 月 27 日正式釋出 Kimi K3 開放權重。
2026-08
社群實作者驗證在 B300 上使用 vLLM 與 MXFP4 達到 92 Token/s 的效能基準。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
