🦙最新收集於 8h

Kimi K3 以八張 B300 GPU 達到每秒 92 Token

Kimi K3 以八張 B300 GPU 達到每秒 92 Token
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#gpu-inference#quantization#throughput#serving-costkimi-k3kimi k3modalvllmunslothllama.cpp

💡了解為何較快的 B300 推理,在每 Token 成本上勝過較便宜的 A100 託管。

⚡ 30-Second TL;DR

有什麼變化

在 Modal 上使用八張 B300 GPU,可達到穩定每秒 92 Token,TTFT 為 0.92–1.02 秒。

為什麼重要

這項基準測試顯示,當吞吐量大幅下降時,較低的 GPU 時租不一定能帶來較低的單 Token 成本。對大型模型服務而言,高階 GPU 的吞吐量與量化支援可能比單純的機器價格更重要。

下一步行動

使用可取得的 GPU 等級,以 vLLM 對目標工作負載進行基準測試,並比較每個輸出 Token 的成本,而不只是每小時機器價格。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在 Modal 上使用八張 B300 GPU,可達到穩定每秒 92 Token,TTFT 為 0.92–1.02 秒。
  • 部署採用 vLLM、八路 Tensor Parallel 與原生 MXFP4,冷啟動約需 27 分鐘。
  • 1-bit UD-IQ1_S GGUF 可在八張 A100-80GB GPU 上執行,但速度僅每秒 9 Token,TTFT 為 7–60 秒。
  • B300 推理成本約為每百萬輸出 Token 190 美元;較慢的 A100 GGUF 配置約為 620 美元。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 15 個來源。

🔑 增強重點摘要

  • Kimi K3 採用混合專家模型 (MoE) 架構,擁有 896 個專家模組,每個 Token 激活參數為 1040 億。
  • 該模型支援高達 100 萬 Token 的上下文視窗,並引入了專有的「Kimi Delta Attention (KDA)」機制以優化長序列推理效率。
  • 模型權重總量約為 1.56 TB,因此單一部署單元至少需要 8 張具備 288GB VRAM 的 GPU(如 B300 或 MI350X)。
  • 在 Artificial Analysis 智能指數中,Kimi K3 目前排名全球前三,特別在編碼與代理任務表現優於多數封閉模型。
  • 除了 vLLM,SGLang 亦提供原生支援,並透過名為「DSpark」的推測解碼技術進一步提升推理吞吐量。
📊 競品分析▸ Show
模型參數規模關鍵技術推理成本 (每百萬 Token)
Kimi K32.8T MoEKDA, MXFP4約 $190 (B300 部署)
Claude Fable 5未公開專有架構依 API 定價
GPT-5.6 Sol未公開專有架構依 API 定價

🛠️ 技術深入

  • 架構:2.8 兆參數混合專家模型 (MoE)。
  • 專家配置:896 個路由專家,每 Token 激活 104B 參數。
  • 注意力機制:Kimi Delta Attention (KDA) 與注意力殘差 (Attention Residuals)。
  • 記憶體需求:約 1.56 TB 權重佔用,需高頻寬記憶體 (HBM) 支援。
  • 優化技術:原生 MXFP4 量化、vLLM 張量並行 (Tensor Parallel)、DSpark 推測解碼。

🔮 前景展望AI analysis grounded in cited sources

MXFP4 將成為超大規模模型推理的標準格式。
Kimi K3 在 MXFP4 下的效能證明了在不顯著犧牲精度的前提下,大幅降低記憶體頻寬瓶頸的可行性。
自託管 2T+ 參數模型將導致企業對雲端 API 的依賴度下降。
隨著 B300 等高密度 GPU 的普及,自行部署 frontier-level 模型在成本效益上已優於部分雲端 API 方案。

時間線

2026-07
Moonshot AI 於 7 月 16 日發布 Kimi K3 API。
2026-07
Moonshot AI 於 7 月 27 日正式釋出 Kimi K3 開放權重。
2026-08
社群實作者驗證在 B300 上使用 vLLM 與 MXFP4 達到 92 Token/s 的效能基準。

📎 來源 (15)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. kimi.ai
  2. kimi.ai
  3. digitalocean.com
  4. reddit.com
  5. medium.com
  6. swfte.com
  7. intuitionlabs.ai
  8. firecrawl.dev
  9. atomic.chat
  10. youtube.com
  11. youtube.com
  12. bleap.finance
  13. vllm.ai
  14. huggingface.co
  15. substack.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。