🦙Reddit r/LocalLLaMA•較早收集於 13h
Krasis 在 RTX 5080 上達 3324 tok/s 預填充

#moe-runtime#hybrid-inference#benchmarkskrasiskrasisqwen3-coder-nextrtx-5080moe
💡新運行時讓 80B MoE 在單 5080 上預填充逾 3k tok/s (22字)
⚡ 30-Second TL;DR
有什麼變化
RTX 5080 上 80B MoE 預填充達 3,324 tok/s
為什麼重要
實現消費級 GPU 上巨型 MoE 模型的實用本地推理,大幅縮短 IDE/工具預填充時間。
下一步行動
從來源下載 Krasis,並在你的 NVIDIA GPU 上基準測試 Qwen3-Coder-Next Q4。
誰應關注:Developers & AI Engineers
關鍵要點
- •RTX 5080 上 80B MoE 預填充達 3,324 tok/s
- •Qwen3-Coder-Next CPU 解碼 14.9 tok/s
- •需系統 RAM 為模型大小 2.5 倍
- •針對 MoE 模型、僅 NVIDIA、BF16 safetensors 輸入
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
- •Krasis 運行時支援混合 CPU/GPU 架構,專為 MoE 模型優化,利用 GPU 處理預填充階段以實現極高吞吐量。
- •RTX 5080 在 Krasis 上運行 80B 模型時,透過系統 RAM 擴展超越 VRAM 限制,實現高效大模型推理。
- •Krasis 目前僅限 NVIDIA GPU,並要求 BF16 safetensors 格式輸入,以確保最佳相容性與效能。
🔮 前景展望AI analysis grounded in cited sources
Krasis 將推動單消費級 GPU 運行更大 MoE 模型
其高預填充速度與 RAM 擴展機制降低對多 GPU 依賴,提升本地部署可及性。
⏳ 時間線
2026-02
Krasis 在 RTX 5080 上達成 3324 tok/s 預填充效能發布
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。