🦙較早收集於 13h

Krasis 在 RTX 5080 上達 3324 tok/s 預填充

Krasis 在 RTX 5080 上達 3324 tok/s 預填充
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#moe-runtime#hybrid-inference#benchmarkskrasiskrasisqwen3-coder-nextrtx-5080moe

💡新運行時讓 80B MoE 在單 5080 上預填充逾 3k tok/s (22字)

⚡ 30-Second TL;DR

有什麼變化

RTX 5080 上 80B MoE 預填充達 3,324 tok/s

為什麼重要

實現消費級 GPU 上巨型 MoE 模型的實用本地推理,大幅縮短 IDE/工具預填充時間。

下一步行動

從來源下載 Krasis,並在你的 NVIDIA GPU 上基準測試 Qwen3-Coder-Next Q4。

誰應關注:Developers & AI Engineers

關鍵要點

  • RTX 5080 上 80B MoE 預填充達 3,324 tok/s
  • Qwen3-Coder-Next CPU 解碼 14.9 tok/s
  • 需系統 RAM 為模型大小 2.5 倍
  • 針對 MoE 模型、僅 NVIDIA、BF16 safetensors 輸入

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • Krasis 運行時支援混合 CPU/GPU 架構,專為 MoE 模型優化,利用 GPU 處理預填充階段以實現極高吞吐量。
  • RTX 5080 在 Krasis 上運行 80B 模型時,透過系統 RAM 擴展超越 VRAM 限制,實現高效大模型推理。
  • Krasis 目前僅限 NVIDIA GPU,並要求 BF16 safetensors 格式輸入,以確保最佳相容性與效能。

🔮 前景展望AI analysis grounded in cited sources

Krasis 將推動單消費級 GPU 運行更大 MoE 模型
其高預填充速度與 RAM 擴展機制降低對多 GPU 依賴,提升本地部署可及性。

時間線

2026-02
Krasis 在 RTX 5080 上達成 3324 tok/s 預填充效能發布
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。