🦙Reddit r/LocalLLaMA•較早收集於 25m
Krasis LLM Runtime 預填充速 8.9 倍於 llama.cpp

💡單 GPU 上 122B+ 模型速 4-9 倍於 llama.cpp(24字元)
⚡ 30-Second TL;DR
有什麼變化
5090 上預填充 8.9 倍、解碼 4.7 倍於 llama.cpp
為什麼重要
讓 5080/5090 等消費級 GPU 以高於 llama.cpp 的速度運行巨型模型,降低本地高效推論門檻。
下一步行動
透過 GitHub 單行指令安裝 Krasis,並在您的 5090 上基準測試 Qwen3.5-122B。
誰應關注:Developers & AI Engineers
關鍵要點
- •5090 上預填充 8.9 倍、解碼 4.7 倍於 llama.cpp
- •預填充/解碼全 GPU,CPU/RAM 需求極低
- •Qwen3.5-122B-A10B 達 2897 tok/s 預填充、27.7 tok/s 解碼
- •支援 Qwen3.5-235B-A22B;GitHub 一行安裝
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。