🦙較早收集於 25m

Krasis LLM Runtime 預填充速 8.9 倍於 llama.cpp

Krasis LLM Runtime 預填充速 8.9 倍於 llama.cpp
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡單 GPU 上 122B+ 模型速 4-9 倍於 llama.cpp(24字元)

⚡ 30-Second TL;DR

有什麼變化

5090 上預填充 8.9 倍、解碼 4.7 倍於 llama.cpp

為什麼重要

讓 5080/5090 等消費級 GPU 以高於 llama.cpp 的速度運行巨型模型,降低本地高效推論門檻。

下一步行動

透過 GitHub 單行指令安裝 Krasis,並在您的 5090 上基準測試 Qwen3.5-122B。

誰應關注:Developers & AI Engineers

關鍵要點

  • 5090 上預填充 8.9 倍、解碼 4.7 倍於 llama.cpp
  • 預填充/解碼全 GPU,CPU/RAM 需求極低
  • Qwen3.5-122B-A10B 達 2897 tok/s 預填充、27.7 tok/s 解碼
  • 支援 Qwen3.5-235B-A22B;GitHub 一行安裝
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。