Search

Tag: #llama-cpp14 results

⚙️

RTX 3090 上 Qwen 3.6 27B 達 50 t/s

教學分享使用 MTP GGUF Qwen3.6-27B 在 RTX 3090 上達 50 令牌/秒,搭配 llama.cpp PR #22673 及 100k 上下文。提供精確伺服器指令,使用 Q4 快取、spec-type mtp 及最佳化。提及 MAC 版 mtplx 支援。

Reddit r/LocalLLaMACommunityMay 6#mtp-gguf#llama-cpp
Strix Halo 基準測試新 LLM

Strix Halo 基準測試新 LLM

Strix Halo(Ryzen AI Max+ 395)基準測試 Minimax M2.5、Step 3.5 Flash、Qwen3-Coder-Next、GLM 4.6V/4.7 Flash 的量化版本,於 30k 上下文下運行。使用 llama.cpp 於 ROCm 7.2,配備 128GB RAM。可依需求測試更多模型。

Reddit r/LocalLLaMACommunityFeb 20#llama-cpp#rocm-benchmarks#edge-inference
Page 1 of 2