🤖
Qwen 35B-A3B:在 8GB 筆電 100K 上下文達 26 t/s
在 RTX 4060 8GB 遊戲筆電上使用 llama.cpp 的 Qwen3.5-35B-A3B-UD-Q4_K_XL 在 100K 上下文生成達 26 t/s,提示處理 331 t/s。效能從 5K 至 100K 上下文擴展良好。使用者考慮升級 RX 7900 XTX 以運行更大模型。
Tag: #moe-model15 results
在 RTX 4060 8GB 遊戲筆電上使用 llama.cpp 的 Qwen3.5-35B-A3B-UD-Q4_K_XL 在 100K 上下文生成達 26 t/s,提示處理 331 t/s。效能從 5K 至 100K 上下文擴展良好。使用者考慮升級 RX 7900 XTX 以運行更大模型。

Sabomako在Hugging Face發佈Qwen3.5-122B-A10B-heretic的GGUF版本。實現巨型模型的高效本地推理。在r/LocalLLaMA社群分享。
Gemma4 26B A4B 透過全 CPU 模式及 4-5 位元量化,在 16GB Mac 上以 6-10 tps 運行。將 GPU 層設為 0 並降低批次大小以確保可用性。LMStudio 修正使用自訂 Jinja 範本啟用思考。

NVIDIA Nemotron 3 Nano 30B MoE model now available. Features 3B active parameters. Managed deployment for generative AI apps.