DFlash 在 8GB GPU 上加速 Qwen 35B 33%
使用者在 RTX 2080 SUPER 8GB VRAM 上透過 llama.cpp 實現 Qwen3.5-35B-A3B 的 DFlash 推測解碼,結合 MoE CPU 卸載。速度從 26.8 tok/s 提升至 35.6 tok/s,獲 33% 加速。最適 draft-max 為 6,接受率 99%。
Tag: #low-vram11 results
使用者在 RTX 2080 SUPER 8GB VRAM 上透過 llama.cpp 實現 Qwen3.5-35B-A3B 的 DFlash 推測解碼,結合 MoE CPU 卸載。速度從 26.8 tok/s 提升至 35.6 tok/s,獲 33% 加速。最適 draft-max 為 6,接受率 99%。
vLLM 的新 PR 引入動態專家快取,使用 LRU 政策,讓 16G MoE 模型能在 8G VRAM 上運行,將活躍專家保留在 VRAM,其他移至 RAM。快取遺漏時,計算轉至 CPU 並同時重排專家以降低延遲。未來將新增 mxfp4 量化及磁碟串流。
Rose 是全新無狀態 PyTorch 優化器,VRAM 極低(低於 8-bit AdamW),收斂快且泛化強,Apache 2.0 授權。MNIST 基準顯示準確率競爭力強,儘管訓練損失偶高但驗證損失低。適合 ML 訓練,記憶體開銷最小。
在 RTX 4060 8GB 遊戲筆電上使用 llama.cpp 的 Qwen3.5-35B-A3B-UD-Q4_K_XL 在 100K 上下文生成達 26 t/s,提示處理 331 t/s。效能從 5K 至 100K 上下文擴展良好。使用者考慮升級 RX 7900 XTX 以運行更大模型。
使用者讚揚 OmniCoder-9B Q4_K_M GGUF 在 8GB VRAM Opencode 中以 40+ tps 運行,在 100K 上下文完美完成任務。優於配額限制的雲端工具。分享 llama-server 設定。
使用者使用 DPO 在心理治療資料集上微調 Gemma 3 4B,採用 QLoRa 和 PeFT 在 RTX 3050Ti 筆電上執行。尋求本地評估基準以比較基底模型。強調僅為實驗,非醫療建議。
用戶報告在 RTX 3060 12GB(有效 8GB VRAM)上以 MXFP4 運行 Qwen3 Coder Next,131k 上下文持續 23 令牌/秒。分享網頁開發配置,取代付費 Claude。需 64GB RAM;適合 SaaS 程式委託。
用戶回報 GLM-4.7(專業方案)變得不穩定,可能因量化問題。尋求類似 GLM-4.7 效能的本地模型,適用於 4GB VRAM 與 24GB RAM 硬體。
Reddit 用戶尋求相容 Ollama 的模型,能在超低 32MB VRAM 硬體如 GeForce 256 和 Pentium 3 上匹配或超越 Claude Opus。目標是用於 vibe coding 建構自訂 AI wrapper。社群討論可能因硬體限制而幽默。
用戶讚揚 Qwen 27B 是低 VRAM/單 GPU 環境的最佳 LLM,在 24-48GB 上運行出色。尋求替代方案但目前無匹敵者。強調其本地推理強大效能。