
397B Qwen3.5 在 $2100 桌上型電腦上達 9 tok/s
FOMOE 讓 397B Qwen3.5 MoE 模型在配備兩張 $500 GPU 與 32GB RAM 的 $2,100 桌上型電腦上,以 Q4_K_M 量化達到 5-9 tokens/s。利用 VRAM 快取常見專家、滾動快取及快取感知路由 (CAR) 將 NVMe 讀取降至 7%。透過雙 GPU 交替與僅 3.5% 困惑度下降實現此效能。
Tag: #moe-inference6 results

FOMOE 讓 397B Qwen3.5 MoE 模型在配備兩張 $500 GPU 與 32GB RAM 的 $2,100 桌上型電腦上,以 Q4_K_M 量化達到 5-9 tokens/s。利用 VRAM 快取常見專家、滾動快取及快取感知路由 (CAR) 將 NVMe 讀取降至 7%。透過雙 GPU 交替與僅 3.5% 困惑度下降實現此效能。

英偉達 Blackwell Ultra 在 DeepSeek-R1 模型測試中,每兆瓦吞吐量較 Hopper 提升 50 倍,百萬 tokens 成本降至 35 分之一。預告 Rubin 平台將再提升 10 倍。主要關鍵為 130 TB/s NVLink 和 NVFP4 精度格式。
Qwen3.5-122B NVFP4 在 2x RTX PRO 6000 Blackwell 上達 198 tok/s,經 SGLang 驗證。公開資料含至 150K 令牌上下文擴展,解碼無減速。關鍵:PCIe 交換器低延遲 MoE。
基準測試顯示雙 AMD RX 7900 XTX GPU 使用 llama.cpp Vulkan 後端,在 Qwen3.5-35B-A3B Q4_K_M 上達成 123 tok/s 令牌生成及最高 3,829 tok/s 提示處理。它優於單一 7900 XTX 並與高階 NVIDIA 卡匹敵。ROCm 上的 vLLM 表現差勁且有錯誤。
vLLM 的新 PR 引入動態專家快取,使用 LRU 政策,讓 16G MoE 模型能在 8G VRAM 上運行,將活躍專家保留在 VRAM,其他移至 RAM。快取遺漏時,計算轉至 CPU 並同時重排專家以降低延遲。未來將新增 mxfp4 量化及磁碟串流。

一名基礎架構工程師分享一台工作站級 AI 伺服器經過六至八個月運作後的實務評測,目標是支援大型 MoE 推理、創意工作與企業研究。系統結合八張 RTX 3090、兩張 RTX 5090、512GB ECC 記憶體,並透過 Open WebUI 搭配 llama.cpp 或 koboldcpp。