⚙️
x570 多GPU:交換 CUDA 順序雙倍提示速度
x570 主機板上的非對稱 x16/x4 PCI-E 通道預設讓 CUDA0 使用慢速 x4 槽,導致 llama.cpp 提示處理瓶頸。設定 export CUDA_VISIBLE_DEVICES="1,0" 優先使用 x16 GPU,將 MoE 模型速度從 70 t/s 提升至 140 t/s。使用 nvtop 或 lspci 驗證通道後再套用。
Tag: #moe-models14 results
x570 主機板上的非對稱 x16/x4 PCI-E 通道預設讓 CUDA0 使用慢速 x4 槽,導致 llama.cpp 提示處理瓶頸。設定 export CUDA_VISIBLE_DEVICES="1,0" 優先使用 x16 GPU,將 MoE 模型速度從 70 t/s 提升至 140 t/s。使用 nvtop 或 lspci 驗證通道後再套用。

2025年11月至2026年4月最新開源模型圖表,按大小分級至1T參數。含今日發布 Qwen3.6 27B 等50+條目。稱最佳本地LLM時期;用戶8GB VRAM跑30-35B MoE。
llama.cpp 的一個實驗性拉取請求引入了 CPU 卸載期間的權重預取功能。它提升了密集模型和小 MoE 模型的效能。適合 RAM 充足但 GPU 不足的使用者。

Reddit 分享 Qwen3 與 Qwen3.5 模型效能比較。密集模型使用列出參數大小;MoE 模型透過 sqrt(總數 × 活躍) 縮放以近似計算等效。資料來自 artificialanalysis.ai 排行榜。