
397B Qwen3.5 在 $2100 桌上型電腦上達 9 tok/s
FOMOE 讓 397B Qwen3.5 MoE 模型在配備兩張 $500 GPU 與 32GB RAM 的 $2,100 桌上型電腦上,以 Q4_K_M 量化達到 5-9 tokens/s。利用 VRAM 快取常見專家、滾動快取及快取感知路由 (CAR) 將 NVMe 讀取降至 7%。透過雙 GPU 交替與僅 3.5% 困惑度下降實現此效能。
Tag: #local-llm172 results

FOMOE 讓 397B Qwen3.5 MoE 模型在配備兩張 $500 GPU 與 32GB RAM 的 $2,100 桌上型電腦上,以 Q4_K_M 量化達到 5-9 tokens/s。利用 VRAM 快取常見專家、滾動快取及快取感知路由 (CAR) 將 NVMe 讀取降至 7%。透過雙 GPU 交替與僅 3.5% 困惑度下降實現此效能。

Reddit 使用者指出,較新的提交移除了 Qwen 35B 模型的相關內容。這項變化被解讀為模型可能不會發布的訊號,也促使使用者向 Qwen 團隊要求澄清。

Meta 發布 Muse Glimmer,這是一款可完全離線運行的免費 300 億參數 AI 模型。使用者不需要訂閱服務或資料中心存取權,但需要至少具備 24GB VRAM 的 GPU。

ExLlamaV3 迎來首個正式生產版本,針對推論速度與硬體效率進行了重大優化。此次更新包含全新的注意力與 GEMV 核心,並增強了對現代模型架構的支援。

Zer0Fit 是一個新的 MCP 伺服器,允許開發者在 Docker 容器中本地運行 Google 的 TabFM 與 TimesFM 基礎模型。它能透過 Open WebUI 等 LLM 介面直接進行預測與分類等零樣本機器學習任務。

Ollama 成功募資 6,500 萬美元,其開源開發工具用戶數已達 900 萬。該平台透過簡化在個人電腦上運行大型語言模型的流程,持續獲得開發者青睞。

開發者實驗顯示,本地 LLM 若無 RAG 支援,在回答技術問題時表現不佳,但結合知識庫後效果顯著。該研究測試了包括 Apple Intelligence 和 Qwen 在內的多種模型,證實了上下文注入的有效性。
Competence Gate 是一個為 Qwen3.5-4B 設計的 10MB LoRA 適配器,透過讀取模型內部激活訊號來決定直接回答、網路搜尋或檢索本地文件。它能有效減少幻覺並防止隱私資料外洩,透過驗證後的信心程度而非模型口頭聲稱來控管工具使用。
Nvidia 已正式在 Hugging Face 上發布 Qwen3.6-27B-NVFP4 模型。此發布擴展了可用於本地部署的高性能開源權重模型選擇。
新版 Gemma 4 (26B 與 31B) 無審查模型現已發布,透過多標記預測 (MTP) 技術顯著提升推理速度。這些模型針對創意寫作與角色扮演進行了優化,移除了拒絕回答的機制。