
USAF:在消費級 GPU 上微調 MoE 模型
USAF 是一種針對混合專家模型 (MoE) 的新型稀疏微調方法,讓原本僅能進行推論的硬體也能執行微調。透過訓練稀疏專家權重與路由器而非傳統適配器,大幅降低了本地模型客製化的門檻。
Tag: #vram-optimization9 results

USAF 是一種針對混合專家模型 (MoE) 的新型稀疏微調方法,讓原本僅能進行推論的硬體也能執行微調。透過訓練稀疏專家權重與路由器而非傳統適配器,大幅降低了本地模型客製化的門檻。

一款全新的 354M 參數注意力模型已發布,採用無 Softmax 架構與自定義 Triton 核心。該模型利用結構化稀疏性與 tile-skipping 技術,顯著降低長文本任務的 VRAM 佔用。

ByteDance 發布了全新的開源多模態模型 Lance,專為在具備 40GB VRAM 的硬體上本地運行而設計。該模型在發布後迅速於 Hugging Face 獲得高度關注。
Cloudflare 的 Unweight 以無損方式壓縮 LLM 15-22%,在 H100 GPU 上為 Llama-3.1-8B 節省約 3GB VRAM。GPU 核心已上 GitHub 並發布技術論文;接下來壓縮注意力權重。
推薦 Gemma 4 26B A4B MoE 的 unsloth UD-IQ4_XS 量化版適用 16GB VRAM,調校參數優化編碼與視覺。勝過 Qwen 3.5 27B 在速度、多語系、SysOps 及真實編碼;容納 30K+ 權杖。

英偉達於GTC 2026發布神經紋理壓縮技術,顯存佔用最高降低85%。該技術利用DLSS等AI進展,提供優異圖形效率。鞏固英偉達在AI驅動創新領先地位。
llama.cpp 更新修復了 Gemma 4 的 KV 快取問題,消除了先前高達 PB 級的 VRAM 消耗。這讓本地推理不再受硬體限制。
單人使用時在 llama.cpp 指令加入 -np 1,將 SWA KV 快取 VRAM 減 3 倍(31B 從 3200MB 到 1200MB)。近期 PR 修復確保 SWA 與 KV 一起量化。避免高 -ub 如 4096 以防膨脹。
Reddit r/LocalLLaMA 貼文詢問是否有人期待 60-70B MoE 模型,激活 8-10B 參數。此尺寸適合 64GB VRAM,或許能匹敵封閉「flash」模型效能。發文者指出目前缺乏 30B 與 120B 之間的中型 MoE 模型。