🤖Reddit r/MachineLearning•最新收集於 39m
llama.cpp 支援執行時擴展 MoE 專家
#mixture-of-experts#runtime-routing#sparse-modelsllama.cpp-moe-expansionllama.cppqwenqwen 3.6 35b a4b+
💡探索 llama.cpp 的執行時 MoE 專家擴展技術,無需重新訓練模型。
⚡ 30-Second TL;DR
有什麼變化
路由的專家數量可超過模型原生的 top-K,例如從 8 個擴展至更多專家。
為什麼重要
這可能讓開發者在不重新訓練模型的情況下,以增加推理計算量換取更豐富的 MoE 行為。不過,由於此方案仍屬實驗性質,實務使用者應測試品質、延遲、記憶體用量與路由穩定性;文章尚未證明其能提升模型品質。
下一步行動
請複製 moe-expansion 版 llama.cpp,執行文件中的 Qwen 3.6 35B A4B+ 測試,並比較擴展 top-K 與原生路由在延遲、記憶體及任務品質上的差異。
誰應關注:Developers & AI Engineers
關鍵要點
- •路由的專家數量可超過模型原生的 top-K,例如從 8 個擴展至更多專家。
- •使用自適應門檻,並讓選定專家的影響力以 99% 至 50% 線性衰減。
- •支援可設定的層範圍與所有 llama.cpp 後端,且不需修改模型權重。
- •已在 Qwen 3.6 35B A4B+ 上測試,並記錄於專用的 llama.cpp 分支中。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。

