🤖最新收集於 39m

llama.cpp 支援執行時擴展 MoE 專家

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#mixture-of-experts#runtime-routing#sparse-modelsllama.cpp-moe-expansionllama.cppqwenqwen 3.6 35b a4b+

💡探索 llama.cpp 的執行時 MoE 專家擴展技術,無需重新訓練模型。

⚡ 30-Second TL;DR

有什麼變化

路由的專家數量可超過模型原生的 top-K,例如從 8 個擴展至更多專家。

為什麼重要

這可能讓開發者在不重新訓練模型的情況下,以增加推理計算量換取更豐富的 MoE 行為。不過,由於此方案仍屬實驗性質,實務使用者應測試品質、延遲、記憶體用量與路由穩定性;文章尚未證明其能提升模型品質。

下一步行動

請複製 moe-expansion 版 llama.cpp,執行文件中的 Qwen 3.6 35B A4B+ 測試,並比較擴展 top-K 與原生路由在延遲、記憶體及任務品質上的差異。

誰應關注:Developers & AI Engineers

關鍵要點

  • 路由的專家數量可超過模型原生的 top-K,例如從 8 個擴展至更多專家。
  • 使用自適應門檻,並讓選定專家的影響力以 99% 至 50% 線性衰減。
  • 支援可設定的層範圍與所有 llama.cpp 後端,且不需修改模型權重。
  • 已在 Qwen 3.6 35B A4B+ 上測試,並記錄於專用的 llama.cpp 分支中。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。