
EntropyMoE 將位元組區塊路由至專用專家
EntropyMoE 為無 tokenizer 的位元組級 LLM 提出具熵感知的稀疏專家路由。它利用動態區塊的熵與長度來專門化計算,在匹配的密集與稀疏基準中取得最低的留出 bits-per-byte,同時維持相近的下游準確率。
Tag: #mixture-of-experts31 results

EntropyMoE 為無 tokenizer 的位元組級 LLM 提出具熵感知的稀疏專家路由。它利用動態區塊的熵與長度來專門化計算,在匹配的密集與稀疏基準中取得最低的留出 bits-per-byte,同時維持相近的下游準確率。

據報Microsoft計畫在8月將Copilot的預設引擎從GPT-4 Turbo切換至自研的Polaris。文章認為,Polaris主要是面向程式碼場景的MoE模型,而Microsoft更大的戰略押注是由Aion、Windows ML與Solara組成的端側技術堆疊。

ECG-MoE 是心電圖分析的新專家混合基礎模型,透過雙路徑建模心跳形態與節律,捕捉週期性與多樣臨床特徵。採用 LoRA 的階層融合網路實現高效推論。在五項公開臨床任務上達到最先進效能,比基準快 40%。
Hugging Face 部落格探討 Transformer 模型中的專家混合 (MoEs) 架構。介紹 MoEs 如何透過每個 token 只啟動選定專家來實現高效擴展。對於理解如 Mixtral 等稀疏模型至關重要。

據稱,一名 Qwen 開發者建議使用者不要等待 35B-A3B 模型。這篇簡短的 Reddit 貼文沒有提供原因,因此目前無法確定該模型是延遲、取消,還是會由其他版本取代。
社群推測 Qwen 3.8 可能以 27B dense 模型推出,而非 35B-A3B MoE 模型。對依賴 GPU offloading 的使用者而言,這可能讓本機推論速度大幅下降。
一項小型本地程式設計實驗發現,Qwen3.6 35B-A3B MoE 的生成速度約為 Qwen3.6 27B dense 的 3.9 倍,約每秒 116 對 30 個 Token。兩個模型在例行維護任務上的表現相近,但 dense 模型在隱含不變量、邊界案例與更廣泛後果方面具有優勢。

G9v3-39A5B 被介紹為一款強調低幻覺率與通用效能的 agent 式混合專家模型。文章認為它可能適合一般工作,但程式設計表現落後於 Qwen。
Reddit r/LocalLLaMA 貼文詢問是否有人期待 60-70B MoE 模型,激活 8-10B 參數。此尺寸適合 64GB VRAM,或許能匹敵封閉「flash」模型效能。發文者指出目前缺乏 30B 與 120B 之間的中型 MoE 模型。
Step 3.5 Flash is a 196B MoE model with 11B active params for agentic tasks. Optimized with sliding-window attention and MTP-3 for low-latency inference. Matches frontier models on math, code, and agent benchmarks.