
MiniMax 預告 M3 模型,長文本處理速度提升 15.6 倍
MiniMax 公布了 M2 系列模型的技術細節,並預告了即將推出的 M3 模型。該模型採用全新的稀疏注意力機制,使長文本解碼速度提升了 15.6 倍。
Tag: #moe72 results

MiniMax 公布了 M2 系列模型的技術細節,並預告了即將推出的 M3 模型。該模型採用全新的稀疏注意力機制,使長文本解碼速度提升了 15.6 倍。
Qwen3.6 35B A3B「異端」無審查版保留全部19個Native MTP,KLD 0.0015,僅10/100拒絕率。在HuggingFace提供Safetensors、GGUF、NVFP4、NVFP4 GGUF及GPTQ-Int4格式。基準測試確認各格式完整保留MTP。

拉請求 #22493 在 llama.cpp 中新增 Xiaomi 的 Mimo v2.5 稀疏 MoE 模型支援。此模型總參數 310B,啟動 15B 參數,支援 1M 權重上下文,並處理文字、圖像、影片、音訊模態。具備專用 ViT 視覺與音訊編碼器及多權重預測。
OpenClaw 最新版本 2026.4.24 整合 DeepSeek-V4,將 V4 Flash 設為預設大模型,並將 V4 Pro 加入模型庫。DeepSeek-V4 預覽版於 4 月 24 日上線並開源,採用 MoE 架構並支援 100 萬 token 上下文。此舉提升高參數開源模型的可用性。
Qwen3.6 35B-A3B MoE 模型透過 llama.cpp Vulkan 在 AMD Radeon 780M iGPU 上展現優異效能。基準測試顯示 ThinkPad T14 Gen 5(64GB RAM)達 282 pp/s 與 20 tg/s。使用者讚揚 Qwen 團隊,經核心調整後 Q6_K 順暢運行。

Ling-2.6-1T 模型將以開放權重發布,繼 Ling 2(1T 總參數、50B 活躍參數)之後。承諾延伸至快閃模型(104B 總參數、7B 活躍參數)。

DeepSeek 更新其 DeepGEMM 儲存庫,新增對 Mega MoE 的測試支援,包括 P4 量化、分佈式通訊、Blackwell 適配以及 HyperConnection 訓練。這暗示正準備部署比 V3 更大的 MoE 模型,可能為 DeepSeek V4,需要 FP4 以實現高效推論。此更新僅限 DeepGEMM 開發,與內部模型發布無關。
llama.cpp 推出動態專家快取,將頻繁 MoE 專家載入 VRAM,提升 Qwen3.5-122B-A10B 權重生成速度 27%(RTX 4090 上 22.67 tok/s,高於層級卸載)。相較全 CPU 提升 45%,VRAM 使用相似。提供程式碼儲存庫測試。
使用者修正 Qwen3.5-35B-A3B-Uncensored 的訓練錯誤,透過縮放區塊 36/37 中的兩個異常張量,將錯誤降低 88.6%。長上下文現已連貫,無哲學化或重複。Hugging Face 分享 GGUF 版本和升級提示。
純 Triton 的融合 MoE 分派核心在 Mixtral-8x7B 推理批次大小下擊敗 CUDA 優化的 Megablocks(32 個 token 時快 131%)。透過融合操作減少 35% 記憶體流量,並支援 NVIDIA 與 AMD 硬體的多模型。GitHub 有程式碼與文章。