Search

Tag: #moe72 results

llama.cpp 新增 Mimo v2.5 支援

llama.cpp 新增 Mimo v2.5 支援

拉請求 #22493 在 llama.cpp 中新增 Xiaomi 的 Mimo v2.5 稀疏 MoE 模型支援。此模型總參數 310B,啟動 15B 參數,支援 1M 權重上下文,並處理文字、圖像、影片、音訊模態。具備專用 ViT 視覺與音訊編碼器及多權重預測。

Reddit r/LocalLLaMACommunityMay 7#moe#multimodal#sparse-experts
DeepSeek-V4 成為 OpenClaw 預設模型

DeepSeek-V4 成為 OpenClaw 預設模型

OpenClaw 最新版本 2026.4.24 整合 DeepSeek-V4,將 V4 Flash 設為預設大模型,並將 V4 Pro 加入模型庫。DeepSeek-V4 預覽版於 4 月 24 日上線並開源,採用 MoE 架構並支援 100 萬 token 上下文。此舉提升高參數開源模型的可用性。

⚙️

Qwen3.6 35B-A3B 在 780M iGPU 上運行迅捷

Qwen3.6 35B-A3B MoE 模型透過 llama.cpp Vulkan 在 AMD Radeon 780M iGPU 上展現優異效能。基準測試顯示 ThinkPad T14 Gen 5(64GB RAM)達 282 pp/s 與 20 tg/s。使用者讚揚 Qwen 團隊,經核心調整後 Q6_K 順暢運行。

Reddit r/LocalLLaMACommunityApr 24#moe#igpu#benchmark
DeepSeek 更新 DeepGEMM 支援 Mega MoE

DeepSeek 更新 DeepGEMM 支援 Mega MoE

DeepSeek 更新其 DeepGEMM 儲存庫,新增對 Mega MoE 的測試支援,包括 P4 量化、分佈式通訊、Blackwell 適配以及 HyperConnection 訓練。這暗示正準備部署比 V3 更大的 MoE 模型,可能為 DeepSeek V4,需要 FP4 以實現高效推論。此更新僅限 DeepGEMM 開發,與內部模型發布無關。

Reddit r/LocalLLaMACommunityApr 16#moe#fp4#blackwell
🤖

修正錯誤解鎖 Qwen3.5 35B 潛力

使用者修正 Qwen3.5-35B-A3B-Uncensored 的訓練錯誤,透過縮放區塊 36/37 中的兩個異常張量,將錯誤降低 88.6%。長上下文現已連貫,無哲學化或重複。Hugging Face 分享 GGUF 版本和升級提示。

Reddit r/LocalLLaMACommunityApr 8#model-fix#moe#deltanet
⚙️

Triton MoE 核心擊敗 Megablocks

純 Triton 的融合 MoE 分派核心在 Mixtral-8x7B 推理批次大小下擊敗 CUDA 優化的 Megablocks(32 個 token 時快 131%)。透過融合操作減少 35% 記憶體流量,並支援 NVIDIA 與 AMD 硬體的多模型。GitHub 有程式碼與文章。

Reddit r/MachineLearningCommunityApr 5#moe#inference#kernels
Page 4 of 8