H64LM:從零構建的 249M 參數 MoE Transformer
H64LM 是一個研究項目,使用 PyTorch 從零開始實現了一個 249M 參數的 Mixture-of-Experts Transformer。它不依賴高階訓練框架,自行實現了 GQA、稀疏路由和 RoPE 等核心組件。
Tag: #moe72 results
H64LM 是一個研究項目,使用 PyTorch 從零開始實現了一個 249M 參數的 Mixture-of-Experts Transformer。它不依賴高階訓練框架,自行實現了 GQA、稀疏路由和 RoPE 等核心組件。

COMPASS 是一個全新的統一多模態框架,旨在提升細粒度組合識別與控制能力。透過在感知與生成任務中共享專家標記,該模型實現了對圖像生成的精確佈局控制。
關於 LLM 發布趨勢轉變的討論,指出過去三個月內缺乏新的 120B MoE 模型。產業似乎正朝向較小的 25B-35B 模型或龐大的 200B+ 架構兩極化發展。
單張 RTX 3090 Ti 上運行 Qwen3.5/3.6 模型,使用 llama.cpp 的 NextN MTP 推測解碼,MoE 模型達 ~150 tok/s。需 cherry-pick 開放 PR #22400 和 #22673;包含建置指示和推薦 GGUF 量化檔。
近期 MoE 模型如 Qwen 3.5 122B 和 MiniMax M2 230B 儘管總大小不同,卻激活約 10B 參數。訓練成本隨活躍參數和令牌擴展,解釋經濟收斂於約 9e23 FLOPs。探討專家數增加時的推論記憶擴展。
使用者在 Strix Halo 上基準測試並將家用實驗室從三個模型整合至單一 122B Qwen3.5 MoE,達到 27.4 tok/s 並獲最高分數。IQ3 量化在半 VRAM 下性能匹配 Q4_K_M。同時處理電子郵件、財務和攝像頭等多個應用。
Savant Commander 48B是基於Qwen3的自訂4x12B MOE,融合Claude、Gemini、OpenAI、DeepSeek等頂尖蒸餾模型,並具手寫路由。使用者可透過提示控制啟動並輕鬆測試差異。Hugging Face上有GGUF常規版與Heretic無審查版。
Apple M5 Max 128GB 的後續基準測試顯示優異提示處理速度,特別是 MoE 模型如 Qwen3.5-35B-A3B 達 2,845 tok/s。Token 生成排名強調 MoE 優於密集模型。測試使用 llama-bench 並比較 llama.cpp 與 MLX。
Qwen 3 32B 在 11 項盲測中以 9.63 平均分勝過所有 Qwen 3.5 模型。高效 3B 活躍參數的 Qwen 3.5 35B-A3B 贏得 4 項評測,適合本地硬體。Coder Next 落後通用模型。
使用者尋求在支援 AVX2 的消費級 CPU 上運行大型 MoE 模型的建議。討論重點在於如何平衡 RAM 容量與運算頻寬,以達到可用的 Token 生成速度。