
騰訊開源 295B Hy3 混合專家模型
騰訊開源 Hy3 預覽版,這是一個擁有 295B 參數的混合專家模型,具備 256K 上下文窗口。此發布結束了一週的忙碌,包括 3D 世界模型以及 QClaw 消費代理的全球 Beta 版。這突顯騰訊專注於工具、記憶體和工作流程的「韁繩」層,以主宰代理時代。
Tag: #moe-model15 results

騰訊開源 Hy3 預覽版,這是一個擁有 295B 參數的混合專家模型,具備 256K 上下文窗口。此發布結束了一週的忙碌,包括 3D 世界模型以及 QClaw 消費代理的全球 Beta 版。這突顯騰訊專注於工具、記憶體和工作流程的「韁繩」層,以主宰代理時代。
Qwen3.6-35B-A3B 的全新無審查激進變體發布,支援 K_P 量化與完整多模態功能。零拒絕、無能力損失,優化本地推理。包含多種量化版本、視覺 mmproj 與 262K 上下文。

Qwen3.5-35B-A3B(3B 活躍參數 MoE 模型)以「編輯後驗證」策略,在 SWE-bench Verified Hard 達 37.8%,逼近 Claude Opus 4.6 的 40%。此簡單每編輯後驗證,從 22% 基準大幅提升。全基準達 67%,匹敵更大模型。

美國新創 Poolside 推出 Laguna XS.2,這是免費 Apache 2.0 開源 33B 參數 MoE 模型,專為單 GPU 本地代理編碼優化。他們還發布專有 225B Laguna M.1 用於企業,以及工具「pool」和「shimmer」。兩模型皆從頭訓練,M.1 暫時透過 API 免費提供。

發布所有四款 Gemma 4 模型(2.3B 至 31B)的無審查版本,使用 MoE 專家消滅術與自動化研究迴圈。基準測試拒絕率降至 0.4-3.2%。Hugging Face 上提供 BF16 與 GGUF 量化。
基準測試顯示 Qwen3.5-397B-A17B Q4_K_M 在單 RTX 5090 加 256GB DDR4 RAM 上運行,提示 717 t/s、生成 20 t/s。FFN exps 卸載至 CPU 透過 PCIe 和系統 RAM 實現巨型模型。

StepFun 完全開源 Step 3.5 Flash,釋出 Base 與 Midtrain 權重及 Steptron 框架。此 196B MoE 代理模型下載量已超過 30 萬。

眾智FlagOS已適配阿里雲的Qwen3.5-397B-A17B,這是目前最大的開源多模態MoE模型,擁有3970億總參數及170億激活參數,可無縫部署於沐曦、平頭哥真武及NVIDIA晶片。提供vLLM-plugin-FL統一多晶片推理支援,並驗證BF16雙機16卡部署。開箱即用模型已在HuggingFace及魔搭平台上線。
Unsloth Qwen3.6-35B-A3B UD XL 模型移植 MTP 層,以 GGUF 格式發布於 HuggingFace。基準測試顯示單 RTX 5090 上加速 2.5-6%,但多 GPU 如 2x 5070 Ti + 3090 可達 50%。包含 convert.py 腳本;結果依硬體而異。

使用者展示 Qwen3.5-35B 透過提示及 qwen-code CLI 從研究論文建立完整網頁應用。分享 GitHub 儲存庫包含 research-webapp-skill 範例。模型在 70-80k 脈絡保持優於 Gemma4 26B,可於 16GB RTX 5080 執行。