
Mistral 推出 Leanstral 程式碼代理
Mistral AI 發布 Leanstral-2603,這是首個適用於 Lean 4 證明助理的開源程式碼代理。基於 Mistral Small 4 系列建構,提供多模態功能、256k 上下文,並在證明工程方面表現出色。以 Apache 2.0 授權在 Hugging Face 上提供。
Tag: #moe72 results

Mistral AI 發布 Leanstral-2603,這是首個適用於 Lean 4 證明助理的開源程式碼代理。基於 Mistral Small 4 系列建構,提供多模態功能、256k 上下文,並在證明工程方面表現出色。以 Apache 2.0 授權在 Hugging Face 上提供。
中國大模型創業公司階躍星辰開源 Agent 基座模型 Step 3.5 Flash 的預訓練權重(Base)、中訓練權重(Midtrain)及 Steptron 訓練框架。採用稀疏 MoE 架構,總參數 1960 億,推理僅激活約 110 億參數。單請求代碼任務推理速度最高達 350 TPS。

r/LocalLLaMA 的 Reddit 貼文強調 Hugging Face 上的 Qwen/Qwen3.5-122B-A10B 模型。可能是擁有 122B 總參數的巨型 MoE 模型。這標誌本地部署的重大開源發布。
阿里巴巴的千問 3.5 登上 Hugging Face 開源模型排行榜首位。中國模型佔據前十名中的 8 席。该模型總參數 3970 億,僅激活 170 億以提升效率。
這篇技術深度分析探討了 Moonshot AI 的 Kimi K3,這是一款擁有 2.78 兆參數的開源權重模型。內容涵蓋了 Kimi Delta Attention 與 Stable LatentMoE 等架構創新。

USAF 是一種針對混合專家模型 (MoE) 的新型稀疏微調方法,讓原本僅能進行推論的硬體也能執行微調。透過訓練稀疏專家權重與路由器而非傳統適配器,大幅降低了本地模型客製化的門檻。
本研究探討了在固定 k 值的預訓練模型上進行後設適應性 MoE(AMG)門控。研究結果顯示,對分佈平坦的路由機制應用閾值門控會導致訊號丟失,而非提升效率。
DeepReinforce-AI 已發布 Ornith-1.0 模型系列,包含從 9B 到 397B 參數的多種規模。該發布聲稱在多項基準測試中達到業界領先水準。

JetBrains 推出了 Mellum2,這是一款全新的 12B 參數混合專家 (MoE) 模型。此次發布標誌著該公司在專業 AI 模型開發領域的持續擴張。

Stepfun 發布了 Step 3.7 Flash,這是一款擁有 196B 參數的稀疏 MoE 模型,專為 AI Agent 工作流程進行了優化。該模型具備每秒 400 token 的高速推理能力與原生工具調用功能。