後設適應性 MoE 門控的實證基準測試
本研究探討了在固定 k 值的預訓練模型上進行後設適應性 MoE(AMG)門控。研究結果顯示,對分佈平坦的路由機制應用閾值門控會導致訊號丟失,而非提升效率。
Tag: #model-optimization39 results
本研究探討了在固定 k 值的預訓練模型上進行後設適應性 MoE(AMG)門控。研究結果顯示,對分佈平坦的路由機制應用閾值門控會導致訊號丟失,而非提升效率。

Xiaomi 研究人員推出了 HarnessX 框架,將 AI 軟體架構視為可組合物件,並能進行自動化優化。透過動態調整提示詞與工具整合,該框架顯著提升了 AI 效能,特別是在小型基礎模型上表現優異。

HDD-RoPE 是一種新的位置編碼技術,將序列位置視為多維度,允許更靈活的旋轉軸。與標準的 xPos Transformer 相比,它在 TinyStories 資料集上展現了更快的收斂速度。

Apodex 發布了開源權重的「Smol」模型(0.8B、2B、4B),專為事實查核與工具基礎合成等子任務進行了優化。這些模型旨在透過將驗證任務從大型模型中卸載,來提高長程代理工作流程的效率。

Model Best 發布了開源框架 BitCPM-CANN,旨在協助在國產 AI 加速器上進行 1.58-bit 模型訓練。此進展顯著降低了高效能模型部署的硬體門檻。

一家中國 AI 公司成功突破技術瓶頸,將 600 億參數的大型語言模型部署於手機硬體上。此成就強調了從框架、晶片到方法論的全面國產化閉環。

SkillSmith 是一個全新的編譯器執行時框架,透過將原始技能轉換為最小化的邊界導向執行介面,優化 LLM Agent 的效能。此方法消除了冗餘的推理與上下文注入,顯著降低了 Token 使用量、延遲與營運成本。

Vercel 分析了超過 20 萬個團隊、長達七個月的生產流量數據,揭示了成本與 Token 使用量如何根據應用場景產生分歧。數據顯示,高風險的 B2B 應用優先選擇推理能力強的模型,而 B2C 應用則傾向於高性價比、高流量的模型。

用戶認為Claude近期變得較不聰明。效率優化與能力削弱在體驗感上並無區別。這被描述為新模型發布前的「黑暗時刻」。

DeepMind 推出 Gemini 3.1 Flash-Lite,為 Gemini 3 系列中最快且最具成本效益的模型。專為大規模智能設計,可高效部署於高容量應用中。