
100B「大象」模型奪SOTA,Token效率頂尖
神秘模型「大象」僅1000億參數即達成最先進(SOTA)效能。其Token效率出色,適合高效AI推理。此消息來自量子位。
Tag: #token-efficiency30 results

神秘模型「大象」僅1000億參數即達成最先進(SOTA)效能。其Token效率出色,適合高效AI推理。此消息來自量子位。

Writer 推出旗艦模型 Palmyra X6,以及旨在降低 AI Agent Token 用量的升級版「harness」。該模型是 Z.ai 開源 GLM-5.2 的後訓練變體,現已提供給 Writer 客戶使用。

Microsoft 推出 MAI-Code-1.1-Flash,這款面向 GitHub Copilot 的升級程式設計模型具備更佳的基準測試表現,Token 生成速度提升 25%,完成相同任務所需的 Token 數量降低 25%。其價格降至初代模型的四分之一,並新增原生影像理解能力。

CASIA 研究人員發表 PhiZero,這是一個先以學習而來的離散「物理語言」進行推理,再生成影片的世界模型。該方法將表示四秒影片所需的 token 數量降低約 175 倍。

阿里巴巴研究人員推出了 SkillWeaver 框架,透過執行圖與回饋迴圈進行組合式工具路由,優化 AI 代理效能。此方法避免了為每個子任務載入整個工具庫,從而顯著降低了 Token 消耗。

這項研究顯示,結合近期工具互動的選擇性保留與自動摘要,能顯著提升企業工作流程中 LLM 代理的效能。該方法在達到 91.6% 任務完成率的同時,相較於保留完整歷史紀錄,大幅降低了 Token 消耗與推論時間。

NVIDIA 推出 Nemotron 3 Ultra,旨在解決多代理工作流程中的效率挑戰。該模型專為處理複雜推理、工具調用與上下文管理而設計,同時能最小化長週期任務中的 Token 開銷。

GPT-5.5 在基準測試中並非領先,但工程師卻熱狂不已。其熱門原因在於與 Codex 的強大組合、優異令牌效率,以及「最後自走到底」的能力。

OpenAI 和 Anthropic 發布 GPT-5.5 和 Claude 4.7 的提示詞指南,警告舊式逐步提示現在會增加噪音。新模型適合結果導向指令、更少絕對規則及明確停止條件。使用者須明確定義目標和個性以達最佳效能。

螞蟻集團推出 Ling-2.6-Flash,一款 104B 參數 AI 模型,優化令牌效率與成本節省。該模型因大量令牌使用迅速流行。它推動更經濟的大型 AI 部署。