
強化學習讓滑動視窗注意力機制在數學推理中更具競爭力
SWARR 提出了一種結合監督式微調與強化學習的兩階段方法,旨在將滑動視窗注意力機制應用於複雜的數學推理。此方法有效縮小了線性複雜度模型與標準自注意力模型之間的效能差距。
Tag: #llm-optimization47 results

SWARR 提出了一種結合監督式微調與強化學習的兩階段方法,旨在將滑動視窗注意力機制應用於複雜的數學推理。此方法有效縮小了線性複雜度模型與標準自注意力模型之間的效能差距。
Cohere 推出了 North Mini Code,這是他們首款專為開發者工作流程與程式編寫任務優化的模型。此發布標誌著其模型產品組合的策略性擴展,旨在更好地支援軟體工程應用場景。

騰訊混元開發了 Stem 稀疏注意力算法,將首字延遲降低了 3.6 倍。該方法透過 Token 位置衰減 (TPD) 和輸出感知度量 (OAM) 兩項創新,僅需 25% 的算力預算即可達到接近稠密注意力的精度。

OpenAI 升級了 ChatGPT 的記憶能力,並針對免費版使用者進行了顯著優化。此次更新涉及對聊天機器人底層「夢境」(dreaming)架構的改進。

NVIDIA 推出 Nemotron 3 Ultra,旨在解決多代理工作流程中的效率挑戰。該模型專為處理複雜推理、工具調用與上下文管理而設計,同時能最小化長週期任務中的 Token 開銷。

本研究引入「交接債務」(handoff debt)概念,量化 AI 程式設計代理在接手未完成任務時的效率損失。實驗顯示,提供結構化上下文能顯著降低 Token 使用量與代理執行次數,優於僅提供原始儲存庫存取權。
清華大學團隊創立的萬格智元獲數千萬元融資,發布端側推理引擎cPilot與智能平台Amis。這些工具旨在通過優化大模型本地部署,降低硬件成本與Token消耗。

來自 Meta、Google 及多所大學的研究人員推出了 AutoTTS 框架,能自動發掘最佳的測試時縮放(TTS)策略。此方法消除了手動調整啟發式規則的需求,讓模型在維持準確度的同時,能有效管理推理預算。

MiniMax 公布了 M2 系列模型的技術細節,並預告了即將推出的 M3 模型。該模型採用全新的稀疏注意力機制,使長文本解碼速度提升了 15.6 倍。

一位 OpenAI 員工分享了一種利用 Codex 自我蒸餾技術來自動化重複性編碼工作的方法。透過使用特定的提示詞,開發者可以顯著減少手動勞動。