📄ArXiv AI•較早收集於 15h
Terminus-4B:小型模型挑戰前沿LLM代理任務

💡4B SLM 在代理終端任務超越前沿 LLM,節省 30% token!
⚡ 30-Second TL;DR
有什麼變化
使用 SFT 和基於評分表的 RL(LLM-as-judge)微調 Qwen3-4B。
為什麼重要
Terminus-4B 透過將終端任務卸載至廉價 SLM,降低代理系統成本。它促進不依賴昂貴前沿模型的可擴展多代理架構。開發者可建構更高效的編碼代理。
下一步行動
從 arXiv:2605.03195 下載 Terminus-4B,並於 SWE-Bench 上測試作為子代理。
誰應關注:Developers & AI Engineers
關鍵要點
- •使用 SFT 和基於評分表的 RL(LLM-as-judge)微調 Qwen3-4B。
- •在 SWE-Bench Pro 和內部 C# 基準上減少主代理約 30% token 使用量。
- •彌平與 Claude Sonnet/Opus/GPT-5.3-Codex 的性能差距,甚至超越。
- •提升主代理對子代理輸出的依賴,減少自行終端執行任務。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗