🧠較早收集於 18h

CLI-Gym 使 Terminal-Bench 解決率暴漲 20%

CLI-Gym 使 Terminal-Bench 解決率暴漲 20%
PostLinkedIn
🧠閱讀原文: 机器之心
#agent-bench#data-scaling#docker-envscli-gymcli-gymterminal-benchlibercoderhuawei

💡20% Terminal-Bench jump via open data pipeline—scale your CLI agents now

⚡ 30-Second TL;DR

有什麼變化

從 29 個基礎鏡像構建 1655 個高可靠 CLI 任務環境

為什麼重要

打破環境交互 Agent 的數據瓶頸,縮小開源與閉源模型差距。實現超出代碼生成的規模化 Agentic Coding。

下一步行動

Clone CLI-Gym GitHub repo and fine-tune on your Terminal-Bench agents.

誰應關注:Researchers & Academics

關鍵要點

  • 從 29 個基礎鏡像構建 1655 個高可靠 CLI 任務環境
  • 291 條成功軌跡帶來 Terminal-Bench 20%+ 解決率提升
  • LiberCoder-32B:+28.6% 至 38.9%;235B:+21.1% 至 46.1%
  • 自動化環境劣化生成問題與測試
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 机器之心

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。