🧧近期收集於 41h

Qwen Code 推出 SWE 與 Terminal-Bench 冒煙測試

Qwen Code 推出 SWE 與 Terminal-Bench 冒煙測試
PostLinkedIn
🧧閱讀原文: Qwen (GitHub Releases: qwen-code)

💡了解 Qwen Code 如何修正 verifier 跳脫問題,並以 SWE 成功作為 Terminal-Bench 的啟動條件。

⚡ 30-Second TL;DR

有什麼變化

新增涵蓋 SWE 與 Terminal-Bench 的單案例端到端冒煙測試。

為什麼重要

這項更新透過驗證完整發布流程,提升 Qwen Code 基準測試與評估管線的可靠性。整合 SWE 與 Terminal-Bench 檢查的開發者,應能減少由 verifier 前置內容跳脫問題造成的誤判失敗。

下一步行動

將 Qwen Code 升級至此版本,並重新執行 SWE 到 Terminal-Bench 的 CI 冒煙測試,以驗證修正後的執行順序與跳脫行為。

誰應關注:Developers & AI Engineers

關鍵要點

  • 新增涵蓋 SWE 與 Terminal-Bench 的單案例端到端冒煙測試。
  • 修正 Terminal-Bench verifier proxy 前置內容的跳脫問題。
  • 調整執行順序,僅在 SWE 成功發布後啟動 Terminal-Bench。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen Code 的此次更新旨在強化 AI 代理在真實軟體工程環境中的自動化除錯與驗證能力,特別是針對複雜的程式碼庫互動。
  • Terminal-Bench 被設計為一個評估模型在終端機環境下執行指令、處理輸出並進行環境互動的基準測試集。
  • 此次修正的跳脫問題(Escaping issue)涉及 verifier proxy 在處理特殊字元時的解析錯誤,這類問題常導致 AI 在執行 Shell 指令時發生語法錯誤。
  • 透過將 SWE 與 Terminal-Bench 串聯執行,Qwen 團隊正在建立一套更嚴謹的 CI/CD 流程,以確保模型在處理真實 GitHub Issue 時的穩定性。
  • 此更新反映了開源模型在 Agentic Workflow(代理工作流)領域的技術演進,重點已從單純的程式碼生成轉向端到端的任務解決能力。
📊 競品分析▸ Show
特性Qwen Code (Agentic)Claude 3.5 Sonnet (Computer Use)OpenAI o1 (Dev)
核心定位開源端到端工程代理視覺化操作與複雜推理高階邏輯與程式碼生成
基準測試SWE-bench / Terminal-BenchSWE-bench VerifiedSWE-bench / 內部評測
執行環境整合式終端機與 Proxy瀏覽器與桌面環境控制雲端沙盒環境

🛠️ 技術深入

  • 引入了基於 Proxy 的驗證機制,用於攔截並過濾模型產生的 Shell 指令,防止惡意或無效操作。
  • 實作了依賴性執行邏輯(Dependency-based execution),確保在 SWE-bench 的環境配置與任務執行成功後,才觸發 Terminal-Bench 的環境測試。
  • 針對終端機輸出(Terminal Output)進行了字元編碼優化,解決了因特殊控制字元導致的解析中斷問題。

🔮 前景展望AI analysis grounded in cited sources

Qwen Code 將進一步整合多模態輸入以增強終端機操作的準確性。
目前的文字介面驗證已趨於成熟,下一步必然是透過視覺化回饋來處理更複雜的 GUI 軟體工程任務。
開源社群將更廣泛地採用 Terminal-Bench 作為評估 AI 代理穩定性的標準。
隨著冒煙測試流程的公開,開發者能更輕易地在本地環境重現並驗證模型在真實終端機下的表現。

時間線

2024-04
阿里雲發布 Qwen1.5 系列,開始強化程式碼生成能力。
2024-09
Qwen2.5-Coder 發布,顯著提升在 SWE-bench 等基準測試上的表現。
2025-03
Qwen Code 引入初步的 Agentic 工作流支援。
2026-08
Qwen Code 推出整合 SWE 與 Terminal-Bench 的端到端冒煙測試。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code)