🧧最新收集於 1m

Qwen Code 發布 Terminal-Bench 煙霧測試 r5

Qwen Code 發布 Terminal-Bench 煙霧測試 r5
PostLinkedIn
🧧閱讀原文: Qwen (GitHub Releases: qwen-code)

💡了解 Qwen Code 如何端到端驗證 Terminal-Bench proxy-prelude 修復。

⚡ 30-Second TL;DR

有什麼變化

新增單案例端到端煙霧測試。

為什麼重要

這是一次針對驗證的版本更新,而非大幅提升功能的版本。它有助於開發者確認 proxy-prelude 修復能在端到端 Terminal-Bench 情境中正常運作。

下一步行動

在你的 Qwen Code CI 環境中執行 r5 單案例煙霧測試,並驗證 Terminal-Bench proxy-prelude 路徑。

誰應關注:Developers & AI Engineers

關鍵要點

  • 新增單案例端到端煙霧測試。
  • 針對 DSW EAS SWE + TB 測試流程。
  • 驗證 Terminal-Bench proxy-prelude 修復後的行為。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Terminal-Bench 是專為評估大型語言模型在真實終端環境(Terminal Environment)中執行軟體工程任務能力而設計的基準測試集。
  • proxy-prelude 問題通常涉及在沙盒環境中執行代碼時,預載入腳本或代理配置導致的環境初始化失敗或權限衝突。
  • DSW (Data Science Workshop) 與 EAS (Elastic Algorithm Service) 是阿里雲提供的開發與部署基礎設施,Qwen Code 透過此架構實現自動化評測。
  • r5 版本標誌著 Qwen Code 在自動化軟體工程(SWE)評測流程中,從單純的代碼生成轉向更嚴格的系統級整合驗證。
  • 此更新強化了模型在處理複雜終端指令序列時的穩定性,減少了因環境配置錯誤導致的誤判。
📊 競品分析▸ Show
特性Qwen Code (Terminal-Bench)SWE-benchDevin (Cognition AI)
評測重點終端環境執行與系統整合GitHub Issue 真實修復自主軟體工程代理
執行環境阿里雲 DSW/EAS 容器化環境Docker 隔離環境專有雲端沙盒
基準測試側重終端指令與環境交互側重代碼庫理解與修復側重端到端任務完成度

🛠️ 技術深入

  • 採用基於容器的動態環境配置,確保每次測試的隔離性與可重複性。
  • 引入 proxy-prelude 機制以模擬真實開發者的終端環境變數與網路代理設定。
  • 煙霧測試(Smoke Test)流程整合了自動化腳本,用於快速驗證模型在執行複雜 Shell 指令時的語法正確性與環境適應性。
  • 針對 DSW/EAS 基礎設施進行了 API 介面優化,以降低模型在執行長任務時的延遲。

🔮 前景展望AI analysis grounded in cited sources

Qwen Code 將進一步提升在複雜終端環境下的自主除錯能力。
透過持續優化 Terminal-Bench 的環境模擬,模型將能更精準地識別並修復因環境配置導致的執行錯誤。
阿里雲將推動 Terminal-Bench 成為開源軟體工程模型評測的標準之一。
隨著煙霧測試流程的標準化,該基準測試有望被更廣泛地應用於評估其他代碼模型在真實終端操作上的表現。

時間線

2024-04
Qwen1.5-Code 系列模型發布,初步展現代碼生成能力。
2025-01
Qwen-2.5-Coder 發布,顯著提升在 SWE-bench 等基準測試上的表現。
2026-05
Terminal-Bench 專案啟動,旨在解決模型在終端環境執行任務的評測缺失。
2026-08
Qwen Code 發布 Terminal-Bench r5 版本,強化端到端煙霧測試。

📰 事件追蹤

📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code)