🧧近期收集於 41h

Qwen Code 煙霧測試結束,未發布基準分數

Qwen Code 煙霧測試結束,未發布基準分數
PostLinkedIn
🧧閱讀原文: Qwen (GitHub Releases: qwen-code)

💡Qwen Code 基準測試在基礎設施層失敗,模型效能仍無法衡量。

⚡ 30-Second TL;DR

有什麼變化

Qwen Code v0.21.12 搭配 qwen3.7-plus 模型接受測試。

為什麼重要

由於基礎設施故障阻止有效評分,此次發布未提供 Qwen Code 在任一基準上的效能證據。開發者應將其視為測試流程健康度訊號,而非模型品質結果。

下一步行動

在使用 Qwen Code v0.21.12 進行基準比較前,請檢查 GitHub Actions 執行編號 31883346071,並重新執行 SWE-bench Verified 與 Terminal-Bench 2.0 煙霧測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen Code v0.21.12 搭配 qwen3.7-plus 模型接受測試。
  • SWE-bench Verified 與 Terminal-Bench 2.0 各完成 1/1 個煙霧測試工作。
  • 兩次執行均為 0 個已解決案例、0 個未解決案例、0 個執行錯誤,以及 1 次基礎設施故障。
  • 由於測試不可評分或遭隔離,且有效評分結果為零,因此未發布分數。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen3.7-plus 模型代表了阿里雲 Qwen 系列在代碼生成領域的最新迭代,重點強化了對複雜軟體工程任務的推理能力。
  • SWE-bench Verified 是目前評估 AI 模型解決真實 GitHub 問題能力的核心基準,此次測試失敗反映了模型在處理大規模代碼庫環境配置時的基礎設施挑戰。
  • Terminal-Bench 2.0 專注於評估模型在終端環境下的操作與除錯能力,是 Qwen Code 針對自動化開發代理(Agent)優化的關鍵測試指標。
  • 此次煙霧測試的基礎設施故障可能與模型在執行環境(Sandbox)中的權限管理或依賴安裝衝突有關,而非模型本身的邏輯生成能力問題。
  • Qwen 開發團隊採取了嚴格的發布標準,在無法確保評測結果可重現(Reproducible)的情況下,主動選擇不公開基準分數以維持數據透明度。
📊 競品分析▸ Show
特性/模型Qwen3.7-plus (Code)Claude 3.5 SonnetGPT-4o (OpenAI)
SWE-bench 表現測試中 (未公開)業界領先高性能
終端操作能力針對性優化強大中等
開源/閉源開源權重 (預期)閉源閉源
定價策略具競爭力 (API)高階定價高階定價

🛠️ 技術深入

  • 模型架構:Qwen3.7-plus 採用了混合專家模型(MoE)架構,針對代碼語法與邏輯推理進行了長上下文(Long-context)微調。
  • 執行環境:測試環境基於 Docker 容器化技術,旨在模擬真實的開發者終端與 GitHub 儲存庫環境。
  • 故障機制:初步分析顯示基礎設施故障源於測試腳本在環境初始化階段與 qwen3.7-plus 的 API 響應格式不匹配,導致執行器(Executor)超時。

🔮 前景展望AI analysis grounded in cited sources

Qwen Code 將在下一版本中整合更穩定的沙盒執行環境。
此次測試失敗暴露了基礎設施與模型交互的瓶頸,迫使團隊優先優化執行器穩定性。
Qwen3.7-plus 將在未來一個月內發布修正後的基準測試報告。
團隊已確認模型具備測試資格,僅因基礎設施故障暫停發布,修復後將重啟評測。

時間線

2025-09
Qwen 2.5 系列發布,確立代碼生成能力基礎。
2026-03
Qwen 3.0 模型發布,大幅提升多模態與邏輯推理性能。
2026-07
Qwen3.7-plus 預覽版發布,針對開發者工具鏈進行深度優化。
2026-08
Qwen Code v0.21.12 進行 SWE-bench 與 Terminal-Bench 煙霧測試。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code)