REAP:從生產環境數據自動化建構編碼代理基準測試
REAP 是一個全新的框架,透過從互動式生產環境的使用數據中提取資訊,自動化建構編碼代理(Coding Agent)的基準測試。此研究旨在縮小合成基準測試與真實軟體工程任務之間的差距。
Tag: #coding-agents68 results
REAP 是一個全新的框架,透過從互動式生產環境的使用數據中提取資訊,自動化建構編碼代理(Coding Agent)的基準測試。此研究旨在縮小合成基準測試與真實軟體工程任務之間的差距。

阿里巴巴在 Qoder 平台上針對其 Qwen3.7-Max 和 Qwen3.7-Plus 模型推出了高達 80% 的大幅降價。此策略旨在吸引全球開發者,並與 Anthropic 等美國 AI 供應商展開直接競爭。

DeepSWE 是一個全新的開源基準測試,旨在評估前沿 AI 模型在真實軟體工程任務中的表現。它強調無污染的任務設計、高度的儲存庫多樣性以及基於軟體行為的驗證機制。

一名開發者回報 Gemini 3.5 在 Agent IDE 中執行任務時,誤刪了超過 2.8 萬行程式碼並損壞了 Firebase 設定。此事故導致系統後台持續出現 404 錯誤長達 33 分鐘。

據報導,DeepSeek 正於北京組建名為「Harness」的新團隊,旨在開發 AI 編碼代理產品。此舉將使該公司與 Anthropic 近期推出的 Claude Code 展開直接競爭。

Together AI 發布了針對編碼代理的全新基準測試,顯示其在效能上顯著優於 TensorRT-LLM 與 Claude Opus。測試結果強調了在大規模推理中,吞吐量、首字延遲與成本效益的顯著提升。

Salesforce 執行長 Marc Benioff 宣布將投入 3 億美元購買 Anthropic 的 Token,主要用於驅動 AI 程式開發代理。該公司旨在利用這些代理來簡化開發流程並降低內部建置成本。

Terminus-4B 是經 SFT 和 RL 微調的 Qwen3-4B 模型,專門用於代理終端執行任務。它在 SWE-Bench Pro 和 C# 基準上匹配或超越 Claude Sonnet/Opus 和 GPT-5.3-Codex 等前沿模型,無性能損失下減少主代理 30% token 使用量。這實現編碼代理中高效的子代理隔離處理冗長任務。
騰訊混元Hy3 preview上線兩週,Token調用量已超過上一代Hy2模型總量的10倍,尤其在程式碼和智能體場景增長明顯。WorkBuddy、CodeBuddy及Qclaw等應用總增長幅度超過16.5倍。

Vercel AI Gateway 現提供 GPT-5.5 和 GPT-5.5 Pro,專為程式設計、電腦使用、知識工作及研究等長時間代理任務優化。這些模型比前一代更具 token 效率,並擅長在大規模程式碼庫中維持上下文。GPT-5.5 Pro 適用於商業及技術領域的嚴苛多步驟工作流程。