🐯虎嗅•較早收集於 3h
ProgramBench 擊潰頂級 AI 程式 0% 完成率

💡新基準顯示頂級 LLM 無法重建真實軟體—AI 程式設計師必讀(42字)
⚡ 30-Second TL;DR
有什麼變化
所有領先模型在無原始碼重建 FFmpeg、SQLite 等專案上完成率 0%。
為什麼重要
凸顯 AI 軟體工程能力的關鍵差距,推動代理長期規劃需求。可能將焦點從程式碼生成轉向系統架構訓練。此類基準將驅動未來模型改進。
下一步行動
下載 ProgramBench 資料集並測試你的微調程式碼模型在 FFmpeg 重建任務上。
誰應關注:Researchers & Academics
關鍵要點
- •所有領先模型在無原始碼重建 FFmpeg、SQLite 等專案上完成率 0%。
- •Claude Opus 4.7 以 3%「幾近完成」(95%+)任務領先;模型偏好單體單檔程式碼。
- •C/C++ 表現優於 Rust;簡單 CLI 工具成功率高於複雜系統。
- •採用代理驅動模糊測試的行為等價評分,而非程式碼相似度。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •ProgramBench 引入了『行為等價性驗證』(Behavioral Equivalence Verification)機制,透過自動化測試套件對模型生成的二進位檔案進行動態執行,而非僅依賴靜態程式碼比對,這大幅提高了評估的嚴苛度。
- •研究發現模型在處理大型專案時,普遍存在『上下文遺忘』與『依賴鏈斷裂』問題,導致模型在處理跨檔案引用(Cross-file references)時,無法正確連結複雜的標頭檔與函式庫路徑。
- •該基準測試揭示了當前 AI 代理(Agentic AI)在處理『軟體工程生命週期』中,缺乏對建構系統(如 Makefile, CMake)的深度理解,導致模型在編譯階段即頻繁失敗。
📊 競品分析▸ Show
| 特性 | ProgramBench | SWE-bench | HumanEval |
|---|---|---|---|
| 評估維度 | 完整專案重建與行為等價 | GitHub Issue 修復 | 單一函式程式碼生成 |
| 任務複雜度 | 極高(系統級) | 中高(模組級) | 低(演算法級) |
| 評分機制 | 動態執行與模糊測試 | 單元測試通過率 | 函數正確性測試 |
🛠️ 技術深入
- •評估環境:採用隔離的 Docker 容器環境,確保模型無法存取外部網路或預先存在的專案快取。
- •測試集組成:包含 FFmpeg, SQLite, libpng 等具有高度複雜依賴關係的開源 C/C++ 專案,並移除所有原始碼,僅提供 API 文件與建構規格。
- •評分演算法:採用『行為等價性分數』(Behavioral Equivalence Score),透過對比模型產出程式與原始專案在相同輸入下的輸出(Output Diff)及執行路徑覆蓋率(Code Coverage)進行加權計算。
- •代理架構:要求模型具備自主規劃能力,需自行決定檔案結構、編寫建構腳本並處理編譯錯誤回饋(Compiler Feedback Loop)。
🔮 前景展望AI analysis grounded in cited sources
AI 代理開發將從『程式碼生成』轉向『系統架構規劃』。
ProgramBench 的結果證明僅具備局部程式碼編寫能力已不足以應對真實世界的軟體工程需求。
未來模型訓練將納入編譯器錯誤日誌作為強化學習的獎勵訊號。
模型在 ProgramBench 中的失敗多源於無法有效解讀編譯器回饋以進行自我修正。
⏳ 時間線
2023-10
SWE-bench 正式發布,確立了以 GitHub Issue 為基礎的 AI 軟體工程評估標準。
2026-03
ProgramBench 基準測試框架正式公開,旨在挑戰 AI 在無原始碼環境下的系統重建能力。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗


