🦙最新收集於 5h

新基準測試深入探究 AI 軟體工程能力

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#software-engineering#benchmarking#reverse-engineering#code-migrationai-coding-benchmarksgpt-6 astraqwen3.8 27bprogram-benchsre-benchcode migration

💡傳統程式設計分數忽略逆向工程與遷移能力;這些測試揭示程式代理真正的弱點。

⚡ 30-Second TL;DR

有什麼變化

Program-Bench 要求代理只能根據編譯後的二進位檔與文件,在沒有反編譯器或網路的情況下重建完整程式碼庫。

為什麼重要

這些基準測試透過考察逆向工程、系統理解與語言遷移,可能更貼近代理型軟體工程的實際能力。它們也可能揭露傳統或已趨於飽和的程式設計基準所掩蓋的能力差距。

下一步行動

將 Program-Bench 與 Code Migration 納入你的程式代理測試套件,以評估二進位理解與跨語言重建能力,而不只是程式碼生成。

誰應關注:Researchers & Academics

關鍵要點

  • Program-Bench 要求代理只能根據編譯後的二進位檔與文件,在沒有反編譯器或網路的情況下重建完整程式碼庫。
  • GPT-6 Astra 在 Program-Bench 得分 5.5%,Fable 5.1 為 5.1%,Qwen3.8 27B 則為 0%。
  • SRE-Bench 中,GPT-6 Astra 得分 88%,GPT-5.6 Sol 為 55.9%,Claude Opus 5 為 12.5%。
  • 在 Code Migration 中,GPT-6 Astra 達到 67.7%,Qwen3.8 27B 則為 14.2%。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。