Anthropic CEO:AI自主開發時代已然來臨
Anthropic CEO Dario Amodei 透露,Claude 的新功能幾乎完全由 AI 自主開發,標誌著 AI 智能體已能處理複雜的端到端任務。公司正轉向企業級解決方案,以規避注意力經濟的陷阱。
Tag: #software-engineering63 results
Anthropic CEO Dario Amodei 透露,Claude 的新功能幾乎完全由 AI 自主開發,標誌著 AI 智能體已能處理複雜的端到端任務。公司正轉向企業級解決方案,以規避注意力經濟的陷阱。
Peter Steinberger的團隊使用100個AI代理來自動化軟體工程任務,如PR審查和修復錯誤,每月成本達130萬美元。OpenAI正在贊助這項大規模的自主AI驅動開發實驗。

Anthropic 一位高管透露,該公司目前 90% 的代碼庫已由 AI 生成。這凸顯了軟體開發效率的顯著提升以及 AI 編碼助手技術的成熟。
Anthropic財務長表示,公司目前90%的代碼由AI編寫。這一轉變標誌著員工的角色正從主動執行轉向系統監督。

SWE-Bench 創作者推出 ProgramBench,新基準測試 AI 僅用文件從零重建如 FFmpeg 等真實軟體專案的能力。Claude Opus 4.7、GPT-5 變體及 Gemini 3.1 等頂級模型在完整行為等價上得 0%。這暴露 AI 在全局系統規劃而非局部程式碼生成上的弱點。

本文探討 AI Coding 如何應用於金融科技的軟體開發生命週期。內容重點不只在程式碼生成,更延伸至整合性的工程研發流程。

本文批評了AI編程代理中對「循環工程」的炒作,指出僅讓AI循環執行任務並不等同於有效的解決問題。文章強調需要「駕馭工程」(Harness Engineering)來定義邊界、約束和成功標準,以確保代理的可靠性。
作者指出多角色 Agent 和過長的執行任務往往會導致效率降低、上下文丟失以及錯誤率上升。他建議在 AI 編碼工作流中採用更簡單的端到端架構,並將任務模組化執行。
OpenAI 發布了一項分析,強調 SWE-Bench Pro 評測基準中的重大缺陷。該報告質疑目前用於評估 AI 程式編寫能力的評測方法之準確性與可靠性。

本文概述了 AI 編碼的系統化方法,重點在於透過明確的約束與結構化需求來減少幻覺。它強調應將 AI 視為必須遵守嚴格架構「憲法」的開發者。