
Anthropic 發布 Claude Fable 5,SWE-bench 測試突破 95%
Anthropic 發布了 Claude Fable 5 編碼模型,在 SWE-bench 基準測試中達到 95.0% 的突破性成績。同時,該公司啟動了名為 Claude Science 的內部藥物研發項目,標誌著其業務正向垂直領域深度滲透。
Tag: #coding-agent22 results

Anthropic 發布了 Claude Fable 5 編碼模型,在 SWE-bench 基準測試中達到 95.0% 的突破性成績。同時,該公司啟動了名為 Claude Science 的內部藥物研發項目,標誌著其業務正向垂直領域深度滲透。

DeepSeek 放棄了非商業化立場,獲得 70 億美元融資以推動大規模招聘與擴張。該公司正推出「Harness AI」編碼代理,旨在與 Anthropic 的 Claude Code 直接競爭。
Cursor 發布了全新 AI 模型「Composer 2.5」,其性能媲美 Claude Opus 4.7 與 GPT-5.5 等頂尖模型,但成本僅為其十分之一。該模型在 Artificial Analysis 的編碼代理基準測試中排名第三。

安全研究人員發現了一種名為「Agentjacking」的漏洞,攻擊者可以利用偽造的錯誤報告劫持 AI 編碼代理。這種攻擊方式無需惡意軟體或竊取密碼,即可將代理轉變為攻擊工具。

DeepSeek 正在組建一個名為「Harness」的新團隊,專注於 AI 程式碼代理產品。該計畫旨在直接對標 Anthropic 旗下的 Claude Code,此消息已由資深研究員陳德里證實。

Pi 是 OpenClaw 的極簡核心框架,系統提示詞與工具定義不到 1000 tokens,僅四工具:read、write、edit、bash,在 Terminal Bench 2.0 排名前五。作者 Mario Zechner 強調讓用戶決定需求,避免 MCP 或 plan mode 等冗餘功能。透過檔案序列化狀態,繞過上下文衰減實現高可靠性。

用戶發布 Qwen3.5 122B 的 Heretic/無審查 INT4 量化版,在 ASUS Ascents 和 DGX Spark 的 256GB RAM 叢集上比密集版更快。分享如「The Cardinal」代理和「The Heretic」速度的自訂設定。強調編碼任務需學習而非僅靠硬體。

OpenAI在6週內推出7項Codex重大更新,包括桌面App、GPT-5.3/5.4模型、Spark推理及Security代理,使用量激增5倍,對抗Anthropic的Claude Code。開發者轉向混合工作流程同時使用兩者。

Anthropic 推出 Claude Code 的 Remote Control,可從智慧手機或 PC 遠端操作本地 AI 程式碼代理。作為研究預覽版提供給 Pro 與 Max 方案用戶。

Cursor 發布了一款 iOS 應用程式,讓開發者在遠離工作站時也能管理並與 AI 程式碼代理互動。該 App 與桌面環境同步,支援會話管理與輸出審查。