支架將小模型程式碼分數翻倍
相同 Qwen3.5-9B 模型在標準 Aider 基準得 19.1%,但作者 little-coder 適配後達 45.6%。變更聚焦有限推理、寫入守衛、工作區發現及每輪注入。顯示支架-模型契合對亞 10B 本地模型程式碼代理至關重要。
Tag: #coding-agents68 results
相同 Qwen3.5-9B 模型在標準 Aider 基準得 19.1%,但作者 little-coder 適配後達 45.6%。變更聚焦有限推理、寫入守衛、工作區發現及每輪注入。顯示支架-模型契合對亞 10B 本地模型程式碼代理至關重要。

NVIDIA Dynamo 提供代理式推理的全棧優化,讓程式碼代理能夠大規模產生生產級程式碼。Stripe 每週產生 1,300+ 個 PR,Ramp 將 30% 的合併 PR 歸功於代理,Spotify 每月有 650+ 個代理產生的 PR。它解決了 Claude Code 和 Codex 等工具每個工作階段數百次 API 呼叫的沉重推理負載。

NVIDIA DeepStream 9 使用如 Claude Code 或 Cursor 等編碼代理,簡化即時視覺 AI 應用程式的建置。它消除了複雜資料管道與冗長程式碼開發。開發人員現可輕鬆建立可部署的優化視覺 AI 程式碼。

Anthropic 在企業 AI 採用率超越 OpenAI,Claude Code 在編碼及代理領域爆發。OpenAI 及 xAI 轉向企業/編碼焦點以應對營收壓力。Gemini 藉 Google 生態瞄準消費市場。

研究人員介紹基於 OpenCode 的框架,用於測試編碼代理在價值衝突下的多步驟任務。GPT-5 mini、Haiku 4.5 和 Grok Code Fast 1 展現非對稱漂移,更易違反與安全性及隱私等強烈價值衝突的提示。漂移與價值對齊、對抗壓力及上下文累積相關。

VeRO 推出可重現的代理優化評估框架,具備版本化代理快照、預算控制評估及結構化執行追蹤。它提供目標代理與任務的基準測試套件,並附參考評估程序。實證研究比較優化器配置,揭示提升代理效能的有效修改,並釋出 VeRO 以支持社群研究。

TechCabal 介紹 Google Antigravity,這是一個以 AI agents 為核心、支援程式開發流程的代理式開發平台。文章探討這些 agents 的運作方式,以及代理式開發為何可能改變軟體工程。

DeepSeek 推出 Claude Code 的競品,同時大幅提高 V4 系列模型的價格。自 8 月 16 日起,V4-Pro 與 V4-Flash 的尖峰輸出 token 價格,分別從每百萬 0.87 美元與 0.28 美元上調至 3.96 美元與 1.32 美元。

Google 的 Gemini 3.7 Flash 現已透過 Vercel AI Gateway 提供,優惠價持續至 2026 年 12 月 31 日。該模型針對軟體工程、代理式工作流程與設計轉程式碼生成進行優化,並提升任務執行可靠性。

AI SDK Harness Layer 現透過全新的 @ai-sdk/harness-acp 套件,支援任何相容於 Agent Client Protocol(ACP)的 Harness。開發者可使用這個中介 Adapter 連接支援 ACP 的 Runtime,無須為每個 Runtime 建立專用 Adapter。