
Google 以創辦人模式押注 Gemini 4
據報 Google 將先確保前沿 AGI 開發所需的算力,再把剩餘資源分配給 Search、YouTube、Cloud 等業務,而 Gemini 4 已進入預訓練階段。文章認為,Sergey Brin 的直接介入可能降低官僚流程,並重新整合 Google 的模型、TPU 基礎設施、雲端服務與應用生態。
Tag: #coding-agents68 results

據報 Google 將先確保前沿 AGI 開發所需的算力,再把剩餘資源分配給 Search、YouTube、Cloud 等業務,而 Gemini 4 已進入預訓練階段。文章認為,Sergey Brin 的直接介入可能降低官僚流程,並重新整合 Google 的模型、TPU 基礎設施、雲端服務與應用生態。

Herdr 現在可讓 Claude Code、Codex 與 OpenCode 分別在獨立的 Vercel Sandbox 中執行,並以各自的終端機風格窗格管理。專案會上傳至隔離環境,代理產生的變更則以 Git patch 返回,供使用者明確核准與套用。

Amazon Bedrock Agent Skills 讓 coding agent 能管理 Automated Reasoning 政策的完整生命週期。這套開源技能可透過可重複的工程流程建置、審查、測試、除錯、部署與驗證自訂政策。

Google 據報正洽談收購舊金山 AI 新創 Mechanize,該公司約有 35 名員工。Mechanize 訓練能夠撰寫軟體的 AI 代理,而這筆交易的價值可能超過 15 億美元。

Vercel Sandbox 現已整合 Devin Outposts,讓每個 Devin 工作階段都擁有獨立的 Sandbox microVM。工作階段編排與命令執行會在客戶的 Vercel 專案中運行,而 Cognition 仍負責 Devin 的代理迴圈。

隨著智譜與 MiniMax 加速發展,中國AI產業正在尋找一個相當於 Anthropic 的「Claude Code」的突破點,以推動開發者採用。

AgentLens 是一個全新的開源基準測試,旨在根據編碼代理的完整互動軌跡進行評估,而非僅僅依賴二元通過/失敗的結果。它結合了形式驗證與 LLM 生成的評論,為代理的行為與效能提供具體的分析見解。

VERITAS 是一個領域無關的驗證框架,利用 CLI 編碼代理自動化科學研究論文的驗證過程。它能提取論文主張、執行方法論,並提供加權驗證分數以評估研究的有效性。

Condense.chat 發布了一項新的代理服務,旨在為 AI 編碼代理壓縮上下文。透過使用兩款內部模型,該服務能在深度編碼會話中將 Token 消耗及相關成本降低高達 72%。

包括 Alibaba、Tencent 和 ByteDance 在內的中國科技巨頭已推出 AI 程式碼代理,旨在與 Anthropic 的 Claude Code 競爭。這些工具透過提供在地化與優化的工作流程,試圖搶佔開發者市場。