
利用代理委員會提升弱推理模型效能
這項研究表明,透過組織弱推理模型委員會,其效能可媲美 Gemini 3 Pro 等頂尖模型。該系統利用驗證器支援的選擇機制,能有效地從弱模型的輸出池中識別出正確的解決方案。
Tag: #agentic-workflows79 results

這項研究表明,透過組織弱推理模型委員會,其效能可媲美 Gemini 3 Pro 等頂尖模型。該系統利用驗證器支援的選擇機制,能有效地從弱模型的輸出池中識別出正確的解決方案。

GitLab 深化與 Anthropic Claude 模型的整合,將其設為 GitLab Duo Agent Platform 的預設模型,用於程式碼生成、審核、代理聊天及漏洞修復。此設計確保 AI 在 SDLC 中遵守企業管治、合規及審計追蹤。企業可透過 Google Cloud Vertex AI、AWS Bedrock 或 Claude Marketplace 存取 Claude。
OpenAI 在 Responses API 中引入 WebSockets,以加速代理工作流程。部落格深入探討 Codex 代理迴圈,強調 WebSockets 和連線範圍快取如何減少 API 開銷。這大幅改善模型延遲。

Cloudflare Workflows 重新架構控制平面,支持更高並行度和建立速率。此耐用執行引擎現可擴展多步驟代理應用。滿足背景 AI 代理需求。
Cloudflare 已將 OpenAI 的 GPT-5.4 和 Codex 整合至其 Agent Cloud 平台。這讓企業能夠建置、部署並擴展 AI 代理,用於真實世界任務。此整合強調代理工作流程的速度與安全性。

Anthropic 的 Claude Code 和 Cowork 現在能透過螢幕導航、點擊、滾動、存取檔案及執行工具來控制電腦,無需特殊整合。它支援從手機指派的 Dispatch 任務,需要使用者批准,目前為 macOS 上 Claude Pro/Max 訂閱者的研究預覽。

HyEvo 是一個自動化工作流程生成框架,結合機率性 LLM 節點進行語義推理與確定性程式碼節點實現高效執行。它採用 LLM 驅動的多島嶼演化策略,透過 reflect-then-generate 機制依執行回饋優化混合工作流程。實驗顯示在推理與程式碼基準測試中超越現有方法,推理成本降低至多 19 倍、執行延遲降低 16 倍。

AI 正從文字提示回應轉向可程式化執行介面。GitHub Copilot SDK 讓開發者直接在應用程式中整合代理式工作流程。此轉變標誌「AI 純文字」時代的結束。

Alphabet 的 Google 正在五角大樓 300 萬員工中部署 AI 代理。這些代理將自動化非機密環境中的例行工作。一位高級國防官員確認了這一計劃。

Andrej Karpathy 的「九九大法」說明為何 90% AI 可靠性不足以用於生產環境,每多一「九」皆需等量工程努力。在多步驟代理工作流程中,失敗會指數級累積,企業級需達每步 99.99% 成功率。文章概述 SLO 指標及九大槓桿如工作流程圖來提升可靠性。