
Cursor 使用 RL 訓練 Composer 自我摘要
Cursor 使用強化學習訓練其新 AI 模型 Composer 以實現自我摘要。此功能支援代理式編碼,適用於長時程任務,透過內部測試壓縮程式碼上下文。它提升了處理長時間編碼工作階段的效率。
Tag: #agentic-coding34 results

Cursor 使用強化學習訓練其新 AI 模型 Composer 以實現自我摘要。此功能支援代理式編碼,適用於長時程任務,透過內部測試壓縮程式碼上下文。它提升了處理長時間編碼工作階段的效率。

Y Combinator 支持的 Random Labs 推出 Slate V1,業界首款「群集原生」自主程式碼代理,用於大規模平行複雜工程任務。它從公開測試版推出,使用動態修剪和 Thread Weaving 有效管理大型程式碼庫。此工具定位為「未來 2000 萬工程師」的協作輔助,而非取代人力。

像 OpenClaw 這樣的編碼代理已越過奇點,實現軟體開發 100 倍加速。編碼外的組織瓶頸如今主導,需要流程大修。真正創新在於為無限供給世界重新定義軟體。
Vera 是一種 MIT 授權的程式語言,專為 LLM 而建,而非人類,透過緊密的編譯器回饋迴圈產生更可靠的程式碼。主要特色包括 De Bruijn 索引消除命名錯誤、Z3 驗證的函數合約防止執行時問題,以及結構化診斷用於代理迭代。它編譯至 WebAssembly,測試覆蓋率達 88%,並附代理就緒文件。

Google 的 Gemini 3.7 Flash 現已透過 Vercel AI Gateway 提供,優惠價持續至 2026 年 12 月 31 日。該模型針對軟體工程、代理式工作流程與設計轉程式碼生成進行優化,並提升任務執行可靠性。

據報 Claude Code 將在五天後把自動模式設為預設選項。Anthropic 將自行承擔增加的費用,而這項變更與長時間工作會導致人類表現下降的觀察有關。

Andrej Karpathy 親自測試 Claude Opus 5 的影片吸引近 300 萬人觀看。模型據稱在兩小時內生成約 5,500 行程式碼,但最終產出的遊戲連模型自己都無法遊玩。

GitLab 說明團隊如何在程式碼撰寫階段之外,治理由 Claude 產生的程式碼,涵蓋合併、依賴更新、基礎設施變更與稽核。透過 GitLab MCP server,Claude 的安全性內容可銜接至 GitLab 的掃描、核准政策、漏洞追蹤與合規工作流程。
基準測試 Google 新 Gemma4 對 Alibaba 的 Qwen3.5,在 RTX 4090 上進行本地代理編碼。Qwen3.5-27B 在程式碼品質、可靠性和效率上表現出色,儘管速度較慢。MoE 變體如 Gemma4-26B 較快但複雜任務準確度較低。

自2025年「代理式程式設計」進入主流以來,借助AI快速生成應用的「氛圍程式設計」在開發者中迅速流行,讓幾乎任何人透過自然語言描述就能做出可用應用並試圖以此謀生。開發者警告此趨勢或拖慢蘋果App Store審核進度。