AutoResearch 在 HPO 速度與成本上勝過 Optuna
在 NanoChat 上的實驗顯示,AutoResearch 收斂更快、成本更低,且泛化能力優於 Optuna。它在樣本效率上表現出色,儘管每步驟成本高 2 倍,仍橫跨所有預算範圍佔優。後期迭代開始探索超出參數調整的程式碼變更。
Tag: #code-generation38 results
在 NanoChat 上的實驗顯示,AutoResearch 收斂更快、成本更低,且泛化能力優於 Optuna。它在樣本效率上表現出色,儘管每步驟成本高 2 倍,仍橫跨所有預算範圍佔優。後期迭代開始探索超出參數調整的程式碼變更。
GPT-5.4-mini 純提示準確率退化 22pp 至 47%;minRLM 透過寫 Python 碼而非模式匹配維持 69.5%。比官方 RLM 少 5.1x token、便宜 3.2x;在 AIME 2025 達 80%。

FactorSmith 從文字規格生成可玩遊戲模擬,使用因式分解 POMDP 減少上下文,並透過規劃-設計-評論代理工作流程進行迭代精煉。每步限制 LLM 上下文,並支援檢查點回滾以提升品質。在 PyGame 基準測試中,超越基線於對齊度、錯誤率及程式碼品質。

ManiBench 是評估 LLM 生成 Manim CE 動態視覺程式碼的新基準,針對語法幻覺與視覺邏輯偏移。它包含 150-200 個橫跨微積分與線性代數等數學主題的問題,基於 3Blue1Brown 的 ManimGL 分析。開源框架自動化評估,使用可執行性與對齊分數等指標。

第五第三銀行執行長Tim Spence表示,AI已撰寫銀行40%的程式碼,讓公司以較少員工規模成長一倍。他強調生產力大幅提升及成長加速。下一階段是AI自主執行金融任務。

Google 為 Gemini 3 Flash 推出新功能「Agentic Vision」,結合視覺推論與程式碼執行。它會自動產生 Python 程式碼調查影像,將影像理解精度提升 10%。

GitLab 推出 Duo Agent Platform,整合如 Anthropic 的 Claude 等外部 AI 模型,实现無縫開發工作流程。代理可自主處理從構想到生產代碼的多步驟任務,包括全棧應用生成與代碼審核。此平台將 AI 輔助維持在 GitLab 環境內,減少工具切換。

Vercel 推出全新的程式語言 Zero,定位為主要寫給 AI 而非人類閱讀的程式碼。這項更新顯示軟體開發正逐步轉向 AI 原生,以及針對機器最佳化的程式碼表達方式。

Andrej Karpathy 親自測試 Claude Opus 5 的影片吸引近 300 萬人觀看。模型據稱在兩小時內生成約 5,500 行程式碼,但最終產出的遊戲連模型自己都無法遊玩。

Google 正在探索一項計畫,向 Google Play 開發者支付費用以獲取其應用程式原始碼。目標是取得高品質且多樣化的程式碼庫,以改進 AI 模型訓練與開發工具。