
Anthropic 暫緩發布高風險 Model 2
Anthropic 表示,儘管內部 Model 2 的能力似乎已超越目前的頂尖模型 Mythos,公司暫時不會公開發布。Anthropic 將高風險情境下模型失控的預估機率由「極低」上調至「低」,並指出模型的自動化研發能力正在加速。
Tag: #autonomous-research9 results

Anthropic 表示,儘管內部 Model 2 的能力似乎已超越目前的頂尖模型 Mythos,公司暫時不會公開發布。Anthropic 將高風險情境下模型失控的預估機率由「極低」上調至「低」,並指出模型的自動化研發能力正在加速。

AutoWorldModel-Bench 評估前沿程式代理是否能透過開放式研究自主改進世界模型,而非只完成預先定義的工程任務。在 64 次測試與 8 個遊戲環境中,Codex-5.4 和 Claude Opus 4.6 在 63 次測試裡改進了起始模型,且多數勝出修改都涉及實質性的研究變更。

本研究提出了一套嚴謹的基準測試協議,利用多模型 LLM 同儕審查來評估自主 AI 研究系統。研究針對四種框架與商業基準進行評測,揭示了顯著的效能差距,並驗證了自動化評估的可靠性。

HOTE 框架引入了一種混合強化學習方法,用於進化開放式研究中的提議者、求解者和評判者模組。實驗顯示,經 HOTE 訓練的 8B 模型在長篇研究任務中表現優於更大的靜態模型。

中國科学技术大學發布「靈境造物」,一款人工智能驅動的科研平台,向全球用戶開放。以昇騰、鯤鵬、華為雲為基礎,整合科學大模型、機器人及1214項技能,實現自主科研。解決傳統科研成本高、週期長、轉化難等痛點。

Mimosa 推出一個演進式多代理框架,能自動合成任務特定工作流程,用於自主科學研究,並透過實驗反饋精煉它們。它使用 DeepSeek-V3.2 在 ScienceAgentBench 上達到 43.1% 成功率,超越單代理和靜態多代理基準。完全開源,支持動態工具發現,並透過記錄追蹤實現可審核性。

AI-Supervisor 是一個多代理框架,用於端到端 AI 研究監督,透過知識圖譜維持持久的研究世界模型作為共享理解。它具備結構化缺口發現、自校正迴圈分析失敗與偏差,以及跨領域搜尋的自改善迴圈。代理使用共識機制自主更新模型。

Project2Task 是一個圖導向的規劃層,能將自主研究專案拆解為具明確貢獻歸屬、範圍受控且具依賴關係的任務。在十份專案簡述上,其組合品質得分達 7.15,高於簡述基準的 4.58;與 AutoResearchClaw 整合後,任務準確率則由 0.536 提升至 0.759。
Cadenza 是開源 CLI 工具與 Python SDK,用於將 Wandb 日誌連接至自主研究代理。它索引執行中的配置與指標,抽樣頂尖表現以避免上下文腐敗。GitHub、文件與 Pypi 均可取得。