🗾較早收集於 66m

Claude Mythos 與 GPT-5.5 在長任務 AI 處理上取得突破

Claude Mythos 與 GPT-5.5 在長任務 AI 處理上取得突破
PostLinkedIn
🗾閱讀原文: ITmedia AI+ (日本)

💡GPT-5.5 與 Claude Mythos 等新模型大幅延長了 AI 自主執行任務的時間長度。

⚡ 30-Second TL;DR

有什麼變化

AI 代理在處理自主任務的能力上,成長速度超乎預期。

為什麼重要

這些突破顯示 AI 代理很快就能在無需人工干預的情況下管理複雜的長時間工作流程,將顛覆傳統自動化模式。

下一步行動

使用最新的 Claude Mythos Preview 對您現有的代理工作流程進行基準測試,以評估任務完成率的潛在提升空間。

誰應關注:Researchers & Academics

關鍵要點

  • AI 代理在處理自主任務的能力上,成長速度超乎預期。
  • Claude Mythos Preview 與 GPT-5.5 是推動此趨勢的關鍵模型。
  • 在長文本處理與多步驟推理方面的效能提升顯著。

🧠 深度解析

Web-grounded analysis with 34 cited sources.

🔑 增強重點摘要

  • Anthropic 的 Claude Mythos Preview 並未公開發布,其存取權限僅限於 Project Glasswing 合作夥伴和經過審查的組織,原因在於其先進的網路安全能力,包括自主發現零日漏洞。
  • OpenAI 的 GPT-5.5(代號「Spud」)是自 GPT-4.5 以來首個經過完全重新訓練的基礎模型,採用原生全模態架構,可在單一統一系統中處理文字、圖像、音訊和視訊輸入。
  • GPT-5.5 在代理程式編碼基準測試中表現出色,例如 Terminal-Bench 2.0 達到 82.7% 和 OSWorld 達到 78.7%,顯示其在複雜命令列工作流程和獨立電腦操作方面的能力顯著增強。
  • 儘管 Claude Mythos Preview 受到限制,但它在編碼(SWE-bench Pro 77.8%)和長上下文推理(GraphWalks 長上下文 80%)方面表現優異,甚至在模擬企業網路攻擊中,10 次嘗試中有 3 次成功完成端到端攻擊,而 GPT-5.5 僅為 2 次。
  • 全球 AI 代理程式市場正經歷快速增長,預計 2026 年將超過 109 億美元,預計到 2026 年底,40% 的企業應用程式將嵌入特定任務的 AI 代理程式。
📊 競品分析▸ Show
模型/功能Claude Mythos PreviewGPT-5.5Claude Opus 4.7Gemini 3.1 Pro
發布日期2026-04-07 (受限預覽)2026-04-232026-04-16 (Opus 升級)2026-02-19
可用性受限於 Project Glasswing 合作夥伴ChatGPT Plus/Pro/Business/Enterprise 訂閱者及 APIClaude.ai、API 及主要雲平台API 及 Google Cloud Vertex AI
輸入價格 (每百萬 Token)$25.00 (參與者)$5.00$5.00未提供具體數據,但通常較低
輸出價格 (每百萬 Token)$125.00 (參與者)$30.00$25.00未提供具體數據,但通常較低
Terminal-Bench 2.082.0% (92.1% 延長超時)82.7%69.4%68.5%
SWE-bench Pro77.8%58.6%64.3%54.2%
OSWorld-Verified79.6%78.7%78.0%未提供
網路安全任務68.6% (專家級)71.4% (專家級)未提供未提供
上下文視窗1M Token (beta)1M Token1M Token (beta)1M Token
主要特點專注於網路安全漏洞發現、軟體編碼、複雜推理原生全模態、代理程式自主性、編碼、科學研究進階軟體工程、複雜多步驟任務、視覺、專業工作多模態、MoE 架構、長上下文推理

🛠️ 技術深入

  • Claude Mythos Preview
    • 據傳擁有 10 兆參數,並在 15.5 兆 Token 上進行訓練。
    • 採用「搜尋而非索引」方法,利用即時程式碼庫檢索,而非傳統的嵌入和語義搜尋。
    • 據報導,其架構為「遞迴深度轉換器 (Recurrent-Depth Transformer, RDT)」,結合了專家混合 (Mixture-of-Experts, MoE) 路由機制和循環推理。
    • 訓練過程中實現了零尖峰訓練 (zero spike training),並透過 MuonClip 和 QK-Clip 優化器提高效率和穩定性。
    • 其工具使用方法簡潔,透過一個 while 迴圈和 bash、讀取、編輯、寫入、grep、glob 等工具來完成任務。
  • GPT-5.5
    • 採用原生全模態架構,能夠在單一統一系統中處理文字、圖像、音訊和視訊輸入。
    • 模型與 NVIDIA 的 GB200 和 GB300 NVL72 機架規模系統進行了硬體協同設計,以在更強大的同時保持低延遲。
    • 具備自我改進的基礎設施,GPT-5.5 和 Codex 在發布前重寫了 OpenAI 自己的服務基礎設施,透過自訂負載平衡啟發式演算法將 Token 生成速度提高了 20% 以上。
    • 內部代號為「Spud」,是自 GPT-4.5 以來首個完全重新訓練的基礎模型,而非在相同基礎上進行迭代更新。

🔮 前景展望AI analysis grounded in cited sources

AI代理將在企業營運中扮演更核心的角色。
隨著AI代理在長任務處理和自主決策方面的能力顯著提升,企業將更廣泛地部署它們以自動化複雜的工作流程並提高效率。
網路安全領域將面臨AI驅動的新型威脅與防禦挑戰。
像Claude Mythos Preview這樣能夠自主發現零日漏洞的AI模型,預示著AI在攻擊和防禦兩方面的能力都將大幅增強,需要新的安全策略。
AI模型開發將更加注重安全部署與風險緩解。
由於Claude Mythos Preview的潛在危險性導致其限制發布,未來AI公司將更謹慎地處理前沿模型的發布,並投入更多資源於安全評估和負責任的AI開發。

時間線

2015-12
OpenAI 成立
2018
OpenAI 發布 GPT-1
2021-02
Anthropic 成立
2023-03
Anthropic 發布 Claude 1
2024-03
Anthropic 發布 Claude 3 系列模型(Haiku, Sonnet, Opus)
2026-04-07
Anthropic 宣布 Claude Mythos Preview (受限預覽)
2026-04-23
OpenAI 發布 GPT-5.5
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本)