🗾ITmedia AI+ (日本)•較早收集於 66m
Claude Mythos 與 GPT-5.5 在長任務 AI 處理上取得突破

#ai-agents#autonomous-systems#long-contextclaude-mythos-/-gpt-5.5anthropicopenaiclaude mythosgpt-5.5
💡GPT-5.5 與 Claude Mythos 等新模型大幅延長了 AI 自主執行任務的時間長度。
⚡ 30-Second TL;DR
有什麼變化
AI 代理在處理自主任務的能力上,成長速度超乎預期。
為什麼重要
這些突破顯示 AI 代理很快就能在無需人工干預的情況下管理複雜的長時間工作流程,將顛覆傳統自動化模式。
下一步行動
使用最新的 Claude Mythos Preview 對您現有的代理工作流程進行基準測試,以評估任務完成率的潛在提升空間。
誰應關注:Researchers & Academics
關鍵要點
- •AI 代理在處理自主任務的能力上,成長速度超乎預期。
- •Claude Mythos Preview 與 GPT-5.5 是推動此趨勢的關鍵模型。
- •在長文本處理與多步驟推理方面的效能提升顯著。
🧠 深度解析
Web-grounded analysis with 34 cited sources.
🔑 增強重點摘要
- •Anthropic 的 Claude Mythos Preview 並未公開發布,其存取權限僅限於 Project Glasswing 合作夥伴和經過審查的組織,原因在於其先進的網路安全能力,包括自主發現零日漏洞。
- •OpenAI 的 GPT-5.5(代號「Spud」)是自 GPT-4.5 以來首個經過完全重新訓練的基礎模型,採用原生全模態架構,可在單一統一系統中處理文字、圖像、音訊和視訊輸入。
- •GPT-5.5 在代理程式編碼基準測試中表現出色,例如 Terminal-Bench 2.0 達到 82.7% 和 OSWorld 達到 78.7%,顯示其在複雜命令列工作流程和獨立電腦操作方面的能力顯著增強。
- •儘管 Claude Mythos Preview 受到限制,但它在編碼(SWE-bench Pro 77.8%)和長上下文推理(GraphWalks 長上下文 80%)方面表現優異,甚至在模擬企業網路攻擊中,10 次嘗試中有 3 次成功完成端到端攻擊,而 GPT-5.5 僅為 2 次。
- •全球 AI 代理程式市場正經歷快速增長,預計 2026 年將超過 109 億美元,預計到 2026 年底,40% 的企業應用程式將嵌入特定任務的 AI 代理程式。
📊 競品分析▸ Show
| 模型/功能 | Claude Mythos Preview | GPT-5.5 | Claude Opus 4.7 | Gemini 3.1 Pro |
|---|---|---|---|---|
| 發布日期 | 2026-04-07 (受限預覽) | 2026-04-23 | 2026-04-16 (Opus 升級) | 2026-02-19 |
| 可用性 | 受限於 Project Glasswing 合作夥伴 | ChatGPT Plus/Pro/Business/Enterprise 訂閱者及 API | Claude.ai、API 及主要雲平台 | API 及 Google Cloud Vertex AI |
| 輸入價格 (每百萬 Token) | $25.00 (參與者) | $5.00 | $5.00 | 未提供具體數據,但通常較低 |
| 輸出價格 (每百萬 Token) | $125.00 (參與者) | $30.00 | $25.00 | 未提供具體數據,但通常較低 |
| Terminal-Bench 2.0 | 82.0% (92.1% 延長超時) | 82.7% | 69.4% | 68.5% |
| SWE-bench Pro | 77.8% | 58.6% | 64.3% | 54.2% |
| OSWorld-Verified | 79.6% | 78.7% | 78.0% | 未提供 |
| 網路安全任務 | 68.6% (專家級) | 71.4% (專家級) | 未提供 | 未提供 |
| 上下文視窗 | 1M Token (beta) | 1M Token | 1M Token (beta) | 1M Token |
| 主要特點 | 專注於網路安全漏洞發現、軟體編碼、複雜推理 | 原生全模態、代理程式自主性、編碼、科學研究 | 進階軟體工程、複雜多步驟任務、視覺、專業工作 | 多模態、MoE 架構、長上下文推理 |
🛠️ 技術深入
- Claude Mythos Preview
- 據傳擁有 10 兆參數,並在 15.5 兆 Token 上進行訓練。
- 採用「搜尋而非索引」方法,利用即時程式碼庫檢索,而非傳統的嵌入和語義搜尋。
- 據報導,其架構為「遞迴深度轉換器 (Recurrent-Depth Transformer, RDT)」,結合了專家混合 (Mixture-of-Experts, MoE) 路由機制和循環推理。
- 訓練過程中實現了零尖峰訓練 (zero spike training),並透過 MuonClip 和 QK-Clip 優化器提高效率和穩定性。
- 其工具使用方法簡潔,透過一個 while 迴圈和 bash、讀取、編輯、寫入、grep、glob 等工具來完成任務。
- GPT-5.5
- 採用原生全模態架構,能夠在單一統一系統中處理文字、圖像、音訊和視訊輸入。
- 模型與 NVIDIA 的 GB200 和 GB300 NVL72 機架規模系統進行了硬體協同設計,以在更強大的同時保持低延遲。
- 具備自我改進的基礎設施,GPT-5.5 和 Codex 在發布前重寫了 OpenAI 自己的服務基礎設施,透過自訂負載平衡啟發式演算法將 Token 生成速度提高了 20% 以上。
- 內部代號為「Spud」,是自 GPT-4.5 以來首個完全重新訓練的基礎模型,而非在相同基礎上進行迭代更新。
🔮 前景展望AI analysis grounded in cited sources
AI代理將在企業營運中扮演更核心的角色。
隨著AI代理在長任務處理和自主決策方面的能力顯著提升,企業將更廣泛地部署它們以自動化複雜的工作流程並提高效率。
網路安全領域將面臨AI驅動的新型威脅與防禦挑戰。
像Claude Mythos Preview這樣能夠自主發現零日漏洞的AI模型,預示著AI在攻擊和防禦兩方面的能力都將大幅增強,需要新的安全策略。
AI模型開發將更加注重安全部署與風險緩解。
由於Claude Mythos Preview的潛在危險性導致其限制發布,未來AI公司將更謹慎地處理前沿模型的發布,並投入更多資源於安全評估和負責任的AI開發。
⏳ 時間線
2015-12
OpenAI 成立
2018
OpenAI 發布 GPT-1
2021-02
Anthropic 成立
2023-03
Anthropic 發布 Claude 1
2024-03
Anthropic 發布 Claude 3 系列模型(Haiku, Sonnet, Opus)
2026-04-07
Anthropic 宣布 Claude Mythos Preview (受限預覽)
2026-04-23
OpenAI 發布 GPT-5.5
📎 來源 (34)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗
