💼VentureBeat•較早收集於 28m
前沿模型生產嘗試三分之一失敗

#ai-benchmarks#model-reliability#ai-agents#jagged-frontierstanford-hai-ai-indexstanford-haiclaude-opus-4.5gpt-5.2qwen3.5humanity's-last-exam
💡基準勝利掩蓋33%生產失敗—可靠AI代理關鍵。(28字)
⚡ 30-Second TL;DR
有什麼變化
前沿模型在Humanity's Last Exam (HLE)一年內進步30%。
為什麼重要
報告揭示企業部署的關鍵可靠性差距,敦促IT領導者應對「鋸齒前沿」。程式碼、網頁任務及網路安全的大幅進展顯示代理能力成熟,但生產失敗使審核與擴展複雜化。
下一步行動
下載史丹佛HAI 2026 AI Index報告,比較您的模型基準成績。
誰應關注:Enterprise & Security Teams
關鍵要點
- •前沿模型在Humanity's Last Exam (HLE)一年內進步30%。
- •Claude Opus 4.5、GPT-5.2等頂級模型在τ-bench代理任務得分62.9%-70.2%。
- •SWE-bench Verified代理表現從60%升至近100%。
- •WebArena自主網頁代理成功率達74.3%。
- •前沿模型在Cybench網路安全基準解決93%問題。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗
每週 AI 簡報
每週一封,可隨時退訂。