📱較早收集於 66m

GPT-5.4 發佈,原生支援操控電腦

GPT-5.4 發佈,原生支援操控電腦
PostLinkedIn
📱閱讀原文: Ifanr (爱范儿)
#agentic-ai#computer-use#ipo-prep#open-sourcegpt-5.4openaigpt-5.4alibaba

💡GPT-5.4 PC 操控解鎖代理 AI;OpenAI 7300 億上市蓄勢待發。

⚡ 30-Second TL;DR

有什麼變化

GPT-5.4 原生支援電腦操控,直接操作 PC

為什麼重要

GPT-5.4 的原生 PC 操控推進代理式 AI,讓開發者實現無縫自動化。OpenAI 上市顯示產業成熟,或釋放 AI 創新資金。阿里 AI 重點確保開源 LLM 競爭持續。

下一步行動

在 OpenAI Playground 測試 GPT-5.4 原生電腦操控功能,建構代理原型。

誰應關注:Developers & AI Engineers

關鍵要點

  • GPT-5.4 原生支援電腦操控,直接操作 PC
  • 阿里維持開源策略,高管離職後持續加大 AI 投入
  • OpenAI 啟動上市準備,估值 7300 億美元或創紀錄
  • 雷軍承諾減輕記憶體漲價對消費者的負擔

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • GPT-5.4 在 OSWorld-Verified 基準測試中達到 75.0% 的成績,超越人類基準線 72.4%,相比 GPT-5.2 的 47.3% 有大幅提升[2]
  • GPT-5.4 API 版本提供高達 100 萬個 token 的上下文窗口,是 OpenAI 迄今最大的上下文容量[6]
  • 新模型在事實準確性上改進顯著,相比 GPT-5.2 單個聲明的錯誤率降低 33%,整體回應的錯誤率降低 18%[6]
  • OpenAI 推出新的 Tool Search 系統優化 API 工具調用,通過動態查詢工具定義而非預先加載,在多工具場景中實現更快更便宜的請求[6]
  • GPT-5.4 在 OpenAI 的網絡安全防護框架中被列為「高能力」等級,是首個獲此分類的通用模型,配備監控系統和受信任的訪問控制[3]
📊 競品分析▸ Show
功能維度GPT-5.4GPT-5.2備註
原生電腦操控✓ 支援✗ 不支援GPT-5.4 首次實現通用模型的原生電腦使用能力[1][2]
OSWorld-Verified 基準75.0%47.3%GPT-5.4 超越人類基準線 72.4%[2]
上下文窗口100 萬 tokens未明確說明GPT-5.4 提供迄今最大容量[6]
事實準確性改進33% 錯誤率降低基準相比 GPT-5.2 單個聲明錯誤率降低 33%[6]
代碼生成能力增強前端編碼基礎能力GPT-5.4 在複雜前端任務中表現更優[2]

🛠️ 技術深入

  • 電腦操控機制:GPT-5.4 通過截圖解釋、鍵盤/滑鼠命令和代碼生成(如 Playwright 庫)與軟體系統直接互動,無需依賴獨立的專用模型[1][2]
  • 視覺感知能力:MMMU-Pro 視覺理解與推理基準從 79.5% 提升至 81.2%[3]
  • 推理穩定性:模型在多輪、多步驟互動中保持更一致的推理,減少任務漂移和工作流中斷[4]
  • 工具調用優化:新的 Tool Search 系統動態查詢工具定義,相比預先加載所有工具定義的舊方法,在大規模工具場景中顯著降低 token 消耗和延遲[6]
  • 思維鏈安全評估:OpenAI 新增評估測試模型的思維鏈透明度,發現 Thinking 版本的 GPT-5.4 欺騙傾向更低,表明模型缺乏隱藏推理的能力[6]
  • 網絡安全分類:GPT-5.4 是首個被列為「高能力」網絡安全等級的通用模型,配備監控系統、受信任訪問控制和零數據保留表面上的請求級阻止[3]

🔮 前景展望AI analysis grounded in cited sources

自主 AI 代理將重塑白領工作流程
GPT-5.4 能自主完成跨多應用的複雜多步驟任務(如數據提取、分析和演示生成),企業採用可能大幅減少人工干預和任務協調成本[1][4]
電腦操控能力成為 AI 模型的標準競爭維度
GPT-5.4 作為首個具原生電腦使用能力的通用模型,其 75% 的桌面導航性能超越人類基準,預示競爭對手將被迫在此領域投入以保持競爭力[2]
網絡安全風險管理將成為高能力 AI 模型的必要條件
GPT-5.4 首次被列為網絡安全「高能力」等級並配備額外安全層,表明監管和安全評估將成為未來前沿模型發佈的標準要求[3]

時間線

2024-Q4
GPT-5.2 發佈,OSWorld-Verified 基準達 47.3%
2025-Q3
GPT-5.3 發佈,Codex 專用模型首次獲得網絡安全高能力分類
2026-03-05
OpenAI 發佈 GPT-5.4,首個具原生電腦操控能力的通用模型,OSWorld-Verified 基準達 75.0%,上下文窗口擴展至 100 萬 tokens
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Ifanr (爱范儿)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。