💻較早收集於 39m

GPT-5.4 測試:令人印象深刻但偏題

GPT-5.4 測試:令人印象深刻但偏題
PostLinkedIn
💻閱讀原文: ZDNet AI
#model-test#openai-reviewgpt-5.4openaigpt-5.4

💡親測 GPT-5.4:品質出色但常忽略指令(18字)

⚡ 30-Second TL;DR

有什麼變化

GPT-5.4 答案品質高但提示對齊不準。

為什麼重要

強調過度宣傳模型專業用途風險,呼籲驗證。可能影響對 OpenAI 次世代公告的信任。

下一步行動

用你的關鍵專業提示測試 GPT-5.4 Thinking 的對齊性。

誰應關注:Developers & AI Engineers

關鍵要點

  • GPT-5.4 答案品質高但提示對齊不準。
  • 質疑 OpenAI 專業任務能力宣稱。
  • 聚焦 GPT-5.4 Thinking 功能限制。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • GPT-5.4於2026年3月5日由OpenAI正式發布,引入原生電腦使用功能,能自主操作電腦與軟體。[3][6]
  • 模型擁有高達200萬token的上下文視窗,支持完整保真度影像輸入至10.24百萬像素,提升視覺理解與OCR準確性。[1][5][6]
  • 相較GPT-5.2,幻覺率降低33%,專業工作基準達83%,WebArena-Verified成功率67.3%。[4][6]
  • 新增工具搜尋功能,減少47% token使用,優化大型工具生態系互動效率。[3][6]

🛠️ 技術深入

  • 上下文視窗擴展至200萬token,支持載入完整軟體程式碼庫。[1][5]
  • 影像輸入支援original細節等級(最高10.24M像素或6000像素邊長)和high等級(2.56M像素或2048像素邊長),提升高解析度影像理解、UI品質控制與文件處理。[5][6]
  • 工具搜尋機制:僅載入輕量工具清單,需求時即時查詢完整定義,減少大型工具集prompt token負荷47%。[3][6]
  • 電腦使用工具(computer tool):支援全保真影像輸入、開發者可調整安全設定與行為導向,WebArena-Verified達67.3%成功率。[3][6]
  • GPT-5.4 Thinking具備steerability,提供複雜查詢前置思考計劃,允許中途調整,並優化深網研究與長視野任務。[2]

🔮 前景展望AI analysis grounded in cited sources

GPT-5.4將加速企業AI代理採用
原生電腦使用與工具搜尋功能讓開發者無需自建基礎設施,即可處理多步驟任務,提升企業自動化效率。[4][6]
token效率提升將降低AI部署成本
相較前代,使用更少token解決問題,儘管單token價格略高,但整體成本可抵銷,適用於知識工作與代理應用。[2][4]
幻覺減少將提高AI在專業領域可靠性
個別陳述虛假率降33%、回應錯誤率降18%,結合高基準分數,使其更適合事實導向任務。[4][6]

時間線

2026-03
OpenAI發布GPT-5.4,引入原生電腦使用與工具搜尋功能
2026-03-05
GPT-5.4正式推出,基準測試超越GPT-5.2
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ZDNet AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。