🤖較早收集於 25h

Databricks 將 GPT-5.5 整合至企業級 Agent 工作流程

PostLinkedIn
🤖閱讀原文: OpenAI News

💡GPT-5.5 已在 Databricks 上線。看看其創紀錄的基準測試表現是否適合您的 Agent 技術堆疊。

⚡ 30-Second TL;DR

有什麼變化

Databricks 採用 GPT-5.5 支援企業級 Agent 應用。

為什麼重要

此次整合標誌著企業自動化正轉向更高推理能力的模型。從業者可以預期在複雜的多步驟 Agent 任務中,準確度將獲得顯著提升。

下一步行動

評估您目前的 Agent 工作流程,看看 GPT-5.5 的推理能力是否能取代現有的多模型鏈。

誰應關注:Enterprise & Security Teams

關鍵要點

  • Databricks 採用 GPT-5.5 支援企業級 Agent 應用。
  • GPT-5.5 在 OfficeQA Pro 基準測試中達到業界領先水準。
  • 此次整合旨在提升企業工作流程的自動化能力。

🧠 深度解析

Web-grounded analysis with 23 cited sources.

🔑 增強重點摘要

  • GPT-5.5 不僅是 OpenAI 的最新前沿模型,更是自 GPT-4.5 以來首個經過全面重新訓練的基礎模型,採用原生全模態架構,能單一統一處理文字、圖像、音訊和視訊,並與 NVIDIA 的 GB200 和 GB300 NVL72 機架規模系統進行硬體協同設計,以提升效率。
  • Databricks 的整合透過其 Unity AI Gateway 進行治理,支援基於企業數據的客製化 Agent,並透過 Genie 實現對業務資訊的自然語言存取,同時強調對模型互動、存取控制和 AI 流程的全面審計。
  • 在 OfficeQA Pro Agent Harness 基準測試中,GPT-5.5 取得了 52.63% 的分數,相較於 GPT-5.4 的 36.10%,錯誤率降低了 46%,這表明其在真實、端到端的企業工作流程中具有顯著的效能提升。
  • Databricks 與 OpenAI 簽署了一項價值 1 億美元的多年合作夥伴關係,旨在將包括 GPT-5.5 在內的 OpenAI 模型原生整合到 Databricks 平台中,使客戶無需外部供應商關係或 API 金鑰即可查詢這些模型。
  • OfficeQA Pro 基準測試是一個專為評估 AI Agent 在大型異構文件語料庫上進行多文件推理而設計的基準,該語料庫包含近 100 年的美國財政部公報,共 89,000 頁和超過 2,600 萬個數值,要求模型進行精確的文件解析、檢索和分析推理。
📊 競品分析▸ Show
特性/平台Databricks (Agent Bricks / Genie)Microsoft Copilot StudioAmazon Q BusinessSnowflake (Cortex Analyst)TrueFoundry
主要用途企業級 AI Agent 工作流程、數據分析、數據湖倉一體、MLOps、程式碼生成、文件推理建立客製化 AI Copilot、與 Microsoft 365 和 Power Platform 深度整合企業 AI 助理、跨企業系統和文件回答問題、總結內容、檢索知識NL-to-SQL 分析、ML/GenAI 工作流程、數據倉儲雲端中立、專為 LLM、Agent 和生產推理設計的 GenAI 原生平台
LLM 整合OpenAI GPT-5.5 (原生整合), Anthropic Claude, Google Gemini, DBRXGPT-4 Turbo 和 Azure OpenAIAWS 內部模型內部 Cortex AI 模型支援 LangChain, LlamaIndex, Hugging Face 等框架
數據治理Unity Catalog (統一治理、存取控制、審計、血緣追蹤)透過 Microsoft Graph 存取企業數據企業系統和文件數據倉儲中心支援雲端或 VPC 部署,具備治理能力
Agent 開發Agent Bricks (無程式碼/低程式碼)、AI Playground、Agent Framework低程式碼介面--GenAI 原生原語、Agent、MCP、提示生命週期管理
基準測試表現GPT-5.5 在 OfficeQA Pro Agent Harness 達 52.63%,錯誤率降低 46%----
定價模式按個別服務計費包含在 M365 E5 或按使用者/月計費--透明且可優化的成本

🛠️ 技術深入

  • GPT-5.5 模型架構: GPT-5.5 是自 GPT-4.5 以來首個完全重新訓練的基礎模型,內部代號為 'Spud'。它採用原生全模態架構,能夠在單一統一系統中處理文字、圖像、音訊和視訊輸入。
  • 硬體協同設計: 該模型與 NVIDIA 的 GB200 和 GB300 NVL72 機架規模系統共同設計,使其在顯著提升能力的同時,仍能保持與 GPT-5.4 相同的每 token 延遲。
  • 自我改進基礎設施: GPT-5.5 和 Codex 在發布前重寫了 OpenAI 自己的服務基礎設施,透過分析數週的生產流量並編寫客製化負載平衡啟發式演算法,將 token 生成速度提高了 20% 以上。
  • 上下文視窗: GPT-5.5 支援 1M+ token 的上下文視窗(922K 輸入,128K 輸出),並支援文字和圖像輸入,實現大規模推理、程式碼編寫和多模態工作流程。
  • Databricks 整合機制: 整合透過 Databricks 的 Unity AI Gateway 進行,該 Gateway 提供對企業環境中所有 LLM 和 MCP 的數據治理、存取控制、速率限制、有害內容預防和血緣追蹤。
  • Agent 應用支援: 整合旨在支援透過 Codex 進行程式碼工作流程、基於企業數據的客製化 Agent,以及透過 Genie 實現對業務資訊的自然語言存取。
  • OfficeQA Pro 基準測試細節: OfficeQA Pro 是一個用於評估 AI Agent 在基於事實、多文件推理能力的基準測試。其語料庫包含美國財政部近 100 年的公報,共 89,000 頁和超過 2,600 萬個數值。測試問題要求模型進行精確的文件解析、檢索和跨非結構化文字及表格數據的分析推理。
  • Databricks 的 ai_parse_document: 該工具能夠生成結構化的文件表示,為 Agent 提供此表示可使平均效能提升 16.1%。

🔮 前景展望AI analysis grounded in cited sources

企業將加速採用 AI Agent 實現端到端工作流程自動化。
GPT-5.5 在 OfficeQA Pro 等基準測試中展現的卓越 Agentic 能力,結合 Databricks 平台提供的治理和數據整合,將促使企業更廣泛地部署能夠自主規劃和執行複雜多步驟任務的 AI Agent。
對統一數據和 AI 治理平台的需求將大幅增加。
隨著像 GPT-5.5 這樣的前沿模型被整合到企業關鍵工作流程中,確保數據安全、模型合規性和可審計性變得至關重要,這將推動對 Databricks Unity Catalog 等提供端到端治理解決方案的需求。
AI 模型將朝向更強大的多模態和自我改進能力發展。
GPT-5.5 的原生全模態架構和自我改進的基礎設施預示著未來 AI 模型將不僅能處理多種數據類型,還能自主優化其運行效率和效能,從而實現更廣泛和更高效的應用。

時間線

2023-03
Databricks 推出開源語言模型 Dolly。
2023-06
Databricks 收購 MosaicML,並宣布推出 Lakehouse AI,包含向量搜尋、湖倉監控和 GPU 加速模型服務等功能。
2025-03
Databricks 與 Anthropic 建立合作夥伴關係,將 Claude 模型整合到其平台。
2025-06
Databricks 推出 Agent Bricks,一套用於建構 AI Agent 的工具,以及 Lakebase。
2025-09
Databricks 與 OpenAI 簽署價值 1 億美元的多年合作夥伴關係,將 GPT 模型(包括 GPT-5)原生整合到 Databricks 平台。
2026-03
OfficeQA Pro 基準測試論文發布,旨在評估 AI Agent 的多文件推理能力。
2026-04
Databricks 正式將 GPT-5.5 模型整合至其企業級 Agent 工作流程中,並透過 Unity AI Gateway 提供。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: OpenAI News