💼較早收集於 12m

Harness-1:開源搜尋代理效能超越 GPT-5.4

Harness-1:開源搜尋代理效能超越 GPT-5.4
PostLinkedIn
💼閱讀原文: VentureBeat

💡一個在檢索基準測試中擊敗 GPT-5.4 的 20B 開源代理,是高效能本地 AI 研究的一大勝利。

⚡ 30-Second TL;DR

有什麼變化

Harness-1 的檢索準確率達到 73%,超越了 GPT-5.4 (70.9%) 與 Tongyi DeepResearch 30B。

為什麼重要

此發布證明了較小型的專用模型在特定的高強度檢索任務中,足以與大型前沿模型競爭。它為企業構建自主研究代理提供了一個高效能的開源替代方案。

下一步行動

從 Hugging Face 下載 Harness-1 權重,並針對您目前的 RAG 管道測試其檢索能力。

誰應關注:Researchers & Academics

關鍵要點

  • Harness-1 的檢索準確率達到 73%,超越了 GPT-5.4 (70.9%) 與 Tongyi DeepResearch 30B。
  • 該模型採用 200 億參數架構,並以寬鬆的 Apache 2.0 授權發布。
  • 透過將搜尋的「簿記」工作卸載至結構化軟體環境,而非僅依賴模型記憶體,從而提升效能。
  • 訓練與推論過程由 Tinker 分散式 AI 模型訓練 API 提供支援。

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • Harness-1是基於OpenAI的gpt-oss-20B開源模型開發的,這是一個200億參數的模型,而非從頭開始訓練,這表明了利用現有開源基礎模型進行創新優化的潛力。
  • Harness-1的性能提升主要歸因於其「狀態外部化」的設計,將搜尋過程中的「簿記」工作(如候選文件池、策展證據、驗證記錄等)從模型記憶體中卸載到結構化軟體環境中,使模型能夠專注於語義決策。
  • 該模型在八個複雜的檢索基準測試中表現出色,這些測試涵蓋了開放網路搜尋、SEC財務文件、USPTO專利資料庫以及多跳問答等領域,證明其在多樣化、密集資料來源中的實際研究能力。
  • Harness-1的訓練採用強化學習(RL)方法,並利用Thinking Machines開發的Tinker分散式AI模型訓練API進行訓練和推論,強調了互動式基礎設施在實現下一代自主模型中的作用。
  • 儘管Harness-1的參數規模相對較小(200億),但其在檢索任務中超越了GPT-5.4等數千億甚至數兆參數的專有大型模型,僅略遜於Opus-4.6,這凸顯了架構創新而非單純擴大模型規模的重要性。
📊 競品分析▸ Show
特性/模型Harness-1GPT-5.4Tongyi DeepResearch 30B
參數200億數千億至數兆 (估計)總300億 (激活30億/token)
授權Apache 2.0 (開源)專有開源
核心機制狀態外部化搜尋harness,RL訓練統一架構,原生操作系統導航,工具搜尋代理式LLM,MoE架構,端到端RL
上下文視窗未明確說明 (harness管理)1M+ tokens (922K輸入, 128K輸出)128K tokens
發布日期2026-06-02 (論文)2026-03-052025-09-17
檢索準確率 (策展召回率)73.0%70.9%61.6% (低於Harness-1 11.4個百分點)
其他基準測試8個複雜搜尋基準 (網路、金融、專利、多跳QA)OSWorld-Verified (75%), GDPval (83%), SWE-bench Pro (57.7%)Humanity's Last Exam, BrowserComp, GAIA, xbench-DeepSearch, FRAMES
定價開源 (主要為運算成本)多種層級,例如Standard ($2.50/$15 每百萬token)輸入 $0.09/M token, 輸出 $0.45/M token

🛠️ 技術深入

  • Harness-1 基礎模型與架構:
    • 基於OpenAI的gpt-oss-20B開源模型構建。
    • 採用200億參數架構。
    • 核心創新在於「狀態外部化」的搜尋代理設計,將搜尋會話的「簿記」工作從模型的工作記憶體中卸載到結構化軟體環境(即「harness」)中。
    • harness維護環境側的工作記憶體,包括候選文件池、帶有重要性標籤的策展集、緊湊的證據連結、驗證記錄、壓縮和去重複的觀察結果以及預算感知的上下文渲染。
    • 策略(模型本身)保留語義決策:搜尋什麼、保留或丟棄哪些文件、驗證什麼以及何時停止。
    • 訓練採用強化學習(RL)方法,並結合了監督式微調(SFT)軌跡。
    • 權重和harness程式碼已公開發布,可透過vLLM、SGLang或Transformers進行服務。
  • Tinker 分散式訓練 API:
    • 由Thinking Machines開發的基於網路的分散式AI模型訓練和微調API。
    • 支援對1B至1T+參數的開源模型進行微調,包括密集型和專家混合(MoE)架構。
    • 實施低秩適應(LoRA)微調,而非全參數微調,這有助於降低成本並提高GPU記憶體利用率。
    • 提供低階原語(如forward_backwardoptim_stepsample),讓開發者能完全控制訓練演算法。
    • 處理多節點排程、GPU資源分配和容錯,抽象化了分散式訓練的複雜性。
    • 支援強化學習工作流程,允許使用者提供生成提示和獎勵的環境。
  • Tongyi DeepResearch 30B 架構:
    • 代理式大型語言模型,總參數為300億,但每個token僅激活30億參數(專家混合架構)。
    • 專為長週期、深度資訊搜尋任務設計。
    • 採用完全自動化的合成資料生成管道進行代理式預訓練、監督式微調和強化學習。
    • 使用基於自訂Group Relative Policy Optimization框架的嚴格on-policy RL方法,包含token級策略梯度、留一法優勢估計和負樣本選擇性過濾。
    • 支援128K的上下文視窗。

🔮 前景展望AI analysis grounded in cited sources

開源搜尋代理的性能將加速追趕甚至超越專有模型。
Harness-1證明了透過創新的架構設計(如狀態外部化)和高效的訓練方法,即使是參數規模較小的開源模型也能在特定任務上超越大型專有模型,這將激勵更多開源社群投入此類優化。
「Harness工程」將成為AI代理開發的關鍵領域。
Harness-1的成功強調了模型外部的結構化環境(harness)在管理代理狀態、決策流程和提高泛化能力方面的重要性,預計未來AI代理的開發將更注重模型與其外部環境的協同設計。
分散式訓練API將降低先進AI模型開發的門檻。
Tinker等API抽象化了分散式訓練的複雜性,讓研究人員和開發者能專注於演算法和資料,從而加速創新,使更多團隊能夠訓練和微調大型、高效的AI模型。

時間線

2025-09
阿里雲通義實驗室發布Tongyi DeepResearch 30B-A3B模型。
2025-10
Thinking Machines發布Tinker API,提供模型微調和RL的訓練服務,當時處於私人測試階段。
2026-03
OpenAI發布GPT-5.4模型。
2026-06-02
Harness-1的相關研究論文《Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses》在arXiv上發布。
2026-06-06
Patrick Jiang(Harness-1的創建者之一)在X上發布Harness-1,宣稱其在長週期搜尋任務中超越GPT-5.4。
2026-06-08
VentureBeat報導Harness-1的發布,強調其性能超越GPT-5.4。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat