🐯較早收集於 6m

理解 AI 開發中的 Harness Engineering

PostLinkedIn
🐯閱讀原文: 虎嗅

💡了解為何頂尖 AI 專家正將重心從提示詞工程轉向「Harness Engineering」,以顯著提升 AI 的可靠性。

⚡ 30-Second TL;DR

有什麼變化

AI 性能不僅取決於模型本身,還取決於「Harness」(控制系統與工具)。

為什麼重要

這一轉變強調,構建生產級 AI 不再僅僅是提示詞工程,而是更多地關於設計具備彈性、自動化的基礎設施,以約束和引導模型的行為。

下一步行動

審查您當前的 AI 工作流程,將重複的手動提示詞修復替換為永久的系統級配置,例如自定義指令或自動化驗證腳本。

誰應關注:Developers & AI Engineers

關鍵要點

  • AI 性能不僅取決於模型本身,還取決於「Harness」(控制系統與工具)。
  • 核心目標是通過修改運行環境來永久解決重複問題,而不僅僅是重新提示。
  • 根據 Harness 設計的質量,AI 性能差異可達 6 倍之多。
  • 自定義指令、知識庫和自動化檢查迴路等常見做法,本質上都是 Harness Engineering。

🧠 深度解析

Web-grounded analysis with 15 cited sources.

🔑 增強重點摘要

  • Harness Engineering 在架構層面上與提示工程 (Prompt Engineering) 和上下文工程 (Context Engineering) 不同;提示工程優化單次互動,上下文工程管理單一上下文視窗內的令牌集,而 Harness Engineering 則處理多會話、多代理問題,引入上下文重置、結構化交接工件和階段門控。
  • Harness Engineering 的概念在 2026 年初由 Mitchell Hashimoto 普及,他描述了透過修改代理的環境來永久修復錯誤的習慣,隨後 OpenAI 和 Anthropic 也發表了文章擴展了這個想法。
  • Harness Engineering 透過多個強化層次運作,包括約束安全帶 (Constraint Harnesses) 作為預防性控制、回饋迴路 (Feedback Loops) 實現自我修正,以及品質門控 (Quality Gates) 用於強制執行前兩層未能阻止的問題。
  • OpenAI 的 Codex 團隊利用 Harness Engineering 原則,在五個月內完全由 AI 代理生成了超過一百萬行生產程式碼,工程師的角色從編寫程式碼轉變為設計控制系統。
  • Harness Engineering 被視為建構值得信賴、可防禦和可靠 AI 產品的核心能力,將安全視為從一開始就必須投入的基礎,而非事後考量。

🛠️ 技術深入

  • Harness 的三層架構
    • 約束安全帶 (Constraint Harnesses):作為前饋控制,在生成開始前縮小代理的解決方案空間,例如規則文件、架構 Lint 配置和類型系統,確保輸出符合預期。
    • 回饋迴路 (Feedback Loops):實現自我修正,將 AI 系統的結果、修正、評級和錯誤回饋到訓練數據中,使其隨時間改進。
    • 品質門控 (Quality Gates):強制執行前兩層未能預防的標準,例如透過持續整合 (CI) 失敗來強制執行工程標準。
  • AI 控制平面 (AI Control Plane):作為企業 AI 系統(模型、代理、管道)與底層數據和業務上下文之間的治理和管理層。它負責執行存取策略、管理身份和權限、在推斷時提供受控上下文,並維護防篡改的審計追蹤。
  • AI 護欄 (AI Guardrails):在 AI 處理的各個階段實施的保護措施,以將輸出維持在可接受的範圍內。它們可以是輸入護欄(過濾有害或不適當的查詢)、輸出護欄(審核內容、提供解釋)和系統護欄(確保 AI 符合業務、道德和法律要求)。
  • 代理架構 (Agentic Architecture):支援 AI 代理的自主行為,使其能夠感知環境、做出決策並採取行動以實現目標。其組件解決了意圖性(規劃)、預見性、自我反應性和自我反思性。
  • OpenAI 的 Harness 實作範例:包括一個結構化的 docs/ 目錄作為單一事實來源、一個 AGENTS.md 文件作為任務上下文的目錄、用於強制執行架構規則的自定義 Lint 工具、定期垃圾收集代理,以及代理可以存取可觀察性數據和瀏覽器導航以進行自我偵錯。
  • 結合數學技術提升可靠性:約翰霍普金斯大學的工程師開發了一種方法,將神經網路與先進的數學技術(如 Zubov 偏微分方程)和深度強化學習中的 Actor-Critic 框架結合,以創建更可靠的複雜機器控制系統,擴大「吸引區域」(Region of Attraction, RoA)。

🔮 前景展望AI analysis grounded in cited sources

Harness Engineering 將成為 AI 開發中的標準且關鍵的學科。
隨著 AI 代理變得更加自主並整合到生產系統中,強大的控制機制對於可靠性、安全性及合規性至關重要,這將使工程重點從編寫程式碼轉向系統設計。
AI 工程師的角色將顯著演變為「Harness 工程師」或「AI 系統工程師」。
未來的重點將從編寫程式碼轉向設計環境、指定意圖以及建構回饋迴路,以使 AI 代理能夠大規模地執行可靠的工作。
監管框架將越來越多地納入 Harness Engineering 的原則。
現有的框架,如 NIST AI 風險管理框架 (AI RMF) 和歐盟 AI 法案,已經強調了可信賴性、安全控制和持續監控,這些都與 Harness Engineering 的目標和機制直接相關。

時間線

2026-02
Mitchell Hashimoto 透過部落格文章普及「Harness Engineering」概念,描述了透過修改代理環境來永久修復錯誤的習慣。
2026-02
OpenAI 發表了題為《Harness engineering: leveraging Codex in an agent-first world》的文章,顯著提升了該術語的廣泛認知度。
2026-03
Anthropic、LangChain 和 Birgitta Böckeler (在 martinfowler.com 上) 發表了相關文章,並有一篇 arXiv 論文將此概念正式化,進一步鞏固了「Harness Engineering」作為一門公認學科的地位。

📎 來源 (15)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. augmentcode.com
  2. milvus.io
  3. datasciencedojo.com
  4. dev.to
  5. nxcode.io
  6. medium.com
  7. irisagent.com
  8. atlan.com
  9. devoteam.com
  10. openlayer.com
  11. galileo.ai
  12. ibm.com
  13. jhu.edu
  14. latitude.so
  15. splunk.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅