🐯虎嗅•較早收集於 6m
理解 AI 開發中的 Harness Engineering
💡了解為何頂尖 AI 專家正將重心從提示詞工程轉向「Harness Engineering」,以顯著提升 AI 的可靠性。
⚡ 30-Second TL;DR
有什麼變化
AI 性能不僅取決於模型本身,還取決於「Harness」(控制系統與工具)。
為什麼重要
這一轉變強調,構建生產級 AI 不再僅僅是提示詞工程,而是更多地關於設計具備彈性、自動化的基礎設施,以約束和引導模型的行為。
下一步行動
審查您當前的 AI 工作流程,將重複的手動提示詞修復替換為永久的系統級配置,例如自定義指令或自動化驗證腳本。
誰應關注:Developers & AI Engineers
關鍵要點
- •AI 性能不僅取決於模型本身,還取決於「Harness」(控制系統與工具)。
- •核心目標是通過修改運行環境來永久解決重複問題,而不僅僅是重新提示。
- •根據 Harness 設計的質量,AI 性能差異可達 6 倍之多。
- •自定義指令、知識庫和自動化檢查迴路等常見做法,本質上都是 Harness Engineering。
🧠 深度解析
Web-grounded analysis with 15 cited sources.
🔑 增強重點摘要
- •Harness Engineering 在架構層面上與提示工程 (Prompt Engineering) 和上下文工程 (Context Engineering) 不同;提示工程優化單次互動,上下文工程管理單一上下文視窗內的令牌集,而 Harness Engineering 則處理多會話、多代理問題,引入上下文重置、結構化交接工件和階段門控。
- •Harness Engineering 的概念在 2026 年初由 Mitchell Hashimoto 普及,他描述了透過修改代理的環境來永久修復錯誤的習慣,隨後 OpenAI 和 Anthropic 也發表了文章擴展了這個想法。
- •Harness Engineering 透過多個強化層次運作,包括約束安全帶 (Constraint Harnesses) 作為預防性控制、回饋迴路 (Feedback Loops) 實現自我修正,以及品質門控 (Quality Gates) 用於強制執行前兩層未能阻止的問題。
- •OpenAI 的 Codex 團隊利用 Harness Engineering 原則,在五個月內完全由 AI 代理生成了超過一百萬行生產程式碼,工程師的角色從編寫程式碼轉變為設計控制系統。
- •Harness Engineering 被視為建構值得信賴、可防禦和可靠 AI 產品的核心能力,將安全視為從一開始就必須投入的基礎,而非事後考量。
🛠️ 技術深入
- Harness 的三層架構:
- 約束安全帶 (Constraint Harnesses):作為前饋控制,在生成開始前縮小代理的解決方案空間,例如規則文件、架構 Lint 配置和類型系統,確保輸出符合預期。
- 回饋迴路 (Feedback Loops):實現自我修正,將 AI 系統的結果、修正、評級和錯誤回饋到訓練數據中,使其隨時間改進。
- 品質門控 (Quality Gates):強制執行前兩層未能預防的標準,例如透過持續整合 (CI) 失敗來強制執行工程標準。
- AI 控制平面 (AI Control Plane):作為企業 AI 系統(模型、代理、管道)與底層數據和業務上下文之間的治理和管理層。它負責執行存取策略、管理身份和權限、在推斷時提供受控上下文,並維護防篡改的審計追蹤。
- AI 護欄 (AI Guardrails):在 AI 處理的各個階段實施的保護措施,以將輸出維持在可接受的範圍內。它們可以是輸入護欄(過濾有害或不適當的查詢)、輸出護欄(審核內容、提供解釋)和系統護欄(確保 AI 符合業務、道德和法律要求)。
- 代理架構 (Agentic Architecture):支援 AI 代理的自主行為,使其能夠感知環境、做出決策並採取行動以實現目標。其組件解決了意圖性(規劃)、預見性、自我反應性和自我反思性。
- OpenAI 的 Harness 實作範例:包括一個結構化的
docs/目錄作為單一事實來源、一個AGENTS.md文件作為任務上下文的目錄、用於強制執行架構規則的自定義 Lint 工具、定期垃圾收集代理,以及代理可以存取可觀察性數據和瀏覽器導航以進行自我偵錯。 - 結合數學技術提升可靠性:約翰霍普金斯大學的工程師開發了一種方法,將神經網路與先進的數學技術(如 Zubov 偏微分方程)和深度強化學習中的 Actor-Critic 框架結合,以創建更可靠的複雜機器控制系統,擴大「吸引區域」(Region of Attraction, RoA)。
🔮 前景展望AI analysis grounded in cited sources
Harness Engineering 將成為 AI 開發中的標準且關鍵的學科。
隨著 AI 代理變得更加自主並整合到生產系統中,強大的控制機制對於可靠性、安全性及合規性至關重要,這將使工程重點從編寫程式碼轉向系統設計。
AI 工程師的角色將顯著演變為「Harness 工程師」或「AI 系統工程師」。
未來的重點將從編寫程式碼轉向設計環境、指定意圖以及建構回饋迴路,以使 AI 代理能夠大規模地執行可靠的工作。
監管框架將越來越多地納入 Harness Engineering 的原則。
現有的框架,如 NIST AI 風險管理框架 (AI RMF) 和歐盟 AI 法案,已經強調了可信賴性、安全控制和持續監控,這些都與 Harness Engineering 的目標和機制直接相關。
⏳ 時間線
2026-02
Mitchell Hashimoto 透過部落格文章普及「Harness Engineering」概念,描述了透過修改代理環境來永久修復錯誤的習慣。
2026-02
OpenAI 發表了題為《Harness engineering: leveraging Codex in an agent-first world》的文章,顯著提升了該術語的廣泛認知度。
2026-03
Anthropic、LangChain 和 Birgitta Böckeler (在 martinfowler.com 上) 發表了相關文章,並有一篇 arXiv 論文將此概念正式化,進一步鞏固了「Harness Engineering」作為一門公認學科的地位。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗


