💼VentureBeat•較早收集於 20m
前沿 AI 模型在自動化工作流程中會悄悄損毀文件

💡前沿模型在自動化任務中會損毀 25% 的數據;了解為何您的 AI 代理可能正在悄悄出錯。
⚡ 30-Second TL;DR
有什麼變化
前沿 LLM 在多步驟委託工作流程中平均會損毀 25% 的內容。
為什麼重要
這項研究凸顯了代理 AI 在可靠性上的關鍵差距,表明當前模型尚未準備好進行無人監督的文件編輯。從業者在委託複雜任務時必須實施強大的驗證層。
下一步行動
在任何 AI 驅動的文件修改工作流程中,實施「人在迴路」(human-in-the-loop) 的驗證步驟或自動化差異檢查。
誰應關注:Developers & AI Engineers
關鍵要點
- •前沿 LLM 在多步驟委託工作流程中平均會損毀 25% 的內容。
- •DELEGATE-52 基準測試評估了 52 個專業領域中的 310 個工作環境。
- •提供代理工具或干擾文件實際上會降低模型性能。
- •「往返接力」方法允許在無需人工標註參考的情況下進行自動化評估。
🧠 深度解析
Web-grounded analysis with 18 cited sources.
🔑 增強重點摘要
- •大型語言模型(LLM)引入的錯誤是「稀疏但嚴重」的,它們會「悄悄地損毀文件」,並在長時間互動中累積,難以察覺,因為輸出在結構上通常看起來是正確的。
- •文件內容損毀的程度取決於領域;LLM在Python等程式設計領域表現較好,但在自然語言、創意領域和利基設定(例如收益報表、樂譜、晶體學)中則表現不佳。Python是唯一一個大多數模型達到「準備就緒」閾值(20次互動後達到98%準確度)的領域。
- •該研究測試了19個LLM,包括Gemini 3.1 Pro、Claude 4.6 Opus和GPT 5.4等前沿模型。其中,Gemini 3.1 Pro表現最佳,在52個領域中有11個達到了98%的準確度。
- •文件尺寸越大、互動長度越長以及工作環境中存在「干擾文件」,都會加劇文件內容的損毀程度。
- •「往返接力」方法透過要求AI執行轉換然後再反轉,來評估模型重建文件至其原始形式的有效性,而無需人工標註參考。
🛠️ 技術深入
- DELEGATE-52 基準測試:
- 模擬跨52個專業領域的長期委託文件編輯工作流程。
- 領域包括程式設計、晶體學、會計帳簿、樂譜、家譜學和法律寫作。
- 使用約15,000個token長度的真實文件。
- 每個環境引入5-10個複雜的編輯任務。
- 數據集託管在Hugging Face上(
microsoft/delegate52),包含48個領域的234個工作環境(310個環境中允許重新分發種子文件的子集)。 - 如果模型在20次互動後達到98%或更高的準確度,則認為其在該領域「準備就緒」。
- 往返接力模擬方法:
- 無需人工標註參考解決方案即可評估結果。
- 該過程將一個種子文件和干擾文本通過10個連續的「往返」傳遞。每次往返都將一次正向編輯與一次反向指令配對,模擬總共20次互動。
- 每一步之後,都會進行語義等效性評估以衡量文件降級。
- 此方法源於機器翻譯評估(往返翻譯/反向翻譯),用於在沒有參考翻譯的情況下評估翻譯質量。 它也已應用於程式碼LLM評估。
- 自定義評估管道將原始文本通過特定領域的解析轉換為結構化表示,然後使用相似性函數比較參考文件和候選文件以衡量語義等效性。
- 測試模型: 來自六個系列的19個LLM,包括Gemini 3.1 Pro、Claude 4.6 Opus、GPT 5.4、GPT 5.2、GPT 5.1、GPT 4.1、Gemini 2.5 Pro、Claude Opus 4、GPT-4.5、Mistral、xAI和Moonshot模型。
🔮 前景展望AI analysis grounded in cited sources
企業應重新評估其自動化工作流程中對大型語言模型的信任程度。
該研究表明,即使是頂級模型也會在多步驟任務中悄悄損毀文件內容,這對依賴自動化的關鍵業務流程構成重大風險。
AI代理的設計將需要更強大的錯誤檢測和糾正機制。
由於模型錯誤是稀疏但嚴重的,並且會隨著時間的推移而累積,因此需要新的方法來確保在沒有人工持續監控的情況下保持文件完整性。
對特定領域的AI模型進行微調和專業化將變得更加關鍵。
該研究發現,模型在程式設計等結構化領域表現更好,但在自然語言和利基領域則表現不佳,這表明通用模型在複雜任務中的局限性。
⏳ 時間線
2022-09
關於機器翻譯評估的「往返翻譯」方法被重新審視,並證明其在無需參考翻譯的情況下進行準確自動評估的有效性。
2024-02
引入「往返正確性」(Round-Trip Correctness, RTC) 方法,用於在無需昂貴人工標註的情況下,對程式碼大型語言模型進行無監督評估。
2025-05
Microsoft Build 2025 強調了AI代理時代的到來,並提及GitHub Copilot和Microsoft 365 Copilot等產品中AI代理的廣泛應用。
2026-04-17
Microsoft 研究人員發布了預印本論文《LLMs Corrupt Your Documents When You Delegate》,介紹了 DELEGATE-52 基準測試。
2026-04-21
DELEGATE-52 基準測試在 Reddit (r/Rag) 上被討論,強調了LLM在編輯文件時會損毀內容的發現。
2026-04-24
YouTube 上發布了關於 DELEGATE-52 基準測試的 AI 研究綜述影片,詳細介紹了其評估方法和結果。
📎 來源 (18)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗

