📄ArXiv AI•最新收集於 3h
確定性分析擊敗執行期代理程式

#governed-analytics#llm-evaluation#reproducibilitymastercontrol-seventeen-every-timeqwen3-8bmastercontrol seventeen every timearxiv
💡了解為何預先核准程式達成 110/110,而執行期規劃器只有 0/330 次完整符合分析契約。
⚡ 30-Second TL;DR
有什麼變化
該架構將自然語言意圖解讀,與分析程式的選擇及執行分離。
為什麼重要
這項研究顯示,限制 LLM 只負責解讀而非規劃執行,可能提升企業分析的可靠性與可稽核性。不過,研究結果僅適用於特定配置,不能據此認定其他設計的執行期代理程式必然失敗。
下一步行動
建立一個受治理的分析管線,將 LLM 意圖映射至版本化的 SQL 與分析程式白名單,並在固定評估資料集上重播測試。
誰應關注:Enterprise & Security Teams
關鍵要點
- •該架構將自然語言意圖解讀,與分析程式的選擇及執行分離。
- •支援的分析範圍包括關聯操作、聚合、比較、視窗函數、排名與相似度分析。
- •固定的語意、政策、資料與執行規則,讓分析結果可以重播與驗證。
- •三個 8B 模型在執行期產生 SQL 並選擇工具,但 330 次規劃情境中沒有一次完整符合契約。
- •Qwen3-8B 負責解讀意圖、政策負責執行核准程式,110 次測試全部成功。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。