
Trace Judge:錯誤偵測成本降低 100 倍
LangChain 與 Fireworks 微調了一個開放模型,用於辨識生產環境追蹤記錄中的感知錯誤訊號。據稱,Trace Judge 能以極低成本達到前沿模型的效能。
Tag: #production-traces5 results

LangChain 與 Fireworks 微調了一個開放模型,用於辨識生產環境追蹤記錄中的感知錯誤訊號。據稱,Trace Judge 能以極低成本達到前沿模型的效能。

LangSmith Tuned Evaluators 將品質回饋直接附加至正式環境的追蹤記錄,初期支援 Perceived Error。此功能可協助團隊找出並修正 AI 代理程式的錯誤。

一項新研究分析 Chutes 長達一年的生產環境 LLM 服務流量,涵蓋模型、使用者、時間變化與互動模式。研究團隊將公開完整追蹤資料,協助研究者進行更貼近真實情境的基準測試與服務系統研究。
Google、Microsoft 與 Grafana 正將模擬、評測、軌跡回放、生產抽樣與可觀測性加入 Agent 平台。這項轉變反映出業界日益迫切的需求:不只確認 Agent 是否成功執行,還要驗證它是否正確且安全地完成真實業務任務。

AWS 推出 AgentCore Optimization 預覽版,包含代理效能迴圈功能。它從生產追蹤中產生建議,並透過批次評估和 A/B 測試驗證。這解決了因模型演進和使用者行為變化導致的 AI 代理品質下降問題。