
鏈上語言模型代理交易2000萬美元真實ETH
在21天部署中,3,505個用戶資助的語言模型代理在DX Terminal Pro中交易真實ETH,產生2000萬美元交易量和99.9%結算成功率。可靠性來自模型周圍的操作層控制,如提示編譯、政策驗證和執行守護,而非僅基模型。發佈前測試修復關鍵故障,將資本部署率從42.9%提升至78%。
Tag: #llm-reliability15 results

在21天部署中,3,505個用戶資助的語言模型代理在DX Terminal Pro中交易真實ETH,產生2000萬美元交易量和99.9%結算成功率。可靠性來自模型周圍的操作層控制,如提示編譯、政策驗證和執行守護,而非僅基模型。發佈前測試修復關鍵故障,將資本部署率從42.9%提升至78%。

CogniConsole 是一個新的架構框架,將推理時控制視為一種正式抽象,以提升大型語言模型 (LLM) 的可靠性。透過使用結構化介面進行任務框架設定與上下文選擇,該架構能在無需重新訓練模型的情況下,顯著降低輸出變異與失敗率。

Lean4Agent 是一個利用 Lean4 形式化語言來建模並驗證 LLM 代理工作流語義一致性的新框架。它引入了用於調試執行軌跡的 FormalAgentLib 以及用於自動優化工作流的 LeanEvolve,在 SWE-Bench 上展現了顯著的性能提升。
研究人員推出了 AgingBench,旨在研究 AI 代理在長期部署中如何退化。研究發現,記憶策略對代理性能的影響遠大於單純更換更強大的模型。

這項研究引入了「合約綁定證據激活」(CBEA) 與「字典序承諾驗證」(LCV),以防止語言模型做出不可靠的承諾。透過限制證據範圍並驗證結構化輸出,該系統顯著降低了長文本與記憶密集型應用中的失敗率。

一項微軟的新研究顯示,前沿 AI 模型在多步驟自動化工作流程中,平均會損毀 25% 的文件內容。該研究引入了 DELEGATE-52 基準測試,旨在衡量委託知識任務中的可靠性。

微軟研究人員的 DELEGATE-52 基準測試 19 個 LLM 橫跨 52 個領域,揭示嚴重錯誤導致文件損壞。頂尖模型如 Gemini 3.1 Pro 在 20 次互動後丟失 25% 內容,所有模型平均劣化 50%。專家警告勿過度依賴 LLM 處理複雜工作流程,需加裝護欄。

近期利用大型語言模型進行體育賽事結果預測的嘗試遭遇重大失敗,凸顯了現有 AI 在處理高熵、現實世界事件時的局限性。

哥倫比亞大學新聞學院 Tow Center 的研究指出,ChatGPT、Claude、Gemini 和 Grok 等主流 AI 模型無法可靠地回答有關投票與選舉的基本問題。該研究強調了隨著選民日益依賴這些工具獲取政治資訊所帶來的重大風險。

本研究提出了一種神經符號學方法,旨在解決大型語言模型在法律實務中的可靠性問題。透過結合大型語言模型與形式驗證,該框架致力於確保法律推理過程能嚴格基於原始文本。