
MAVEN:透過符號驗證提升代理工具呼叫能力
MAVEN 是一個輕量級符號推理框架,旨在改善代理工具的編排與驗證能力。它能在無需額外訓練的情況下,顯著提升複雜基準測試中的準確率。
直接匹配不多,已補上最新動態。
Tag: #symbolic-reasoning4 results

MAVEN 是一個輕量級符號推理框架,旨在改善代理工具的編排與驗證能力。它能在無需額外訓練的情況下,顯著提升複雜基準測試中的準確率。
作者使用 Torchwright 將小學直式乘法演算法直接編譯進一般的 Phi-3 checkpoint,完全不需訓練。這個三位數計算器在 3,000,000 個支援的表達式上達到 100% 準確率,另有支援 12 位數乘法的 checkpoint。

ReSS 框架從決策樹提取決策路徑作為符號支架,引導 LLM 產生表格資料的忠實推理。它建立高品質資料集用於微調 LLM,並透過資料增強提升泛化能力。在醫學與金融基準上提升達 10%,並引入忠實度指標。

研究人員引入一個包含 516 個證明狀態的基準,用於評估命題邏輯輔導中的 LLM 反饋。他們發現驗證可將錯誤傾向反饋提升 85%,但所有管道在複雜度 4-5 以上均失效。這挑戰了驗證器普遍改善輔導的假設。

California 與其他 28 個州指控 Meta 設計 Facebook 和 Instagram 使其具成癮性、違反兒童隱私法,並隱瞞相關做法。檢方將其涉嫌採取的策略概括為「吸引、留住、收集、隱瞞」。

Cloudflare 推出 Agent Tracing,支援設定 Payload 截斷限制。不同支援的 Agent 框架在 Payload 預設記錄策略上有所差異,因此開發者在設定可觀測性時需要檢查各框架的個別設定。

編劇、導演與製片人正接下臨時工作,教導 AI 系統編劇與製作規劃等技能。時薪介於 12 至 200 美元之間,但部分工作者認為這等同於協助自動化自己的職業。
AI 資料中心擴張正大幅推升磷化銦衍底的需求,這類材料用於高速光晶片。全球供應高度集中於三家海外供應商,而中國國內產能仍然有限,且正處於擴產爬坡階段。

Timothy Garton Ash 探討 AI 可能很快進入遞迴自我改進並達到超級智慧的預測。矽谷的樂觀展望,與 Geoffrey Hinton 等人對人類可能無法控制日益強大系統的警告形成對比。
一名獨立開發者表示,他以 300 億個 FineWeb tokens 訓練 SHADOW-250M,這個 2.5 億參數 LLM 經量化後低於 2 bits。據稱模型可在筆電 CPU 上以每秒約 400 tokens 運行,並透過磁碟上的 1-bit 壓縮機制,從最長 1 億 tokens 的歷史內容中進行檢索。