
MEDLEY-BENCH:規模提升評估而非控制
MEDLEY-BENCH 推出 AI 元認知基準測試,將推理、私人自我修正及社會影響修正分離,在模型間真實分歧下進行評估。它評估 12 個家族的 35 個模型,橫跨五個領域,顯示規模提升評估能力但非控制能力。小型模型常匹敵或超越大型模型,挑戰規模為元認知唯一途徑的觀念。
Tag: #belief-revision7 results

MEDLEY-BENCH 推出 AI 元認知基準測試,將推理、私人自我修正及社會影響修正分離,在模型間真實分歧下進行評估。它評估 12 個家族的 35 個模型,橫跨五個領域,顯示規模提升評估能力但非控制能力。小型模型常匹敵或超越大型模型,挑戰規模為元認知唯一途徑的觀念。

本調查回顧從 Doyle 與 London 於 1980 年提出的分類法,到 AGM 框架及當代計算方法的信念變更研究演進。研究將歷史理論與實作挑戰連結起來,為開發穩健且具形式保證的計算藍圖奠定基礎。

Kumiho 推出圖形原生認知記憶架構,用於 AI 代理,並以正式 AGM 信念修訂語義為基礎。它使用不可變修訂和 URI 定址等原語法統一認知記憶與版本化資產。在 LoCoMo(0.565 F1)和 LoCoMo-Plus(93.3% 準確率)基準上達到 SOTA 結果,超越 Gemini。

研究人員推出了 AGMpabd,這是第一個能夠處理矛盾假設而不導致邏輯崩潰的 AGM 式溯因擴展運算。此發展利用 RCbr 邏輯,在複雜的推理任務中維持知識狀態的一致性。

PBRC 是一種協議級機制,用於多代理系統中嚴格分離開放通訊與可接受的信念變更,透過預註冊證據觸發器避免從眾導致的錯誤收斂。合約固定一階證據觸發、可接受修訂運算子、優先規則與後備政策,每項實質信念變更需提供外部驗證證據。論文證明其安全性,並展示審核性與邏輯規格化。

本文探討區間順序與雙順序作為總預序的泛化,用於理性信念修訂。提供對應修訂算子的公理化特徵,並引入非優先修訂,透過視不一致輸入為不可信來確保一致性。此方法連結可信度限制修訂,適合代理最初拒絕新資訊的情境。
一則 Reddit 討論詢問,現有研究是否曾在神經系統中共同評估持續性的認知暫緩、來源保存、證據觸發的信念修正,以及受控的非相關變更。發文者希望找出選擇性預測、不確定性估計、信念修正、持續學習與模型編輯等領域中的相關術語、部分先例與反例。