
醫療 LLM 展現信心判斷力,也暴露盲點
一項受心理物理學啟發的基準測試發現,gpt-4.1-nano 的信心程度通常能反映證據品質、資訊缺失與診斷正確性。然而,在中度且互相矛盾的阿茲海默型病例中,模型仍顯得過度自信,顯示僅靠準確率無法衡量校準能力。
Tag: #metacognition11 results

一項受心理物理學啟發的基準測試發現,gpt-4.1-nano 的信心程度通常能反映證據品質、資訊缺失與診斷正確性。然而,在中度且互相矛盾的阿茲海默型病例中,模型仍顯得過度自信,顯示僅靠準確率無法衡量校準能力。

MEDLEY-BENCH 推出 AI 元認知基準測試,將推理、私人自我修正及社會影響修正分離,在模型間真實分歧下進行評估。它評估 12 個家族的 35 個模型,橫跨五個領域,顯示規模提升評估能力但非控制能力。小型模型常匹敵或超越大型模型,挑戰規模為元認知唯一途徑的觀念。

Google 研究人員引入了「忠實不確定性」(faithful uncertainty),這是一種後設認知技術,允許 LLM 表達信心程度,而非僅限於二元回答。此方法旨在解決「效用稅」(utility tax)問題,即模型為了避免幻覺而犧牲大量有效資訊。

這項研究挑戰了目前關於 LLM 具備真實元認知監控能力的普遍觀點。研究表明,模型在自我報告內部狀態時的表現,更可能是基於模式匹配而非真正的內省。

MetaKGEnrich 是一個自動化管線,透過識別稀疏圖譜區域並檢索外部證據,使 LLM 能夠進行自我導向的知識修復。該系統結合了拓撲診斷與 GraphRAG,顯著提升了多項基準測試中的回答準確度。

Hyperagents 將任務代理與元代理整合為單一可編輯程式,实现後設認知自我修改。DGM-H 擴展 Darwin Gödel Machine,支持跨領域通用自我改進,在多樣任務中超越基準。持久記憶等元層改進可跨領域轉移並隨執行累積。

大型推理模型在複雜任務中因自我調控不足而失敗,儘管中間步驟正確。元認知行為調優(MBT)透過 MBT-S(從頭合成嚴謹推理軌跡)和 MBT-R(改寫軌跡穩定探索)注入元認知策略。它在多跳 QA 基準上提升準確率,並減少 token 消耗。

自我監控模組如元認知作為輔助損失,在連續時間多時間尺度RL代理中各種捕食者-獵物環境中無顯著益處。將輸出結構整合至決策路徑,在非穩態環境中帶來邊際改善,但未優於基準。關鍵教訓:自我監控須直接影響決策,而非平行運行。

提出操作框架,將元認知判斷建模為狀態轉換操作,區分經典狀態變化與結構性非交換性。引入反事實確定性與評估非侵入性假設,產生可測試的相關性約束,以證實真實非交換性。提供3D旋轉模型與行為範式進行實證驗證。
LLMs lack human-like metacognitive skills, causing errors, sycophancy, and 'slop' outputs. Enhancing metacognition could catch mistakes, stabilize alignment via reflective endorsement, and improve research utility. Benefits for alignment may outweigh capability risks, with work already underway.