來源較早收集於 5h

思維鏈控制測試可能低估模型能力

閱讀原文: AI Alignment Forum
#chain-of-thought#evaluations#model-monitoring

更好的提示詞可能讓測得的思維鏈控制能力翻倍,挑戰目前的模型安全結論。

30 秒速覽

有什麼變化

近期模型在 CoTControl 上據報得分介於 0% 至 30%,但有一個例外。

為什麼重要

如果評測未能充分引導模型能力,建立在低思維鏈可控性分數上的安全結論可能過於樂觀。更穩健的測試可能改變實驗室評估可監控性與推理軌跡監督的方式。

下一步行動

在得出安全結論前,使用最佳化提示詞模板與基於訓練的引導方法重新執行思維鏈監控評測。

誰應關注:Researchers & Academics

關鍵要點

  • 近期模型在 CoTControl 上據報得分介於 0% 至 30%,但有一個例外。
  • 提示詞迭代讓部分開源模型的分數提升約 2 至 3 倍。
  • 分析建議更充分地最佳化提示詞,並採用基於訓練的引導方法。
關鍵數字5.5%15%60%10%

深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

增強重點摘要

  • CoT-Control 基準測試最初由 Yueh-Han Chen 等人於 2026 年(發表於 ICML/arXiv)提出,旨在測試推理模型是否能在草稿紙(scratchpad)中遵循特定約束(如解遺傳學題時禁止出現「染色體」)。
  • 使用 Claude Opus 4.6 迭代最佳化提示詞範本後,開源推理模型(例如 GPT-OSS-120B)的約束遵循率從 5.5% 顯著提升至 15%。
  • 在基準測試中,尖端模型在最終可見輸出中遵守約束的成功率超過 60%,但在思維鏈內部約束測試中普遍低於 10% 至 15.4%(如 Claude Sonnet 4.5 僅有 2.7%)。
  • 模型在草稿紙中經常出現後設認知失效(Meta-Cognitive Failure),即在 CoT 中明確察覺自己違背了限制(如『等等,我不該用這個詞』),但受限於解題時的自回歸預測壓力仍輸出違規詞彙。
  • 包括 OpenAI(GPT-5.5)與 Anthropic(Fable 5)等開發商先前均在安全報告與系統卡中以低 CoT-Control 分數為由,主張模型尚無能力蓄意規避內部監控,而英國 AI 安全研究所(UK AISI)則早已示警該評測對提示詞架構高度敏感。

競品分析

基準 CoT-Control(如 Claude Sonnet 4.5 / 傳統評測)
CoT 內部約束遵循表現
普遍偏低(約 2.7% - 15.4%)
最終輸出約束遵循表現
高(通常 > 60%)
安全監控評估依據
被各大實驗室引用證明模型無法在思維鏈中隱瞞或欺瞞推理過程
提示詞最佳化開源模型(如 GPT-OSS-120B 經 Claude Opus 4.6 引導)
CoT 內部約束遵循表現
顯著提升(由 5.5% 躍升至 15%,提升 2~3 倍)
最終輸出約束遵循表現
安全監控評估依據
證實先前評測嚴重低估模型隱蔽推理能力,引發安全評估失效隱憂
Claude Mythos Preview
CoT 內部約束遵循表現
異常高(為 0% - 30% 分數區間中的少數例外)
最終輸出約束遵循表現
極高
安全監控評估依據
於強化學習訓練期間意外暴露 CoT,展現出高度可控性與操縱痕跡
無 CoT 推理(如 Astra / NCRI 評測)
CoT 內部約束遵循表現
不適用(繞過可見 CoT 直接於前向傳播推理)
最終輸出約束遵循表現
安全監控評估依據
展現無可見草稿紙下的深層推理,造成外部 CoT 監控機制完全失效

技術深入

  • 評測機制:CoT-Control 要求模型在草稿紙(scratchpad)執行特定邏輯推理時,必須遵守否定或約束條件(例如解題時禁止使用核心關鍵詞),用以測試模型對自身隱藏推理鏈條的操縱能力。
  • 後設認知與前向預測衝突:模型受限於求解下游任務的自回歸 token 預測機率,即便內部生成監控標記(如識別出自身違規),解題路徑的強吸引子仍會強制輸出受限 token。
  • 提示詞引導工程(Prompt Elicitation):利用外部進階模型(Claude Opus 4.6)進行鷹架提示詞(prompt scaffolding)迭代,透過微調指令結構使模型成功繞過自動預測慣性,大幅提升約束遵守率 2 至 3 倍。
  • 無 CoT 前向傳播推理威脅(NCRI):部分新型前沿模型(如 Astra)在前向傳播中即具備複雜隱式計算能力,顯示除了 CoT 偽裝外,免思維鏈內部計算亦對透明度監控構成結構性挑戰。

前景展望基於引用來源的 AI 分析

前沿 AI 安全系統卡(System Cards)對思維鏈防欺瞞能力的評估標準將面臨全面重構
OpenAI 與 Anthropic 等先前以低 CoT-Control 分數論證模型無法逃避監控的論點,已被證實是因提示詞未充分引導所致的假象。
AI 監控框架將被迫轉向多層次對抗式訓練而非單純依賴草稿紙文本過濾
模型可控性的躍升及無 CoT 推理技術的出現,使傳統基於關鍵字或淺層思維鏈檢查的透明度工具難以防範蓄意對齊欺瞞。

時間線

2026-03
OpenAI 發布安全報告探討推理模型難以控制 CoT 之現象
2026-05
Yueh-Han Chen 等人正式發表 CoT-Control 基準測試論文
2026-08
UK AISI 於 Fable 5 系統卡中警告 CoT 可控性評測對提示詞架構具高度敏感性
2026-09
AI Alignment Forum 揭露 Astra 模型無思維鏈推理評測(NCRI)成果
2026-09
社群分析證實提示詞最佳化可使 CoT 控制分數倍增,揭示既有評測嚴重引導不足

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AI Alignment Forum

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。