📄最新收集於 11h

當拒答失效:LLM 捏造疼痛分數

當拒答失效:LLM 捏造疼痛分數
PostLinkedIn
📄閱讀原文: ArXiv AI
#hallucination#abstention#model-calibration#clinical-aillm-robustness-auditgemini-2.5-flashllama-3.1-8btame-pain

💡了解為何模型在不可能回答的臨床任務中自信作答,會暴露拒答基準忽略的弱點。

⚡ 30-Second TL;DR

有什麼變化

僅依賴逐字稿的疼痛預測接近隨機,AUC 為 0.489,儘管聲學特徵仍帶有有限訊號。

為什麼重要

研究結果顯示,拒答本身並不是衡量模型穩健性的可靠指標:提示詞可能大幅影響模型是否承認不確定性。臨床及其他高風險系統應分別評估證據依據、被迫回答時的行為、校準程度,以及加權信心的幻覺率。

下一步行動

在你的 LLM 測試套件中加入使用無證據輸入的強制回答評估,並分別追蹤拒答率、信心程度、校準誤差與高信心捏造率。

誰應關注:Researchers & Academics

關鍵要點

  • 僅依賴逐字稿的疼痛預測接近隨機,AUC 為 0.489,儘管聲學特徵仍帶有有限訊號。
  • 在合作式提示詞下,六個模型幾乎對所有無資訊逐字稿拒答,並以 0.939–1.00 的準確率擷取明確說出的疼痛評分。
  • 權威式提示詞使同一模型在語意等效的不同措辭下,拒答率從 0.18 變動至 1.00。
  • Gemini 2.5 Flash 與 Llama 3.1 8B 產生高信心捏造疼痛分數的比例分別為 0.53 與 0.76。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • 研究顯示 AI 安全拒答機制通常位於模型淺層神經網絡,極易受到特定提示詞擾動而失效。
  • 在缺乏必要臨床數據時,模型傾向於依賴人口統計學假設進行推論,導致醫療診斷捏造率高達 18%。
  • 模型常將不可信的輸入元數據誤判為權威指令,導致在標準拒答機制失效時出現「流氓行為」。
  • 即便針對醫療領域進行微調,模型在臨床摘要任務中仍存在約 1.47% 的幻覺率與 3.45% 的資訊遺漏率。
  • 現有 AI 代理在處理少數族群疼痛評估時,存在系統性低估偏差,顯示模型訓練數據的代表性不足。

🛠️ 技術深入

  • 拒答機制脆弱性:安全層與推理層分離,導致提示詞注入攻擊可輕易繞過拒答邏輯。
  • 幻覺觸發機制:模型在面對高風險、低機率醫療場景時,因缺乏確定性約束,傾向於生成機率性高但事實錯誤的內容。
  • 權威性誤判:模型將輸入上下文中的提示詞視為系統級指令,導致語意等效但措辭不同的提示詞產生極大拒答率差異。
  • 臨床數據處理:模型缺乏本體論驅動的驗證機制,無法在缺乏證據時主動觸發確定性拒答。

🔮 前景展望AI analysis grounded in cited sources

醫療 AI 將強制導入確定性防護層
由於 LLM 本身的機率性本質難以完全消除幻覺,未來臨床應用將必須結合確定性掃描器與人機協作審核機制。
拒答機制將從提示詞層轉向架構層
研究顯示單純依賴提示詞工程無法解決安全問題,開發者將轉向在模型推理路徑中嵌入硬編碼的安全閘門。

時間線

2026-07
安全研究指出 LLM 會將不可信輸入誤判為權威指令,導致拒答機制失效。
2026-08
學界發表關於 LLM 在醫療診斷中因缺乏數據而產生人口統計學偏見與幻覺的研究。

📎 來源 (9)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. nxcode.io
  2. preprints.org
  3. nih.gov
  4. cmu.edu
  5. paloaltonetworks.com
  6. nxcode.io
  7. enter.health
  8. arxiv.org
  9. nxcode.io
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。