📄ArXiv AI•最新收集於 11h
當拒答失效:LLM 捏造疼痛分數

#hallucination#abstention#model-calibration#clinical-aillm-robustness-auditgemini-2.5-flashllama-3.1-8btame-pain
💡了解為何模型在不可能回答的臨床任務中自信作答,會暴露拒答基準忽略的弱點。
⚡ 30-Second TL;DR
有什麼變化
僅依賴逐字稿的疼痛預測接近隨機,AUC 為 0.489,儘管聲學特徵仍帶有有限訊號。
為什麼重要
研究結果顯示,拒答本身並不是衡量模型穩健性的可靠指標:提示詞可能大幅影響模型是否承認不確定性。臨床及其他高風險系統應分別評估證據依據、被迫回答時的行為、校準程度,以及加權信心的幻覺率。
下一步行動
在你的 LLM 測試套件中加入使用無證據輸入的強制回答評估,並分別追蹤拒答率、信心程度、校準誤差與高信心捏造率。
誰應關注:Researchers & Academics
關鍵要點
- •僅依賴逐字稿的疼痛預測接近隨機,AUC 為 0.489,儘管聲學特徵仍帶有有限訊號。
- •在合作式提示詞下,六個模型幾乎對所有無資訊逐字稿拒答,並以 0.939–1.00 的準確率擷取明確說出的疼痛評分。
- •權威式提示詞使同一模型在語意等效的不同措辭下,拒答率從 0.18 變動至 1.00。
- •Gemini 2.5 Flash 與 Llama 3.1 8B 產生高信心捏造疼痛分數的比例分別為 0.53 與 0.76。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •研究顯示 AI 安全拒答機制通常位於模型淺層神經網絡,極易受到特定提示詞擾動而失效。
- •在缺乏必要臨床數據時,模型傾向於依賴人口統計學假設進行推論,導致醫療診斷捏造率高達 18%。
- •模型常將不可信的輸入元數據誤判為權威指令,導致在標準拒答機制失效時出現「流氓行為」。
- •即便針對醫療領域進行微調,模型在臨床摘要任務中仍存在約 1.47% 的幻覺率與 3.45% 的資訊遺漏率。
- •現有 AI 代理在處理少數族群疼痛評估時,存在系統性低估偏差,顯示模型訓練數據的代表性不足。
🛠️ 技術深入
- 拒答機制脆弱性:安全層與推理層分離,導致提示詞注入攻擊可輕易繞過拒答邏輯。
- 幻覺觸發機制:模型在面對高風險、低機率醫療場景時,因缺乏確定性約束,傾向於生成機率性高但事實錯誤的內容。
- 權威性誤判:模型將輸入上下文中的提示詞視為系統級指令,導致語意等效但措辭不同的提示詞產生極大拒答率差異。
- 臨床數據處理:模型缺乏本體論驅動的驗證機制,無法在缺乏證據時主動觸發確定性拒答。
🔮 前景展望AI analysis grounded in cited sources
醫療 AI 將強制導入確定性防護層
由於 LLM 本身的機率性本質難以完全消除幻覺,未來臨床應用將必須結合確定性掃描器與人機協作審核機制。
拒答機制將從提示詞層轉向架構層
研究顯示單純依賴提示詞工程無法解決安全問題,開發者將轉向在模型推理路徑中嵌入硬編碼的安全閘門。
⏳ 時間線
2026-07
安全研究指出 LLM 會將不可信輸入誤判為權威指令,導致拒答機制失效。
2026-08
學界發表關於 LLM 在醫療診斷中因缺乏數據而產生人口統計學偏見與幻覺的研究。
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。