
醫療 LLM 展現信心判斷力,也暴露盲點
一項受心理物理學啟發的基準測試發現,gpt-4.1-nano 的信心程度通常能反映證據品質、資訊缺失與診斷正確性。然而,在中度且互相矛盾的阿茲海默型病例中,模型仍顯得過度自信,顯示僅靠準確率無法衡量校準能力。
Tag: #clinical-reasoning5 results

一項受心理物理學啟發的基準測試發現,gpt-4.1-nano 的信心程度通常能反映證據品質、資訊缺失與診斷正確性。然而,在中度且互相矛盾的阿茲海默型病例中,模型仍顯得過度自信,顯示僅靠準確率無法衡量校準能力。

近期研究顯示 AI 診斷能力存在矛盾結果,一項顯示高誤診率,另一項則優於醫生。此差異凸顯了評估標準、測試方法以及當前大語言模型在臨床推理上的局限性。
January Mirror,一個基於證據的臨床推理系統,在2025內分泌委員會風格的120題考試中獲得87.5%準確率,超越人類專家(62.3%)和前沿LLM如GPT-5.2(74.6%)。它在最難題目上表現出色(76.7%準確率),在無網路存取的封閉證據限制下運行。輸出提供可追溯的指南引用,準確率100%。

MedRealMM 是一個基於真實中文臨床諮詢的大規模多模態基準測試。它評估了大型語言模型處理圖文醫療數據的能力,並突顯了模型在安全性與推理能力上與人類醫師的差距。

MedCalc-Pro 是一個包含 2,268 個臨床案例與 77 種醫療計算器的全新基準測試,旨在解決現有 LLM 醫療評估的侷限性。該研究同時提出了一種專用代理框架,能處理多工具選擇與嵌套計算,並有效抑制參數誤差傳播。