
利用強化學習提升 LLM 的證據導向診斷推理能力
本研究提出了一種框架,將 LLM 從被動推理轉變為具備迭代證據搜尋能力的診斷代理。透過結合強化學習與可驗證獎勵 (RLVR) 以及 RAGES 模擬器,該模型實現了高保真的臨床推理。
Tag: #medical-ai86 results

本研究提出了一種框架,將 LLM 從被動推理轉變為具備迭代證據搜尋能力的診斷代理。透過結合強化學習與可驗證獎勵 (RLVR) 以及 RAGES 模擬器,該模型實現了高保真的臨床推理。

MedCalc-Pro 是一個包含 2,268 個臨床案例與 77 種醫療計算器的全新基準測試,旨在解決現有 LLM 醫療評估的侷限性。該研究同時提出了一種專用代理框架,能處理多工具選擇與嵌套計算,並有效抑制參數誤差傳播。

研究人員推出了混合專家擴散語言模型 DiffusionGemma-26B,其在醫學視覺問答任務中的表現與自回歸模型相當甚至更優。該模型提供了獨特的雙向填充功能,允許放射科醫師編輯報告片段,同時由 AI 填補中間內容。

RareDxR1 是一款以推理為核心的端到端大型語言模型,旨在直接從非結構化臨床筆記中診斷罕見疾病。它透過內化醫學知識並利用演化學習來提升診斷準確性,從而繞過傳統基於管線的提取方式。

一家中國國產醫療AI廠商成功突破行業「死循環」,在多項關鍵醫療評測中表現優異。據報導,該模型在特定的臨床診斷與醫療推理任務中,表現超越了GPT-5.5。

NVIDIA 透過合成高品質 3D 醫學影像,解決放射科 AI 領域中數據稀缺與隱私限制的問題。此方法協助團隊克服因數據集狹窄且難以共享所導致的開發瓶頸。
Elon Musk 宣佈 Neuralink 正準備進行首例臨床植入手術,旨在恢復失明患者的視力。這標誌著該公司的腦機介面技術從運動控制應用領域的重大擴展。

哈佛研究顯示基於 OpenAI o1 的 AI 在急診分診準確率超越醫生:67% 對 50-55%。更多資料時準確率升至 82%,治療計劃達 89% 而醫生僅 34%。研究者強調 AI 是輔助而非取代,因限於文字輸入。

哈佛一項研究評估大型語言模型(LLMs)在各種醫療情境的表現,包括真實急診室案例。至少一個LLM的診斷準確度高於人類急診醫生。