⚛️較早收集於 78m

國產醫療AI在關鍵評測中超越GPT-5.5

國產醫療AI在關鍵評測中超越GPT-5.5
PostLinkedIn
⚛️閱讀原文: 量子位
#medical-ai#benchmarkdomestic-medical-aigpt-5.5

💡首個在臨床基準測試中宣稱超越GPT-5.5的國產醫療AI模型。

⚡ 30-Second TL;DR

有什麼變化

國產醫療AI模型在臨床基準測試中取得突破性表現。

為什麼重要

這一進展表明,透過領域專精的微調與高品質醫療數據治理,國產模型有望在專業領域超越通用型前沿模型。

下一步行動

分析該研究中使用的評測方法,以找出您自身領域專精模型基準測試中的不足之處。

誰應關注:Researchers & Academics

關鍵要點

  • 國產醫療AI模型在臨床基準測試中取得突破性表現。
  • 成功解決了長期困擾醫療AI發展的「死循環」難題。
  • 在專業醫療推理與診斷準確度測試中超越了GPT-5.5。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 18 個來源。

🔑 增強重點摘要

  • 該國產醫療AI模型已被確認為訊飛醫療(iFlytek Healthcare)自主研發的「星火醫療大模型V3.5」。
  • 星火醫療大模型V3.5在IDC《中國醫療大模型技術評估2026》中榮獲綜合實力行業榜首,並在上海人工智慧實驗室MedBench智能體評測中以98.9分登頂。
  • 該模型成功解決了醫療AI長期面臨的「死循環」難題,即大多數醫療AI產品無法深度嵌入醫生工作流程,導致難以獲取真實臨床數據進行持續迭代的問題。
  • 星火醫療大模型V3.5在真實臨床應用中表現出色,其生成的病歷醫生採納率高達91%,並能將病歷書寫時間縮短52%。
  • 該模型依賴於一個龐大的「數據飛輪」進行持續訓練,其數據基座包含16億人次脫敏醫療語音數據和12億次真實診療數據,平台每日新增學習的語音、影像、病歷類真實醫療數據超過220萬份。

🛠️ 技術深入

  • 多模態融合能力全面升級: 星火醫療大模型V3.5在真實診室環境中,深度融合醫療語音識別、多人語音識別與病歷自動生成。同時,影像輔診和醫學語義理解的多模態能力也全面升級,實現影像識別與診療推理的深度結合。
  • 長文本高效推理實現自主可控: 該模型率先在國產算力平台上實現了DSA(動態稀疏注意力)與MTP(多Token預測)的長文本高效訓練,將醫療長上下文場景推理吞吐量提升4.5倍,支援醫院和區域性醫療機構的本地化部署及迭代。
  • 循證思維鏈技術提升智能體能力: 模型整合中英文權威診療指南、專家共識等高質量醫學證據,支援多步推理、深度反思與完整證據溯源,覆蓋線上問診、門診、住院等全診療場景,旨在降低誤診漏診風險並提高診療規範性。
  • 數據飛輪與演算法創新: 訊飛醫療科技的星火醫療大模型V3.5以中國16億人次脫敏醫療語音數據和12億次真實診療數據為基礎持續訓練,平台每日新增學習的語音、影像、病歷類真實醫療數據超過220萬份。在演算法方面,應用醫療高質量數據與醫生交互回饋的監督數據,實現「證據對齊——反思校驗——專家強化」的循證推理技術。

🔮 前景展望AI analysis grounded in cited sources

垂直醫療AI模型將加速在中國醫療體系中的普及與應用。
該模型在真實臨床場景中展現出高醫生採納率和效率提升,並解決了數據閉環難題,預示著其在中國醫療機構的廣泛落地。
醫療AI的評測標準將更加側重於實際臨床落地能力而非單純的知識問答。
業界意識到傳統評測與臨床實踐存在鴻溝,新的評測體系如DoctorBench和MedBench強調多步驟、跨部門、多角色和長時程的複雜流程處理能力。
中國醫療AI產業將受益於政策支持和數據優勢,加速全球競爭力提升。
中國政府大力推動「AI+醫療健康」計畫,並擁有龐大的脫敏醫療數據基礎,為國產醫療AI的發展提供了獨特優勢。

時間線

2025-05
OpenAI推出HealthBench,作為衡量大型語言模型在醫療領域效能與安全性的開源評估基準。
2025-11
中國大陸國家衛生健康委員會發布「關於促進和規範『人工智能+醫療衛生』應用發展的實施意見」,規劃到2027年建立高品質醫療資料集與專業AI模型。
2026-02
訊飛星火醫療大模型被列為2026年國內最值得期待的九個醫療大模型之一,被描述為「臨床閉環成熟的國產全科輔診標杆」。
2026-04
OpenAI正式推出GPT-5.5,主打自主完成複雜任務、編寫程式碼及科研輔助三大場景。
2026-04
杭州德適生物發布醫療AI評測平台DoctorBench,並揭曉首期全球醫療大模型排行榜,WiseDiag-v2、Gemini-3.1-Pro-Preview、GPT-5.4位列前三甲。
2026-06
訊飛醫療正式發佈自主研發的星火醫療大模型V3.5,並在IDC《中國醫療大模型技術評估2026》中位列行業榜首,MedBench智能體評測以98.9分登頂,綜合能力顯著超越GPT-5.5等主流大模型。

📎 來源 (18)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. udn.com
  2. etnet.com.hk
  3. qq.com
  4. 163.com
  5. sina.cn
  6. qbitai.com
  7. life.tw
  8. yam.com
  9. hk01.com
  10. storm.mg
  11. sina.com.cn
  12. line.me
  13. taiwan-healthcare.org
  14. cn-witmed.com
  15. technews.tw
  16. ettoday.net
  17. segmentfault.com
  18. unwire.hk
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。