⚛️量子位•較早收集於 78m
國產醫療AI在關鍵評測中超越GPT-5.5

#medical-ai#benchmarkdomestic-medical-aigpt-5.5
💡首個在臨床基準測試中宣稱超越GPT-5.5的國產醫療AI模型。
⚡ 30-Second TL;DR
有什麼變化
國產醫療AI模型在臨床基準測試中取得突破性表現。
為什麼重要
這一進展表明,透過領域專精的微調與高品質醫療數據治理,國產模型有望在專業領域超越通用型前沿模型。
下一步行動
分析該研究中使用的評測方法,以找出您自身領域專精模型基準測試中的不足之處。
誰應關注:Researchers & Academics
關鍵要點
- •國產醫療AI模型在臨床基準測試中取得突破性表現。
- •成功解決了長期困擾醫療AI發展的「死循環」難題。
- •在專業醫療推理與診斷準確度測試中超越了GPT-5.5。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 18 個來源。
🔑 增強重點摘要
- •該國產醫療AI模型已被確認為訊飛醫療(iFlytek Healthcare)自主研發的「星火醫療大模型V3.5」。
- •星火醫療大模型V3.5在IDC《中國醫療大模型技術評估2026》中榮獲綜合實力行業榜首,並在上海人工智慧實驗室MedBench智能體評測中以98.9分登頂。
- •該模型成功解決了醫療AI長期面臨的「死循環」難題,即大多數醫療AI產品無法深度嵌入醫生工作流程,導致難以獲取真實臨床數據進行持續迭代的問題。
- •星火醫療大模型V3.5在真實臨床應用中表現出色,其生成的病歷醫生採納率高達91%,並能將病歷書寫時間縮短52%。
- •該模型依賴於一個龐大的「數據飛輪」進行持續訓練,其數據基座包含16億人次脫敏醫療語音數據和12億次真實診療數據,平台每日新增學習的語音、影像、病歷類真實醫療數據超過220萬份。
🛠️ 技術深入
- 多模態融合能力全面升級: 星火醫療大模型V3.5在真實診室環境中,深度融合醫療語音識別、多人語音識別與病歷自動生成。同時,影像輔診和醫學語義理解的多模態能力也全面升級,實現影像識別與診療推理的深度結合。
- 長文本高效推理實現自主可控: 該模型率先在國產算力平台上實現了DSA(動態稀疏注意力)與MTP(多Token預測)的長文本高效訓練,將醫療長上下文場景推理吞吐量提升4.5倍,支援醫院和區域性醫療機構的本地化部署及迭代。
- 循證思維鏈技術提升智能體能力: 模型整合中英文權威診療指南、專家共識等高質量醫學證據,支援多步推理、深度反思與完整證據溯源,覆蓋線上問診、門診、住院等全診療場景,旨在降低誤診漏診風險並提高診療規範性。
- 數據飛輪與演算法創新: 訊飛醫療科技的星火醫療大模型V3.5以中國16億人次脫敏醫療語音數據和12億次真實診療數據為基礎持續訓練,平台每日新增學習的語音、影像、病歷類真實醫療數據超過220萬份。在演算法方面,應用醫療高質量數據與醫生交互回饋的監督數據,實現「證據對齊——反思校驗——專家強化」的循證推理技術。
🔮 前景展望AI analysis grounded in cited sources
垂直醫療AI模型將加速在中國醫療體系中的普及與應用。
該模型在真實臨床場景中展現出高醫生採納率和效率提升,並解決了數據閉環難題,預示著其在中國醫療機構的廣泛落地。
醫療AI的評測標準將更加側重於實際臨床落地能力而非單純的知識問答。
業界意識到傳統評測與臨床實踐存在鴻溝,新的評測體系如DoctorBench和MedBench強調多步驟、跨部門、多角色和長時程的複雜流程處理能力。
中國醫療AI產業將受益於政策支持和數據優勢,加速全球競爭力提升。
中國政府大力推動「AI+醫療健康」計畫,並擁有龐大的脫敏醫療數據基礎,為國產醫療AI的發展提供了獨特優勢。
⏳ 時間線
2025-05
OpenAI推出HealthBench,作為衡量大型語言模型在醫療領域效能與安全性的開源評估基準。
2025-11
中國大陸國家衛生健康委員會發布「關於促進和規範『人工智能+醫療衛生』應用發展的實施意見」,規劃到2027年建立高品質醫療資料集與專業AI模型。
2026-02
訊飛星火醫療大模型被列為2026年國內最值得期待的九個醫療大模型之一,被描述為「臨床閉環成熟的國產全科輔診標杆」。
2026-04
OpenAI正式推出GPT-5.5,主打自主完成複雜任務、編寫程式碼及科研輔助三大場景。
2026-04
杭州德適生物發布醫療AI評測平台DoctorBench,並揭曉首期全球醫療大模型排行榜,WiseDiag-v2、Gemini-3.1-Pro-Preview、GPT-5.4位列前三甲。
2026-06
訊飛醫療正式發佈自主研發的星火醫療大模型V3.5,並在IDC《中國醫療大模型技術評估2026》中位列行業榜首,MedBench智能體評測以98.9分登頂,綜合能力顯著超越GPT-5.5等主流大模型。
📎 來源 (18)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
每週 AI 簡報
每週一封,可隨時退訂。