💰較早收集於 15m

百川智能將發布新一代醫療大模型

百川智能將發布新一代醫療大模型
PostLinkedIn
💰閱讀原文: 钛媒体

💡新款醫療大模型宣稱幻覺率僅 3.3%,挑戰通用模型在高風險醫療領域的地位。

⚡ 30-Second TL;DR

有什麼變化

新款醫療專用大模型專注於高準確度。

為什麼重要

此次發布凸顯了垂直領域模型在醫療等高風險領域優於通用模型的趨勢。

下一步行動

將您目前的 RAG 流程與 3.3% 的幻覺率進行基準測試,以評估您的應用場景是否需要進行垂直領域微調。

誰應關注:Developers & AI Engineers

關鍵要點

  • 新款醫療專用大模型專注於高準確度。
  • 事實性幻覺率降低至 3.3%。
  • 王小川認為通用模型無法滿足醫療產業的嚴格要求。

🧠 深度解析

Web-grounded analysis with 23 cited sources.

🔑 增強重點摘要

  • 百川智能的最新醫療大模型Baichuan-M4在HealthBench、HealthBench Hard和HealthBench Professional三大權威醫療榜單中均位列世界第一,超越了GPT-5.5、Opus 4.7、DeepSeek-V4-Pro等模型。
  • 百川智能的醫療模型(如M3 Plus)採用「證據錨定」技術,能將AI回答中的每個關鍵醫學判斷精確錨定到原始文獻的具體段落,引用準確率從行業普遍的約75%提升至95%以上。
  • 百川智能已推出AI家庭醫生產品「百小醫」,專注於C端患者服務,涵蓋就醫準備、處方分析及長期健康管理,並在北京兒童醫院等B端場景中輔助多學科會診,吻合率達95%。
  • 百川智能在2025年進行了重大戰略轉型,大幅縮減通用模型團隊及金融等其他業務線,全面聚焦AI醫療領域,王小川認為醫療是大模型「皇冠上的明珠」。
  • 新一代醫療大模型Baichuan-M4的API服務價格較前代大幅下降70%,並推出「海納百川計劃」向為醫務工作者提供服務的機構長期免費提供循證增強的M3 Plus API服務,旨在推動行業協作與發展。
📊 競品分析▸ Show
 公司/ 模型  主要特點  幻覺率  基準測試表現  定價策略 
百川智能 Baichuan-M4 專注高準確度、循證增強、AI家庭醫生「百小醫」  裸模型3.3% (M3 Plus為2.6%)  HealthBench、HealthBench Hard、HealthBench Professional全球第一  API價格較前代下降70%;「海納百川計劃」向機構免費提供M3 Plus API 
京東健康 京醫千詢2.0 全場景閉環醫療大模型,「三引擎+四模型」架構,多模態感知  未明確提及  2026年3月登頂MedBench多模態評測榜首 (63.6分)  未明確提及 
訊飛醫療 星火醫療大模型 聚焦醫療痛點,提供全生命週期智慧健康管理  未明確提及  「智醫助理」累計完成超10.1億次AI輔助診斷  未明確提及 
聯影智能 元智醫療大模型 「設備+AI+臨床」深度融合,聚焦多場景醫療智能解決方案  未明確提及  醫療AI應用獲證總數全球第一,17款NMPA三類證  未明確提及 
數坤科技 數坤坤多模態醫療健康大模型 「數字人體」理念,融合影像、文本、語音等多模態數據  未明確提及  累計獲18張NMPA三類證,科研成果登《Nature Communications》  未明確提及 
協和・太初 (北京協和醫院+中科院自動化所) 國內首個罕見病專用大模型,國際首個適配中國人群的罕見病AI系統  未明確提及  平均確診週期從23個月縮短至9天,識別率達97.6%  未明確提及 
OpenAI GPT-5.2 High 通用大模型,在醫療領域亦有佈局  約50%被評為「有問題」,近20%「高度有問題」  曾是HealthBench評測集榜首,後被百川M3超越  未明確提及 
DeepSeek-R1 開源大模型,在醫療領域有應用  百川M2 Plus幻覺率為其1/3左右  在HealthBench評測中表現良好,但被百川M2超越  未明確提及 

🛠️ 技術深入

  • 事實感知強化學習 (Fact-Aware RL):百川智能醫療大模型的核心技術之一,用於顯著降低事實性幻覺率,是M3和M4取得低幻覺率的關鍵。
  • 證據錨定 (Evidence Anchoring):M3 Plus模型首創的技術,要求AI在生成答案時,不僅標注文獻來源,還必須將每一句關鍵醫學判斷逐條錨定到原始論文、指南或共識中的具體段落,確保每個結論都能在原文中找到明確對應,引用準確率達95%以上。
  • 六源循證推理 (Six-Source Evidence-Based Reasoning):M2 Plus和M3 Plus採用的範式,整合了原始研究、證據綜述、指南規範、實踐知識、公共健康教育、監管與真實世界數據等六大類醫學信息來源,以確保回答的準確性和可靠性。
  • MoE (Mixture of Experts) 架構:M3模型已從稠密模型架構切換至MoE架構,這帶來了顯著的成本效益並提升了推理效率。
  • 大型驗證器系統 (Large Verifier System):M2模型採用的創新系統,結合了患者模擬器和多維度驗證機制,從真實世界的醫療問題出發進行醫療領域後訓練對齊。
  • SPAR工作流:M3模型通過SPAR工作流推理實現嚴肅臨床諮詢。
  • 訓練數據:Baichuan-M1-14B模型總數據量高達萬億級token,涵蓋千萬級中/英文專業醫療論文、千萬級院內真實中/英文醫療病例、萬本醫療教材、幾十萬級醫療書籍、千萬級知識圖譜醫療實體、百萬級醫療詞條、百萬級指南/專家共識/知識庫等專業數據,以及億級醫療問答/問診/臨床看病數據。

🔮 前景展望AI analysis grounded in cited sources

AI醫療將加速普及並重塑醫患關係。
百川智能的低幻覺率模型和「百小醫」等產品,結合其免費API策略,將降低AI醫療的應用門檻,促使更多醫生和患者採用AI輔助工具,尤其是在院外場景,提升醫療資源的可及性與效率。
醫療AI領域的競爭將從通用能力轉向更深度的臨床落地和可信賴性。
王小川強調通用模型無法滿足醫療嚴格要求,百川智能專注於循證增強和證據錨定技術,這將推動行業更加注重AI在真實臨床場景中的準確性、可解釋性和安全性,促使其他參與者跟進。

時間線

2023-04
百川智能成立,獲5000萬美元天使輪融資。
2023-10
完成3億美元A1輪戰略融資,估值超10億美元,躋身獨角獸行列。
2024-07
完成50億人民幣A輪融資,估值達200億人民幣,並啟動B輪融資計畫。
2025-03
進行戰略轉型,裁撤金融B端業務組,全面聚焦AI醫療領域。
2026-01
發布醫療大模型Baichuan-M3,在HealthBench奪得全球第一,幻覺率3.5%;隨後發布M3 Plus,幻覺率降至2.6%,首創「證據錨定」技術。
2026-05-26
發布新一代醫療大模型Baichuan-M4與AI家庭醫生「百小醫」,M4在三大醫療榜單中位列世界第一,裸模型事實性幻覺率降至3.3%。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体