🗾較早收集於 56m

東大松尾研推出醫療專用日語LLM

東大松尾研推出醫療專用日語LLM
PostLinkedIn
🗾閱讀原文: ITmedia AI+ (日本)
#medical-ai#japanese-llm#open-modelweblab-medllm-qwen-2.5-109b-instructweblab-medllm-qwen-2.5-109b-instructmatsuo-labsakura-internetuniversity-of-tokyo

💡109B日語醫療LLM免費供研究者—醫療AI開發者理想工具。(38字)

⚡ 30-Second TL;DR

有什麼變化

東京大學松尾・岩澤研究室主導開發

為什麼重要

透過免費提供大型領域專用LLM,推動日本醫療AI研究,加速日語醫療NLP創新。

下一步行動

申請免費存取Weblab-MedLLM-Qwen-2.5-109B-Instruct,用於日語醫療AI實驗。

誰應關注:Researchers & Academics

關鍵要點

  • 東京大學松尾・岩澤研究室主導開發
  • 醫療專用日語LLM,109B參數規模
  • 免費提供研究者使用
  • 基於Qwen-2.5 Instruct架構
  • 櫻花互聯網等合作

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Qwen2.5系列模型已在編碼、數學和長文本生成方面實現顯著改進,Qwen2.5-72B-Instruct在HumanEval基準測試中達到86.6分,為醫療領域的專業應用奠定了堅實基礎[5][6]
  • Qwen2.5架構支持高達131,072個token的上下文長度,以及Qwen2.5-1M-Instruct可擴展至100萬token的變體,使其能夠處理複雜的醫療文檔和長篇臨床記錄[1][3]
  • Qwen2.5在監督微調階段使用超過100萬個高質量樣本,包括指令跟隨、長輸出生成和結構化數據理解,這些能力對醫療LLM的準確性和可靠性至關重要[1]

🛠️ 技術深入

  • 基礎架構:Qwen2.5採用Transformer架構,配備RoPE位置編碼、SwiGLU激活函數和RMSNorm正規化[2][3]
  • 注意力機制:使用分組查詢注意力(Grouped Query Attention),Q頭數為64,KV頭數為8,提高計算效率[3]
  • 預訓練數據規模:從Qwen2的7萬億token擴展至18萬億token,顯著增強了模型的知識基礎[5]
  • 長上下文能力:Qwen2.5-1M-Instruct通過漸進式預訓練課程、自適應RoPE基數縮放和雙塊注意力(Dual Chunk Attention)框架實現100萬token上下文[1]
  • 微調方法:採用雙向數據合成(Infinite-Instruct)技術,使較小的模型(7B/32B)能以少於10%的指令數據成本匹配基線性能[1]

🔮 前景展望AI analysis grounded in cited sources

醫療AI本地化競爭加劇
東大與日本機構合作開發日語醫療LLM,表明亞洲研究機構正在建立獨立的醫療AI能力,可能減少對國際模型的依賴。
開源醫療模型將成為臨床決策支持的關鍵基礎設施
免費提供研究者使用的模式,結合Qwen2.5在結構化數據理解和長文本生成方面的優勢,可能加速醫療AI在臨床工作流中的整合。

時間線

2024-12
Qwen2.5系列發布,預訓練數據擴展至18萬億token,編碼和數學能力大幅提升
2025-05
Qwen2.5-Coder-Instruct模型通過Infinite-Instruct數據合成技術實現高效微調
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。