📄較早收集於 11h

LLaMA 3.1 在從 MRI 報告中提取結構化數據方面表現優異

LLaMA 3.1 在從 MRI 報告中提取結構化數據方面表現優異
PostLinkedIn
📄閱讀原文: ArXiv AI

💡了解 LLaMA 3.1 在專業醫療任務上的表現,以及如何透過少樣本提示優化臨床數據提取。

⚡ 30-Second TL;DR

有什麼變化

LLaMA 3.1 在零樣本設定下,針對 Fazekas 和皮質萎縮等視覺評分指標達到了 87-96% 的準確度。

為什麼重要

這項研究驗證了使用開源權重 LLM 進行複雜醫療數據自動化提取的可行性,有望減輕臨床研究人員的手動工作負擔。

下一步行動

如果您正在建構醫療 NLP 管線,請實作基於結構相似度的少樣本提示(few-shot prompting),以提高數值臨床數據的提取準確度。

誰應關注:Researchers & Academics

關鍵要點

  • LLaMA 3.1 在零樣本設定下,針對 Fazekas 和皮質萎縮等視覺評分指標達到了 87-96% 的準確度。
  • 少樣本提示顯著提升了微出血計數等數值變數的提取表現。
  • 無論輸入是荷蘭語原文還是翻譯後的英語,模型均表現出一致的穩定性。
  • 與分類評分相比,針對特定位置的變數提取仍面臨挑戰。

🧠 深度解析

Web-grounded analysis with 31 cited sources.

🔑 增強重點摘要

  • LLaMA 3.1 於 2024 年 7 月 23 日發布,其模型參數最高達 405B,使其成為當時最大的開源基礎模型,在通用知識、可控性、數學、工具使用和多語言翻譯方面可與頂級AI模型媲美。
  • 該模型支援八種語言,包括英語、德語、法語、義大利語、葡萄牙語、印地語、西班牙語和泰語,並具有 128K 詞元的擴展上下文長度,這對於處理冗長的醫療文件至關重要。
  • LLaMA 3.1 採用標準的僅解碼器 Transformer 模型架構,並透過監督式微調(SFT)和直接偏好優化(DPO)進行迭代後訓練,以最大化訓練穩定性並與人類偏好保持一致。
  • 開源大型語言模型(如 LLaMA 3.1)為醫療機構處理敏感患者數據提供了更高的隱私、控制和客製化優勢,使其能夠在自己的基礎設施中部署,從而滿足數據駐留要求。
  • 透過在特定領域的醫療數據集上進行微調,LLaMA 3.1 能顯著提高其在醫療相關查詢中的準確性和上下文理解能力,例如在醫學問答、主題標記和情感分析方面,優於通用模型。
📊 競品分析▸ Show
特徵/模型LLaMA 3.1 (及醫療微調版)OpenAI GPT-4 / Claude 3.5 SonnetAmazon Comprehend Medical / Microsoft Azure AI / Google Cloud Clinical NLPMe-LLaMA / Llama-3-Meditron (基於Llama 2/3)
模型類型開源基礎模型 (可微調)閉源專有模型企業級臨床NLP服務開源醫療領域專用LLM
數據隱私/控制高 (權重可下載,可本地部署/自託管)低 (依賴API服務商,數據處理透明度較低)高 (通常符合HIPAA,雲端部署提供安全保障)高 (可本地部署/自託管)
客製化能力高 (權重可下載,易於微調以適應特定需求)有限 (主要透過API進行微調或提示工程)中等 (預設功能,部分可配置以適應特定工作流程)高 (專為醫療數據進行持續預訓練和指令微調)
多語言支援8種語言 (Llama 3.1)多語言 (廣泛支援)多語言 (通常支援主要醫療市場語言)針對生物醫學和臨床數據訓練,通常支援多語言醫學文本
醫療領域專精需微調,但潛力巨大,可減少幻覺通用知識強,但在醫療領域可能產生幻覺,需額外防護專為醫療數據設計,內建醫學術語和概念識別專門針對醫療數據進行持續預訓練和指令微調,具備深厚醫學知識
性能 (醫療數據提取)零樣本高準確度,少樣本提示顯著提升數值提取高 (在某些醫學基準測試中表現優異,但幻覺風險較高)高 (針對結構化提取優化,F1分數可達93%)在多個醫學基準測試中超越通用LLM,甚至超越GPT-4
架構Decoder-only TransformerDecoder-only Transformer (通常)混合NLP、OCR、機器學習方法Decoder-only Transformer (基於Llama 2/3)
參數規模8B, 70B, 405B數十億至數千億 (閉源,具體不公開)不公開或基於內部模型13B, 70B (Me-LLaMA); 8B, 70B (Llama-3-Meditron)

🛠️ 技術深入

  • 模型架構: LLaMA 3.1 採用優化的僅解碼器(decoder-only)Transformer 架構,以最大化訓練穩定性。
  • 參數規模: LLaMA 3.1 系列包含 80 億 (8B)、700 億 (70B) 和 4050 億 (405B) 參數的模型。
  • 訓練數據: 預訓練數據量約為 15 兆個詞元,來自公開可用的線上資源。微調數據包括公開的指令數據集以及超過 2500 萬個合成生成範例。
  • 訓練過程: 採用迭代後訓練程序,結合監督式微調(SFT)和直接偏好優化(DPO)來提升性能和安全性。 針對醫療領域的微調常使用低秩適應(LoRA)等參數高效技術,並利用專業醫療數據集(如 MedMCQA、患者-醫生對話、生物醫學文獻、臨床筆記)。
  • 上下文長度: 模型支援高達 128K 詞元的上下文長度,能夠處理非常長的輸入和文件。
  • 多語言支援: LLaMA 3.1 支援八種語言,包括英語、德語、法語、義大利語、葡萄牙語、印地語、西班牙語和泰語。
  • 安全工具: Meta 提供 Llama Guard 3 和 Prompt Guard 等安全工具,以幫助開發者負責任地構建應用。
  • 訓練硬體: LLaMA 3.1 405B 模型在超過 16,000 個 NVIDIA H100 GPU 上進行訓練。
  • 推理部署: LLaMA 模型可部署在 IBM watsonx.ai、AWS 和 NVIDIA NIM 等平台上,支援即時和批次推理。

🔮 前景展望AI analysis grounded in cited sources

醫療領域將加速採用開源大型語言模型。
LLaMA 3.1 在醫療報告結構化數據提取方面的出色表現,加上其開源特性提供的隱私、控制和客製化優勢,將鼓勵更多醫療機構將其整合到臨床工作流程中。
針對特定領域的微調和少樣本學習將成為醫療AI應用的關鍵。
研究表明,透過少樣本提示和針對醫療數據的微調,可以顯著提高模型在數值變數提取和特定醫療任務上的準確性,解決通用模型在醫療領域可能產生的幻覺問題。
混合式AI架構(結合傳統NLP與LLM)將在醫療數據提取中變得普遍。
傳統NLP在精確、可審計的實體提取和術語標準化方面仍有優勢,而LLM則提供推理和自然語言互動,兩者結合能實現更準確、可操作的臨床數據處理,並滿足臨床決策支援系統的需求。

時間線

2023-02
LLaMA 1 發布,最初為研究用途,但權重洩露導致廣泛採用,開啟開源LLM時代。
2023-07
LLaMA 2 發布,開放商業使用,並包含指令微調版本,進一步推動開源AI生態系統。
2023-08
Code Llama 發布,作為 Llama 2 的程式碼專用版本,提供程式碼生成和理解能力。
2024-04
LLaMA 3 發布,包含 8B 和 70B 模型,在性能上實現顯著提升,並計劃支援多語言和多模態。
2024-07
LLaMA 3.1 發布,包含 8B、70B 和 405B 模型,支援八種語言和 128K 詞元的上下文長度,成為當時最大的開源基礎模型。
2025-04
LLaMA 4 系列發布,引入多模態能力和專家混合(MoE)架構,進一步擴展 LLaMA 模型的功能。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI