📝較早收集於 21h

OpenAI 推出 LifeSciBench 用於評估 AI 生命科學能力

PostLinkedIn
📝閱讀原文: OpenAI Blog
#benchmarking#life-sciences#scientific-ailifescibenchopenailifescibench

💡一個由專家審核的全新基準測試,用於檢驗您的 AI 模型處理複雜生命科學研究任務的能力。

⚡ 30-Second TL;DR

有什麼變化

專為生命科學研究任務量身打造的基準測試

為什麼重要

此基準測試為研究人員提供了一種標準化方法,用以衡量 AI 在專業科學領域的進展,有望加速 AI 驅動的藥物開發與生物研究工具的發展。

下一步行動

如果您正在開發用於科學研究的模型,請將 LifeSciBench 整合至您的評估流程中,以基準測試您模型的領域特定推理能力。

誰應關注:Researchers & Academics

關鍵要點

  • 專為生命科學研究任務量身打造的基準測試
  • 內容由領域專家撰寫與審核
  • 專注於評估科學領域的真實決策能力

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 13 個來源。

🔑 增強重點摘要

  • LifeSciBench 旨在評估如 OpenAI 專為生命科學研究打造的 GPT-Rosalind 等 AI 系統,並提供其在真實世界影響的衡量標準。
  • 該基準測試採用「端到端」的科學工作視角,涵蓋六個核心工作流程領域:證據處理、分析、設計與優化、科學推理、驗證與操作,以及轉譯與溝通。
  • LifeSciBench 包含 750 個由具備博士學位訓練和生物技術/製藥經驗的專家所撰寫的任務,涵蓋七個工作流程和七個生物學領域,並涉及超過 1,000 個任務相關的科學文件與 19,020 個評分標準。
  • 評估採用兩種互補的指標:「通過率」(模型達到 70% 成功門檻的任務百分比)和「分數」(平均評分標準獎勵,允許部分得分),以全面衡量模型表現。
  • OpenAI 的 GPT-Rosalind 模型在 LifeSciBench 上的表現優於 GPT-5.5,特別是在科學溝通和轉譯任務方面展現出顯著進步。
📊 競品分析▸ Show
平台/基準測試焦點領域主要功能/評估項目備註
OpenAI LifeSciBench生命科學研究中的真實決策能力評估 AI 模型在證據處理、分析、設計與優化、科學推理、驗證與操作、轉譯與溝通等六大工作流程的端到端表現。由 173 位專家創建 750 個任務。專為 GPT-Rosalind 等模型設計,不包含 Anthropic 的 Claude 模型。
Anthropic Claude for Life Sciences生命科學研究與醫療保健作為「生產性研究夥伴」,提供專門的「連接器」和「代理技能」,整合 bioRxiv、medRxiv、Medidata、ClinicalTrials.gov 等科學數據生態系統。於 2025 年 10 月推出,與 OpenAI 成立生命科學研究團隊時間相近。
Nvidia BioNeMo生物學軟體平台提供多種領先 AI 生物學模型的存取權限。自 2022 年開始建構。
Amazon Bio Discovery (AWS)加速生命科學研發AI 驅動的研發加速工具。於 2026 年 6 月首次亮相。
Insilico Medicine Drug Discovery Benchmark藥物發現結合公共與專有基準,全面評估 AI 在臨床試驗預測和靶點發現方面的能力。包含 Claude Opus 和 GPT 等模型的排名。
Deep Origin DO Challenge自主代理系統在藥物發現中的能力針對虛擬篩選等綜合性挑戰,評估 AI 代理系統獨立開發、實施和執行策略的能力。專注於整合性挑戰而非單一任務。
LatchBio TherapeuticsBench Preclinical Pharmacology (TxBench-PP)小分子臨床前藥理學測試 AI 代理從真實實驗室數據中得出準確結論的能力,而非僅依賴文獻記憶。包含 100 項評估任務,涵蓋作用機制、藥效學推理、化合物-靶點結合等。
Omic GPQA Diamond BenchmarkAI 科學推理能力測試 AI 系統在研究生級別生物學、化學和物理學問題上的表現。Omic AI Scientist 在此基準上得分很高。

🛠️ 技術深入

  • LifeSciBench 的任務設計模擬科學家與知識淵博的合作者之間的互動,包括科學提示、相關背景或科學文件,以及自由形式的回答。
  • 超過一半(53%)的任務要求模型解釋或綜合至少一份科學文件中的資訊。
  • 任務由 173 位擁有博士學位訓練並在生物技術和製藥領域具有直接經驗的科學家共同創建。
  • 評估方法採用兩種指標:通過率(模型達到 70% 成功門檻的任務百分比)和分數(平均評分標準獎勵,允許對個別標準給予部分分數)。
  • LifeSciBench 的任務涵蓋六個核心工作流程領域:證據處理、分析、設計與優化、科學推理、驗證與操作,以及轉譯與溝通。
  • GPT-Rosalind 是一個專為生命科學研究設計的模型,旨在跨生物學、科學證據、數據和工具進行推理。它與 Codex 協同工作,並整合了生命科學研究和 NGS 分析插件。
  • GPT-Rosalind 最初是基於 GPT-4o 的縮小版本進行初始化,然後在主要由蛋白質序列、生物學文本和標記化 3D 結構數據組成的數據集上進行了進一步訓練。

🔮 前景展望AI analysis grounded in cited sources

AI 模型將日益成為計算生物學領域的「研究夥伴」。
OpenAI 的生命科學研究負責人 Joy Jiao 表示,這是 AI 系統朝著更像研究夥伴邁進的重要一步,尤其是在生物學研究日益計算化的世界中。
像 LifeSciBench 這樣專業的 AI 基準測試的發展,將加速 AI 在敏感科學領域的負責任部署和改進。
此類基準測試提供了標準化、經專家驗證的評估方法,以應對複雜、真實世界科學任務中的挑戰,彌補了通用 AI 基準測試的不足。
科技巨頭在生命科學 AI 領域的競爭將加劇,從而催生更多專業化的模型和工具。
OpenAI 推出 GPT-Rosalind 和 LifeSciBench 的舉動,緊隨 Anthropic、Nvidia 和 Amazon 等公司的類似行動,表明生物製藥領域的 AI 市場競爭激烈且不斷擴大。

時間線

2015
OpenAI 成立,其宗旨之一是解決人類面臨的重大問題,包括生命科學挑戰。
2025-10
OpenAI 首次組建其生命科學研究團隊。
2026-01
OpenAI 推出「ChatGPT for Healthcare」,專注於醫院和醫療系統。
2026-04
OpenAI 宣布推出 GPT-Rosalind,這是其首個專為生命科學領域打造的 AI 模型,作為選定企業用戶的研究預覽版。
2026-05
OpenAI 推出 Rosalind 生物防禦 (Rosalind Biodefense)。
2026-06
OpenAI 推出 LifeSciBench,一個經外部專家評估的基準測試,旨在衡量並持續改進 GPT-Rosalind 在真實世界中的影響。

📎 來源 (13)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. openai.com
  2. youtube.com
  3. rdworldonline.com
  4. openai.com
  5. openai.com
  6. endpoints.news
  7. stephenturner.us
  8. insilico.com
  9. deeporigin.com
  10. latch.bio
  11. omic.ai
  12. openai.com
  13. reliant.ai
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: OpenAI Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。