摘要 · Nature Biotechnology 2026.04
生醫 × 機器學習 · 文獻綜覽Nature Biotechnology · 2026.04
220 個 Biomedical Foundation Models 全景分析
生醫基礎模型正從單模態走向多模態
一項涵蓋 220 個生醫專屬基礎模型、時間跨度四年的調查。過半數(53.6%)已整合兩種以上資料模態,而自然語言正逐漸成為串接各類生醫資料的「連接介面」。研究刻意排除 ChatGPT、Gemini、Claude 等通用大型語言模型。
- 220收錄模型數,四年累積
- 53.6%多模態模型比例(118 個整合 ≥2 種模態)
- 17資料模態總類
- 4領域:語言/影像/組學/序列
起 · 定義與全局 · 內容 1 / 3
何謂生醫基礎模型 本調查的界定範圍
- 大規模機器學習模型,訓練於多元的生醫與臨床資料。
- 資料涵蓋基因序列、分子剖析(molecular profiling)、生醫影像、電子病歷(EHR)。
- 學習通用表徵(generalizable representations),以支援下游發現與臨床應用。
- 調查涵蓋四大領域:自然語言、影像訊號、組學(omics)、分子序列。
- 排除通用 LLM,聚焦 220 個生醫專屬模型。
關鍵觀察
自然語言最常與其他模態配對,逐漸成為跨資料類型的連接介面(connective interface)。這一點貫穿全文——後段的新興引用領跑者與未充分發展方向,都指回同一個結構。
編碼器架構占主導 架構分布
| 架構 | 數量 | 占比 |
|---|---|---|
| Encoder-based 編碼器 | 114 | 51.8% |
| Mixed 混合架構 | 67 | 30.5% |
| Decoder-based 解碼器 | 31 | 14.1% |
| Non-Transformer(如 Mamba) | — | 3.6% |
解碼器較少的原因並非架構偏好,而是資料條件:文字生成任務需要高品質的 image–text 標註配對,這在生醫領域取得困難。
轉 · 評估缺口與引用格局 · 內容 2 / 3
評估方式仍偏單一 下游任務分布
| 評估任務 | 占比 |
|---|---|
| Classification 分類 | 50.9% |
| Report generation 報告生成 | 10.9% |
| Question answering 問答 | 8.6% |
| Segmentation 分割 | 7.3% |
評估缺口
缺乏多任務基準(multitask benchmarks)、人在迴路評估(human-in-the-loop),以及對資料品質、可解釋性與轉譯相關性的綜合考量。半數模型只在分類任務上被檢驗過。
各領域的引用王者 * 標示為多模態模型
| 領域 | 領先模型與引用數 |
|---|---|
| Natural language 自然語言 | BioBERT 6,925 · MultiMedQA 3,707 · PubMedBERT 2,278 |
| Imaging & signals 影像訊號 | UNI 1,141 · ConVIRT* 1,003 · MedCLIP* 794 |
| Omics 組學 | scGPT 846 · Geneformer 836 · scBERT 509 |
| Molecular sequences 分子序列 | ESM-1b 2,807 · ProtTrans 1,207 · DNABERT 1,051 |
2025 年後的新興領跑者 增長由多模態推動
| 模型 | 領域 | 引用 |
|---|---|---|
| BiomedCLIP* | 影像 + 語言 | 498 |
| Quilt-1M* | 病理 + 語言 | 216 |
| ESM3 | 蛋白質序列 | 201 |
| Evo-2 | DNA / RNA | 197 |
| Borzoi | 分子序列 | 190 |
| MedGemma-27B | 自然語言 | 165 |
| Nicheformer* | 組學 omics | 81 |
| OmiCLIP* | 影像 + 組學 | 58 |
新興引用的增長明顯由整合異質資料模態的模型推動,而非單一資料類型的專家模型。八個新興領跑者中有四個是多模態。
合 · 缺口與展望 · 內容 3 / 3
尚未充分發展的整合方向 三個機會,一個共同瓶頸
機制可解釋性
語言 ↔ 序列/組學
- 以語言介面協助 scRNA-seq 註解、通路富集(pathway enrichment)、空間轉錄體。
治療標的
影像 ↔ 組學
- H&E 病理 ↔ omics 的整合仍偏弱。
- 連結組織形態與分子機制的潛力大。
跨調控層次
DNA / RNA / 蛋白質 / 表觀
- 各層次連結度有限,尤其蛋白質與其他模態之間。
主要瓶頸不是想法
阻礙並非概念缺乏,而是資料條件:配對資料稀少、預處理與標註標準不一、缺乏標準化的多模態基準。這與前文「解碼器較少」的成因是同一件事。
高採用因素與展望 什麼讓一個模型被真正使用
- 對應高影響應用:臨床語言處理、蛋白質建模、數位病理。
- 評估嚴謹度:多元下游任務測試提升信任與重用。
- 可近用性:公開預訓練權重、程式碼、易用介面。
- 新關鍵:與 agent-based AI 工作流的整合相容性。
待解難題
資料品質、世代多樣性(cohort diversity)、批次效應(batch effects)、隱私安全、幻覺(hallucination)、對抗穩健性——這些仍限制真實場景的部署。作者建議以跨領域協作(生物學家 × 臨床醫師 × 模型開發者),並以高效微調強預訓練骨幹(efficient adaptation)取代從頭訓練。