Awesome BioIE Logo
BioIE Logoを扱う資料や関連プロジェクトをまとめたAwesomeリストです。
目次
- 研究概観
- 活動中の研究グループ
- 組織
- 学術誌とイベント
- チュートリアル
- Code Library
- Tool、Platform、Service
- 技法とモデル
- データセット
- Ontologyと統制語彙
- Data Model
- クレジット
研究概観
生物医学IEのLLM
- 医療におけるLarge Language Model:包括的Benchmark - 医療言語タスクへ適用した16種のLLMに対する統計的・人手評価。
- Large Language Modelの研究状況と臨床的有用性の評価:Scoping Review - 2024年3月時点の医療LLM応用に関する高水準Review。
- 医療におけるLarge Language Modelの倫理・規制上の課題 - 生物医学LLM応用から生じる倫理問題のReview。
- On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? 🦜 - Language Modelの役割、応用、Riskに関する、頻繁に参照され現在も関連性のある論文。
LLM以前の概観
- Cloud上のBiomedical Informatics:心血管医学を前進させる宝探し - BioIE/Bioinformatics Workflowを心血管の健康・医学研究の問いへ適用する方法。
- 臨床情報抽出応用:文献Review - 2016年9月までの臨床IE論文をMayo Clinic GroupがReview。
- Literature Based Discovery:モデル、手法、動向 - 無関係に見える科学文献間に意味あるつながりを見つけるというLBDのReview。
- LBDの歴史的背景はUniversity of ChicagoのDon Swanson/Neil Smalheiserによる論文、Undiscovered Public Knowledge(有料)とRediscovering Don Swanson: the Past, Present and Future of Literature-Based Discoveryを参照。
- 電子健康記録(EHR)のMining:Survey - 有害事象検出を含むEHR Miningの手法と考え方。2017年半ば時点の関連論文は表2を参照。
- 患者の視点を捉える:健康関連テキストNLPの進歩に関するReview - 健康記録とSocial Mediaテキストの情報抽出へNLPを適用した2017年Review。重要な指摘は、比較可能・再現可能な研究による手法開発を進めるため、Communityで共有・利用できるデータの入手可能性が主要課題だという点です。
- Awesome AI-based Protein Design - AIベースのProtein Design研究論文集。
活動中の研究グループ
- Boston Children’s Hospital Natural Language Processing Laboratory - 元Mayo Clinic/Apache cTAKES ProjectのGuergana Savova博士が主導。
- Brown Center for Biomedical Informatics - Brown Universityを拠点にNeil Sarkar博士が率い、臨床NLP/IEを研究。
- Center for Computational Pharmacology NLP Group - University of Colorado Denverを拠点にLarry Hunterが主導。GitHubリポジトリも参照。
- 米国National Institutes of Health(NIH)/National Library of Medicine(NLM)のGroup:
- NLMのDemner-Fushman Group
- NCBIのBioNLP Group - Zhiyong Lu博士が率い、PubMedなどの生物医学文献検索・Curationを改善。
- JensenLab - University of CopenhagenのNovo Nordisk Foundation Center for Protein Researchを拠点。
- National Centre for Text Mining(NaCTeM) - University of Manchesterを拠点にSophia Ananiadou教授が率い、Text Mining全般、とりわけ生物医学応用を重視。
- Mayo Clinicの臨床NLP Program - 過去20年にApache cTAKESなどBioIEへ大きく貢献した複数Group。
- Monarch Initiative - Oregon State University、Oregon Health & Science University、Lawrence Berkeley National Lab、The Jackson Laboratoryなどの共同活動。意味論を用いて生物情報を統合し、Phenotypeで知識Gapを橋渡しする新しい提示を目指します。
- TurkuNLP - University of Turkuを拠点に、BioNLP/臨床応用を重視してNLP全般を研究。
- UTHealth Houston Biomedical Natural Language Processing Lab - University of Texas Health Science Center at Houston School of Biomedical Informaticsを拠点にHua Xu博士が主導。
- VCU Natural Language Processing Lab - Virginia Commonwealth Universityを拠点にBridget McInnes博士が主導。
- Zaklab - Harvard Medical School Department of Biomedical InformaticsのIsaac Kohane博士が主導。Kohane博士はn2c2(旧i2b2)データセットのStewardでもあります。下のデータセットを参照。
- Columbia University Department of Biomedical Informatics - George Hripcsak博士とNoémie Elhadad博士が主導。
組織
- AMIA - 生物医学情報学研究者の多く(全員ではありません)がAmerican Medical Informatics Association会員。学術誌JAMIAを発行。
- IMIA - International Medical Informatics Association。IMIA Yearbook of Medical Informaticsを発行。
学術誌とイベント
BioIEは学際的であり、研究者はさまざまな方法で成果・Toolを共有します。生物医学・Life Scienceでは一般的な学術誌論文、Computer Science・Engineeringでは一般的なConference Paperと採択後のPoster/口頭発表などです。Conference PaperはProceedingsとしてまとめられることが多く、Preprintも次第に一般化し機関に受容されています。これらの正式な成果物を取り巻くのがOpen Science、Open Data、Open Sourceであり、BioIE研究者が作るCode、Data、SoftwareはCommunityの重要資料です。
学術誌
PreprintはarXivのComputation and Language(cs.CL)/Information Retrieval(cs.IR)、bioRxiv、medRxivのHealth Informaticsなどを試してください。
- Database - 副題は「The Journal of Biological Databases and Curation」。Open Access。
- NAR - Nucleic Acids Research。幅広いBiomolecular領域を扱い、年次Database Issueで特に著名。
- JAMIA - Journal of the American Medical Informatics Association。臨床Care/Research、Translational/Implementation Science、Imaging、教育、Consumer Health、Public Health、Policyを扱います。
- JBI - Journal of Biomedical Informatics。既定ではOpen AccessではありませんがOpen Accessの「X」版があります。
- Scientific Data - 科学的価値のあるデータセットの説明と、科学データの共有・再利用を進める研究を掲載するSpringer NatureのOpen Access誌。
カンファレンスなど
- ACM-BCB - ACM Conference on Bioinformatics, Computational Biology, and Health Informatics。2010年から毎年開催。
- BIBM - IEEE International Conference on Bioinformatics and Biomedicine。
- ISMB - International Society for Computational Biologyが1993年から毎年開催するInternational Conference on Intelligent Systems for Molecular Biology。臨床を明示せずBioinformatics/Computational Biologyを主に扱いますが、Text Miningも増加。2019年にはText Mining for Biology and Healthcareの終日特別Sessionを開催。奇数年はEuropean Conference on Computational Biology(ECCB)と合同。
- PSB - Pacific Symposium on Biocomputing。
Challenge
BioIEの一部イベントは、与えられたデータセットへ各Groupが計算的Solutionを開発する正式Task/Challengeを中心に構成されます。
- BioASQ - 生物医学Semantic Indexing/Question AnsweringのChallenge。2013年から毎年ChallengeとWorkshopを開催。
- BioCreAtIvE workshop - 2004年から開催。BioCreative VIは2017年2月、BioCreative/OHNLP Challengeは2018年開催。下のデータセットも参照。
- SemEval workshop - Computational Semantic AnalysisのTask/評価。年ごとに異なりますが科学・生物医学言語を頻繁に扱い、例としてSemEval-2019 Task 12:科学論文のToponym Resolutionがあります。
- eHealth-KD - SpanishのeHealth文書から多様な知識を自動抽出するSoftware Technology開発を促すChallenge。以前はSpanish Semantic Analysisの年次Workshop TASSの一部。
- EHR DREAM Challenge - Bioinformatics中心のほかのChallengeと併催。2019年10月開始で、EHR Dataによる患者死亡予測を扱います。実在EHRではなくSynthetic Dataを使用。
チュートリアル
分野の変化が速く、数年以上前のチュートリアルには重要な詳細が欠けます。比較的新しい教育資料を以下に示します。Text Mining技法の基礎理解とPython/Rの基礎経験が有用で、実践しながら学ぶのが最善かもしれません。
LLMガイド
未定—今後の更新をお待ちください。
LLM以前のガイド、講義、講座
- Getting Started in Text Mining - Cohen/HunterによるBio-Text Miningの短い入門。10年以上前ですが今も関連性があります。同著者の以前の論文も参照。
- Biomedical Literature Mining - 2014年Methods in Molecular Biologyの有料書籍。Text Mining入門原則、生物科学応用、臨床/Medical Safetyでの可能性を扱います。
- Coursera - Foundations of mining non-structured medical data - テキスト・画像を含むさまざまな種類・構造の医療データを扱う約3時間の動画講義。比較的高水準で初心者向けと思われます。
- JensenLab text mining exercises
- VIB text mining and curation training - 2013年開催のTraining Workshopで、Slideは現在もOnline。
Code Library
- Biopython - 論文 - コード - 主にBioinformatics/Computational Molecular Biology向けPython Tool。PubMed文書・Abstractを含むデータ取得にも便利(Documentation第9章参照)。
- Bio-SCoRes - 論文 - 生物医学Coreference Resolution Framework。
- medaCy - 予測的医療NLP Model構築System。spaCy Framework上に構築。
- ScispaCy - 論文 - 科学・生物医学文書向けspaCy Framework。
- rentrez - PubMedを含むNCBI ResourceへAccessするR Utility。
- Med7 - 論文 - コード - 薬剤関連ConceptのNERを行うspaCy向けPython Package/Model。
特定データセットのリポジトリ
- mimic-code - MIMIC-IIIデータセット(下記)関連Code。有用なチュートリアルを収録。
Tool、Platform、Service
- cTAKES - 論文 - コード - 電子Medical Recordのテキスト処理System。広く利用されるOpen Source。
- CLAMP - 論文 - 臨床Reportのテキスト向けNLP Toolkit。まずLive Demoで動作を確認できます。学術研究では無料利用可。
- DeepPhe - Cancer Presentationを記述した文書の処理System。cTAKESベース。
- DNorm - 論文 - 疾患名・略語への言及を一意Concept IDへLinkするDisease Normalization手法。Download版はNCBI Disease CorpusとBC5CDR(下記)を同梱。
- II-Commons - PubMed/PMC、arXiv、対応US Policy Corpusを対象に、決定的で日次更新の検索、Metadata Lookup、全文Markdown取得を行うNode.js CLI/Agent Skill。
- PubTator Central - 論文 - PubMed記事・PubMed Central全文から5種類の生物医学Conceptを識別するWeb Platform。全Annotation SetをDownload可能です(下記の注釈付きテキストデータを参照)。
- Pubrunner - PubMedの最新Document SetへText Mining Toolを実行するFramework。
- SemEHR - 論文 - EHR向けIE Infrastructure。CogStack Project上に構築。
- TaggerOne - 論文 - Concept Normalizationを実行。特定Concept Type向けに学習でき、ほかのNormalization機能から独立してNERも実行可能。
- TabInOut - 論文 - 文献中の表からIEを行うFramework。
Annotation Tool
- Anafora - 論文 - Adjudicationと進捗追跡を備えるAnnotation Tool。
- brat - 論文 - コード - brat Rapid Annotation Tool。Browserで視覚的にText Annotationを作成。分野非依存で多様なProjectに適し、可視化はstav Toolを基盤とします。
- MedTator - 論文 - コード - 依存関係を最小限にしたAnnotation Tool。
技法とモデル
Large Language Model
未定—今後の更新をお待ちください。
BERTモデル
- BioBERT - 論文 - コード - PubMed/PubMed Centralで学習したBERT Language Model。
- ClinicalBERT - 似た名前を持つ2つの臨床テキスト学習済みLanguage Model。両方ともMIMIC-IIIの臨床Noteで学習したBERTです。
- SciBERT - 論文 - Semantic Scholar Databaseの100万超の論文で学習したBERT Model。
- BlueBERT - 論文 - PubMed TextとMIMIC-III Noteで事前学習したBERT Model。
- PubMedBERT - 論文 - PubMedで一から学習したBERT Model。Abstract+全文版とAbstractのみ版があります。
GPT-2モデル
その他のモデル
- PubMedのFlair Embedding - Flair Framework/Embedding Methodから利用できるLanguage Model。2015年までのPubMed Abstract 5% Sample、合計120万超で学習。
Text Embedding
- Mayo ClinicのHongfang Liu Groupによる論文は、生物医学・臨床Textで学習したEmbeddingが生物医学NLP Taskで常にではないものの高性能になり得ることを示します。分野固有Embeddingの学習は計算量が多いため、事前学習済みEmbeddingが適する場合があります。
- BioASQword2vec - 論文 - 人気のword2vec Toolで1,000万超のPubMed Abstractから得た生物医学TextのWord Embedding。
- BioWordVec - 論文 - コード - 2,700万超のPubMed Title/Abstractから得たWord Embedding。MeSHベースのSubword Embedding Modelを含みます。
データセット
以下の一部データセットはAccessにUMLS Terminology Services(UTS)Accountが必要です。UTS AccountのLicenseではUMLS Resource利用に関する年次Report提出が必要ですが、見た目ほど難しくありません。
生物医学テキスト情報源
以下は生物医学科学の索引付きText Documentを含みます。
- OHSUMED - 論文 - 1987〜1991年のMEDLINE Entry 348,566件(Title、場合によりAbstract)。MeSH Labelを含み、主に歴史的意義があります。
- PubMed Central Open Access Subset - 従来のCopyright以外のLicenseで使えるPubMed Central記事集。正確なLicenseは出版物・情報源ごとに異なり、PDF/XMLで利用可能。
- CORD-19 - COVID-19に関する学術原稿Corpus。主にPubMed CentralとPreprint Server由来で、全文のない論文Metadataも含みます。
注釈付きテキストデータ
- SPL-ADR-200db - 論文 - FDA承認薬200種の既知有害反応約5,000件について標準化情報とText内出現Annotationを含むPilot Dataset。
- BioCreAtIvE 1 - 論文 - Protein/Gene Nameを注釈した15,000文(学習10,000・Test 5,000)。Protein Name/Gene Ontology Termを注釈した生物医学研究全文1,000件。
- BioCreAtIvE 2 - 論文 - Protein/Gene Nameを注釈した別の15,000文、EntrezGene IDへLinkしたAbstract 542件、Protein間相互作用の特徴を注釈した各種論文。
- BioCreAtIvE V CDR Task Corpus(BC5CDR) - 論文 - 2014年以降の1,500記事(Title/Abstract)。Chemical 4,409、Disease 5,818、Chemical–Disease Interaction 3,116を注釈。登録必須。
- BioCreative VI CHEMPROT Corpus - 論文 - 多様なRelation TypeのChemical–Protein Interactionを注釈した2,400超の記事。登録必須。
- CRAFT - 論文 - Concept/Coreferenceなどを多様に注釈した生物医学全文67件。現在Version 5で、MONDO Disease OntologyへのConcept Linkを含みます。
- n2c2(旧i2b2)Data - Harvard Medical School DBMIが、2006年からのNational NLP Clinical Challenges/Informatics for Integrating Biology and the BedsideのDataを管理。Access/利用前に登録必須。個別説明はData Challenge一覧を参照。
- NCBI Disease Corpus - 論文 - Disease NameとMeSH/OMIMの関連Conceptを注釈した生物医学Abstract 793件。
- PubTator Central datasets - 論文 - RESTful API/FTP DownloadでAccess可能。2,900万超のAbstractと約300万の全文DocumentのAnnotationを収録。
- Word Sense Disambiguation(WSD) - 論文 - 曖昧語203語と、生物医学研究出版物から自動抽出した用例37,888件。UTS Account必須。
- Clinical Questions Collection - CQC/Iowa Collectionとも呼ばれ、診療中に医師が出した数千の質問と回答を収録。
- BioNLP ST 2013 datasets - 6つのShared TaskのData。一部はAccessしにくい可能性があります。広範なEntity/Event AnnotationにはCG Task Set(BioNLP2013CG)を試してください。
- BioScope - 論文 - 医学・生物学文書の文にNegation、Speculation、Linguistic Scopeを注釈したCorpus。
- BioRED - 論文 - 6,500超の生物医学Relation Annotationと新規知見Label。
タンパク質間相互作用注釈Corpus
Protein–Protein InteractionはPPIと略します。以下はBioC形式で利用できます。古いSet(AIMed、BioInfer、HPRD50、IEPA、LLL)はWBI Corpora Repository提供で、Turku UniversityのGroupが原Setから派生させました。
- AIMed - 論文 - PPIを注釈したMEDLINE Abstract 225件。
- BioC-BioGRID - 論文 - PPI/Genetic Interactionを注釈した全文120件。BioCreative V BioC Taskで使用。
- BioInfer - 論文 - PPIを含む関係、Named Entity、Syntactic Dependencyを注釈した生物医学Abstract 1,100文。追加情報・Download。
- HPRD50 - 論文 - Human Protein Reference Databaseが参照する科学Abstract 50件へPPIを注釈。
- IEPA - 論文 - Proteinを含む共起Chemical Pairを注釈した生物医学Abstract 486文(したがってPPI Annotationを含む)。
- LLL - 論文 - 細菌_Bacillus subtilis_に関する論文77文へProtein–Gene Interactionを注釈(PPIに近い)。追加情報。
その他のデータセット
- Columbia Open Health Data - 論文 - EHRから抽出したCondition、Drug、Procedure、Patient Demographicsの有病率・共起頻度DB。元Record Textは含みません。
- Comparative Toxicogenomics Database - 論文 - Chemical、Gene Product、Phenotype、Disease、Environmental Exposure間の人手Curation Association DB。Chemical Typeなど関連Concept Ontologyの組み立てに有用。
- MIMIC-III - 論文 - ICU入院約6万件のDeidentified Health Data。利用前にOnline Training(CITI Training)完了とData Use Agreement同意が必要。
- MIMIC-CXR - MIMIC Chest X-Ray DB。377,000超のRadiographic Imageと付随する自由記述Radiology Report。MIMIC-III同様、Data Use Agreement同意が必要。
- UMLS Knowledge Sources - Reference Manual - 生物医学用語・IdentifierとTool/Scriptの大規模で包括的なCollection。目的によってはUMLS Metathesaurus全Conceptの一意ID/Nameを含むMRCONSO.RRFだけで十分です。下のOntology/統制語彙も参照。
- MIMIC-IV - MIMIC-IIIのMultimodal Patient Data更新版。より新しい入院年、新Data Structure、救急部記録、MIMIC-CXR ImageへのLinkを追加。
- eICU Collaborative Research Database - 論文 - 一貫した構造を持つICU入院20万超の観察DB。登録、Training完了、Data Use Agreementが必要。
Ontologyと統制語彙
- Disease Ontology - 論文 - 人の疾患Ontology。MeSH、ICD、NCI Thesaurus、SNOMED、OMIMへのCross-Linkを持つPublic Domain。GitHubとOBO Foundryで利用可能。
- RxNorm - 論文 - Clinical Drug/Drug Packの正規化Name。成分、Strength、Form、Semantic Network由来Typeを組み合わせ、毎月Release。
- SPECIALIST Lexicon - 論文 - 多数の生物医学用語を含む一般英語Lexicon。1994年から年次更新され、2019年時点でも更新中。UMLSの一部ですがDownloadにUTS Account不要。
- UMLS Metathesaurus - 論文 - 380万超Concept、1,400万Concept Name、200超の生物医学語彙・Identifier Source間のMapping。巨大です。MetamorphoSys Installation ToolでSubsetを準備できますが、2019 Releaseでも約30GB必要。Manual。UTS Account必須。
- UMLS Semantic Network - 論文 - 生物医学Concept/語彙を扱う133 Semantic Typeと54 Semantic Relationshipの一覧。Metathesaurusが複雑すぎる場合に試せます。DownloadにUTS Account不要。
Data Model
Data Modelが必要ですか?生物医学Dataを扱うなら、おそらく答えは「はい」です。
- Biolink - コード - 生物EntityのData Model。YAML Fileとして提供。
- BioUML - 論文 - 生物医学Dataの分析、統合、可視化Architecture。視覚Modeling Language UMLを概念的基盤とします。
- OMOP Common Data Model - 観察医療Dataの標準。
- unmiri-ngs-fhir-schema - Vendor横断の体細胞NGS解釈出力(Foundation Medicine、Tempus、Caris、Guardant)向けApache-2.0 JSON Schema(Draft 2020-12)API Contract。HL7 FHIR Genomics IGに準拠し、Oncology Lab Reportを解析する生物医学情報抽出Pipelineの標準準拠Target Representationです。
クレジット
Curatorと情報源のクレジット。