科学的発見は常に、質が高くクリーンなデータに依存してきました。質の低いデータは、再現性のない結果や問題のあるソリューションにつながり、最終的にはより良いデータを再取得する必要性に迫られます。AIを活用した予測モデルが初期の創薬ワークフローで一般的になりつつある今、研究ワークフロー全体を通じて正確かつ一貫性のあるデータの重要性はかつてないほど高まっています。  

乱雑なデータは現代の創薬における根深い課題であり、科学者はエンティティ命名の不一致の解決、データベース形式の不整合の発見、エラーの修正に多大な時間を費やしています。機械は、曖昧さや不整合を解釈するために必要な文脈的理解を欠いているため、複雑なデータセットのニュアンスを扱うのに苦労します。そのため、テクノロジーでは十分に対処できないデータに潜む問題を特定し、修正する作業が、頻繁に人間の科学者に委ねられています。

Is your R&D data ready for the future? The CAS Intelligence Hub is a powerful integrated solution that transforms fragmented scientific R&D data into a harmonized, AI-ready knowledge environment.

創薬チームにとって、乱雑なデータは波及効果を生み、研究者が欠陥のある前提や不完全な情報に基づいて実験を設計したりモデルを構築したりする原因となり、最終的には貴重なリソースを浪費することになります。ここで、データのクリーニングとハーモナイゼーションという補完的なプロセスが、ワークフローを最適化する上で極めて重要な役割を果たします。それぞれが、相互に関連しながらも異なる課題に対処します。  

  • データクリーニング:専門家がエラーを特定・修正し、欠損値を埋め、無関係な情報を削除することで、個々のデータセット内の正確性と信頼性を確保するプロセス  
  • データハーモナイゼーション:複数のソースからの情報を人間が統合し、標準化して一貫性のあるフレームワークに統一することで、シームレスな分析、比較可能性、コラボレーションを可能にするプロセス  

クリーニングとハーモナイゼーションを成功させる鍵は、人間によるキュレーションにあります。  

データクリーニング:不可欠な第一歩 

科学者がデータをハーモナイズする前に、まずはクリーニングを行う必要があります。データ入力、計算ミス、センサーの誤作動、システム障害によって生じるエラーを排除することで、科学者は データ基盤 を構築できます。適切にクリーニングされたデータに依存するチームは、以下のメリットを得られます: 

  • 精度の向上、 このデータから得られる知見の信頼性と再現性を確保し、質の高い創薬候補の創出につなげます。 
  • 効率の向上、 エラーによるトラブルシューティングや解析のやり直しに費やす時間を削減します。 
  • コラボレーションの強化、 データセット間の不一致を解消することで、チーム、機関、業界間の連携を円滑にします。 
  • 予測精度の向上、クリーンなデータを活用して、薬物と標的の相互作用や疾患との関連性などを正確に予測できる予測モデルの基盤を構築します。 

適切なデータクリーニングを行わないデータ統合は、流砂の上に建物を建てるようなもので、脆弱かつ持続不可能です。科学者がデータをクリーニングすることで、最も関連性が高く信頼できる情報のみが後続のプロセスに組み込まれ、研究環境の正確な把握と強固なデータ基盤の構築が可能になります。 

データ統合を成功させるための構造化されたアプローチ 

データ統合(図1)は、まず 権威ある構成要素 と命名基準を確立することから始まります。例えば、この緻密な作業により、創薬目的でタンパク質などのエンティティがすべてのソースやデータセット間で統一的に命名・分類され、標的の特定が可能になります。

統合の次のフェーズは物質のリンク付けです。ここでは、科学者が異なるデータセットやデータベース間で同一の化学物質へのリフェレンス、基準、参考文献を特定し、結びつけます。このプロセスにより、異なる物質の表現、同義語、識別子が単一の一貫したエンティティに統合されます。この取り組みは、ソースごとに異なる慣習が用いられ、同じ化合物が異なる方法で記述されることが多い薬理学や創薬において不可欠です。 

A data harmonization workflow requires a structured approach
図1: データ統合のワークフローには、標的の命名基準の確立から、データセットの一貫性の確保、そして多様なデータセットやソース全体にわたるデータの品質と信頼性の最適化に至るまで、構造化されたアプローチが必要です。

ハーモナイゼーション(統合)プロセスのさらなる段階として、データサイエンティストは正確な文書や関連文書を特定・管理し、データの重複を防ぐとともに、最も関連性の高い情報のみが保持されるようにします。最終ステップでは、データセット全体でデータ定義の一貫性を確保することに重点を置きます。これは、複数のソースからのデータで構成される一貫した基盤を構築するために不可欠です。  

創薬チームは、人間によるキュレーション(情報の収集・整理)を活用したハーモナイゼーションのワークフローを導入することで、複雑なデータ環境を自信を持ってナビゲートできます。その結果、高度な分析や予測モデリングに適した信頼性の高いデータセットが得られます。この体系的なアプローチにより、エラーが最小限に抑えられ、その後のすべての研究が強固でクリーンなデータ基盤の上に構築されることが保証されます。 

Data integrity for AI-powered scientific research. AI’s capacity for data and its computational speed surpass what humans are capable of and the technology will continue to redefine what is possible. But data integrity and harmonization are critical components of any successful application of AI in science.

ハーモナイズされたデータが予測モデルの精度を向上させる 

データハーモナイゼーションの最も具体的な利点の一つは、 予測モデルへの影響です。予測精度へのプラスの効果を実証するため、CASの科学者は、新しくハーモナイズされたデータセットを使用して、リガンドとターゲットのペアの活性を予測する既存のアンサンブルモデルを再学習させました。   

再学習されたモデルは大幅な精度向上を示し、予測結果と実験結果の間の標準偏差を23%削減し、予測されたリガンドとターゲットの相互作用と実験値との乖離を56%減少させました(図2)。ターゲット名を正規化し、物質のリンクを改善することで、科学者は物質とターゲットの関係をより一貫性を持って正確に記述できるようデータを強化しました。  

Retraining a bioactivity predictive model using harmonized data increased its accuracy
図2: ハーモナイズされたデータを使用して生物活性予測モデルを再学習させたことで精度が向上し、ターゲットに対するリガンドの活性をより確実に推定できるようになりました。  

この予測モデリングは、モデルのパフォーマンスを洗練させる上で、人間によるデータハーモナイゼーションが不可欠な役割を果たすことを強調しています。スクリーニングプロセスの早い段階で最も有望な候補を特定し、そこに注力することで、チームはヒット・トゥ・リードのフェーズをより迅速に進め、開発や試験へと移行できるようになります。  

ハーモナイズされたデータが高度な分析を促進する 

データハーモナイゼーションは、予測モデルや、革新的な創薬ワークフローを推進するナレッジグラフや相互作用ネットワークといった高度な分析ツールも最適化します(図3)。これらのツールは、研究者がターゲット、物質、生物学的経路の間の関係を探求し、疾患との関連性や新しい治療モダリティを特定するのに役立ちます。 

図3: データハーモナイゼーションにより、研究者は相互作用ネットワークを通じて生物学的データを可視化できます(A)。これらのネットワークをさらにリンクさせることで、物質が基礎となる生物学的プロセスにどのように影響するかをより包括的に把握できる広範なネットワーク図を構築できます(B)。 

人間がキュレーションした統一されたデータ基盤により、科学者は遺伝子発現、タンパク質相互作用、代謝経路など、さまざまな生物学的レベルにわたる複雑な相互作用を追跡でき、断片化されたデータソースでは見えなかった洞察を得ることができます。このアプローチは、既存の化合物と新たな治療ターゲットとの間の隠れたつながりを明らかにするため、創薬の精度を向上させ、潜在的なドラッグリポジショニングの機会の特定を加速させます。 

人間によるキュレーションがイノベーションの基盤を形成する 

文脈の微妙なニュアンスを理解できない機械は、生物学的データセットに内在する曖昧さや矛盾を適切に処理するのに苦労します。熟練した専門家は、自動化システムでは不可能な方法で、微妙な差異を認識し、エラーを解決し、データを調整することで、正確性と妥当性を確保する重要な役割を担っています。このプロセスは、科学研究を行う人々や関連サービスを提供する組織にとって不可欠です。例えば、何百人ものCASの科学者が、データをクリーンアップし、調和させ、収集しています。 CAS Content Collection™を構築するために使用されるデータは、人間が収集した科学知識のコレクションとして世界最大規模を誇ります。

この取り組みは、下流工程における分析の信頼性を高め、潜在的な創薬ターゲットや効果的な疾患治療法の発見を加速させるという成果をもたらします。 

人間が収集・調和させたデータは、予測モデルやネットワーク図のような高度なツールに適用されると、生命科学分野やその先におけるブレイクスルーを促進します。組織が研究におけるデータクリーンアップを優先し続けることで、研究結果の品質を確保し、イノベーションを加速させることができます。 

Related CAS Insights

Addressing sustainability of the global patent system: the role of AI in enhancing productivity

AI’s emerging role in natural product drug discovery

AIを活用した科学研究のためのデータ整合性

Gain new perspectives for faster progress directly to your inbox.