人工知能(AI)は、10年前には想像もできなかったペースでイノベーションを推進しています。AIは、効率性の向上、データに基づく意思決定の促進、セキュリティの強化を通じて、ほぼすべての業界やビジネスに影響を与えています。また、化学や生命科学を含む多くの科学研究分野に革命をもたらしています。これらの2つの業界におけるAIの進歩は、新しい材料の発見方法を生み出し、創薬を加速し、ラボに足を踏み入れる前に何百万もの実験を実行できる予測モデルの作成につながりました。
AIが日常生活のあらゆる側面に影響を与えている中、AIをこれほど強力なものにしている要因や、技術がつまずく点を見失いがちです。重要な要素の一つは、あらゆるAIアプリケーションにおけるデータ品質の重要性です。
データ品質の定義
データの品質は人によって異なる意味を持つことがありますが、一般的には正確性、一貫性、完全性、関連性の4つの主要な要素の組み合わせで構成されます。
- 正確性は、データに誤りやミスがないことを保証します。
- 一貫性とは、データが均一に表現されることを意味します。
- 完全性により、必要なデータがすべて存在することが保証されます。
- 関連性は、データが目の前のタスクに適用可能であることを検証します。
これらの要素に準拠したデータセットは、AIアルゴリズムのトレーニングに不可欠です。しかし、これらの要件を満たさなかった場合の結果も考慮することが重要です。
精度
不正確なデータセットでモデルをトレーニングすると、不正確なモデルが生成されます。データセットの精度が低いと、一般化が不十分になる可能性が高くなります。モデルが適切に一般化されない場合、トレーニングセットに含まれていないデータに対してはパフォーマンスが低下します。精度が低い場合、結果としてモデルの信頼性が低下し、展開後に克服するのが難しい信頼性と確信の問題につながります。
一貫性
データに一貫性がない場合、トレーニングセットに新しいデータを導入するには、より多くの労力が必要になります。欠落しているフィールド、単位の変更、重複、その他の種類の不整合を識別する必要があるため、時間のかかるプロセスになります。ほとんどのデータサイエンティストは、データセットの一貫性向上に多くの時間を費やしています。この時間は、データパイプラインの早い段階でデータの一貫性を優先すれば、AIアルゴリズムの開発により有効に活用できるはずです。
完全性
モデルの目的に関連するすべての情報の完全なデータセットにアクセスできなければ、モデルの理解にギャップが生じます。これらのギャップはモデルのバイアスとして現れることがあります。バイアスのあるモデルは、トレーニングセットに似ていないデータに遭遇すると、不適切な予測を行う傾向があります。偏ったモデルは、有害な固定観念を強化したり、モデルのユーザーに悪影響を与える可能性があるため、多くの倫理的および法的懸念を伴います。
妥当性
データセットが現在のタスクと関連性がない場合、有用なモデルをトレーニングするのにさらに時間が必要になる可能性があります。トレーニングで無関係なデータを使用すると、最終的な決定に影響を与えないデータを考慮しようとするため、モデルが混乱します。この無関係なデータのためにモデルのトレーニング段階でより多くの時間が必要になる場合、有用なモデルをトレーニングするためにさらに多くの時間、計算リソース、および費用がかかることが予想されます。
CASは人間の専門知識を活かしたデータ品質を保証します
データ品質に関する懸念はどこにでも存在しますが、CASは科学的データに関連するこれらの要素の重要性を認識し、優先しています。化学および生命科学のデータは、その情報源によって大きく異なる場合があります。化学において分子構造を表す方法はいくつかあります。これにはMDL Molfile(MOL)、Structure-Data Format(SDF)、Simplified Molecular Input Line Entry System(SMILES)、およびInternational Chemical Identifier(InChI)が含まれます。これらの分子表現にはそれぞれ長所と短所があります。CASは、すべての分子形式をCAS REGISTRY®にマッピングする技術に依存しています。技術だけでは正確な一致を判断できない場合、人間の専門知識を用いて正しい構造を特定します。この人間によるキュレーションを通じて、CASおよびパートナー企業において多様なAIアプリケーションで使用される、化学構造と化学反応の両方に関する高品質なデータベースを維持しています。
同様に、CASはライフサイエンスデータへの最近の拡張においても、人間によるキュレーションに依存してきました。CASの科学者と技術者からなるグローバルチームは、薬学、バイオマーカー、シグナル伝達経路などのライフサイエンスデータをレビューします。この取り組みにより、データの正確性と一貫性が確保されており、これは高品質なデータセットの重要な要素です。私たちの薬学データセットを使用して、タンパク質ターゲットに対する分子の活性を予測するための既存のモデルをトレーニングしたところ、ベースラインモデルと比較して実験値と予測値の差が56%減少し、標準偏差が23%減少しました。この取り組みは、すべてのCASデータセットに見られるデータ品質の重要性を示しています。
CASでは、AIアプリケーションにおけるデータ品質の重要性を認識しています。人間の関与により、私たちは高精度かつ一貫したデータセットを生成します。当社は100年を超える歴史の中で、コンテンツと知識の管理に関する専門知識を培ってきました。当社の科学者たちはこの専門知識を活用して、特定のAIアプリケーションに対するデータセットの完全性と関連性を判断しています。この専門知識を活用することで、データセット内の完全性と関連性の問題を特定し、これらの問題に対処するための計画を立てることができます。
