導入事例

カスタムMLデータセットがSelvitaの有機合成ワークフローを加速

業界

医薬品CRO

ソリューション

CAS Custom Services℠

青い背景に、分子コンポーネントがラベル付けされた化学構造図のクローズアップ。

主な成果

60万件以上

キュレーションされた反応データを提供

主な成果

数日

手作業で数ヶ月かかっていた作業を短縮

主な成果

1週間以上

シニアケミストと比較して反応クラスターごとに削減

課題

断片的で一貫性のないオープンアクセスデータが機械学習モデルの開発を停滞させる

欧州最大級の非臨床受託研究機関であるSelvitaは、製薬パートナーにより迅速かつ効率的なソリューションを提供するため、有機合成ワークフローの改善を絶えず行っています。ロボット工学と自動化の力を最大限に活用するため、同社の化学者たちは類似の合成反応から化合物をクラスター化し、並列処理を可能にすることで生産効率の向上を目指しました。しかし、収率を損なうことなく反応を並列で行うには、温度、試薬、圧力といった条件を精密に制御する必要があります。

Selvitaの計算化学者たちは、自社のワークフローおよび製薬業界全体において、鈴木・宮浦カップリング反応やアミドカップリング反応が中心的な役割を果たすことに着目し、反応収率を予測して化合物のグループ化に最適な条件を特定するための機械学習(ML)モデルを開発しました。しかし、信頼性の高いモデルを構築するには、まず堅牢なトレーニングデータセットを作成しなければなりません。当時、信頼できる構造化データベースへのアクセスは限られており、利用可能なオープンアクセスソースは検証が不十分で一貫性に欠けていました。そのデータを手作業でクリーニングし検証するには数ヶ月を要し、チームが本来注力すべき科学研究から注意を逸らしてしまう恐れがありました。

「私たちはプロセス全体を通じて定期的に連携しました。この協力体制こそが、プロジェクトを成功に導いた要因です。」

— Fabrizio Ambrogi, Selvita社 シニア機械学習スペシャリスト

解決策

数日で構築された機械学習用カスタムトレーニングデータセット

Selvita社は、CASカスタムサービスにオーダーメイドのソリューションを求めました。CASのソリューションコンサルタントは、Selvita社の計算化学者と連携し、まずデータセットの要件を定義した上で、チームの目標に合致する最適なフォーマットを決定しました。続いてCASのデータスペシャリストが、人間がキュレーションしたCAS Content Collection™を検索し、各ターゲット反応タイプに関連する情報を特定・抽出しました。これにより、数ヶ月を要する恐れがあったデータクリーニングの負担を大幅に軽減しました。

データセットが信頼性の高いモデルトレーニングに必要な品質基準を満たすよう、CASのコンテンツコンサルタントと専門の化学者が、高度な自動化ツールを用いて各エントリの品質保証を行いました。CASは数日以内に、鈴木・宮浦カップリング反応用に40万件、アミドカップリング反応用に20万件の検証済みデータセットを提供しました。Selvita社はこれらのキュレーション済みデータセットを使用し、一般的な試薬、溶媒、触媒を分類・ランク付けするフィルターを適用することで、並列合成に必要なクラスターを作成しました。

モデルはまず、確保しておいたテストセットで検証されました。さらにSelvita社のチームは、これまで一度も実施されたことのない一連の反応において、モデルと熟練化学者を直接対決させました。数時間のうちに、モデルは化学者が1週間以上かけて導き出した選択を上回る最適な条件を特定しました。これらの実世界での結果により、効率的な合成に向けて反応条件を確実に予測するモデルの能力が実証されました。

成果

より優れたデータが加速させる創薬研究

CASとの提携により、Selvita社は数ヶ月に及ぶ手作業のデータ処理や、信頼性の低いトレーニングセットに起因するコストのかかる試行錯誤を回避しました。チームは直ちにモデルの開発と検証へと移行し、不可欠な有機合成ワークフローを合理化するとともに、製薬パートナー に対してより迅速かつ効率的な創薬ソリューションを提供する能力を強化しました。このプロジェクトは、最初から適切なデータ基盤を持つことの大きな影響を実証しました。

CAS Custom Services℠の無料相談を予約する