案例研究

定制化机器学习数据集加速 Selvita 有机合成工作流程

行业

医药合同研究组织 (CRO)

解决方案

CAS Custom Services℠

蓝色背景下,带有分子组件标签的数字化学结构图特写。

关键成果

60万+

已交付的精选反应条目

关键成果

数日

交付周期,对比数月的人工工作

关键成果

>1 周

每个反应簇节省的时间,对比资深化学家的人工处理

挑战

零散且不一致的开源数据拖慢了机器学习模型的开发进度

作为欧洲最大的临床前合同研究组织之一,Selvita 不断改进其有机合成工作流程,旨在为制药合作伙伴提供更快速、更高效的解决方案。为了充分发挥机器人技术和自动化的优势,该公司的化学家们致力于将相似合成反应的化合物进行聚类,从而实现并行处理并提高生产效率。然而,要在不影响产率的前提下进行并行反应,需要对温度、试剂和压力等条件进行精确控制。

Selvita 的计算化学家们认识到 Suzuki 偶联和酰胺偶联反应在其内部工作流程及整个制药行业中的核心地位,因此开发了一种机器学习 (ML) 模型,用于预测反应产率并确定化合物分组的最佳条件。但要构建一个可靠的模型,首先必须建立一个稳健的训练数据集。当时可获取的可靠结构化数据库非常有限,而现有的开源数据来源未经核实且质量参差不齐。如果通过人工方式清洗和验证这些数据,将耗费数月时间,从而分散团队对核心科研工作的精力。

“在整个过程中,我们保持着密切的沟通与合作;正是这种协作促成了项目的成功。”

— Fabrizio Ambrogi,Selvita 资深机器学习专家

解决方案

数日内构建定制化机器学习训练数据集

Selvita 寻求 CAS 定制化服务以获取专属解决方案。CAS 解决方案顾问与 Selvita 的计算化学家紧密合作,首先明确了数据集需求,并确定了符合团队目标的最佳格式。随后,CAS 数据专家对人工标引的 CAS Content Collection™ 进行检索,提取出各目标反应类型的相关信息,大幅减轻了原本可能耗费数月的数据清洗工作负担。

为确保数据集达到可靠模型训练所需的质量标准,CAS 内容顾问与专家化学家利用先进的自动化工具对每条数据进行了质量保证。仅在数日内,CAS 便交付了包含 40 万条铃木反应(Suzuki reactions)数据和 20 万条酰胺偶联反应数据的高质量数据集。Selvita 利用这些精选数据集,通过筛选对常用试剂、溶剂和催化剂进行分类与排序,从而构建起平行合成所需的集群。

该模型首先通过预留测试集进行了验证。随后,Selvita 团队更进一步,将模型与资深化学家进行对比测试,针对一系列从未开展过的反应进行预测。仅在数小时内,模型便确定了优于化学家选择的最佳反应条件,而化学家完成同样工作则需耗时一周以上。这些实际应用结果证实了该模型能够可靠地预测反应条件,从而实现高效合成。

成果

以优质数据驱动更快速的药物研发

通过与 CAS 合作,Selvita 避免了数月的繁琐人工数据处理,以及因训练集不可靠而导致的昂贵试错成本。团队直接进入模型开发与验证阶段,简化了核心有机合成工作流程,并增强了为制药合作伙伴提供更快速、更高效药物研发解决方案的能力。该项目充分证明了从一开始就建立正确数据基础所带来的重大影响。

预约免费的 CAS Custom Services℠ 咨询服务