Executive Summary

    • 许多人工智能模型在受控测试中表现良好,但在应用于真实的实验室数据时却会失效,从而减缓了 R&D 进度并削弱了研究人员的信任。
    • 收录的科学数据能产生明显更好的模型。CAS 的研究结果显示,在药物-蛋白质结合研究中,使用一半的训练数据即可获得约两倍的预测准确度;而在使用经科学家验证的原子映射时,合成路径预测的准确度提高了 30% 以上。
    • 持续的人工智能成熟度取决于三种运营实践的协同作用:数据治理、工作流程验证和数据可持续性。

人工智能 在科学 R&D 领域持续获得关注。然而,许多组织发现,早期模型在应用于现实研究时表现各异。在受控评估中看似可靠的算法,在面对活跃研究环境中特有的变异性、记录实践和实验多样性时,往往表现出不一致的行为。这种差异凸显了 R&D 领域对更高人工智能成熟度的需求。 在科学 R&D 领域持续获得关注。然而,许多组织发现,早期模型在应用于现实研究时表现各异。在受控评估中看似可靠的算法,在面对活跃研究环境中特有的变异性、记录实践和实验多样性时,往往表现出不一致的行为。这种差异凸显了 R&D 领域对更高人工智能成熟度的需求。

导致行为差异的一个主要因素是底层数据结构。实验结果取决于测量数据的生成方式以及这些结果的记录方式。这些细节在不同团队之间差异巨大,从仪器和协议的差异,到单位、命名规范的差异,甚至实验室记录中记载的详细程度都不尽相同。此外,许多在有限、狭窄的数据切片上训练的人工智能系统,无法解读超出其初始静态范围的意外变异。 如果没有适当的准备,预测结果就会变得不稳定,并在实验室验证过程中失效。这些不一致性不断累积,在原型性能与实际部署之间造成了差距,限制了早期人工智能工作的成效,并为更深层次的组织挑战埋下了隐患。  

为什么人工智能在科学 R&D 中的进展会停滞不前

这些挑战反映了许多 R&D 组织中普遍存在的更深层次的成熟度差距。早期人工智能模型在受控测试环境中表现良好,但一旦遇到真实的实验室数据或被部署到多个研究项目中,性能就会下降,进展也会放缓。当模型面临不一致的输入数据、缺乏解读结果所需的背景基础,或使用阻碍数据无缝流动的分散数字基础设施时,问题就会显现出来。这些问题表明,瓶颈不在于模型本身,而在于周围数据、流程和基础设施的就绪程度。了解这种故障发生的位置,有助于解释为什么在科学 R&D 中实现人工智能成熟度仍然充满挑战。

科学数据的变异会导致不准确、不可信的结果

“Garbage In, Garbage Out”(垃圾进,垃圾出)是一个耳熟能详的短语,但在科学 R&D 中,它反映了一个更深层次的结构性挑战。实验结果源自遵循不同格式、术语和元数据捕获约定的仪器、实验室团队和文档系统。两个团队可能进行相同的分析,但其输出文件的结构、单位、背景细节甚至命名规范却可能存在显著差异。然而,结构上的不一致往往次于一个更严重的问题:实验条件本身(温度、仪器校准、时间等)可能会剧烈改变结果,而这些变量在各团队间往往记录不足或记录不一致。即使数值看起来具有可比性,产生这些数值的条件也可能不同。当训练数据携带这些不一致性时,模型无法可靠地将有意义的科学变异与报告伪影区分开来。不匹配的标识符、缺失的元数据和不完整的记录阻碍了模型形成对底层科学的稳定表征,从而导致模型学习到的模式不准确,其输出结果也无法被信任。    

当训练好的模型投入使用时,会出现第二个同样严重的问题。如果模型在实际应用中输入的数据是基于与原始训练数据不同的假设准备的,那么即使是构建良好的模型也会失效。训练流程与推理流程之间在单位、标识符、实验背景或文件结构上的差异,会导致模型误解输入内容,从而产生不可靠或无法使用的预测结果。因此,对于在活跃的 R&D 环境中部署的任何人工智能解决方案而言,保持训练数据假设与实际数据流程之间的一致性是一项持续的要求。  

不清晰的推理会降低对人工智能输出结果的信心

可解释性是影响人工智能技术采用的另一个重要因素。当模型行为与研究人员或领导者基于既定实验室结果的预期不符时,人工智能模型的使用率就会下降。科学家依赖于可以通过实验验证的预测和输出。当预测结果无法追溯到结构化数据(通常情况下)或清晰的推理路径时,对系统的信心就会减弱。由于不清楚预测是如何做出的,研究人员会犹豫是否将其纳入正在进行的实验中。

当系统无法指出哪些输入影响了其预测/结果时,这种不确定性会加深。分析设置、样本属性或分子描述符的细微差异都可能影响结果。如果无法洞察模型结论的依据,团队就无法评估输出结果在科学上是否合理。随着时间的推移,这些可解释性方面的差距限制了技术的采用,阻碍了故障排除,并降低了人工智能可靠支持或加速活跃研究计划的能力。  

碎片化的基础设施中断了数据连续性

除了能够形成可靠的推理路径以将预测与输入联系起来之外,另一个挑战源于 碎片化的数字基础设施。许多研究团队依赖于在数字化转型不同阶段采用的软件,导致数据和算法分散在孤立的平台中。实验记录可能驻留在一个环境中,而分析输出或专有文献则存储在另一个位置。

这些割裂破坏了数据的连续性,使得追踪模型如何产生输出,或者该输出如何与特定实验室条件相关联变得困难。当系统无法可靠地交换数据时,团队被迫通过复制文件、导出结果或跨平台重建记录来手动传输信息。这些手动传输增加了出错的风险,并削弱了对依赖于通过碎片化工作流程移动的信息所做出的预测的信心。随着时间的推移,缺乏端到端的整合限制了可重复性,减缓了迭代速度,并制约了人工智能在活跃研究计划中的有效性。

科学 R&D 的成功三角框架

为了应对这些挑战,CAS 利用“成功三角”作为一种专为科学 R&D 量身定制的结构化合作框架。该模型阐述了协调的科学审查、有意的技术设计和结构化的知识管理如何为稳定的模型行为创造必要条件。通过整合这三大支柱的专业知识,组织可以系统地加强其数据、基础设施和科学基础,从而加速向更高的人工智能成熟度迈进。

Illustration showing the CAS "Triangle of Success," with three areas of governance for: domain experts, tech/algorithm experts, and content experts.

“成功三角”适用于人工智能生命周期的两个关键阶段。第一阶段是模型创建:确保预测问题在科学上被正确界定,训练数据具备正确的背景和质量,且人工智能方法与用例高度匹配。第二阶段是模型应用:一旦模型经过训练和验证,该框架将通过验证原始假设是否依然成立、输入数据是否持续满足模型构建时的条件,以及随着研究环境的演变输出结果是否依然可信,来指导模型如何部署到实际的研究工作流程中。这两个阶段的结合确保了人工智能能力的构建和使用均有的放矢。  

该框架突显了各团队独特而又相互依存的贡献:领域专家负责解释实验变异性,内容专家负责标准化和稳定数据,技术专家负责统一数字基础设施生态系统。他们共同为人工智能可靠地影响 R&D 决策提供了稳定性和科学基础。

领域专家

组织内的领域专家运用科学知识和现实研究经验,评估人工智能模型的行为是否准确。其核心职责包括:

  • 明确哪些实验因子会影响结果,以及这些因子应如何在数据中体现。
  • 设定模型应学习的内容预期,以及科学约束的适用范围。
  • 核查输出结果是否符合既定的科学认知,而非数据中的人为伪影。

内容专家

内容专家(例如 CAS 专家)可确保输入人工智能系统的科学信息准确且经过验证,并确保每项输入都反映了既定的科学关系,而非不一致或不完整的记录。他们通过以下方式提供指导:

  • 准备能够反映化学、生物学和材料科学领域已验证关系的数据集。
  • 解决冲突的标识符、缺失的元数据、不一致的术语或其他削弱模型稳定性的问题。
  • 从经过验证的科学来源中添加背景信息,使输入数据能够代表现实研发环境中的观察结果。
  • 维护内容系统,以保留数据来源,并确保数据集随着科学领域的发展与最新知识保持一致。

技术与算法专家

技术与算法专家负责构建基础设施,使人工智能系统能够在各项研究计划中可靠运行。他们通过以下方式支持人工智能开发:

  • 构建能够实现数据在流水线中自动传输的系统,从而无需人工操作并降低错误率。
  • 监控模型在系统更新新数据时的表现,并在性能发生变化时调整工作流程。
  • 将预测结果整合到现有研究工具中,以便团队在日常决策过程中使用。  

为何更优质的数据能带来更出色的预测模型

科学 R&D 中的人工智能成熟度取决于用于训练每个模型的数据的质量和一致性。当“成功三角”应用于实践时,其影响最直观地体现在训练数据的质量及随后的模型性能上。经过收录的输入数据为模型提供了更清晰的视角,使其能够识别出预期的关联,从而减少了可能限制其在现实研究环境中可靠性的干扰因素。CAS 的研究结果表明,更坚实的数据基础能产生更稳定、更准确的模型表现。

在一项药物-蛋白质结合预测研究中,基于科学家收录的 CAS 数据进行训练的模型,其表现大约为 预测准确率提高了一倍,同时使用的数据点减少了 50%。这一改进减少了不必要的后续实验,并帮助团队在工作流程的早期阶段优先筛选出最合理的结合候选物。*

对合成路径预测的另一项评估也显示了类似的收益。 当科学家验证过的原子映射被添加到训练数据中时, 路径准确率 提高了 30% 以上。 经过验证的映射解决了之前导致模型误判的结构歧义,使预测结果更贴近实验室观察,并减少了纠错迭代的次数。**

这些发现表明,当人工智能模型使用经过专家评审的协调科学数据进行训练时,其表现更为有效。要持续获得这些收益,需要的不仅仅是一次性的改进,还取决于能够随着时间推移不断强化成熟度的运营实践。    

强化人工智能成熟度的运营步骤

当组织的 AI 和数据战略开始为日常 R&D 决策提供参考时,人工智能的成熟度就会提高,这涵盖了从团队准备数据的方式到他们在项目中利用模型预测的方式。进步取决于构建能够适应研究需求,并保持输入工作流程的数据与输出预测结果之间清晰关联的系统。  

三项运营实践有助于团队从早期的试点项目转向更成熟、更可靠的人工智能赋能工作流程。

数据治理    

  • 设定数据进入工作流程前的准备规则
  • 定义检查机制,以确认输入和预测结果是否符合科学预期
  • 维护数据集变更、模型更新和评估步骤的文档记录
  • 明确数据审查和工作流程更新审批的责任归属

工作流程验证

  • 存储生成预测所使用的所有步骤(包括预处理和模型设置),以确保结果可追溯且可重复
  • 通过不同团队或在不同时间进行的重复运行来确认稳定性
  • 汇集科学和技术人员,共同审查并解决差异
  • 设定明确的标准,以判断工作流程何时达到足以支持其他项目的稳定性

数据可持续性

  • 通过受控的摄入流程添加经过精心收录的新数据,使模型与最新的科学知识保持一致
  • 在每个新数据集进入工作流程前,应用标准化的格式、元数据和上下文规则
  • 使用检索增强方法,使模型在推理过程中能够参考最新的科学来源
  • 监测数据模式或假设的变化,并更新数据集或模型,以防止预测质量下降

当数据治理、工作流程验证和数据可持续性在整个工作流程中得到保持时,人工智能将变得更加可靠,并支持向更高的成熟度迈进。

人工智能成熟度如何加强科学工作流程和成果

人工智能的成熟度决定了科研机构能否依赖模型输出来制定影响实验和项目方向的决策。许多团队在受控评估中表现出色,但一旦模型进入真实的 R&D 环境,由于测量差异和工作流程的不同,其可靠性便会下降。

迈向更高成熟度的进程取决于加强每个模型背后的科学基础。领域专家负责阐明系统必须遵循的研究假设和科学约束,确保模型的推理与既有知识保持一致。技术负责人负责维护数字环境,以确保可重复性、追踪数据来源,并确保输出结果在数据演变过程中保持可追溯性。内容专家提供经过协调和验证的输入,这些输入反映了真实世界的行为,并消除了导致学习不稳定的不一致性。  

当这些能力达成一致时,人工智能系统在科学审查下表现得更加稳定,并能以更高的信心支持日常决策。

如需了解 CAS 如何为您的人工智能之旅提供支持,请探索 这些 Science-smart 人工智能资源。  

- - -

* CAS 案例研究展示了高质量、经科学家收录的内容对配体针对蛋白质靶点的生物活性预测准确性的影响。通过使用 CAS 收录的内容而非嘈杂的公共数据,该模型在训练数据集仅为原始规模一半的情况下,预测准确性提高了 2 倍。

** 与 Molecule.One 合作开发的案例研究。一个基于公共反应数据训练的逆合成模型使用 CAS 数据进行了重新训练,利用了科学家收录的反应物与产物原子之间的映射关系,这对准确的化学预测至关重要。使用 CAS 数据后,经专业合成化学家评估,有效合成路线的准确预测率提高了 30%。

Questions and answers

为什么数据质量对人工智能至关重要?

什么是人工智能的数据治理?

如何启动 R&D 中的人工智能计划?

Related CAS Insights

AI 药物开发技术的兴起

Defining the path to TBK1 inhibition with QSAR modeling

Embracing the future of AI in the food industry

Gain new perspectives for faster progress directly to your inbox.