提升科学研发中人工智能表现的 5 种方法

深色六边形背景下,充满发光蓝色电路的半透明胶囊。

人工智能持续吸引着科学研发领域的关注,为加速发现和制定更明智的决策带来了希望。然而,许多团队发现其成果并未跟上预期。挑战不在于雄心,而在于协同。大多数人工智能系统并非为科学的复杂性而构建。本文概述了组织提升人工智能表现并在科学研发中实现更大影响的五种方法。

1. 通过更清洁、精选的数据提升人工智能成果

科学研究产生的数据形式各异:图像、光谱、扫描笔记和复杂的化学结构。与其它行业中清洁、标准化的数据集不同,科学数据杂乱且具有高度的语境依赖性。微小的差异可能蕴含重大的意义。楔形键、虚线键与实线键可能代表完全不同的化学构型,而一个简单的拼写错误(例如将“3”误认为“8”)就可能改变化合物或反应规格。当这种程度的噪声在没有经过适当筛选的情况下进入人工智能模型时,结果的准确性会迅速下降。证据表明,使用精选科学数据集训练的模型,在数据量减半的情况下,预测准确率提高了近一倍。在研发中,数据质量始终优于数据数量。薄弱或不一致的信息会阻碍人工智能系统生成可靠的预测。

2. 保持人工智能与科学变革步伐的一致性

每天都有成千上万的新论文、专利和实验结果扩充着科学记录。与此同时,实验室仪器也在产生海量的全新数据。科学知识本身是动态的,随着发现的演进,理解的基础构件也在不断完善。这种快速的节奏使得静态的人工智能系统难以保持同步。基于去年数据训练的模型会迅速失去相关性,产生过时的结果。保持科学一致性需要持续更新且经专家精选的数据基础,而非一次性的数据摄入。大型语言模型有助于加速数据处理,但必须结合科学专业知识以维护完整性、语境和一致性。若缺乏这种持续的同步,人工智能在不断前进的领域中就有沦为滞后工具的风险。

3. 与具备关键数据专业知识的伙伴合作

研究机构擅长产生新知识,但很少有机构能够满足人工智能在技术和数据管理方面的需求。数据分散在遗留系统中,这减缓了协作,且内部团队往往缺乏构建、训练和管理可靠模型所需的专业知识。数据管理、数据科学和人工智能工程等学科需要不同的技能组合,且每一项都必须与深厚的科学理解相结合,才能产生有意义的成果。许多组织试图在内部建立这些能力,但遇到了可扩展性和治理方面的挑战。更有效的方法是与数据科学和知识管理领域的专家合作,确保人工智能计划建立在高质量、经科学验证的数据基础之上。建立此类合作伙伴关系后,研究人员可以专注于发现,而人工智能系统则提供预测能力和可重复性。

4. 通过透明度和可重复性赢得科学家的信任

科学进步依赖于可重复性。当人工智能的输出结果不透明或与已知原理不一致时,这种期望就会产生摩擦。三分之二的研发决策者表示对人工智能采用的速度和可靠性感到不满,这反映出对其当前表现的信任度有限。人工智能要获得信誉,必须提供透明、可解释且可重复的结果,并与实验现实保持一致。当使用经过验证的原子映射反应数据来训练合成规划模型时,路径预测的准确率比使用机器筛选的数据提高了 30% 以上。同样,使用精选数据集训练的药物-蛋白质结合模型在数据量减半的情况下,准确率提高了一倍。这些案例表明,当人工智能系统植根于经科学验证的数据时,研究人员更有可能信任并采纳其见解。

5. 聚焦于能带来可衡量影响的具体应用场景

关于人工智能在几天内发现药物或带来十倍生产力提升的头条新闻,为科学研发设定了不切实际的期望。这些故事往往取材于复杂性较低、约束较少的领域。科学领域人工智能的成功取决于定义具体、可衡量的应用场景,而非宏大的愿景。例如,在保持产率高于 80% 的前提下优化总合成时间,提供了一个具体的客观目标,可以引导模型开发朝着有意义的成果发展。当应用场景模糊时,结果往往难以达到预期。可持续的影响来自于将人工智能视为一段成熟之旅,通过长期的持续投入来完善和扩展其能力。构建目标明确、基于科学的应用,确保进步稳步积累,将早期的试点项目转化为研发中值得信赖的高价值工具。

为“科学智能”人工智能奠定基础

人工智能在研发中经常受挫,因为它并非为科学的现实而设计。成功不仅依赖于巧妙的算法,还需要学科专业知识、精选的科学数据以及与研发工作流程相匹配的基础设施,这些要素必须协同工作。

这就是“科学智能”人工智能的承诺。有了正确的基础,组织可以摆脱停滞不前的试点项目,利用团队可以信任的见解加速发现。

在您的人工智能计划中是否也面临类似的挑战?请联系 CAS 专家,探讨“科学智能”人工智能如何助力加强您的研发战略。

联系我们