Executive Summary
- 数据质量 是人工智能在科学领域成败的关键因素。
- 数据完整性和数据协调 是以人为本的学科,而非纯粹的自动化过程。
- 协调后的数据 能显著提升人工智能模型的性能。
- “暗数据” 是人工智能驱动研究中尚未开发的巨大资源。
- 人工智能在各科学领域的应用正在迅速加速,但数据基础设施仍是制约因素。
毫无疑问,人工智能(AI)凭借其分析海量数据集的能力,彻底改变了科学研究。人工智能处理数据的能力及其计算速度远超人类,这项技术将继续重新定义科学发现的可能性。
然而同样毋庸置疑的是,“垃圾进,垃圾出”的原则依然适用——人工智能算法和模型输出结果的可靠性完全取决于支撑它们的数据质量。数据质量问题与科学本身一样古老——如果基于错误的数据,任何假设都无法得到重复验证——但随着人工智能驱动研究的建立,以及当今可用数据量的激增,这一问题变得愈发严峻。
解决方案的重要组成部分是 数据协调,它为集成模型、大语言模型(LLMs)及其他类型的人工智能系统提供正确且一致的数据。例如,高质量数据在生物医学和材料科学等领域的人工智能成功应用中起着决定性作用。在这两个领域,蛋白质结构、原子结构、DNA 等数据的复杂性凸显了人工智能模型对纯净、协调数据的迫切需求。
我们对 CAS Content CollectionTMTM(全球最大的人工收录科学信息库)的整理,使我们对数据协调的最佳实践拥有了无与伦比的见解。让我们探讨其运作方式,并审视在推动人工智能驱动的成功发现时,人类专业知识这一常被忽视的作用:
化学领域的人工智能模型:当今布局与未来展望
人工智能推动了药物发现和新材料识别的加速。我们看到生物医学和材料科学领域模型类型的激增,通过进行概念共现分析,研究人员可以发现建模方法中的新兴趋势。这份对应用于生命科学和材料科学的人工智能特定工具和技术的深入研究,揭示了人工智能技术在当下的影响以及未来的发展方向:

数据完整性与协调:构建人工智能成功的基础
利用人工智能进行科学研究需要干净、标准化的数据。纠错和工作流程编排是构建必要数据基础的关键步骤,但人类专业知识在标准化和验证数据输入方面仍然是这些工作中不可或缺的一部分。在使用协调数据时,我们在预测模型和高级分析中看到了切实的好处——这提醒我们,在利用最先进的技术时,人类依然是至关重要的一环。

制药领域的人工智能:引领药物重定位工作
制药研究人员可以获取海量数据,包括药物配方、存档的临床试验和电子健康记录等,这仅是其中一小部分来源。妥善利用这些数据可以为现有药物的重定位揭示重要见解,这是满足患者需求的一项有力策略。他们该如何实现?通过一种知识管理解决方案,获得干净、标准化的数据,从而有效地驱动人工智能工具。
拥有丰富多样的资源可以显著增强人工智能在药物开发中的潜力,并加速您的重定位流程。然而,更多的数据并不一定意味着更好的数据。
预测模型:利用数据质量加速药物发现
预测配体与靶点的活性或代谢物谱是药物发现建模中的关键产出,但要获得可信的结果,需要进行广泛的数据整合。CAS 科学家之间的这场对话解释了为何人工数据收录在准备驱动预测模型的信息时发挥着如此重要的作用。了解模型开发中的一些关键挑战,以及 CAS 如何通过持续的模型训练来保持我们的解决方案处于最新状态。
白皮书
优化 R&D 工作流程的五种知识管理策略
研究人员深知打破数据孤岛并确保科学信息整洁一致的重要性。但实施这些步骤的最佳实践是什么?在本白皮书中,我们分享了五条改进科学 R&D 工作流程的知识管理建议。立即下载白皮书:
数据整合的未来趋势
人工智能驱动的解决方案已不再是遥远的创新,而是当今科学发现的核心部分。人工智能模型可以识别新型化合物和材料,发现药物重定位机会,并分析跨学科领域中海量的可用数据。然而,这些模型需要整洁、标准化的数据才能生成高质量的见解,而实现这一状态既依赖于技术能力,也依赖于人类的专业知识。
科学数据存在于出版物的表格、图表和补充材料中。研究机构拥有各种各样的“暗数据”,它们虽然是非结构化的,但却包含有价值的见解。通过与数据专家合作并建立坚实的数据整合基础,研究人员可以充分利用他们拥有的所有信息,并从人工智能模型和算法中获得实质性的益处。
Questions and answers
问:什么是数据整合?
答:数据整合是将来自多个来源的信息进行整合,并将其标准化为一个统一框架的过程,以便能够可靠地进行分析、比较和共享。在人工智能的背景下,这一点至关重要,因为在不一致或碎片化数据上训练的模型,其输出结果也会继承这些不一致性。
问:为什么人工智能无法自动完成数据整合?
答:人工智能和机器学习工具可以帮助处理海量数据,但它们缺乏解决实验室笔记、期刊文章、学术论文和专利中经常出现的歧义所需的科学严谨性和判断力。虽然大型语言模型可以根据日常用法区分概念,但同一个蛋白质可能会被数十种不同的名称、翻译和标识符所指代,而这些只有各自领域的专家才能识别。
问:数据整合如何改进科学预测模型?
答:通过规范靶点名称并改进物质关联,测试模型的准确性得到了显著提高。预测结果与实验结果更加一致,在筛选过程中识别最有希望的候选药物的能力也相应提高。
问:什么是“暗数据”,它如何影响人工智能驱动的药物重定位?
“暗数据”是指组织随时间积累但从未有效利用的非结构化信息。当暗数据得到适当的整合并实现可访问时,它可以显著增强人工智能训练数据集的多样性和可靠性,从而提高药物重定位预测的质量,并降低产生偏差或误导性结果的风险。
问:当今科学研究中最常应用的人工智能模型有哪些?
答:大语言模型(LLMs)正越来越多地用于知识提取、假设生成和生成式设计。随机森林(Random Forest)和支持向量机(Support Vector Machines)等经典方法在生物标志物发现和癌症亚型识别等任务中依然常见,尤其是在训练数据有限的情况下,尽管深度学习已在数据充足的环境中取代了它们。自2020年以来,图神经网络(Graph Neural Networks)和基于Transformer的模型激增——前者用于蛋白质结构和相互作用预测,后者用于生物医学文献挖掘和序列分析。在材料科学领域,经典机器学习在性质预测中占据主导地位,而卷积神经网络(CNNs)则应用于微观结构图像分析,基于神经网络的代理模型则为繁重的模拟工作流程提供支持。
问:为什么集成模型优于单一模型方法?
答:没有任何单一模型能够捕捉任何科学数据布局的全部复杂性。集成方法结合了多个模型来生成“共识预测”,这通常比任何单个模型单独产生的结果更可靠。
链接
更多资源
面临数据整合挑战的组织,无论是数字化遗留记录、标准化化合物库,还是为人工智能建模准备数据集,都可以探讨围绕特定科学领域和现有技术基础设施设计的定制解决方案。




