数字屏幕上的化学结构和分子图,其中部分区域以红色、绿色和蓝色圆圈高亮显示

化学人工智能模型:绘制材料与生命科学领域蓝图

执行摘要

在现代科学研究的版图中,人工智能 (AI) 已成为一股变革力量,从根本上改变了研究人员构思、开展和验证其工作的方式。计算能力、先进算法和海量数据集的融合,推动人工智能从理论上的可能性转变为各科学学科中的实际需求。

这场革命解决了长期以来限制科学进步的若干挑战:基因组学、医学和材料科学等领域产生的数据量过大;药物研究等过程耗时且成本高昂;以及在假设生成方面的认知局限。人工智能为克服这些挑战并跨越多个科学学科实现更快的突破提供了新的、有前景的路径。

例如,在生物医学科学领域,人工智能彻底改变了蛋白质结构预测,加速了 药物研究过程,并实现了个性化医疗。同样,在材料科学领域,人工智能正在加速 发现 新型材料。这些进展为自动驾驶实验室和逆向设计框架铺平了道路,正在改变科学方法本身。人工智能还通过实现实时实验调整来提高产量和效率,同时减少浪费和成本,从而显著推进了工艺优化。

Is your R&D data ready for the future? The CAS Intelligence Hub is a powerful integrated solution that transforms fragmented scientific R&D data into a harmonized, AI-ready knowledge environment.

我们对 CAS Content CollectionTM进行了定量分析,这是全球最大的经人工收录的科学信息库,旨在了解这些技术进步对科学发现的实施情况和影响。我们系统地分析了 CAS Content Collection 中 2015 年至 2025 年间超过 310,000 篇期刊文章和专利,采用先进的分析技术来识别与人工智能相关的出版物及其相关的方法论、机构和研究领域。

我们的研究探讨了人工智能方法在各科学领域的分布,并对生物医学科学和材料科学这两个关键领域进行了深入分析。这些分析详细说明了主导概念、人工智能方法的共现模式以及显著的物质类别。此外,我们还调查了人工智能在优化工业流程和新兴应用中的作用。  

这些发现为当前 人工智能整合 的现状和发展轨迹提供了重要的见解。 在科学研究中,为研究人员、机构和政策制定者提供宝贵的指导,帮助他们了解技术采用模式、识别合作机会,并就未来人工智能投资和研究方向做出明智的战略决策。

科学领域的人工智能模型布局  

为了了解特定模型被选用的背景及其影响,我们对纳入了人工智能方法的科学出版物(包括期刊和同族专利)进行了全面分析。整个布局的可视化结果突显了随着更多模型和功能的开发,这些技术在各科学学科中的整合程度日益提高(见图 1)。

Diagram titled "AI methods in science" categorizing techniques like neural networks, NLP, LLMs, and clustering. Includes a legend showing publication volume using colored dots from 1–10 to 1000+.
图 1: 人工智能方法在各科学学科中的应用布局。数据包括 2015 年至 2025 年期间的期刊和专利出版物,其中 2025 年数据涵盖 1 月至 3 月。来源:CAS Content CollectionTM。

该可视化图的主要分支包括:  

分类、回归和聚类模型

分类模型旨在预测离散标签或类别,在处理高维数据和提供可解释结果方面尤为有效。常见模型包括决策树(DT),该模型通过递归地将数据拆分为分支来对结果进行分类。随机森林(RF)是决策树的集合,通过平均预测结果来减少过拟合。另一种常见模型是支持向量机(SVM),它能找到类别之间的最优边界,而 K-近邻算法(KNN)则根据最近邻居的多数类别进行分类。  

这些模型广泛应用于具有分类结果的标记数据集(监督学习),例如具有已知类别的光谱、显微镜或组学数据。应用示例包括根据基因表达或成像数据对疾病类型进行分类、预测材料类别,以及根据毒性或反应性对化合物进行分类。

回归模型用于预测连续数值,使其成为预测和优化的理想选择。在出版物中观察到的一些回归模型包括线性回归、逻辑回归、支持向量回归(SVR)和符号回归。这些模型适用于来自实验、模拟的数值数据,或来自传感器或仪器的时序数据。应用包括预测能级、衰变率或粒子轨迹、估算反应产率、分子性质、模拟温度、降水量,以及预测电导率、硬度和带隙。

与分类和回归不同,聚类模型可以发现未标记数据中的自然分组,揭示隐藏的结构并支持探索性分析(无监督学习)。这些模型对于成像、光谱和分子数据等高维、未标记数据集非常有效。适用于该组的科学数据包括但不限于根据表达谱对基因或样本进行分组,以及从结构数据中发现新的材料家族。

人工神经网络(ANNs)

人工神经网络(ANNs)是一类旨在通过互连的人工神经元层学习复杂模式的机器学习(ML)模型。它们在建模数据中复杂的非线性关系方面功能强大。因此,它们构成了深度学习的基础,也是现代人工智能的基石,并拥有多种专用架构,例如用于序列数据的循环神经网络(RNNs)、能够更好地捕捉长距离依赖关系的增强型 RNN——长短期记忆网络(LSTM),以及作为 LSTM 简化版且参数更少的门控循环单元(GRUs)。  

这些模型适用于序列和时间序列数据,如基因表达、蛋白质序列、生理信号、气候数据、粒子物理学和传感器网络数据。它们通常利用知识图谱(即针对特定领域概念及其关系的结构化表示)来增强图像与文本的对齐,这有助于弥合视觉数据(如医学图像)与文本描述(如临床记录或诊断报告)之间的语义鸿沟。它们在药物发现与开发、精准医疗、医学影像、材料发现与设计、能源存储、制造以及质量控制等领域的应用已大幅增长。

混合方法

ANNs 与传统机器学习模型(如分类、回归和聚类)之间的比较,重点不在于孰优孰劣,而在于理解它们各自的互补作用。ANNs 在数据复杂且非结构化、拥有大型训练数据集以及需要表征学习的场景中占据主导地位。相反,传统机器学习在数据量较小、研究问题需要严格的可解释性,以及输入数据具有明确的统计关系且需要量化不确定性的情况下依然表现强劲。

特定领域模型

尽管特定领域模型的出版物较少,但它们包括了一些开创性的工作,例如 AlphaFold,这是一种在蛋白质结构预测方面达到近乎实验精度水平的深度学习方法。ESMFold 是另一个引人注目的模型,它直接利用蛋白质语言建模,从单一蛋白质序列中直接生成高质量的结构预测。

自然语言处理(NLP)

NLP 用于分析、理解、解释和生成人类语言。它涉及诸如分词(将文本分解为更小的单元,即词元,通常为单词或子词)等任务,以便算法进行处理。一种常见的文本表示方法是词袋(BoW)模型,它根据词频将文本转换为数值向量,而忽略语法和词序。另一项关键技术是命名实体识别(NER),它用于识别并分类文本中的人名、组织机构和地点等实体。

NLP 模型在生物医学文本挖掘和知识提取方面有着广泛的应用,范围涵盖了在生物医学文献上预训练的专用语言模型(如 BioBERT、BioGPT)和电子健康记录(EHR)分析,到从临床记录中自动提取疾病特征,以及利用语言模型创建新型候选药物。在材料科学和化学领域,NLP 已被用于合成方案提取、材料性质预测、知识库构建和逆向设计。  

大语言模型(LLMs)

这一变革性的人工智能系统彻底改变了 NLP,并在各个科学领域得到了广泛应用。LLMs 是基于神经网络的系统,通过在海量文本数据上进行训练来学习语言的统计模式。它们被用于信息提取、摘要生成、知识图谱构建、跨领域整合以及生成式应用。

被广泛采用的 LLMs 包括生成式预训练 Transformer(GPT),它驱动了 ChatGPT 以及 GPT-3.5 和 GPT-4。双向编码器表征 Transformer(BERT)依然是顶尖的语言模型,并保持着强劲的学术 兴趣 ,这归功于其双向上下文理解能力,以及在问答和情感分析方面的卓越表现。  

BLOOM 作为一个多语言模型,已成为研究布局中的重要贡献者。Google DeepMind 开发的 GEMINI、Meta AI 开发的 LLAMA 以及 Anthropic 开发的 Claude 等新模型也日益普及。2023 年至 2025 年间推出的 Gemma、Falcon、Mistral、Qwen 和 DeepSeek 等最新一代模型,展现出巨大的未来发展潜力。

一些专门用于化学、生命科学和材料科学的 LLM 也正在产生影响,例如 chemLLM、PharmaGPT 和 MatSciBERT。

出版趋势显示了人工智能对科学的影响

如前所述,我们分析了 CAS Content CollectionTM 中 2015 年至 2025 年期间与科学研究中人工智能相关的 310,000 份文献。我们注意到在整个期间内呈现稳步增长,且在过去五年中增长尤为显著(见图 2)。同族专利数量的不断增加进一步表明,人工智能正从一项新兴技术演变为各行各业必不可少的研究工具。

Bar graph titled "Figure 2" showing journal articles (blue) and patent families (yellow) from 2015–2025. Both increase over time, peaking in 2025; data for 2025 is for January through March.
图 2: 期刊文章和同族专利的年度趋势。数据涵盖 2015 年至 2025 年期间的出版物,其中 2025 年的数据包含 1 月至 3 月。来源:CAS Content CollectionTM。

  • 按国家/地区和组织分布: 中国在出版物数量(期刊和专利)方面处于领先地位,而美国、印度、韩国和日本的出版物数量也呈现稳步增长(见图 3)。总体而言,数据凸显了亚洲作为全球人工智能科学创新新中心的崛起,而西方国家在定量产出方面目前已处于落后地位。
Bar chart titled "Figure 3" comparing journal articles (blue) and patent families (yellow) across seven countries. China leads in both, followed by the U.S.; others show lower publication counts.
图 3: 按人工智能相关出版物数量排名的领先国家/地区。
  • 同族专利分布: 我们进一步分析了排名前五的国家在期刊和专利方面的出版趋势。中国和印度共同贡献了该领域全球 75% 以上的专利——专利申请量排名前 15 的机构均来自中国和印度。中国高校在期刊出版数量方面占据主导地位,其中大多数高校的平均引用次数在 10 到 20 次之间。相比之下,麻省理工学院(MIT)和斯坦福大学的平均引用次数显著更高,分别为 32 次和 66 次。这表明,尽管中国在数量上表现出色,但美国高校在人工智能领域的期刊文章质量和影响力方面处于领先地位。
  • 特定出版物分布: 我们分析了发表人工智能相关研究的领先科学期刊的出版数量和引用影响力。出版数量主要集中在 Scientific Reports, Applied Sciences,以及 PLoS One然而,若以单篇文章的平均引用次数来衡量, 美国国家科学院院刊 (PNAS) 表现尤为突出,尽管其发文量相对适中,但每篇论文的引用次数近 50 次,展现出非凡的影响力。其他期刊如 化学信息与建模杂志 (JCIM)生物信息学 (Bioinformatics) 以及 自然通讯 (Nature Communications) 也显示出卓越的平均引用表现,显著优于那些发文量巨大的期刊。这一模式表明,尽管像 科学报告 (Scientific Reports) 这类综合性期刊发表了最多的人工智能相关研究,但专业或权威期刊如 PNAS、JCIM自然通讯 (Nature Communications) 发表了更具影响力且能产生更大科学价值的研究成果。  
  • 各科学领域的趋势: 人工智能已对众多领域产生了深远影响,其中几个领域在论文发表数量上呈现出指数级增长(见图 4):
图 4: 2015 年至 2024 年间各学科的出版趋势:(A) 期刊文章和 (B) 同族专利。来源:CAS Content Collection。

在所有学科中,工业化学与化学工程在期刊出版物方面表现出最显著的增长,其轨迹到 2024 年已达到文献总量的约 8%。这种卓越的增长可能反映了该领域在制造、工艺优化和工业创新方面的广泛应用,以及其在开发可持续工业流程和绿色化学解决方案中的关键作用。  

分析化学在期刊出版物方面成为增长第二快的领域,深蓝色线条显示了从 2019 年起整个期间的强劲增长。这种强劲的增长模式表明了该领域在化学所有领域的基础重要性,以及其在开发支持多学科研究的新测量技术、仪器仪表和分析方法方面的作用。

能源技术与环境化学表现出稳健的增长,与生物化学并列成为增长最快的领域第三名。这反映了全球对气候变化、环境可持续性挑战和突发事件的紧迫关注。

其余学科,包括物理化学、药理学、毒理学与制药、有机化学、无机化学、天然产物和合成聚合物,均表现出适度但持续的出版量增长。这些领域代表了科学研究的成熟领域,其基本原理已确立,但持续的研究仍能带来渐进式的进展和改进。

同族专利数据呈现出与期刊出版物截然不同的格局,其创新模式高度多样且集中,而非学术产出中看到的统一增长。这种对比突显了学术研究生产力与商业可行创新之间的根本区别,其中市场力量、实际应用和经济激励在决定哪些科学进步转化为可申请专利的知识产权方面起着决定性作用。

在专利方面,生物化学呈现出指数级的增长,到 2024 年达到约 8%,完全超过了所有其他学科。生物化学专利格局以生物医学方法为主导,并由将分子科学与先进医疗技术相结合的创新所塑造。关键领域包括疾病检测、医学成像、可穿戴监测和临床决策支持,所有这些都利用了生物化学标记物。生物化学还推动了神经接口、基因组学、生物标记物发现、信号处理、手术指导和生物医学制造方面的进展,突显了其在现代生物医学创新中的核心作用。这种剧烈的专利活动反映了对生命科学研究的强烈商业兴趣和投资,并在应对新冠疫情的响应中得到进一步提振,当时商业研究获得了大量资金支持。

基于我们的分析,我们发现大多数人工智能相关出版物与生物医学研究和材料科学有关。因此,我们对这些关键研究领域进行了深入分析,因为这些领域在数据集中占主导地位,表现出快速的人工智能采用率和显著的年度增长率,并产生更高的引用影响力,表明了它们的科学相关性。

人工智能模型在生物医学研究中的应用

概述

生物医学研究一直面临着复杂性和成本方面的挑战,而人工智能现在可以解决这些问题。例如,解码复杂的蛋白质结构和相互作用、药物开发相关的高成本和高失败率,以及理解多因素疾病机制的复杂性,都适合采用基于人工智能的方法。  

Data integrity for AI-powered scientific research. AI’s capacity for data and its computational speed surpass what humans are capable of and the technology will continue to redefine what is possible. But data integrity and harmonization are critical components of any successful application of AI in science.

进行此项分析的依据是,通过使用文献频率作为客观指标来识别关键概念,从而确保对最重要的研究领域进行具有代表性的抽样。具体而言,我们利用生物医学领域内的几种人工智能/机器学习方法,识别了产生重大科学兴趣和研究投资的概念(见图 5)。

Each category lists specific items and is color-coded to show frequency from blue for low to red for high.
图 5: 2015 年至 2025 年人工智能驱动的生物医学研究出版物的概念布局,分为五个不同的领域:生物化学、建模与药物设计、诊断、疾病和治疗。每个领域包含 15 个代表性概念,采用从红色(最高)到蓝色(最低)的颜色编码,表示文献频率。来源:CAS Content Collection。

生物化学领域中,蛋白质序列与结构、基因与基因表达以及 DNA/基因组学已成为研究最广泛的概念,并广泛应用了各种人工智能方法。由于数据丰富且标准化程度高,特别是在蛋白质层级和基因调控网络等复杂系统中,人工智能模型在这些领域表现出色。人工智能 擅长 处理诸如 序列-功能映射、蛋白质家族分类、结构域预测、结构-功能分析、肿瘤特征选择、癌症中的基因相互作用预测,以及肿瘤学中基于表达模式的基因聚类等任务。这些任务利用了数千个基因同时测量的高维表达数据、基因与表型之间复杂的非线性关系,以及基因调控网络的层级组织结构。

AlphaFold 和 BERT 等先进的人工智能模型被 用于 蛋白质结构预测,通过学习氨基酸序列和进化模式来预测三维折叠和功能结构域。这些模型能够有效处理复杂的空间关系以及具有长程依赖性的序列输入。

建模与药物设计领域中,定量结构-活性关系(QSAR)建模占据主导地位。它利用人工智能方法从化学结构中提取分子描述符(即物理化学性质、指纹),通过监督学习方法 预测 生物活性和毒性终点。这些方法在处理特征丰富的分子描述符、结构-活性关系以及适用于回归任务的定量终点时表现优异。

分子对接是第二大高频概念,它在三维结构数据和分子图上使用深度学习方法(CNN 和 GNN)来预测蛋白质-配体结合姿态和亲和力,并利用空间构象、能量图谱和分子相互作用。药代动力学是随后的重点领域,利用人工智能从分子描述符、生理参数和时间序列数据中学习,以预测 ADMET 性质(吸收、分布、代谢、排泄、毒性)和药物清除率。

生物标志物 主导 诊断领域 其中人工智能方法 分析 高维基因组学、蛋白质组学和代谢组学数据,通过特征选择和分类来识别区分疾病状态与健康对照组的鉴别性分子特征。人工智能方法也用于 预后 研究,通过生存分析技术分析患者临床数据和治疗史,以预测生存时间和疾病进展。  

医学影像包含来自 X 射线、CT、MRI 的数据以及结构化的空间信息,非常适合深度学习方法。卷积神经网络(CNN)被广泛用于分析放射影像,通过自动模式识别进行肿瘤检测、骨折识别、疾病分类和病理状况评估。影像学研究也能受益于深度学习提取多尺度特征和执行分割任务的能力,特别是在 癌症诊断 方面,它有助于肿瘤检测、分类、恶性程度评估和风险预测。

疾病领域,癌症研究受到了最高关注,各种机器学习模型根据数据类型被应用于此。基因组和转录组数据通常 分析 使用随机森林(RF)和支持向量机(SVM)模型进行癌症亚型分类和治疗预测。这些任务 受益 于整合多组学数据(其涵盖了多样的分子层面)以及对异质性肿瘤微环境的复杂性进行建模。

各种算法被用于糖尿病研究,以 预测 糖尿病并发症并优化治疗方案,利用纵向监测数据、生活方式因素与遗传学之间的复杂相互作用,以及血糖水平的时间序列预测问题。在 阿尔茨海默病,RF 和 SVM 模型被广泛用于早期预测,通过分析神经心理学测试评分、生物标志物水平(β-淀粉样蛋白、tau 蛋白)以及人口统计学数据,将患者分类为健康或轻度认知障碍类别。

治疗领域中,抗肿瘤药物获得了最多的研究关注,利用人工智能 方法 进行药物筛选和活性预测,通过分析分子描述符和化学性质来识别具有潜在抗癌活性的化合物。在化疗中,这些方法通过分析患者临床数据、基因图谱和肿瘤特征,预测治疗反应和 毒性 ,从而实现药物选择和给药方案的个性化。同样,这些模型 支持 免疫疗法,通过分析患者免疫图谱、肿瘤突变负荷和生物标志物表达来预测反应并优化治疗结果,以应对免疫相互作用和时间动态的复杂性。  

人工智能模型与生物医学概念的共现

我们的分析探讨了生物医学概念与各种人工智能/机器学习方法之间的共现模式,阐明了它们在五个领域中的战略应用(见图 6)。

Sankey diagram titled "Figure 6A" showing how machine learning methods (e.g., SVM, Random Forest) are applied across biomedical fields like biochemistry, drug design, diagnosis, disease, and therapy, with flow widths indicating usage frequency.

Sankey diagram titled "Figure 6B" linking machine learning methods (e.g., Random Forest, SVM) to biomedical applications in biochemistry, drug design, diagnosis, disease, and therapy, with flow widths indicating usage frequency.
图 6 A 和 B: 桑基图展示了 (A) 2015-2019 年和 (B) 2020-2024 年期间人工智能方法与生物医学概念的共现情况。来源:CAS Content Collection。

随机森林 (RF) 已成为生物医学研究中占主导地位的人工智能方法,呈现出显著增长,并在两个时期之间超越了支持向量机(SVM)。随机森林(RF)在生物医学科学的所有领域中,特别是在生物化学、诊断和疾病相关研究中,与相关概念表现出极强的共现性。RF 通过分析氨基酸组成、序列基序和理化性质,将蛋白质分类为功能家族,从而用于蛋白质功能预测和分类。在生物标志物发现方面,RF 被用于分析高维基因组学、蛋白质组学和代谢组学数据。

支持向量机(SVM) 在两个时期之间稳步增长,并在蛋白质、基因表达、DNA 和基因组学、生物标志物、预后、医学影像和癌症研究中保持了显著的存在感。在蛋白质研究中,SVM 通过分析氨基酸序列、结构特征和理化性质,用于蛋白质分类和功能注释。它还利用基于核函数的高维特征空间映射来预测亚细胞定位并识别酶类别。  

在基因表达方面,SVM 可识别参与特定生化过程的基因,对代谢途径进行分类,并根据不同生化条件和细胞状态下的表达模式预测编码酶的基因。对于基因组变异分类,SVM 通过处理 DNA 序列特征和注释,区分致病突变与良性突变,并通过对核苷酸模式和基因组背景的高维特征分析,识别与疾病相关的基因组区域。  

在生物标志物研究中,SVM 通过将多个生物标志物整合到预测模型中,支持识别、分类和验证,从而用于诊断、治疗反应、疾病进展风险评估,以及为个性化医疗方案进行患者分层。SVM 在癌症研究中用于区分癌症组织与正常组织、对癌症类型进行分类,并识别特定癌症内的分子亚型。它还通过整合临床参数、生物标志物谱和基因组特征,预测患者生存结果、治疗反应、耐药模式和复发风险,从而用于癌症预后和治疗预测。图 6B 显示,SVM 在定量构效关系(QSAR)和构效关系(SAR)建模中保持了优势,而其与蛋白质分析的联系在后期相对于 RF 有所减弱。

逻辑回归(LR) 是一种在生物医学研究中广泛使用且具有可解释性的统计方法,常与蛋白质、基因表达、生物标志物、预后、医学影像、癌症和 COVID-19 等关键概念共现。在蛋白质功能预测中,LR 分析氨基酸组成、序列特征和结构性质,将蛋白质分类为功能或结构类别。该模型的主要优势在于提供可解释的系数,这些系数表明每个特征对分类决策的相对贡献,使研究人员能够识别哪些氨基酸性质或结构特征对预测的影响最大。  

这种可解释性在基因表达分类中同样具有价值,LR 可帮助识别差异表达基因。对于生物标志物验证和诊断,LR 模型预测二元结果(如患病/健康或有反应/无反应),并提供具有临床意义的优势比,以辅助诊断决策。在预后建模中,LR 通过评估临床参数、生物标志物谱和患者人口统计学数据,预测死亡/生存、疾病复发/缓解、预后良好/不良等结果,从而进行类似的二元结果预测。

LR 被用于 COVID-19 的诊断、严重程度预测和死亡率评估,通过整合合并症、生命体征和生物标志物,支持风险分层和临床决策。这些多样化的应用凸显了 LR 与核心生物医学研究主题的高度契合,使其成为可解释且具有临床相关性建模的基础工具。图 6B 展示了逻辑回归日益增强的适应性,这很可能归功于其进行多分类和基于概率输出的能力,而线性回归则仅限于连续预测。  

如图 6B 所示,2020-2024 年期间见证了一些早期几乎不存在的专业深度学习方法的出现,例如 AlphaFold。这一时期,用于分子相互作用建模的图神经网络(GNN)、用于合成数据生成的图对抗网络(GAN)以及 模式识别 在影像应用和诊断挑战中的使用也出现了激增。  

近年来另一个重大转变是将自然语言处理(NLP)技术整合到生物医学研究中,以 BERT 为代表的模型在挖掘临床报告和分析生物医学文本方面的兴起便是明证。 这种专业化反映了该领域已超越了通用人工智能方法的应用,转向针对特定生物医学挑战开发定制化方法。

两个时期之间的研究重点发生了实质性转变。蛋白质序列与结构分析以及基因表达分析在 2020-2024 年期间显著增长(图 6B)。生物标志物发现和影像应用也经历了剧烈增长,而疾病特异性研究大幅扩展,其中 COVID-19 成为主要焦点,癌症研究也在多个亚型中呈现多样化。  

生物医学研究中的物质

此项比较为尚未充分探索的治疗机会提供了战略见解,并突显了那些可能受益于增加研究投资或创新方法的物质类别,从而弥合科学发现与临床应用之间的差距(见图 7)。请注意,“物质类别”是指 CAS 收录的具有公认潜在治疗应用价值的物质类别。  

Figure 7 shows two stacked bar graphs (A and B) compare journal articles and patent families from 2015–2024 across categories like small molecules, polymers, proteins, and alloys. Each category is color-coded in the bars.
图 7 展示了两个堆叠条形图(A 和 B),比较了 2015 年至 2024 年间小分子、聚合物、蛋白质和合金等类别的期刊文章和同族专利。每个类别在条形图中均以颜色编码。

小分子药物 在药物研究与开发中持续占据主导地位,人工智能技术正在加速其发现过程。基于机器学习的虚拟筛选、 定量构效关系(QSAR)建模 用于药代动力学预测,以及优化合成路径的深度学习系统,现已成为该流程不可或缺的一部分。这些创新建立在小分子固有的优势之上,包括成熟的合成路线、特征明确的药代动力学、口服生物利用度以及具有成本效益的制造工艺。

蛋白质/多肽类药物 是研究第二广泛的类别。AlphaFold 等工具彻底改变了蛋白质结构预测,使得治疗性蛋白质的设计与优化成为可能,例如用于治疗糖尿病的胰岛素、用于中风的组织纤溶酶原激活剂,以及用于癌症和自身免疫性疾病的单克隆抗体。机器学习模型通过预测蛋白质间的相互作用并优化多肽稳定性,进一步推动了该领域的发展。  

盐类化合物 受益于人工智能驱动的制剂优化算法,这些算法可预测溶解度、生物利用度及稳定性,反映了药物制剂和生物利用度优化的重要性。聚合物通常作为关键的治疗递送系统,正通过人工智能设计的纳米颗粒制剂、机器学习优化的水凝胶性能以及用于靶向药物递送的预测建模得到增强,从而提高治疗效果和组织特异性。  

配位化合物 是另一个前景广阔的类别,人工智能在此领域协助配体设计和 金属有机框架 (MOF) 优化。这些化合物正通过计算化学和预测金属-配体相互作用及生物活性的人工智能模型进行改进。

人工智能模型在材料科学中的应用

概述  

材料科学,理解并预测材料成分、结构特征与性质之间复杂的相互关系,对于加速材料发现至关重要。相关数据通常具有多维、分层、异构的特点,且多由高通量、数据密集型流程产生。人工智能(尤其是机器学习)通过对这些复杂数据集的分析,正在彻底改变该领域。我们分析了 CAS Content Collection,识别出应用人工智能方法的关键材料科学概念,并评估了它们在材料发现和性质预测中的重要性(见图 8)。

Figure 8. Chart for materials science areas like materials, structure, properties, phenomena, devices, modeling methods, and applications. Each category lists specific items and is color-coded to show frequency from blue for low to red for high.
图 8: 人工智能驱动的材料科学出版物概念布局,分为七大类。每一类均包含代表性概念,颜色编码从红色(最高)到蓝色(最低)表示出版频率。来源:CAS Content Collection。

能源存储是当今人工智能应用最密集的领域, 应用反映了全球对先进电池技术和可持续能源解决方案的需求。机器学习技术已成为 强有力的工具 ,助力电池材料创新。研究人员主要采用三种策略:直接性质预测、机器学习势函数和逆向设计。该领域人工智能研究的高度集中,源于电池系统复杂的多尺度特性,传统的实验方法往往难以优化材料成分、结构与电化学性能之间错综复杂的关系。

材料器件 类别中,陶瓷、压电陶瓷、传感器和场效应晶体管领域活跃的人工智能研究,反映了这些材料及其器件的复杂性。这些先进材料通常表现出复杂的结构-性质关系,是机器学习方法的理想应用对象。  

结构特征,我们发现卷积神经网络(CNN)与计算机视觉技术正被用于微观结构分析,通过实现显微图像的自动分类、分割和特征提取,助力揭示以往难以量化的结构与性质之间的关系。在冶金领域,针对性的人工智能方法正在推动高温合金的研发,而诸如 CAMEO(闭环自主材料探索与优化)等系统通过将人工智能与高通量实验相结合,实现了组合冶金。此外,用于三维断层扫描数据的机器学习工具正在加强对多孔材料的分析,从而能够更精确地模拟渗透率和机械强度等性质。

介电常数和电导率是以下领域的主要概念: 性质,而压电性则在以下领域处于领先地位: 现象。在 模拟与建模方面,计算建模显示出较高的人工智能采用率,这与机器学习在数据分析任务中的天然兼容性相一致。

图 7 中紫色和混合色区域所代表的人工智能中度活跃领域,是人工智能采用率正在加速但仍有提升空间的领域。例如,以蓝色为主的部分材料领域活跃度较低,这些领域代表了科学界最成熟、最基础的学科,从而形成了一种矛盾的局面:最成熟的领域反而表现出最低的人工智能整合度。复合材料和聚合物就是此类别的典型代表。  

然而,专门的人工智能模型正在被开发以应对特定的挑战。polyBERT 模型将聚合物结构视为一种化学语言,从而能够更有效地对复杂的聚合物系统进行建模。对于 晶体材料,MEGNet、CGCNN 和 SchNet 等模型结合了晶体对称性和量子相互作用,而 ALIGNN 则捕捉到了对于精确预测合金性质至关重要的高阶原子相互作用。

人工智能模型与材料科学概念的共现

正如我们在生物医学分析中所做的那样,我们密切关注了材料科学中的人工智能方法及其共现概念。我们发现,传统的机器学习模型,如随机森林(RF)、支持向量机(SVM)、梯度提升机(GBM)和决策树(DT),被广泛用于预测和特征重要性分析,这在很大程度上是因为材料信息学中常见具有非线性关系的高维数据(见图 9)。

Flow diagram Figure 9A linking machine learning methods (e.g., SVM, Random Forest) to materials science topics like materials, structure, properties, phenomena, devices, computational models, and applications, with colored lines indicating connections.

Sankey diagram titled "Figure 9B" linking machine learning models (e.g., Random Forest, SVM) to materials science categories like structure, properties, devices, and applications. Flow widths reflect usage frequency.
图 9: 桑基图展示了 (A) 2015-2019 年和 (B) 2020-2024 年期间人工智能方法与材料科学概念的共现情况。来源:CAS Content CollectionTM。

随机森林(RF)模型 被广泛使用并分布于所有概念领域。与 梯度提升机(GBM)模型一样,它们在处理复杂、异质材料方面表现出很强的共现性,这归功于它们能够对非线性关系进行建模并处理混合数据类型。它们常用于异质复合材料,通过捕捉基体与增强体之间复杂的相互作用,进行力学性能预测和失效分析。  

我们观察到这些模型与合金的共现,其中 RF 被用于映射合金成分中的非线性关系,有助于高熵合金设计、沉淀强化预测和热处理优化。GB 正越来越多地应用于精确的性能调节,例如优化屈服强度或耐腐蚀性。

支持向量机(SVM) 更常用于具有明确结构-性能关系的材料。此类模型在利用固定维度的特征向量对合金类型和阈值进行分类方面非常有效。温度相关性能通常也遵循非线性模式,并取决于成分、加工历史和环境条件,树模型和 SVM 能有效地捕捉这些因素。

对于微观结构等结构特征,集成模型被用于从复杂图像中识别特征;对晶界、相和缺陷进行分类;以及预测晶体结构(通常被视为需要对称感知模型的分类问题)。表面性质跨越了从原子到宏观的尺度,涉及表面能和反应性方面的复杂模式。这些应用需要对图像数据进行预处理、提取多尺度特征,并对对称性和周期性进行编码,特别是在催化、腐蚀和粘附研究中,通常需要与分子建模相结合。

应用领域已大幅扩展,其中电池研究呈现出显著增长。图 9A 和 9B 证实了 RF 与电化学过程之间的强相关性,它能处理复杂的相互作用,用于电池容量预测、电极材料选择和时间相关过程。  

2020-2024 年间能源相关应用(储能、发电)的出现展示了该领域的多元化。长短期记忆(LSTM)网络能够捕捉对电池退化预测和循环性能预测至关重要的时间动态。另一个新兴的相关性是强化学习(RL),它能够优化充电协议和材料使用,并可用于电池管理系统。卡尔曼滤波也常见于电池和二次电池研究中,用于跟踪加工过程中的材料状态,并预测电池的健康状态和剩余使用寿命。  

Transformer 模型被用于从科技文献中提取合成程序和材料性质,并捕捉复杂材料描述中的长程依赖关系。卷积神经网络(CNN)和生成对抗网络(GAN)实现了 2D/3D 结构特征提取的自动化,并支持性能预测和模式识别。尽管它们功能强大,但需要更多的数据和计算资源,且可解释性较低,因此它们是传统模型的补充而非替代。神经网络越来越多地用于基于图像的分析和生成式设计,而传统方法在数据集有限的情况下,在成分-性能映射方面仍保持优势。这也是神经网络与传统模型结合使用的原因之一。另一个发展趋势是结合了对称性和物理约束的材料专用 CNN 架构,而图神经网络(GNN)在原子和分子结构方面也正受到越来越多的关注。  

材料科学中的物质

回到 CAS 收录的物质类别,我们分析了材料科学中与这些物质相关的出版物数量(见图 10)。

Figure 10 includes two bar graphs (A and B) showing journal articles and patent families from 2015–2024, categorized by material types like polymers, alloys, and minerals. Both graphs show rising publication trends.
图 10: 材料科学中关键物质类别的柱状图,基于 (A) 期刊和 (B) 专利出版物的发表频率。来源:CAS Content Collection。

占据主导地位的是 有机/无机小分子 在人工智能驱动的研究中,反映了该领域在处理小分子结构时,相较于聚合物等大型复杂系统,在计算成本方面所具备的计算优势和数据丰富性。该类别拥有约 6,500 篇期刊文章,得益于数十年来积累的化学数据库。  

小分子特别适合机器学习方法,因为它们的性质可以通过分子描述符、指纹和基于图的表示法进行有效编码。该领域大量的研究也表明,制药和化学工业在药物发现、催化剂设计和分子性质预测方面对人工智能进行了大量投资。  

元素,以约 5,500 篇论文排名第二,同样得益于广泛的数据库和相对简单的结构,使其成为人工智能驱动的性质预测和材料发现的理想候选对象。

表格无机材料,拥有约 4,500 篇期刊文章,代表了人工智能已获得实质性应用的另一个领域。这些材料(包括陶瓷、氧化物和其他结构化无机化合物)得益于晶体学数据库和系统性的性质测量,为有效的机器学习提供了所需的大型数据集。这些材料的结构化特性允许基于晶体结构、成分和键合特征进行一致的特征工程。该类别在人工智能研究中的突出地位,可能反映了材料科学界专注于发现用于能源存储、催化以及电子和磁性应用的新型功能材料。

聚合物 研究显示人工智能的应用处于中等水平,约有 1,800 篇期刊文章,考虑到聚合物的工业重要性,这一数字似乎偏低。这很可能反映了聚合物为人工智能应用带来的独特挑战,包括其复杂的链结构、分子量分布和依赖于加工的性质。然而,研究数量的增长表明,在将人工智能应用于聚合物性质预测、合成和加工优化方面,正取得越来越多的成功。

我们分析的另一个重要发现是,在所有材料科学类别中,同族专利仅占期刊文章的一小部分。期刊数量与专利数量之间的差异表明,材料科学中的大部分人工智能研究仍处于基础或探索阶段,学术发现与商业阶段值得申请专利的实际应用之间存在显著的时间滞后。

专利数量相对较少也可能反映了将人工智能驱动的材料发现转化为商业可行技术的挑战,因为该领域的许多人工智能应用侧重于性质预测和基础理解,而非可立即申请专利的发明。不同材料类型之间的一致比例表明,学术向商业转化的挑战在材料科学领域是普遍存在的,而非特定于某种材料类别。

人工智能在流程管理中的应用

人工智能通过实现更智能、更快速和更具适应性的决策,正在改变流程管理。分析人工智能在这一领域的作用揭示了自动化、预测分析和实时优化如何推动各行业的卓越运营(见图 11)。

Framework illustrating the role of artificial intelligence in modernizing research, development, and operational processes across scientific domains.
图 11: 展示人工智能在科学领域内实现研究、开发和运营流程现代化的框架。

人工智能驱动的优化广泛应用于增材制造、石油化工、塑料加工、冶金、流动化学、催化过程以及药物发现与合成。常用的模型包括响应面法 (RSM)、实验设计以及机器学习技术,如人工神经网络 (ANN)、混合模型、物理信息神经网络 (PINN)、大语言模型 (LLM) 和强化学习方法。让我们探索其他几种将预测建模扩展到实时决策和自动化的技术:

  • 实时监控: 这些系统利用机器学习分析流式数据,以检测模式、趋势和早期预警信号,从而促进动态预测和主动决策。关键创新包括自主决策(根据实时输入自动调整参数)、预测性维护(在故障发生前进行预判)以及能够适应不断变化条件的自改进模型。此外,实时数据可视化和智能警报系统正在改变操作员与实时流程数据的交互方式。这些进展正被应用于自动化色谱系统和制药生产中的药物反应监测等行业。我们还看到它们被用于聚合物生产中的性质优化、废物管理中的固体废物分析、环境监测、大规模氢气生产的能源和资源管理,以及针对老化基础设施的云端能源管理。
  • 软传感器: 软传感器利用来自物理传感器的实时数据,结合人工智能和统计模型,对难以直接测量或测量成本高昂的变量进行估算。它们被广泛应用于生物过程监测、废水和空气质量监测等多个行业。在化学过程控制中,软传感器被用于监测复杂的硫化矿浮选、异构化、反应精馏和汽油调合。
  • 数字孪生: 这些创新技术是物理系统的虚拟复制品,正随着人工智能的整合而迅速演进,从而实现实时优化、预测分析和自主运行。人工智能通过学习历史数据和实时数据来模拟未来状态、检测异常并预测故障,从而增强了数字孪生,使其从静态模型转变为具有韧性的自优化系统。在制造业中,人工智能驱动的数字孪生利用传感器和图像来预测设备故障、优化生产流程并检测质量问题。在医疗保健领域,它们用于模拟患者状况、支持个性化医疗、进行疾病建模、模拟临床试验以及优化免疫疗法。在环境和可持续发展领域,人工智能驱动的数字孪生被应用于地质碳封存、矿石废料处理和资源管理。它们还支持材料科学,实现自动化发现、缺陷分析和逆向分子设计。

人工智能在科学研究应用中面临的挑战

人工智能显然已为所有科学研究领域做出了许多积极贡献,并且随着其不断进步,这种贡献将持续下去。然而,这些创新并非没有挑战,研究人员和数据科学家必须解决这些问题,以确保人工智能在科学领域充分发挥其潜力。一些最紧迫的挑战包括:

  • 数据隐私与安全: 确保数据隐私和安全是实施人工智能面临的最大挑战之一,因为人工智能的训练和运行需要大量敏感数据。当敏感信息在未经适当许可的情况下被收集和使用,或者从人工智能系统中泄露或被窃取时,问题便随之产生。科学数据集可能包含未发表的实验结果、新颖的化合物结构以及代表重大竞争优势的专有合成方法。当研究人员使用基于云的人工智能平台或参与协作研究环境时,他们面临着知识产权泄露的巨大风险。为了应对这一风险,一些企业正在实施保障措施以保护客户信息并维护信任,一些初创公司正在 寻找 市场利基,以防范外部人工智能威胁。
  • 数据质量与偏差: 数据集经常存在系统性偏差,这些偏差可能会在人工智能模型中传播,导致预测结果出现偏差,并可能加剧现有的研究不平等。已发表反应数据中的历史偏差(即成功反应被过度报道,而失败实验被漏报)会严重削弱机器学习模型探索新颖化学空间的能力,尤其是在无机材料领域。这种“发表偏差”形成了一个自我强化的循环,使得人工智能系统倾向于推荐与已深入研究的化合物相似的物质。生成式人工智能模型带来了额外的担忧,因为它们可能会操纵现有数据并产生幻觉,以牺牲真实证据为代价来满足客户的需求。
  • 透明度: 这些模型的“黑箱”性质可能会掩盖其预测背后的逻辑,使研究人员难以评估其可靠性或识别潜在的故障模式。一项 综述 药物发现中可解释人工智能方法的应用表明,复杂模型缺乏可解释性会削弱药物化学家的信任,并阻碍监管机构对制药开发中人工智能辅助决策的认可。对于处理高维化学表征的图神经网络和 Transformer 模型而言,这一挑战尤为严峻,因为在这些模型中,输入特征与预测结果之间的关系变得高度非线性。
  • 平衡自动化与人类专业知识: 尽管人工智能系统能够处理海量数据集并识别超出人类认知能力范围的模式,但它们缺乏经验丰富的科学家在研究问题时所具备的直觉、创造力和背景理解能力。这可能会导致新一代科学家缺乏基础研究技能和概念理解。反之,这也可能导致算法厌恶,即当人工智能得出的结论与直觉相悖时产生排斥。

人工智能模型与科学研究的未来

人工智能在科学研究中的重要性将与日俱增,其革命性能力已在生物医学和材料科学等领域得到体现。正如我们对 CAS Content Collection 的分析所显示的那样,新的应用、模型和方法正不断被应用于解决各种难题。我们可以预见,药物发现、疾病诊断、材料开发等领域的突破将受到人工智能技术的深刻影响,甚至完全由其推动。  

随着人工智能从工具转变为科学协作伙伴,我们很可能会看到逆向设计和自动驾驶实验室等新范式,将科学方法论重新定义为自主发现引擎。然而,较低的专利与出版物比例表明,大量研究仍停留在学术界,特别是在传统材料科学领域。  

人工智能的进一步普及需要通过不确定性量化和模型透明度等技术解决方案进行适当的信任校准。人工智能对科学影响的广泛性及其在实施过程中面临的挑战规模,意味着协作和透明度将是最大化其科学进步效益的关键。

欲了解更多信息,请阅读我们的期刊重印文章:化学领域的人工智能革命:塑造材料与生物医学科学的未来。


本文中使用的品牌名称和/或提及的任何第三方产品或服务仅用于教育目的,并不暗示 CAS 或美国化学会对其表示认可,也不构成对未提及的类似品牌、产品或服务的歧视。

下载报告

Related CAS Insights

AI 药物开发技术的兴起

Defining the path to TBK1 inhibition with QSAR modeling

Embracing the future of AI in the food industry

Gain new perspectives for faster progress directly to your inbox.