六边形图像呈现的“六大趋势”图示

科学人工智能:推动前沿研究的六大趋势

人工智能(AI)正在从根本上改变科学发现。 大语言模型 (LLM)、神经网络、生成式人工智能和机器学习在分析海量数据集方面的能力,使得评估比人类研究人员单枪匹马所能处理的更多的信息成为可能,且耗时更短。随着人工智能技术的演进为从个性化医疗到石油化工等领域开启了新的可能性,以下是一些近期示例,展示了人工智能如何对科学发现产生深远影响。


相关内容: 观看我们的“人工智能赋能科学”网络研讨会录像 来自 3M、莫菲特癌症中心和研究所(Moffitt Cancer Center and Research Institute)以及 CAS 的专家们在研讨会上探讨了人工智能的具体应用案例、挑战以及在当今动态研究布局背景下的机遇。


生成式人工智能助力基于预期属性设计新型材料

Generative AI for materials design - glass

设计具有特定属性的材料可能是一个缓慢的过程,需要专家手动筛选大量的候选列表并进行反复试验。生成式人工智能正在推动材料科学的范式转变,通过从第一性原理预测物质属性并更快速地筛选更多材料,帮助研究人员评估更多的候选对象。

Data integrity for AI-powered scientific research. AI’s capacity for data and its computational speed surpass what humans are capable of and the technology will continue to redefine what is possible. But data integrity and harmonization are critical components of any successful application of AI in science.

生成式人工智能让研究人员能够以 最终目标 为起点,而无需在现有材料上反复试验。这不仅节省了时间,而且通过探索非常规组合来快速生成数千甚至数百万种假设化合物,研究人员可以利用人工智能提高创新的潜力。例如,过去几年中出现了几种旨在优化材料设计过程的生成式人工智能模型:

  • 微软研究院的 MatterGen 使用扩散模型作为材料生成的基础。  
  • MatAgent 利用基于材料知识库增强的LLM来提出新成分,利用扩散模型结构估计器根据所提出的成分确定晶体结构,并利用基于图神经网络(GNN)的属性评估器来预测该晶体结构的属性。  
  • IBM Research还发布了一套模型,使用了 专家混合方法,该方法在设计 PFAS替代品方面展现出了前景。

Meta近期发布了Open Molecules 2025(一个用于推进分子发现的数据集)以及原子通用模型(UMA)。 

Is your R&D data ready for the future? The CAS Intelligence Hub is a powerful integrated solution that transforms fragmented scientific R&D data into a harmonized, AI-ready knowledge environment.


机器学习在预测候选材料属性方面也非常有效。微软开发了 MatterSim,这是MatterGen的配套工具,是一个基于主动学习、生成模型和分子动力学模拟混合数据训练的深度学习模型。谷歌也发布了一款名为GNoME的材料发现工具,被誉为“材料发现领域的AlphaFold”。研究人员利用DeepMind将220万种材料的列表缩小至38.1万种,随后使用GNoME预测哪些材料最稳定,最终筛选出528种可用于电池的潜在锂离子导体。  

人工智能助力科学,推动精准医疗的兴起

Personalized medicine

人工智能驱动的遗传建模现在可以分析和解读海量的遗传、表观遗传和生物信息学数据,帮助研究人员理解基因变异及其影响。该方法利用机器学习算法和其他人工智能工具,识别遗传信息中的模式和相关性,从而为每个人量身定制预防措施、治疗方案和药物。其目标是实现早期干预、最大限度地减少副作用并降低成本,最终为每位患者的需求提供个性化的护理方案。

人工智能在遗传建模中的应用已在以下领域取得了重大进展:

  • 数据整合与分析: 人工智能模型 处理 大量遗传数据,包括 DNA 测序(例如全外显子组/全基因组测序)、转录组、蛋白质组和代谢组数据,以揭示传统算法可能遗漏的见解。卷积神经网络 (CNN) 和循环神经网络 (RNN) 可识别 生物标志物、疾病风险和药物反应之间的复杂关联。这些模型能够捕捉基因组数据中传统统计方法可能忽略的复杂模式,从而更准确地预测疾病易感性和治疗结果。
  • 预测分析: 人工智能正被应用于根据个人的遗传特征、家族病史甚至医生的记录来预测患上某些疾病的可能性。这种 方法 利用机器学习算法和临床信息学来分析复杂的遗传数据和家族模式,为预防措施和个性化治疗方案提供见解。
  • 定制化治疗方案: 人工智能支持基于个人 独特 基因组和表观基因组开发精准疗法。人工智能模型可以分析并识别可能影响疾病风险和治疗反应的特定变异和突变。人工智能解决方案还可以检查 表观遗传 修饰(如 DNA 甲基化和组蛋白修饰),以了解环境因素和生活方式选择如何影响基因表达。
  • 多组学数据的整合: 利用人工智能关联基因组、转录组、蛋白质组和代谢组数据的能力,研究人员可以创建更 全面 的生物系统模型。这种整体方法有助于更深入地理解遗传因素、非遗传因素和环境影响在疾病发生和发展过程中的复杂相互作用。

人工智能驱动的解决方案能够分析海量数据,从而帮助制定诊断和治疗方案,并综合考量每位患者的各种影响因素。无论是向 全组学模型 迈进,还是解决遗传和表观遗传数据带来的计算复杂性,人工智能都有望成为推动精准医疗发展的核心力量。

人工智能算法提升碳捕集与封存效率

AI for carbon capture

即使当今停止所有二氧化碳排放,大气中现有的 二氧化碳仍会持续捕获热量并推动全球变暖。正如政府间气候变化专门委员会(IPCC) 所指出的那样,虽然二氧化碳捕集与清除不能替代减排,但要将温升控制在 2°C 以内,必须降低温室气体排放。  

人工智能在科学领域的应用正日益发挥重要作用,助力多种二氧化碳捕集方法,包括碳捕集与封存(CCS)和增强岩石风化(ERW)。

  • 碳捕集与封存(CCS): 人工智能算法通过分析运行数据来优化碳捕集系统,从而提高效率。例如,强化学习算法已被用于 工艺优化 ,在从工业烟气中去除二氧化碳的同时,最大限度地降低所需的运行能耗。结果表明,预测模型和算法可在超过 70% 的案例中降低能源成本。机器学习还可以 识别 用于吸附的多孔材料,其速度远超传统方法。微软的 MOFDiff是一种粗粒度扩散模型,能够生成结构 金属有机框架 (MOFs),在碳捕集方面非常有效。  
  • 增强岩石风化(ERW): ERW 通过加速正常的地球化学过程来去除大气中的二氧化碳。通过在土地(如农田)上铺设一层细碎的硅酸盐或碳酸盐岩石,化学风化过程在雨水的作用下将大气中的二氧化碳转化为碳酸氢根离子。人工智能驱动的 解决方案 可以通过识别目标位置和土壤条件,以及运行确定项目有效性所需的预测模型,来支持 ERW 工作。

虽然人工智能在碳捕集活动中有许多应用,但必须指出的是,运行人工智能所产生的排放也必须 纳入考量。否则,它们不仅不能缓解全球变暖,反而会加剧这一问题。

利用数字孪生技术提升石油化工运营的安全性和效率

Digital twins in petrochemical manufacturing

“数字孪生”是一种基于人工智能的技术,用于创建物理空间的高保真虚拟副本,以分析实时数据并预测结果。在石油化工行业,这些副本 能够 对复杂的化学过程进行模拟、分析和优化。通过嵌入详细的运行数据和反应动力学,数字孪生技术可以深入洞察制造工厂系统在不同条件下的运行情况。  

数字孪生软件近年来已显著成熟,许多行业都在利用这些模拟所提供的预测能力。数字孪生在石油化工制造中的成功实施依赖于几项关键技术:

  • 高保真模拟 平台:Aspen HYSYS、gPROMS 和 AVEVA 等软件工具整合了详细的化学动力学和热力学,能够创建石油化工运营的精确虚拟副本。
  • 物联网与传感器集成: 广泛的传感器网络提供实时数据流,持续更新数字孪生,以准确反映当前的运行状态。
  • 机器学习与人工智能整合: 人工智能驱动的分析 增强 预测能力,使数字孪生能够预见运行干扰并主动优化工厂性能。

这些创新使石油化工企业能够实施预测性维护和资产管理。数字孪生甚至可以 提高安全性 ,通过在设备故障发生前进行预测、主动安排维护,从而显著减少停机时间和运营成本。它们还结合了实时分析,能够动态调整流程以优化产量并降低能耗。例如,通过对 乙烯裂解装置进行详细建模,数字孪生可通过精确的运行调整,最大化原料利用率和产品产量。

利用人工智能模型加速药物发现与药物重定位

药物重定位长期以来一直是药物开发中的一种成功策略。然而,它通常需要缓慢且耗时的临床观察和文献综述工作,随后还需要进行大量的测试和验证。通过将人工智能应用于科学研究,制药公司现在可以更高效地预测药物适应症和禁忌症,有时甚至无需新的参数或数据,即可通过一种称为“零样本推理”的方法实现。

人工智能在药物重定位中的应用包括:

这些工作的成功在很大程度上取决于高质量数据的可用性,而这仍然是一项挑战。据 一些估计显示,55% 的组织知识属于“暗数据”,即随着时间推移积累的非结构化信息。暗数据通常未经统一整理且存储在分散的系统中,其可访问性有限,且由于存储在分散的系统中,阻碍了其整合到人工智能战略中。  

人体的复杂性以及缺乏有效治疗手段的疾病所带来的挑战意味着,人工智能的计算能力对于识别现有药物的新用途至关重要。  

用于微观结构分析的计算机视觉,旨在提高安全性和质量

Computer vision

在材料科学研究中,计算机视觉利用人工智能处理海量的视觉数据(如显微图像或光谱图像),以识别材料的性质、结构和缺陷。这种分析长期以来一直是理解材料机械性能的重要步骤,并在 安全性材料选择以及 质量控制方面发挥着关键作用。 晶粒尺寸和分布等是影响材料强度和延展性的重要因素,航空航天和电子等行业对材料及组件的微观结构分析有着极高且精确的要求。

人工智能驱动的计算机视觉正在彻底改变这一流程。过去耗时的人工程序,现在可以更快速、更准确地完成, 自动化任务,例如 相识别和微观结构分类。计算机视觉算法可以定位并识别缺陷,包括裂纹、空洞和异物。它们还可以分割微观结构中的单个晶粒,检测存在的不同材料相,并利用机器学习特征实现各种定量分析功能。  

对于制造商而言,基于计算机视觉的微观结构分析通过确认材料符合特定规格来改善质量控制。通过比人工分析更快地识别潜在缺陷,这些系统有助于确保材料在极端条件(如核反应堆中)下的完整性,或确认焊接材料的稳定性。

科学人工智能的未来:变革性与惊喜并存

技术进步与科学突破始终相辅相成。随着人工智能驱动的技术不断完善,预计它们将进一步变革科学研究的诸多领域。  

正如我们从上述示例中所见,在科学领域应用人工智能并没有“一刀切”的方法。其影响可能会以不同方式渗透到科学和计算学科的各个领域——从数据挖掘、整合、分析和优化,到模拟、可视化、预测分析和建模。  

Harnessing the transformative power of AI for research can be a challenge. Find out how CAS can help.

在 CAS,我们不断分析 CAS Content CollectionTMTM,这是全球最大的人工收录科学信息库,旨在更好地了解研究布局,以及人工智能如何在从医疗保健到材料科学等各个领域产生深远影响。凭借我们能够第一时间洞察前沿创新的能力,我们期待看到人工智能在 2025 年及以后将科学发现带向何方。

Related CAS Insights

AI 药物开发技术的兴起

Defining the path to TBK1 inhibition with QSAR modeling

Embracing the future of AI in the food industry

Gain new perspectives for faster progress directly to your inbox.