执行摘要
- 专利检索与其他类型的科学研究不同,因为专利数据是非标准化的,分散在多种类型的文档中,且并不总是使用清晰一致的语言。
- 由于来源和措辞的多样性,标准人工智能工具和大语言模型难以检索到所有相关的专利数据。
- 能够规范语义和文档差异的结构化、索引化数据,是实现人工智能辅助专利检索成功的关键要素。
- 由 STN™ 提供支持的 CAS IP Finder 就是一个例子,它结合了人工整理的索引数据与尖端人工智能检索功能,能够可靠地识别相关的专利信息。
为了实现令人振奋的突破或新的创新,您需要确认某种物质是否已被授予专利。专利信息分散在许多来源中,且时间紧迫。您知道自己想问的问题:“文献中有哪些催化剂在二氧化碳转化为甲醇的过程中实现了超过 90% 的选择性?”您应该将其输入通用大语言模型(LLM)并查看结果吗?
这似乎有悖常理,但答案是否定的。标准大语言模型可以快速浏览大量出版物,但检索专利信息和现有技术涉及独特的复杂性,人工智能工具并不总是能够处理。这也不是简单的“垃圾进,垃圾出”问题。为了使专利检索取得成功,研究人员必须使用索引化、结构化的数据,并结合能够驾驭专利文献复杂性并揭示可操作见解的人工智能解决方案。
为什么专利检索与众不同
专利的编写目的与期刊文章或其他科学出版物不同:即保护知识产权(IP)。与期刊出版物旨在公开内容以供发现和引用不同,专利申请人只提供成功获得专利所绝对必需的数据量。这些申请可能会对新的突破保持一定程度的保密,甚至进行模糊处理。
专利文档的早期部分也可能包含大量“噪音”,例如冗长的描述或与新创新本身无关的材料或化合物列表。这些详尽的列表通常是为了建立后备方案或阐述细微变化,以防止发明的微小优化随后被声称为具有创造性。然而,这可能使一份文档看起来相关,而实际上它只是肤浅地描述了某种物质或主题,从而干扰了检索过程。
此外,专利文献缺乏科学出版物的标准化。不同司法管辖区、申请人和分类系统的文档组织方式各不相同,其术语往往反映了组织内部的行话或历史习惯,而非通用的惯例。例如,在同行评审的科学文献中,“共聚物”(copolymer)最常指代任何包含两种或多种单体的聚合物。而在专利文献中,它通常指代包含恰好两种单体的聚合物,而“内聚物”(interpolymer)一词则被更广泛地用于指代具有多种单体的聚合物。
因此,专利信息是“稀释”的,即分散在一系列零散的文档中,研究人员必须使用“稀释”的问题,在术语不一致且语言通常模糊的广泛集合中进行搜索(例如试图广泛涵盖作为后续解决方案基础的方法和技术的平台专利)。回到我们之前关于催化剂的问题,让我们将其与一个“集中”的问题进行比较:
- 集中式: 乙腈的沸点是多少?
- 稀释式: 文献中有哪些催化剂在二氧化碳转化为‑甲醇的过程中实现了超过 90% 的选择性?
人工智能如何助力专利检索——及其局限性
生成式人工智能和大语言模型似乎正是为专利检索量身定制的,因为这些工具能够审查跨数据库甚至整个互联网的海量离散文档。然而,专利文献的复杂性使得标准大语言模型难以提供高质量的结果。这些平台依赖于模式识别,但正如我们所讨论的,专利往往不遵循固定模式,甚至在描述同一事物时使用的语言也各不相同。
大语言模型通常难以处理宽泛模糊的问题。它们或许能给出看似详尽的回答,但研究人员无法完全确信模型是否理解了所有需要核查的来源类型,或者是否被语义差异所误导。为了验证专利性,研究人员必须将专利申请与科学文献结合起来评估。为此,必须实现数据协调,以便能够以远超人类速度遍历更多源材料的人工智能工具,能够审查所有相关信息。
关键在于拥有结构化且一致的索引信息,供人工智能解决方案使用。如果人工智能工具所检索的材料缺乏索引,那么该工具就像是被扔进了一个没有杜威十进制分类法的图书馆,却被要求从中找到特定主题的书籍一样。
人类专业知识与技术效率的结合
为什么索引数据对于人工智能驱动的专利检索至关重要?结构化、已索引的数据使大语言模型和人工智能检索工具能够更快速地识别反应物、催化剂及其他关键数据点,而无需浪费时间和精力。数据完整性还有助于跨不同来源检索相关信息。
例如,CAS 对 CAS Content CollectionTM 进行了索引,这是全球最大的人工标引科学信息库,它为专利检索创建了一个统一的数据层。该统一层通过标准化不同术语,实现了专利与科学文献之间的比对。非专利文献中往往包含研究人员必须了解的替代方案和非侵权方法,以便将其创新与现有专利进行比对。统一数据层还能挖掘跨行业联系和无效证据,这些对于专利检索至关重要,却往往容易在不同的源材料或语义中被遗漏。
本体论是这一统一数据层的核心,因为它们定义了规范术语、同义词、领域关系和上下文含义。如果没有本体论,每个领域甚至每家公司或组织都会使用自己的科学方言。人工智能需要本体论提供的一致性来避免幻觉和错误的模式识别。然而,开发本体论并确保数据清洁、结构化且一致,需要人类的参与,这样人工智能工具才能正确利用这些数据。
这就是 CAS 数据区别于其他数据库或搜索引擎的原因:应用人类专业知识确保数据完整性,使强大的技术工具能够更快地发现 准确的见解。例如,CAS IP Finder™ 在高度结构化的内容中提供了无与伦比的精确度。此外,CAS Newton℠ 将对话式人工智能引入专利和知识产权检索,让您能够用自然语言提问,并从 100 多种专利和非专利文献来源中提取答案,同时提供智能的后续步骤建议。
人工智能驱动的专利检索未来
人工智能工具和大语言模型快速检索海量数据的能力,使其成为当今专利检索的标准,甚至是必要手段。然而,正如我们在专利检索中问题的宽泛性以及专利文档本身的特性所看到的那样,人工智能在寻找所有相关信息和克服术语差异方面仍可能面临挑战。如果没有通过本体论和其他形式的标引来实现数据完整性,即使是最强大的人工智能工具也可能遗漏关键的现有技术。
人工智能将继续在专利生命周期的各个环节发挥作用,从探索性检索和自由实施分析,到执行侵权分析和识别异议。对于寻求推进突破性进展的研究人员而言,将人类专业知识与尖端技术速度相结合的结构化数据,依然是推动创新的催化剂。
常见问题解答
为什么专利检索与其他科学文献检索不同?
专利文献可能散布在数千份文档中,同一项创新或构思可能以不同方式描述。有时,专利申请人会故意模糊关键含义,并可能使用其他文档中未使用的组织术语。这需要广泛的发现和对多种文档类型及措辞的检索,这可能会混淆人类和计算机驱动的检索。
为什么人工智能难以返回准确的专利检索结果?
标准大语言模型之所以困难,是因为它们依赖于语言模式匹配,而专利数据和专利检索问题的分散、宽泛特性违背了一致的模式。专利文档包含大量“噪音”,例如,早期部分通过详尽的现有技术描述以及与实际发明无关的兼容共用药物或条件的“清单”来划定边界。
研究人员如何克服数据挑战以在专利检索中使用人工智能?
具有统一层的结构化数据是克服这些挑战的关键。当大语言模型或人工智能工具应用于结构化、已索引的数据时,它们可以挖掘出关键词检索所遗漏的信息。索引使这些工具能够完成检索增强生成、语义检索和概念聚类,从而获得更稳健、更准确的结果。





