Executive Summary
- 专利检索与其他类型的科学研究不同,因为专利数据是非标准化的,分散在多种类型的文档中,且并不总是使用清晰、一致的语言。
- 由于来源和措辞的多样性,标准人工智能工具和大型语言模型难以检索到所有相关的专利数据。
- 能够标准化语义和文档差异的结构化、已索引数据,是实现人工智能辅助专利检索成功的关键要素。
- 由 STN™ 驱动的 CAS IP Finder 是一个结合了人工收录、索引数据与尖端人工智能检索功能的示例,能够可靠地识别相关的专利信息。
为了实现令人振奋的突破或新的创新,您需要查看某种物质是否已被授予专利。专利信息分散在许多来源中,且时间紧迫。您知道您想问的问题:“文献中哪些催化剂在二氧化碳转化为甲醇的过程中实现了 >90% 的选择性?”您应该将其输入通用大型语言模型(LLM)并查看结果吗?
这似乎有悖常理,但答案是否定的。标准大模型可以快速浏览大量出版物,但检索专利信息和现有技术涉及人工智能工具并不总是能够处理的独特复杂性。这也不是简单的“垃圾进,垃圾出”问题。为了使专利检索成功,研究人员必须使用 已索引的结构化数据 以及能够驾驭专利文献复杂性并揭示可操作见解的人工智能解决方案。
为什么专利检索与众不同
专利的撰写目的与期刊文章或其他科学出版物不同:即保护知识产权(IP)。与期刊出版物旨在宣传其内容以便被发现和引用不同,专利申请的作者力求仅提供成功获得专利所绝对必要的数据量。这些申请可能会对新的突破保持一定程度的保密,甚至进行模糊处理。
专利文件的前半部分往往包含大量“噪音”,例如冗长的描述或与新创新本身无关的材料或化合物列表。这些详尽的列表通常是为了建立后备方案或阐述细微变化,以防止发明的微小优化随后被他人声称具有创造性。然而,这可能导致一份文件在仅表面描述某种物质或主题时显得相关,从而干扰检索过程。
此外,专利文献缺乏科学出版物的标准化。不同司法管辖区、申请人和分类系统对文件的组织方式各不相同,其术语往往反映了组织内部的行话或历史习惯,而非任何通用的惯例。例如,在同行评审的科学文献中,“共聚物”(copolymer)最常指代任何包含两种或多种单体的聚合物。而在专利文献中,它通常指 恰好 包含两种单体的聚合物,而“互聚物”(interpolymer)一词则被更广泛地用于指代具有多种单体的聚合物。
因此,专利信息是“稀释”的,即分散在大量不同的文件中,研究人员必须使用“稀释”的问题在这些术语不一致且语言通常模糊的广泛集合中进行检索(例如试图广泛涵盖作为后续解决方案基础的方法和技术的平台专利)。回到我们之前关于催化剂的问题示例,让我们将其与一个“浓缩”的问题进行比较:
- 浓缩: 乙腈的沸点是多少?
- 稀释: 在现有文献中,哪些催化剂在 CO₂ 转‑化为甲醇的过程中实现了 >90% 的选择性?
人工智能如何促进专利检索——以及它的局限性
听起来专利检索似乎正是生成式人工智能和大语言模型(LLM)的理想应用场景,因为这些工具可以审查跨越任何数据库甚至整个互联网的海量不同文件。然而,专利文献的复杂性使得标准大语言模型难以提供高质量的结果。这些平台通过寻找模式来工作,但正如我们所讨论的,专利往往不遵循既定模式,甚至不会使用相同的语言来描述同一事物。
大语言模型在处理“稀释”问题时往往力不从心。它们可能会给出一个看似详尽的答案,但研究人员无法完全确信模型是否理解了所有需要核查的来源类型,或者是否被语义差异所误导。为了验证专利性,研究人员必须将专利申请和科学文献结合起来评估。为此,必须进行数据整合,以便能够比人类更快地遍历更多源材料的人工智能工具,能够审查所有相关信息。
关键在于拥有结构化且一致的索引信息,以供人工智能解决方案使用。如果人工智能工具所检索的资料没有经过索引,那么该工具就像是一个被扔进没有杜威十进制分类法的图书馆里,却被期望能找到特定主题书籍的人。
人类专业知识与技术效率的结合
为什么索引数据对于人工智能驱动的专利检索至关重要?结构化的索引数据使大语言模型(LLM)和人工智能检索工具能够更快速地辨别反应物、催化剂和其他关键数据点,而无需浪费时间和精力。数据完整性还有助于在不同来源中检索相关信息。
例如,CAS 对 CAS Content CollectionTMTM,这一全球最大的经人工收录的科学信息库进行了索引,从而为专利检索创建了一个统一的数据层。该统一层通过标准化不同的术语,实现了专利与科技文献之间的比对。非专利文献中往往包含研究人员必须了解的变通方法和非侵权方法,以便将其创新成果与现有专利进行比对。统一的数据层还可以挖掘跨行业的联系和无效证据,这些对于专利检索至关重要,但往往会淹没在不同的源材料或其语义中。
本体论是这一统一数据层的关键,因为它们定义了规范术语、同义词、领域关系和上下文含义。如果没有本体论,每个领域甚至每家公司或组织都会使用自己的科学方言。人工智能需要本体论所提供的一致性,以避免产生幻觉和错误的模式识别。然而,只有人类才能开发本体论并确保数据干净、结构化且一致,从而使人工智能工具能够正确利用这些数据。
这就是 CAS 数据区别于其他数据库或检索引擎的原因:应用人类专业知识来确保数据完整性,使强大的技术工具能够更快速地揭示 准确的见解 。例如, CAS IP Finder™ 在高度结构化的内容中提供了无与伦比的精确度。此外, CAS Newton℠ 将对话式人工智能引入专利和知识产权检索,让您能够用通俗语言提问,并从 100 多个专利和非专利文献来源中提取答案,同时提供智能的后续建议。
人工智能驱动的专利检索未来
人工智能工具和大型语言模型能够快速检索海量数据,这使其成为当今专利检索的标准,甚至是必要手段。然而,正如我们在专利检索中问题的分散性以及专利文件本身所看到的那样,人工智能在查找所有相关信息和克服术语差异方面可能会遇到困难。如果没有通过本体论和其他形式的收录来确保数据完整性,即使是最强大的人工智能工具也可能会遗漏关键的现有技术。
人工智能将继续在专利生命周期的各个环节发挥作用,从探索性检索和确定自由实施权,到执行侵权分析和识别异议。对于现在寻求推进其突破性进展的研究人员而言,将人类专业知识与尖端技术速度相结合的结构化数据,仍然是他们推动创新所需的催化剂。
Questions and answers
为什么专利检索不同于其他科技文献检索?
专利文献可能分散在数千份文件中,同一项创新或构思可能会以不同的方式进行描述。有时,专利申请人会刻意模糊关键含义,并可能使用其他文件中未使用的组织术语。这需要进行广泛的发现和检索,涉及多种类型的文件和措辞,这可能会干扰人类和计算机驱动的检索。
为什么人工智能难以返回准确的专利检索结果?
标准的大型语言模型之所以难以胜任,是因为它们依赖于对语言的模式匹配,而专利数据和专利检索问题的分散、稀释特性违背了这种一致性模式。专利文件包含大量的“噪音”,例如,早期部分通过详尽的现有技术描述以及与实际发明无关的兼容共用药物或病症的“清单”来划定边界。
研究人员如何克服数据挑战,从而在专利检索中使用人工智能?
具有统一层的结构化数据是克服这些挑战的关键。当大型语言模型或人工智能工具应用于结构化、已索引的数据时,它们可以挖掘出关键词检索所遗漏的信息。索引功能使这些工具能够完成检索增强生成、语义检索和概念聚类,从而获得更稳健、更准确的结果。





