Executive Summary
- 특허 검색은 다른 유형의 과학 연구와 다릅니다. 특허 데이터는 비표준적이고 다양한 유형의 문서에 분산되어 있으며, 항상 명확하고 일관된 언어를 사용하지 않기 때문입니다.
- 표준 AI 도구와 대규모 언어 모델은 출처와 용어의 가변성 때문에 모든 관련 특허 데이터를 검색하는 데 어려움을 겪습니다.
- 의미론적 차이와 문서적 차이를 표준화하는 구조화되고 색인화된 데이터는 AI 기반 특허 검색을 성공으로 이끄는 핵심 요소입니다.
- STN™ 기반의 CAS IP Finder는 관련 특허 정보를 안정적으로 식별할 수 있는 최첨단 AI 검색 기능과 인간이 엄선하여 색인화한 데이터의 예입니다.
흥미로운 돌파구나 새로운 혁신을 실현하려면 특정 물질이 특허를 받았는지 확인해야 합니다. 특허 정보는 여러 출처에 분산되어 있으며 시간이 매우 중요합니다. “문헌 전반에서 CO₂를 메탄올로 전환할 때 90% 이상의 선택도를 달성한 촉매는 무엇인가?”라는 질문을 던지고 싶을 때, 이를 범용 대규모 언어 모델(LLM)에 입력하여 결과를 확인해야 할까요?
직관에 어긋날 수 있지만, 대답은 '아니오'입니다. 표준 LLM은 방대한 양의 간행물을 빠르게 훑어볼 수 있지만, 특허 정보와 선행 기술을 검색하는 데는 AI 기반 도구가 항상 처리할 수 있는 것은 아닌 고유한 복잡성이 수반됩니다. 이는 단순히 "쓰레기를 넣으면 쓰레기가 나온다(garbage in, garbage out)"는 문제도 아닙니다. 특허 검색이 성공하려면 연구자는 반드시 색인화되고 구조화된 데이터 를 특허 문헌의 복잡성을 탐색하고 조치 가능한 통찰력을 드러낼 수 있는 AI 기반 솔루션과 함께 사용해야 합니다.
특허 검색이 다른 이유
특허는 학술지 기사나 기타 과학 간행물과는 다른 목적, 즉 지식재산권(IP)을 보호하기 위해 작성됩니다. 학술지 간행물처럼 내용을 공개하고 발견 및 인용되는 것을 목표로 하는 대신, 특허 출원인은 특허를 성공적으로 받기 위해 절대적으로 필요한 양의 데이터만을 제공하려고 합니다. 이러한 출원서는 새로운 돌파구에 대해 어느 정도 비밀을 유지하거나 심지어 모호하게 기술할 수도 있습니다.
특허 문서의 초기 섹션에는 새로운 혁신과 무관한 긴 설명이나 관련 물질 또는 화합물 목록과 같은 많은 "노이즈"가 포함될 수 있습니다. 이러한 방대한 목록은 일반적으로 예비적 위치를 확보하거나 사소한 최적화가 추후 독창적인 발명으로 주장되는 것을 방지하기 위해 포함됩니다. 그러나 이로 인해 특정 물질이나 주제를 피상적으로만 설명하는 문서가 관련성이 있는 것처럼 보여 검색 과정을 혼란스럽게 만들 수 있습니다.
게다가 특허 문헌은 과학 출판물과 같은 표준화가 부족합니다. 문서는 관할권, 출원인, 분류 체계에 따라 다르게 구성되며, 용어 또한 공통된 관례보다는 조직 내부의 전문 용어나 역사적 특수성을 반영하는 경우가 많습니다. 예를 들어, 동료 심사를 거친 과학 문헌에서 "공중합체(copolymer)"라는 단어는 가장 일반적으로 두 개 이상의 단량체로 구성된 모든 중합체를 의미합니다. 반면 특허 문헌에서는 종종 정확히 두 개의 단량체로 구성된 중합체를 의미하며, "인터폴리머(interpolymer)"라는 용어가 다수의 단량체를 포함하는 중합체를 지칭하는 더 넓은 의미로 사용됩니다.
따라서 특허 정보는 희석되어 있습니다. 즉, 광범위한 문서 세트에 분산되어 있으며, 연구자는 일관성 없는 용어와 일반적으로 모호한 언어가 사용된 방대한 세트를 검색하기 위해 "희석된" 질문을 사용해야 합니다(추가 솔루션의 기반이 되는 방법과 기술을 광범위하게 포괄하려는 플랫폼 특허를 생각해보십시오). 앞서 언급한 촉매에 관한 질문으로 돌아가서, 이를 "집중된" 질문과 비교해 보겠습니다.
- 집중된 질문: 아세토니트릴의 끓는점은 얼마입니까?
- 희석된 질문: 문헌 전반에서 CO₂를‑메탄올로 전환하는 데 90% 이상의 선택성을 달성한 촉매는 무엇입니까?
인공지능이 특허 검색을 촉진하는 방법과 그렇지 못한 이유
특허 검색은 생성형 인공지능과 LLM을 위한 완벽한 활용 사례처럼 들릴 수 있습니다. 이러한 도구는 데이터베이스나 인터넷 전체에 걸쳐 방대한 양의 이질적인 문서를 검토할 수 있기 때문입니다. 그러나 특허 문헌의 복잡성으로 인해 표준 LLM이 양질의 결과를 도출하기는 어렵습니다. 이러한 플랫폼은 패턴을 찾지만, 앞서 논의했듯이 특허는 패턴을 따르지 않거나 동일한 대상을 설명할 때 같은 언어를 사용하지 않는 경우가 많습니다.
LLM은 종종 희석된 질문을 처리하는 데 어려움을 겪습니다. 그럴듯한 답변을 내놓을 수는 있지만, 연구자는 LLM이 확인해야 할 모든 유형의 출처를 이해했는지, 혹은 의미론적 차이로 인해 오류를 범하지 않았는지 완전히 확신할 수 없습니다. 특허 가능성을 검증하려면 연구자는 특허 출원과 과학 문헌을 함께 평가해야 합니다. 이를 위해서는 데이터 조화가 이루어져야 하며, 이를 통해 인간보다 훨씬 빠르게 더 많은 원천 자료를 탐색할 수 있는 인공지능 도구가 모든 관련 정보를 검토할 수 있게 됩니다.
핵심은 인공지능 기반 솔루션이 사용할 수 있도록 구조화되고 일관된 색인 정보를 갖추는 것입니다. 인공지능 도구가 검색하는 자료에 대한 색인이 없다면, 이는 듀이 십진 분류법이 없는 도서관에 던져진 채 특정 주제의 책을 찾으라고 요구하는 것과 다름없습니다.
인간의 전문성과 기술적 효율성의 결합
인공지능 기반 특허 검색에서 색인 데이터가 중요한 이유는 무엇일까요? 구조화되고 색인된 데이터는 LLM과 인공지능 검색 도구가 시간과 에너지를 낭비하지 않고도 반응물, 촉매제 및 기타 주요 데이터 포인트를 더 빠르게 구분할 수 있게 해줍니다. 또한 데이터 무결성은 서로 다른 출처에서 관련 정보를 검색하는 것을 용이하게 합니다.
예를 들어, CAS는 다음을 색인합니다. CAS Content CollectionTM, 즉 인간이 직접 엄선한 최대 규모의 과학 정보 저장소는 특허 검색을 위한 통합 데이터 계층을 생성합니다. 이 통합 계층은 서로 다른 용어를 표준화하여 특허와 과학 문헌 간의 비교를 가능하게 합니다. 비특허 문헌에는 연구자가 자신의 혁신을 기존 특허와 비교하기 위해 반드시 알아야 할 우회 방법이나 비침해적 방법이 포함되어 있는 경우가 많습니다. 통합 데이터 계층은 또한 산업 간 연관성과 무효화 자료를 표면화할 수 있는데, 이는 특허 검색에 매우 중요하지만 서로 다른 원본 자료나 그 의미론 속에서 길을 잃기 쉽습니다.
온톨로지는 표준 용어, 동의어, 도메인 관계 및 문맥적 의미를 정의하기 때문에 이 통합 데이터 계층의 핵심입니다. 온톨로지가 없다면 모든 도메인, 심지어 모든 기업이나 조직이 각자의 과학적 방언을 사용하게 될 것입니다. 인공지능이 환각 현상과 잘못된 패턴 인식을 피하려면 온톨로지가 제공하는 일관성이 필요합니다. 그러나 데이터가 깨끗하고 구조화되며 일관되게 유지되어 인공지능 도구가 이를 적절히 활용할 수 있도록 보장하는 것은 인간의 몫입니다.
이것이 바로 CAS 데이터가 다른 데이터베이스나 검색 엔진과 차별화되는 점입니다. 인간의 전문성을 적용하여 데이터 무결성을 보장함으로써 강력한 기술 도구가 다음을 발견할 수 있게 합니다. 정확한 통찰력 을 더 빠르게. 예를 들어, CAS IP Finder™는 고도로 구조화된 컨텐츠 전반에서 일치하지 않는 정밀도를 제공합니다. 또한, CAS Newton℠ 는 대화형 인공지능을 특허 및 IP 검색에 도입하여, 일상적인 언어로 질문하고 100개 이상의 특허 및 비특허 문헌 출처에서 답변을 도출하며 다음 단계에 대한 스마트한 제안을 제공합니다.
인공지능과 함께하는 특허 검색의 미래
인공지능 기반 도구와 LLM이 방대한 데이터를 신속하게 검색하는 능력은 오늘날 특허 검색에서 표준이자 필수적인 요소가 되었습니다. 그러나 특허 검색 질문과 특허 문서 자체의 희석된 특성에서 알 수 있듯이, 인공지능은 모든 관련 정보를 찾거나 용어의 차이를 극복하는 데 어려움을 겪을 수 있습니다. 온톨로지 및 기타 형태의 큐레이션을 통한 데이터 무결성이 뒷받침되지 않으면, 가장 강력한 인공지능 도구조차도 중요한 선행 기술을 놓칠 수 있습니다.
인공지능은 탐색적 검색과 실시 가능성 판단부터 침해 분석 수행 및 이의 제기 식별에 이르기까지 특허 수명 주기의 모든 부분에서 계속해서 역할을 할 것입니다. 지금 혁신을 앞당기려는 연구자들에게 인간의 전문성과 최첨단 기술의 속도를 결합한 구조화된 데이터는 혁신을 주도하는 데 필요한 촉매제로 남아 있습니다.
Questions and answers
특허 검색이 다른 과학 문헌 검색과 다른 이유는 무엇입니까?
특허 문헌은 수천 개의 문서에 흩어져 있을 수 있으며, 동일한 혁신이나 아이디어가 서로 다른 방식으로 설명될 수 있습니다. 때때로 특허 출원인은 핵심 의미를 의도적으로 모호하게 만들기도 하며, 다른 문서에서는 사용되지 않는 조직적 전문 용어를 사용할 수도 있습니다. 이는 광범위한 발견과 다양한 유형의 문서 및 문구 검색을 필요로 하며, 사람과 컴퓨터 기반 검색 모두를 혼란스럽게 할 수 있습니다.
인공지능이 특허에 대한 적절한 검색 결과를 반환하는 데 어려움을 겪는 이유는 무엇입니까?
표준 LLM은 언어에 대한 패턴 매칭에 의존하기 때문에 어려움을 겪으며, 특허 데이터와 특허 검색 질문의 분산되고 희석된 특성은 일관된 패턴을 따르지 않습니다. 특허 문서에는 상당한 양의 "노이즈"가 포함되어 있습니다. 즉, 초기 섹션은 광범위한 선행 기술 설명과 실제 발명에 아무런 영향을 미치지 않는 호환 가능한 병용 약물 또는 상태에 대한 "나열식 목록"으로 경계를 설정합니다.
연구자가 특허 검색에서 인공지능을 사용하기 위해 데이터 문제를 어떻게 극복할 수 있습니까?
통합 계층을 갖춘 구조화된 데이터가 이러한 문제를 극복하는 핵심입니다. LLM이나 인공지능 기반 도구가 구조화되고 색인화된 데이터에 적용되면 키워드 검색으로는 놓칠 수 있는 정보를 찾아낼 수 있습니다. 색인화를 통해 이러한 도구는 검색 증강 생성, 의미론적 검색 및 개념 클러스터링을 완료하여 더욱 강력하고 정확한 결과를 얻을 수 있습니다.




.avif)
