요약
- 특허 검색은 특허 데이터가 비표준적이고 다양한 유형의 문서에 분산되어 있으며, 명확하고 일관된 언어를 사용하지 않는 경우가 많기 때문에 다른 유형의 과학 연구와는 차이가 있습니다.
- 표준 AI 도구와 거대 언어 모델은 출처와 표현의 가변성 때문에 관련 특허 데이터를 모두 찾아내는 데 어려움을 겪습니다.
- 의미론적 차이와 문서상의 차이를 표준화한 구조화 및 색인화 데이터는 AI 기반 특허 검색을 성공으로 이끄는 핵심 요소입니다.
- STN™ 기반의 CAS IP Finder는 관련 특허 정보를 안정적으로 식별할 수 있는 최첨단 AI 검색 기능과 인간이 직접 큐레이션하고 색인화한 데이터를 결합한 사례입니다.
획기적인 돌파구나 새로운 혁신을 실현하려면 특정 물질이 특허를 받았는지 확인해야 합니다. 특허 정보는 여러 출처에 분산되어 있으며 시간은 매우 중요합니다. “문헌상 CO₂를 메탄올로 전환할 때 90% 이상의 선택도를 달성한 촉매는 무엇인가?”와 같은 질문을 던지고 싶을 때, 이를 범용 거대 언어 모델(LLM)에 입력하여 결과를 확인해야 할까요?
직관적이지 않게 들릴 수 있지만, 답은 '아니오'입니다. 표준 LLM은 방대한 양의 간행물을 빠르게 훑어볼 수 있지만, 특허 정보와 선행 기술을 검색하는 데는 AI 기반 도구가 항상 처리할 수 있는 것은 아닌 고유한 복잡성이 따릅니다. 이는 단순히 '쓰레기를 넣으면 쓰레기가 나온다(garbage in, garbage out)'는 문제도 아닙니다. 특허 검색을 성공적으로 수행하려면 연구자는 색인화되고 구조화된 데이터와 함께 특허 문헌의 복잡성을 탐색하고 실행 가능한 통찰력을 도출할 수 있는 AI 기반 솔루션을 사용해야 합니다.
특허 검색이 다른 이유
특허는 학술지 논문이나 기타 과학 간행물과는 다른 목적, 즉 지식재산권(IP) 보호를 위해 작성됩니다. 학술지 논문처럼 내용을 널리 알리고 인용되는 것을 목표로 하기보다는, 특허 출원인은 특허를 받는 데 절대적으로 필요한 최소한의 데이터만을 제공하려 합니다. 이러한 출원서는 새로운 돌파구에 대해 어느 정도 비밀을 유지하거나 심지어 모호하게 기술할 수도 있습니다.
특허 문서의 앞부분에는 새로운 혁신과 무관한 긴 설명이나 관련 물질 및 화합물 목록과 같은 '노이즈'가 많이 포함될 수 있습니다. 이러한 방대한 목록은 일반적으로 예비적 위치를 확보하거나 사소한 변형을 명시하여, 발명의 사소한 최적화가 추후에 독창적인 것으로 주장되는 것을 방지하기 위해 포함됩니다. 그러나 이로 인해 물질이나 주제를 피상적으로만 설명하는 문서가 관련성이 있는 것처럼 보여 검색 과정을 혼란스럽게 만들 수 있습니다.
게다가 특허 문헌은 과학 출판물과 같은 표준화가 부족합니다. 문서는 관할권, 출원인, 분류 체계에 따라 다르게 구성되며, 용어 또한 공통된 관례보다는 조직 내부의 전문 용어나 역사적 관습을 반영하는 경우가 많습니다. 예를 들어, 동료 심사를 거치는 과학 문헌에서 '공중합체(copolymer)'라는 단어는 가장 흔히 두 개 이상의 단량체로 구성된 모든 중합체를 의미합니다. 반면 특허 문헌에서는 정확히 두 개의 단량체로 구성된 중합체를 의미하는 경우가 많으며, '인터폴리머(interpolymer)'라는 용어가 여러 단량체를 포함하는 중합체를 지칭하는 더 넓은 의미로 사용됩니다.
따라서 특허 정보는 희석되어 있습니다. 즉, 광범위한 문서 세트에 분산되어 있으며, 연구자는 일관성 없는 용어와 일반적으로 모호한 언어(추가 솔루션의 기반이 되는 방법과 기술을 광범위하게 포괄하려는 플랫폼 특허를 생각해보십시오)를 사용하여 그 넓은 범위를 검색하기 위해 '희석된' 질문을 사용해야 합니다. 앞서 언급한 촉매 관련 질문으로 돌아가서, 이를 '집중된' 질문과 비교해 보겠습니다.
- 집중된 질문: 아세토니트릴의 끓는점은 얼마인가?
- 희석된 질문: 문헌상 CO₂를 메탄올로 전환할 때 90% 이상의 선택도를 달성한 촉매는 무엇인가?‑
AI가 특허 검색을 지원하는 방식과 그렇지 못한 방식
방대한 양의 서로 다른 문서를 데이터베이스나 인터넷 전체에서 검토할 수 있는 생성형 AI와 LLM이 특허 검색에 최적화된 도구처럼 보일 수 있습니다. 하지만 특허 문헌의 복잡성으로 인해 일반적인 LLM이 양질의 결과를 도출하기는 어렵습니다. 이러한 플랫폼은 패턴을 찾지만, 앞서 논의했듯이 특허는 일정한 패턴을 따르지 않거나 동일한 대상을 설명할 때도 서로 다른 용어를 사용하는 경우가 많기 때문입니다.
LLM은 종종 모호한 질문을 처리하는 데 어려움을 겪습니다. 답변은 그럴듯하게 내놓을 수 있지만, 연구자는 LLM이 확인해야 할 모든 유형의 출처를 이해했는지, 혹은 의미론적 차이로 인해 오류를 범하지 않았는지 완전히 확신할 수 없습니다. 특허성을 검증하려면 연구자가 특허 출원서와 과학 문헌을 함께 평가해야 합니다. 이를 위해서는 데이터 조화가 필수적이며, 이를 통해 인간보다 훨씬 빠르게 방대한 자료를 훑을 수 있는 AI 도구가 모든 관련 정보를 검토할 수 있어야 합니다.
핵심은 AI 기반 솔루션이 활용할 수 있도록 구조화되고 일관된 색인 정보를 갖추는 것입니다. AI 도구가 검색하는 자료에 색인이 없다면, 이는 듀이 십진 분류법이 없는 도서관에 던져진 채 특정 주제의 책을 찾으라는 것과 다를 바 없습니다.
인간의 전문성과 기술적 효율성의 결합
왜 AI 기반 특허 검색에 색인 데이터가 중요할까요? 구조화된 색인 데이터가 있으면 LLM과 AI 검색 도구가 시간과 에너지를 낭비하지 않고 반응물, 촉매제 및 기타 주요 데이터 포인트를 더 빠르게 구분할 수 있습니다. 또한 데이터 무결성은 서로 다른 출처에서 관련 정보를 검색하는 과정을 원활하게 합니다.
예를 들어, CAS는 CAS Content CollectionTM을 색인화합니다. 이는 인간이 직접 큐레이션한 최대 규모의 과학 정보 저장소로, 특허 검색을 위한 통합 데이터 계층을 형성합니다. 이 통합 계층은 서로 다른 용어를 표준화하여 특허와 과학 문헌 간의 비교를 가능하게 합니다. 비특허 문헌에는 연구자가 자신의 혁신 기술을 기존 특허와 비교하기 위해 반드시 알아야 할 우회 방법이나 비침해적 방법이 포함된 경우가 많습니다. 통합 데이터 계층은 또한 산업 간 연결 고리와 무효화 자료를 찾아낼 수 있는데, 이는 특허 검색에 매우 중요하지만 개별 출처나 의미론적 차이 속에서 간과되기 쉽습니다.
온톨로지는 표준 용어, 동의어, 도메인 관계 및 문맥적 의미를 정의하므로 이 통합 데이터 계층의 핵심입니다. 온톨로지가 없다면 모든 도메인, 심지어 모든 기업이나 조직이 각자의 과학적 방언을 사용하게 될 것입니다. AI가 환각 현상이나 잘못된 패턴 인식을 피하려면 온톨로지가 제공하는 일관성이 필요합니다. 하지만 데이터가 깨끗하고 구조화되며 일관되게 유지되어 AI 도구가 이를 제대로 활용할 수 있도록 만드는 것은 결국 인간의 몫입니다.
이것이 바로 CAS 데이터가 다른 데이터베이스나 검색 엔진과 차별화되는 점입니다. 인간의 전문성을 적용하여 데이터 무결성을 보장함으로써 강력한 기술 도구가 정확한 통찰력을 더 빠르게 찾아낼 수 있게 합니다. 예를 들어, CAS IP Finder™는 고도로 구조화된 콘텐츠 전반에서 타의 추종을 불허하는 정밀도를 제공합니다. 또한 CAS Newton℠은 대화형 AI를 특허 및 IP 검색에 도입하여, 일상 언어로 질문하고 100개 이상의 특허 및 비특허 문헌 출처에서 답변을 도출하며 다음 단계에 대한 스마트한 제안까지 제공합니다.
AI와 함께하는 특허 검색의 미래
AI 기반 도구와 LLM이 방대한 데이터를 빠르게 검색하는 능력은 오늘날 특허 검색을 표준이자 필수적인 과정으로 만들었습니다. 그러나 특허 검색 질문의 모호함과 특허 문헌 자체의 특성에서 보았듯이, AI는 모든 관련 정보를 찾거나 용어의 차이를 극복하는 데 어려움을 겪을 수 있습니다. 온톨로지 및 기타 큐레이션 형태를 통한 데이터 무결성이 뒷받침되지 않으면, 가장 강력한 AI 도구라도 중요한 선행 기술을 놓칠 수 있습니다.
AI는 탐색적 검색, 특허 침해 여부 판단부터 침해 분석 및 이의 제기 식별에 이르기까지 특허 수명 주기의 모든 단계에서 계속해서 역할을 할 것입니다. 지금 혁신을 앞당기려는 연구자들에게 인간의 전문성과 최첨단 기술의 속도를 결합한 구조화된 데이터는 혁신을 주도하는 데 필요한 촉매제로 남을 것입니다.
질의응답
특허 검색이 다른 과학 문헌 검색과 다른 이유는 무엇입니까?
특허 문헌은 수천 개의 문서에 흩어져 있을 수 있으며, 동일한 혁신이나 아이디어가 서로 다른 방식으로 설명될 수 있습니다. 때로는 특허 출원인이 핵심 의미를 의도적으로 모호하게 하거나 다른 문서에서는 사용되지 않는 조직 고유의 전문 용어를 사용할 수도 있습니다. 이는 광범위한 발견과 다양한 유형의 문서 및 어휘 검색을 필요로 하며, 사람과 컴퓨터 기반 검색 모두를 혼란스럽게 할 수 있습니다.
AI가 특허에 대한 적절한 검색 결과를 반환하는 데 어려움을 겪는 이유는 무엇입니까?
표준 LLM은 언어보다는 패턴 매칭에 의존하기 때문에 어려움을 겪습니다. 특허 데이터와 특허 검색 질문의 분산되고 모호한 특성은 일관된 패턴을 따르지 않기 때문입니다. 특허 문서에는 상당한 양의 "노이즈"가 포함되어 있습니다. 예를 들어, 초기 섹션은 광범위한 선행 기술 설명과 실제 발명에 영향을 미치지 않는 호환 가능한 병용 약물 또는 질환의 "나열식 목록"으로 경계를 설정합니다.
연구자가 특허 검색에서 AI를 활용하기 위해 데이터 문제를 어떻게 극복할 수 있습니까?
통합 계층을 갖춘 구조화된 데이터가 이러한 문제를 극복하는 핵심입니다. LLM이나 AI 기반 도구를 구조화된 색인 데이터에 적용하면 키워드 검색으로는 놓칠 수 있는 정보를 찾아낼 수 있습니다. 색인화를 통해 이러한 도구는 검색 증강 생성(RAG), 의미론적 검색 및 개념 클러스터링을 완료하여 더욱 강력하고 정확한 결과를 도출할 수 있습니다.





