エグゼクティブサマリー

  • 特許検索が他の科学的研究と異なるのは、特許データが非標準的であり、多種多様な文書に分散しており、必ずしも明確で一貫した言語が使われていないためです。
  • 標準的なAIツールや大規模言語モデルでは、情報源や表現のばらつきが大きいため、関連するすべての特許データを網羅的に取得することが困難です。
  • AIを活用した特許検索を成功させる鍵は、意味論的および文書形式上の差異を正規化した、構造化・インデックス化されたデータにあります。
  • STN™を基盤とするCAS IP Finderは、人間が精選しインデックス化したデータと最先端のAI検索機能を組み合わせることで、関連する特許情報を確実に特定できる好例です。

画期的な発見や新たなイノベーションを実現するには、特定の物質が特許取得済みかどうかを確認する必要があります。特許情報は多くの情報源に分散しており、時間との勝負です。「文献全体の中で、CO₂からメタノールへの変換において90%以上の選択率を達成した触媒はどれか?」という問いを立てたとします。これを汎用的な大規模言語モデル(LLM)に入力して結果を待つべきでしょうか?

CAS Newton transforms patent and IP searching with intuitive, conversational AI that understands your intent and delivers relevant insights so you can search with confidence, reduce uncertainty, and make IP decisions faster.

‍

直感に反するかもしれませんが、答えはノーです。標準的なLLMは膨大な出版物を素早く検索できますが、特許情報や先行技術の調査には、AIツールが必ずしも対応できるとは限らない特有の複雑さが伴います。これは単なる「ゴミを入れればゴミが出てくる(Garbage In, Garbage Out)」という問題ではありません。特許検索を成功させるには、研究者はインデックス化された構造化データと、特許文献の複雑さを読み解き、実用的な洞察を導き出せるAIソリューションを組み合わせる必要があります。

なぜ特許検索は特殊なのか

特許は、学術論文やその他の科学出版物とは異なる目的、すなわち知的財産(IP)を保護するために作成されます。学術論文のように内容を広く公開し、発見や引用を促すことを目的とするのではなく、特許出願人は特許を取得するために必要最小限のデータしか開示しない傾向があります。そのため、出願書類では画期的な発見について意図的に秘密にしたり、曖昧にしたりすることがあります。

また、特許文書の冒頭部分には、イノベーション自体には影響を与えない長い説明や、関連材料・化合物のリストなど、多くの「ノイズ」が含まれていることがあります。こうした広範なリストは、通常、代替案を確保したり、些細な改良が後から発明として主張されるのを防いだりするために記載されます。しかし、これにより、ある物質やトピックを表面上記述しているだけの文書が関連性の高いものに見えてしまい、検索プロセスを混乱させる原因となります。

On top of this, patent literature lacks the standardization of scientific publishing. Documents are organized differently across jurisdictions, applicants, and classification systems, and their terminology often reflects organizational jargon or historical quirks rather than any shared convention. For example, in peer-reviewed scientific literature, the word “copolymer” most frequently means any polymer comprising two or more monomers. In patent literature, it often means a polymer with exactly two monomers, while the term “interpolymer” is used more broadly to refer to polymers with multiple monomers.

したがって、特許情報は希薄であり、広範囲に分散した文書群に散らばっています。研究者は、一貫性のない用語や曖昧な表現が混在する広大なデータセットを検索するために、「希薄な」問いを立てる必要があります(さらなる解決策の基盤となる方法や技術を広範にカバーしようとするプラットフォーム特許を想像してください)。先ほどの触媒に関する問いに戻り、これを「濃縮された」問いと比較してみましょう。

  • 濃縮された問い: アセトニトリルの沸点は何度か?
  • 希薄な問い: 文献全体の中で、CO₂から‑メタノールへの変換において90%以上の選択率を達成した触媒はどれか?

‍

AIは特許検索をどう促進し、どこに限界があるのか

膨大な文書群をあらゆるデータベースやインターネット全体から精査できる生成AIやLLMは、特許検索に最適なツールのように思えるかもしれません。しかし、特許文献の複雑さは、標準的なLLMが質の高い結果を返すことを困難にしています。これらのプラットフォームはパターンを検索しますが、前述の通り、特許は必ずしもパターンに従わず、同じ事象を説明するのに異なる用語が使われることも珍しくありません。

LLMは、曖昧な質問への対応に苦慮することがよくあります。一見もっともらしい回答を返しても、研究者は、LLMが確認すべき情報源をすべて網羅しているか、あるいは意味的な差異に惑わされていないかを確信できません。特許性を検証するには、特許出願と科学文献の両方を評価する必要があります。そのためには、人間には不可能な速度で膨大な資料を横断できるAIツールが、関連情報をすべて精査できるようデータを統合(ハーモナイズ)しておくことが不可欠です。

鍵となるのは、AIソリューションが利用できるよう、構造化され一貫性のあるインデックス化された情報を持つことです。AIツールが検索する資料がインデックス化されていなければ、それはデューイ十進分類法のない図書館に放り込まれ、特定のトピックに関する本を探すよう求められるようなものです。

人間の専門知識とテクノロジーの効率性

なぜAIを活用した特許検索にはインデックス化されたデータが不可欠なのでしょうか。構造化されインデックス化されたデータがあれば、LLMやAI検索ツールは、時間や労力を浪費することなく、反応物、触媒、その他の重要なデータポイントをより迅速に識別できます。また、データの整合性は、異なるソース間で関連情報を検索する際にも役立ちます。

例えば、CASは、科学情報の最大の人間によるキュレーション・リポジトリであるCAS Content CollectionTMをインデックス化しており、これが特許検索のための統合データレイヤーを形成しています。この統合レイヤーにより、異なる用語を正規化し、特許と科学文献を比較することが可能になります。非特許文献には、研究者が自身のイノベーションを既存の特許と比較する際に知っておくべき回避策や非侵害的な手法が含まれていることがよくあります。また、統合データレイヤーは、業界を横断する関連性や無効化資料を浮き彫りにすることもできます。これらは特許検索において極めて重要ですが、ソース資料やその意味論の違いの中に埋もれてしまいがちです。

オントロジーは、標準的な用語、同義語、ドメイン間の関係、文脈上の意味を定義するため、この統合データレイヤーの鍵となります。オントロジーがなければ、あらゆるドメイン、さらには企業や組織が独自の科学的方言を話すことになってしまいます。AIがハルシネーション(幻覚)や誤ったパターン認識を回避するには、オントロジーが提供する一貫性が必要です。しかし、オントロジーを開発し、AIツールがデータを適切に活用できるよう、データをクリーンで構造化された一貫性のある状態に保つには、人間の力が必要です。

これこそが、CASのデータが他のデータベースや検索エンジンと一線を画す理由です。人間の専門知識を適用してデータの整合性を確保することで、強力なテクノロジー・ツールが正確なインサイトをより迅速に発見できるようになります。例えば、CAS IP Finder™は、高度に構造化されたコンテンツ全体で比類のない精度を実現します。さらに、CAS Newton℠は、会話型AIを特許およびIP検索にもたらし、自然言語での質問を可能にするとともに、100以上の特許および非特許文献ソースから回答を抽出し、次のステップに向けたスマートな提案を行います。

AIによる特許検索の未来

AIツールやLLMが膨大なデータを迅速に検索できる能力は、今日の特許検索において標準的であり、不可欠なものとなっています。しかし、特許検索における質問の曖昧さや特許文書自体の性質に見られるように、AIはすべての関連情報を見つけ出し、用語の差異を克服するのに苦労することがあります。オントロジーやその他のキュレーションを通じたデータの整合性がなければ、最も強力なAIツールであっても重要な先行技術を見落とす可能性があります。

AIは、探索的検索や実施の自由(FTO)の判断から、侵害分析の実行や異議申し立ての特定に至るまで、特許ライフサイクルのあらゆる部分で役割を果たし続けるでしょう。今、画期的な成果を推進しようとしている研究者にとって、人間の専門知識と最先端技術のスピードを融合させた構造化データこそが、イノベーションを加速させるために必要な触媒であり続けます。

Q&A

特許検索が他の科学文献検索と異なる理由は何でしょうか。

なぜAIは特許の適切な検索結果を返すのに苦労するのでしょうか。

研究者はどのようにデータ課題を克服し、特許検索でAIを活用できるのでしょうか。

関連するCASインサイト

青と緑の光の粒子が同心円状に広がる、抽象的なデジタル・トンネル。

製薬業界のデジタルトランスフォーメーション:成果を生むAIを支える基盤

六角形のグリッド上に流れるデータストリームと、半透明のピンクと紫の円柱。

科学的AIの核心にある評価の課題

回路基板上で光を放つマイクロチップのクローズアップ。中心部から色鮮やかな光線が放射されている。

AIを活用した科学研究におけるデータ整合性

より迅速な進歩を実現するための新しい視点を、メールでお届けします。