検索エンジンは、情報を探すための標準的なツールとして定着しており、最も一般的な検索エンジンの名前が「検索する」という行為そのものの代名詞(「ググる」など)になるほどです。しかし、検索エンジンを通じて得られる膨大な情報は、科学的概念や研究といった専門的な内容を検索する際には、かえって妨げとなることがあります。有用かつ関連性の高い結果を返しつつ、重要な情報を漏らさないというバランスを保つことは困難ですが、新しいツールや設計手法によってそのプロセスは改善されつつあります。
科学研究者はこの課題を熟知しており、適切なツールがなければ、関連する論文や資料を見つけることは困難です。検索結果が広すぎれば本当に重要な情報にたどり着けず、逆に絞り込みすぎれば重要な新しいアイデアを見落とす可能性があります。
科学研究において最適なバランスを見つけることは難しいものですが、幸いにもそれは決して不可能なことではありません。
検索エンジンにおける再現率と適合率
科学的な検索を理解するには、まず検索エンジンの仕組みを知ることが重要です。例えばGoogleは「再現率(Recall)」を優先します。言い換えれば、クエリに対して可能な限り多くの回答を返すことを重視しています。ユーザーがすべての回答を確認する必要があるとは想定しておらず、関連性の高い情報が検索結果のトップに表示されるよう、アルゴリズムがランク付けを行います。
対照的に、他の検索エンジンでは「適合率(Precision)」を優先するものがあります。これは、クエリに対して最も関連性の高い回答を最大化するものです。この種の検索は図書館の蔵書検索に似ており、タイトル、著者、日付など、検索を絞り込むための項目が設定されています。適合率を最大化すれば、管理可能な範囲の結果を得やすくなりますが、その一方で、設定した条件からわずかに外れた重要な情報を見落とす可能性も高まります。
この違いを例で見てみましょう。「Plasticizer 40T」というクエリで検索した場合、一般的な検索エンジンでは、このクエリ全体が特定の商用物質であることを認識できません。再現率を優先するため、検索エンジンは「40T」を含まない一般的な可塑剤の検索結果を返してしまいます。ユーザーは「40T」を含めるようにクエリを再定義し、再度検索しなければなりません。
一方、CAS SciFinderⓇのような、科学的知見に基づいた適合率重視の検索では、クエリをキュレーションされたオントロジーデータと照合し、これを新規の物質エンティティとして認識します。そのため、たとえ論文内で異なる名称が使われていたとしても、特定の物質である「Plasticizer 40T」の検索結果を即座に返します(図1参照)。
適切な検索機能の設計はCASの核心であり、だからこそCAS SciFinderは科学研究に関連する用語から新規物質を容易に認識できるのです。科学者自身が開発した検索ツールは、研究者が使用する専門用語に対して本質的に高い感度を持っています。とはいえ、単一の商用物質を検索するのは比較的明確な作業です。では、研究者が特定の疾患や研究分野、概念に関連する「関連性」と「網羅性」の両方を求めている場合はどうでしょうか。
検索エンジンの「スイートスポット」を見つける方法
網羅性と深さのバランスをとる一般的な方法として、ブール演算検索があります。これは「and」「or」などの接続詞を使用して用語を組み合わせる手法です。また、引用符(ダブルクォーテーション)で検索語を囲むことで、クエリを固定し、より精度の高い結果を得ることも可能です。
どのようなクエリを作成する場合でも、構造化データを使用し、複数の単語からなる文字列を認識できる検索エンジンを使えば、研究者は最適なバランスを見つけることができます。構造化データは一貫した形式を持ち、その特性に基づいてデータセットとして整理されています。これにより、検索アルゴリズムはどの結果を返すかをより効率的に特定・評価できます。また、複数の単語からなる文字列を単一のエンティティとして認識して検索することで、個々の単語をバラバラに検索した場合に発生する無関係な検索結果を減らすことができます。
このようなコンテンツコーパスはどのように構築されるのでしょうか。それは、慎重なキュレーションとオントロジーの活用により、ユーザーのクエリに対する理解を深めることで実現します。例えば、CAS Content CollectionTMは、人間がキュレーションした科学情報の最大規模のリポジトリであり、独自のキュレーション方針に基づいて最も関連性の高い用語や物質を特定し、索引を作成しています。このキュレーションにより、検索結果は特定の出版物のタイトルや要約の内容に限定されません。
当社の索引には、科学文献の実験セクションから抽出された、その出版物の科学的新規性に特化した概念や用語が含まれています。例えば、学術論文の序論では、著者が関心を持つメタコンテキスト(特定の疾患に対する次なる画期的な治療法など)が定義されることがありますが、その論文の真の新規性は、化学プロセスを評価するための新しい分析手法にあるかもしれません。CAS SciFinderのようにキュレーションされたデータを使用するソリューションは、メタコンテキストではなく分析手法に焦点を当てることで、ユーザーのクエリにより的確に応答します。
オントロジーが適切なアイデアを結びつけ、関連性の高い結果を導く
こうしたつながりを構築する方法がオントロジーです。これは、同義語関係の把握を含む、キュレーションされた用語集です。これらの関係性は、活用すべき用語の洗練された、かつ広範なリストを提供します。ユーザーが商用名で物質を検索した場合、当社のオントロジーには、化学名のバリエーション、その他の商用名、さらには特許出願における内部識別子までが含まれます。こうしたつながりがなければ、一般的な検索エンジンでは関連性の高い結果を特定できません。
科学者が科学者のために構築した検索ツールが、より効率的なイノベーションを促進できる理由はここにあります。再現率を優先する検索エンジンよりも迅速に関連性の高い結果を提供でき、データが主要な用語間の階層関係を捉えているからです。
例えば、「Sonic Hedgehog」という用語をCAS SciFinderで検索した場合と、一般的な検索エンジンで検索した場合では、結果が大きく異なります。CAS SciFinderはこれを即座にタンパク質として認識し、関連する科学文献を返します(図3参照)。一方、一般的な検索エンジンでは、科学者が求めているタンパク質情報ではなく、有名なビデオゲームのキャラクターが表示されてしまいます。
オントロジーに加え、人間によるキュレーション索引は、アルゴリズムでは対応できない発見を可能にします。人間はコードと化学構造の関連性を認識し、非人間的なキュレーション手法では見落とされがちな化学的実体を定義する関係性を構築できます。これにより、分子や化合物などの図表からデータを取得し、その情報を出版物の他の場所にある表、グラフ、テキスト内の説明と結びつけることが可能になります(図4参照)。
キュレーションがなければ、一般的な検索エンジンはグラフや図表の読み取りを光学式文字認識(OCR)に頼らざるを得ず、画像の解像度が低いといった単純な理由で重要な発見が見落とされる可能性があります。CASのチームが提供するような人間によるキュレーションソリューションは、人間の専門知識と、最先端技術のスピードおよびアルゴリズムの進歩を融合させています。
検索の未来においてデータ品質が重要である理由
科学的検索は地元のレストランのレビューを調べるのとは異なり、学術機関や商業機関は、再現率と適合率のバランスが取れたソリューションから恩恵を受けています。科学分野の知識体系が拡大するにつれ、検索機能も進化する必要があります。AI主導のツールが標準的な検索ソリューションとなるにつれ、この重要性はさらに高まるでしょう。大規模言語モデル(LLM)は、適切なデータで学習し、非テキストデータを処理するためのニューラルネットワーク層を備えていない限り、科学的検索において苦戦する可能性があります。
専門家によるキュレーション、堅牢なオントロジー、そして非テキストデータを活用する能力を備えた専門的なソリューションこそが、科学的検索を継続的に洗練・改善し、革新的な発見を促進するという課題に応えることができるのです。




