AIの世界におけるトレーニングと透明性

分子データが表示された透明なスクリーンに向かって作業する、白衣を着た科学者。

前回の記事で述べたように、完全で質の高いトレーニングデータのないAIは、エンジンを積んでいない車のようなものです。見た目は良くても、どこへも進むことはできません。AIの透明性はユーザーにとっても同様に重要です。そのため、私たちはAIがいつ、どこで使用されているかを正確に伝え、ユーザーが十分な情報に基づいた意思決定を行えるようにしています。

生成AIのよく知られたリスクに「ハルシネーション」があります。これは、モデルがもっともらしいデータを生成し、時には偽の引用まで含めるものの、内容は完全に誤っているという現象です。研究開発において、このようなハルシネーションは許容できないため、回避するための対策を講じる必要があります。

本記事では、CASがどのようにしてAIと科学的発見の架け橋となる独自の立ち位置を築いているのかを解説します。また、ハルシネーションを最小限に抑え、質の高いトレーニングデータを優先することで、研究を推進するための重要な情報をユーザーに提供する、当社の戦略的なAI活用法についても触れます。

トレーニングデータ

科学研究開発において、正確なデータは不可欠です。実験や試験の結果次第で、医薬品が市場に出せるかどうかが決まったり、製品ライン全体の再設計が必要になったりすることさえあります。

トレーニングデータとは、AIモデルの学習に使用される精査されたデータ群のことです。このデータは、モデルがパターンを識別したり、タスクを学習したり、予測を行ったりするのに役立ちます。モデルの性能はデータ次第であり、「ゴミを入れればゴミが出てくる(Garbage in, garbage out)」という言葉の通りです。

CASは100年以上にわたり、化学情報の権威ある情報源として、社内の科学者が世界で最も包括的な化学データコレクションを精査してきました。現在、私たちはその専門知識を拡大し、科学の進歩を支援するAIモデルの開発に取り組んでいます。お客様は、信頼性が高く一貫したデータを求めて当社を頼りにしています。私たちが構築する専門家による精査済みトレーニングデータが同様に信頼できるものであることを保証することで、一貫したパフォーマンスを維持し、お客様の期待に応えることができます。

確かな回答、ハルシネーションのない世界

AIと聞いて多くの人が真っ先に思い浮かべるのは、ソースの質次第で誤った回答を生成するチャットボットではないでしょうか。もし、その回答がすでに専門家によって精査、検証、整理されていたらどうでしょう。その場合、AIはより効率的に洞察を探求・発見するために活用でき、信頼性も高まります。

透明性

科学的な検索と発見を再定義する過程で、私たちは計画に反映させるためにお客様からのフィードバックループを取り入れてきました。そこで浮き彫りになった重要なテーマの一つが「信頼」です。AIによる新たなイノベーションは刺激的ですが、出力が再現不可能であったり、入力のわずかな変更で結果が急激に変わったり、何が行われ、どのように結果が生成されたのか説明のない「ブラックボックス」として機能したりすることが多いため、多くのAIツールが生成する科学的結果に対してユーザーは不信感を抱いています。

Maintaining user trust in our content and solutions is paramount. While we can take steps to minimize unreliability in how the LLM interfaces between the user and our data, it is inherently prone to variability. Hesitation in trying AI-enhanced features can be mitigated by being transparent about where AI is being used in the product and providing obvious alternate avenues for finding the information users are looking for.

CAS SciFinderのSearchSense

では、CAS SciFinderはどのような役割を果たすのでしょうか。一般の方々と同様に、科学研究者も膨大な情報の中から必要な情報を探し出す時間を短縮できれば大きな恩恵を受けられます。これは科学コミュニティにとって大きな非効率性です。私たちは、この負担を軽減するためにCAS SciFinderにさまざまなAI対応の検索改善機能を導入しました。これを「SearchSense」と呼び、科学的整合性を維持しながら情報発見を効率化しています。

過去12ヶ月間、CASは科学者のために科学者が開発した、最大かつ権威ある包括的で信頼性の高い科学情報検索エンジンの構築に取り組んできました。SearchSenseは、当社のクラス最高の化学コレクションとAIを組み合わせることで、正確性を損なうことなく、研究者により迅速な回答を提供します。

基本原則

CAS SciFinderへのAI導入にあたり、私たちは妥協できない基本的な基準を設けました。当社のソリューションは、以下の原則を遵守する必要があります。

  • コンテンツ提供における正確性の優先。
  • 検索応答速度の維持。
  • 顧客データの機密保持。

SearchSenseの仕組み

SearchSenseのユニークな点は、AIを使って回答を生成するのではなく、検索意図を解釈する点にあります。ユーザーのクエリの意図を理解することで、CAS SciFinderは、CASが誇る信頼性と正確性の基準に基づき、厳選された関連回答や裏付けデータへとユーザーを導きます。意図解釈の正確性は、堅牢で質の高い学習用コーパスに大きく依存します。当社の検索クエリ学習データセットは、CASの専門家が作成した1万件以上のデータポイントに基づいています。これは当社が扱うあらゆる科学分野を網羅しており、すべての領域でパフォーマンスを維持するのは困難な作業ですが、数百件のデータポイントを追加するだけでも、全体的な正確性に相乗効果が生まれることが分かりました。

モデルのアーキテクチャとパフォーマンス

学習データは、クエリの検索意図を判断するAIモデルのトレーニングに使用されました。速度と正確性は使用するモデルのサイズに依存します。一般的にパラメータ数が多いモデルほど正確ですが、特定のユースケースと質の高い学習データがあれば、小規模なモデルでも十分な正確性を実現できることが研究で示されています¹。当社では70億パラメータのモデルを採用しました。これは、1兆パラメータを超える大規模なモデルと比較すると非常に軽量です。質の高い学習データにより、この小規模なモデルでも十分な正確性を確保し、安定した検索パフォーマンスを維持することができました。

CAS SciFinderは強力な検索アルゴリズムを使用して最も関連性の高い結果を導き出しますが、これは独自に構築されたものであり、標準的なクエリ言語は使用していません。当社の検索アーキテクチャは独自仕様であるため、AIモデルをトレーニングして、システムが理解できる言語で検索を実行させる必要がありました。これにより、AIによるクエリ解釈と、独自の検索エンジンによる複雑な検索結果を融合させるという目標を達成しました。その結果、ユーザーはより少ない時間と労力で関連データにアクセスできるようになります。

データセキュリティとプライバシー

私たちは、お客様の研究が極めて機密性の高いものであることを理解しており、データの機密保持を最優先事項としています。開発したモデルはすべて独自のものであり、オンプレミスでホストされているため、データが外部に流出することはありません。CASにおけるAIの倫理的な利用に関する詳細はこちらをご覧ください。

結論

CAS SciFinderは、お客様が大切にする信頼を維持しながら、科学研究と発見の成功を支援することに尽力しています。CAS SciFinderにSearchSenseを導入したことで、私たちは強力な新技術をよりインテリジェントな方法で活用できるようになりました。専門家、最高品質のコンテンツコレクション、そしてテクノロジーが一体となり、ユーザーにさらなる価値を提供することで、科学研究開発の発展に貢献してまいります。

‍