NullSet Informatics Solutions創設者、ジェファーソン・パーカー博士との対談
創薬における計算生物学が進化を続ける中、新たな課題と機会が絶えず生まれています。シーケンス解析は、長年バイオインフォマティクスの重要な側面を担ってきました。本記事では、NullSet Informatics Solutionsの創設者であり、ライフサイエンス分野のデータ分析の専門家であるジェファーソン・パーカー博士に、創薬におけるシーケンス解析の新たな最前線について伺います。
CAS:計算生物学者として、これまで創薬においてどのような役割を担ってこられましたか?
ジェファーソン:創薬ラボの支援からトランスレーショナルリサーチグループまで、あらゆる業務に携わってきました。直近では、臨床チームと連携して運用や開発に携わりました。ファーマコビジランス(医薬品安全性監視)チームの安全性データ分析のサポート、事業開発、競合インテリジェンス業務も経験しています。また、バイオインフォマティクスアナリストとしてソフトウェアエンジニアリングチームに加わり、ウェットラボの科学者とソフトウェア開発者の間の「翻訳者」のような役割も果たしてきました。
CAS:創薬におけるシーケンス解析の役割について教えていただけますか?なぜ重要なのでしょうか?
ジェファーソン:創薬において、シーケンス解析は標的探索のスクリーニングに活用できます。トランスクリプトームレベルで何が起きているかを観察し、既存のパスウェイ知識と照らし合わせることで、「最も可能性の高い上流の原因は何か?」を問いかけることができます。それが創薬標的、あるいはシグナル伝達の観点から標的に近いものとなります。もし特定の標的に向けて薬を設計したのであれば、その標的に作用していることを確認する助けとなるはずです。
また、患者選定のためのバイオマーカーを探すことも可能です。発現レベルやDNAシーケンスレベルで、特定の遺伝子プロファイルや様々な変異が見られるでしょうか?患者が持つ特定の変異によって、薬の有効性が左右されることはないでしょうか?これは製薬業界において非常にエキサイティングで活発な分野です。治療前に「この薬は効くはずだ」あるいは「おそらく効かないだろう」と判断できることは、成功と失敗を分ける決定的な要因となり得ます。さらに、患者の貴重な時間を無駄にすることもありません。特に腫瘍学のような分野では、患者にはあまり時間が残されていません。効果のない薬で試行錯誤を繰り返し、何度も治療ラインを重ねるような時間を奪わずに済むのです。
つまり、これらすべてにシーケンス解析が関わっており、創薬プロセスのあらゆる側面に影響を与えているのです。
CAS:シーケンス解析における最大の課題は何だとお考えですか?
ジェファーソン:技術が年々進歩しているため、課題は急速に減少していると言えるでしょう。以前は非常に短いリードしか得られず、アセンブリが大きな課題でした。現在はより長いリードが得られるようになり、依然としてアセンブリは課題ではあるものの、その難易度は下がっています。
『戦争と平和』のコピーをシュレッダーにかけてしまったと想像してください。数ミリ×数センチの断片しかない状態では、本を元通りに組み立てるのは非常に困難です。しかし、断片がもっと大きく、単語の破片ではなく段落の塊であれば、物語を正しい順序で組み立てることはずっと容易になります。現在、より長いリードへの移行が進んでいるのは、まさにそういうことです。
ストレージは依然として課題です。直近の職務でも、シーケンスデータを移動させる際、最も速い方法はハードドライブにロードしてFedExの箱に入れることでした。何百ギガバイトやテラバイトものデータをインターネット経由で転送するよりも、箱に入れて送る方が速いのです。ローカルストレージの問題ではなく、大量のデータをある場所から別の場所へ転送することがボトルネックとなっています。今日では、データさえ適切な場所に届けば、シーケンスプロジェクトを実行するための計算能力を確保することは可能ですが、データをマシンまで運ぶことが依然として障壁となっています。
患者由来のサンプルも課題です。採取は苦痛を伴い、生検は侵襲的であり、病気の患者は何度もサンプルを提供したいとは思いません。採取されたサンプルは通常、ホルマリン固定パラフィン包埋(FFPE)されるため、核酸材料はある程度劣化してしまいます。こうした処理済みの組織からシーケンス用に抽出・利用する方法はありますが、シーケンスの品質はどうしても低下してしまいます。
小規模な企業にとって、技術コストが高いことも問題です。これらのマシンは非常に高価です。同様に、計算生物学者は増えてきてはいますが、どこにでもいるわけではなく、誰もが最大手で最高の環境、そして高収入を求めています。労働力は拡大していますが、依然として限られているのが現状です。
ある意味、誰もがシーケンス解析の仕事から離れようとしています。皆、次なる偉大な学習モデルを作りたいと考えているのです。焦点は数値計算やデータ解析から、高度なAIや機械学習へと移っています。誰もが新しく、注目を集める輝かしい技術に取り組みたいと考えており、それがシーケンス解析ではないのです。そのため、近い将来、この分野は課題に直面することになるでしょう。
CAS:今、シーケンス解析を行うために計算生物学者は本当に必要なのでしょうか?
Jefferson:確立され、検証され、文書化された定型的な手法を行うのであれば、必要ありません。ゼロから新しい手法を構築できる人材は不要です。さまざまなシーケンス解析装置からの入力データに対応できる、市販のソフトウェアソリューションが豊富に存在します。データを読み込み、処理したいパイプラインのアイコンをドラッグ&ドロップして実行ボタンを押すだけです。コーヒーを飲んだり、昼食をとったり、あるいは装置の規模によっては帰宅して翌朝戻ってくれば、作業は完了しています。そのような作業に私のような人間は必要ありません。ITに精通したリサーチアソシエイトであれば誰でも実行可能です。
一方で、最先端のシーケンス解析装置を扱い、これまでになかった新しい解析手法を導き出そうとするのであれば、市販のソリューションでは対応できません。その場合、生物学を理解し、入力データ、出力データ、数学、その他すべてを把握している人間が必要です。それらを統合して、存在しない新しいソリューションを構築するには、私のような、すべての要素を理解している人間が必要になります。
CAS:AIや機械学習に取り組みたいという人が増えているというお話でしたが、これらの技術はシーケンス解析の助けになるのでしょうか?
Jefferson:適切にキュレーションされたデータセットがあれば、AIや機械学習は間違いなく役立ちます。実際に、機械学習技術を応用して文献を読み込み、ナレッジグラフを構築している組織があることを知っています。ですから、AIや機械学習は確実に役割を果たすでしょう。シーケンスアセンブリそのものにAIや機械学習が役立つかと言えば、おそらく可能ですが、それは過剰な技術かもしれません。
CAS:AIといえば、タンパク質の構造をAIで予測するAlphaFoldについて、どのようにお考えですか?
Jefferson:AlphaFoldは間違いなくゲームチェンジャーです。構造解析への道のりを大幅に短縮し、コンピュータ支援による創薬などにこれまでよりもはるかに速く活用できるようになりました。出発点を得るために、必ずしもNMRや結晶構造解析を行う必要はなくなりました。結晶構造解析と同等の精度かと言えば、おそらくそうではないでしょう。実際に測定されたデータは、常にシミュレーションよりも優れています。しかし、時間という観点で見れば、今すぐ利用可能なものを手にできるのです。これは、私たちがまだ気づいていないような影響をもたらすでしょう。AlphaFoldは池に投げ込まれた石のようなもので、すでに波紋を広げていますが、それはまだ最初の波紋に過ぎないと感じています。
CAS:創薬におけるAIと機械学習の最前線はどこにあるとお考えですか?
Jefferson:空間解析です。これはシングルセル解析の次世代版とも言えるマルチオミクスです。DNA、RNA、タンパク質、メタボロミクスを取り込み、それらすべてを統合します。細胞経路や細胞間コミュニケーションとの統合も含まれます。もはや単一の細胞だけを見る時代ではありません。シングルセルとその隣接する細胞、さらにその先の細胞まで含め、それらがどのように相互作用しているかを見る。そこが向かっている先であり、すでに到達している場所でもあります。
CAS:私たちは今後、生物システムのモデルを構築できるようになると思いますか?
Jefferson:大学院生の頃に同じ質問をされていたら、人類には生物システムを記述できる数学など存在しないと答えていたでしょう。生物学は複雑な化学であり、化学は複雑な物理学、そして物理学は複雑な数学です。すべてはその基礎の上に成り立っています。物理学は数学的に解ける問題であり、膨大なデータが必要なだけです。化学も、ある程度は同じことです。しかし生物学については……かつて私は、生物システムを数学的にモデル化する能力を人類が持つことはないし、持つこともできないと信じていました。
しかし今では、おそらくその方向へ進まざるを得ないと考えています。量子コンピュータが必要になるでしょうか?おそらくそうでしょう。私の存命中に実現するかは分かりませんが、いつか人類は、生体システムの正確で信頼性の高い計算シミュレーションを手に入れることができると、今なら自信を持って言えます。その言葉は少し恐ろしくもあります。デジタルツインの分野で多くの研究が進んでいることは知っています。限定的な初期段階のシナリオではありますが、デジタルツインはすでにオンラインで臨床試験に使用されています。それが、その始まりなのです。
CAS:では、こうした新たなフロンティアを前進させるために何が必要だと思いますか?新しいアルゴリズムやフレームワークが必要なのでしょうか?それとも、すべてをうまく適合させることが重要なのでしょうか?
Jefferson:そのすべてが必要です。問題に対する新しい考え方が求められています。既存のアルゴリズムを新しい設計手法で適用したり、新しいアルゴリズムを実装したりすることになるでしょう。エピゲノミクスやDNAダイナミクスの観察、非コードRNA領域、エクソーム解析などは、単なるシーケンス解析とは異なります。それに対する考え方も異なるのです。シーケンスであることに変わりはありませんが、単なるシーケンスではないのです。問題に対するこうした異なる考え方には、異なるツールが必要になります。
CAS:もし魔法の杖を使って、シーケンス解析と創薬における問題を一つ解決できるとしたら、何を解決しますか?また、それはどのような影響をもたらすでしょうか?
Jefferson:すべてのデータを適切にアノテーションし、誰でも利用できるようにします。企業、機関、大学などが持つあらゆる独自のデータを、適切にアノテーションされ、文書化された統合ストレージプラットフォーム上に置き、誰もが自由に使えるようにするのです。そうすれば十分なデータが揃い、大きな問題を解決できるようになるからです。
JeffersonはMITで研究キャリアをスタートさせ、グラム陽性土壌細菌Rhodococcus aetherovoransにおける異物代謝を研究しました。DNAマイクロアレイ開発のためのゲノムアノテーション作業で膨大なデータに直面したことをきっかけにコンピュータの世界に入り、以来、生物学、コンピュータ科学、数学の交差点で活動しています。ノバルティスやトムソン・ロイターなど、小規模製薬企業から大手製薬企業、コンサルティング組織まで幅広く経験を積みました。その過程でペンシルベニア州立大学の応用統計学大学院修了証書とボストン大学のコンピュータサイエンス修士号を取得しました。
現在は、自身のバイオインフォマティクス・コンサルティング会社であるNullSet Informatics Solutionsを設立し、データ解析、データモデリング、技術プロジェクト管理サービスを提供しています。




