与 NullSet Informatics Solutions 创始人杰斐逊·帕克博士的对话

随着药物研发中计算生物学的不断推进,新的挑战与机遇层出不穷。序列分析长期以来一直是生物信息学的核心。在本文中,我们采访了 NullSet Informatics Solutions 创始人、生命科学数据分析专家杰斐逊·帕克博士,共同探讨药物研发中序列分析的新前沿。

CAS:作为一名计算生物学家,您在药物研发中担任过哪些角色?

杰斐逊:我做过各种工作,从支持药物研发实验室到服务转化研究团队都有涉及。 最近,我与临床团队合作开展运营和开发工作。我曾为药物警戒团队提供安全数据分析支持,也从事过业务开发和竞争情报工作。我甚至曾作为生物信息分析师深入软件工程团队,充当湿实验室科学家与软件开发人员之间的“翻译官”。

CAS:您能谈谈序列分析在药物研发中的作用吗?它为何如此重要?

杰斐逊:在研发阶段,序列分析可用于靶点发现筛选。 通过观察转录组层面的变化,您可以将其映射回已知的通路知识,并推断:“最可能的上游诱因是什么?”这些就是您潜在的药物靶点,或者在信号传导意义上与药物靶点接近的物质。如果您的药物是针对特定靶点设计的,那么序列分析有助于确认您是否确实击中了目标。

您还可以开始寻找患者筛选的生物标志物。是否存在特定的遗传特征,无论是在表达水平还是 DNA 序列水平(包含各种突变)上?患者体内是否存在某些突变,使其对药物的敏感性或疗效产生影响?这是制药行业中一个极其令人兴奋且活跃的领域。能够在治疗前判断药物是否有效,往往是决定成败的关键。此外,这也能避免浪费患者宝贵的时间。特别是在肿瘤学等领域,患者的时间非常有限,我们不应让他们在无效的药物治疗和反复的尝试中浪费时间。

因此,这一切都离不开序列分析。它触及了药物开发过程的每一个环节。

CAS:您认为序列分析目前面临的最大挑战是什么?

杰斐逊:我认为挑战实际上正在迅速减少,因为技术每年都在进步。 过去,我们只能处理极短的测序片段,组装难度极大。现在我们有了更长的读取片段,虽然组装仍然具有挑战性,但难度已经降低了。

想象一下,如果您把一本 《战争与和平》 扔进碎纸机。得到的纸片只有几毫米乘几厘米,要将其还原成书非常困难。但如果纸片更大、更长,包含的是一段段文字而非零碎的词汇,那么按正确顺序重组故事就会容易得多。这正是目前向长读长测序技术过渡所带来的变化。

存储仍然是一个问题。即使在我最近的工作中,我们也必须转移序列数据,而最快的方法竟然是将其存入硬盘,然后通过联邦快递寄送。与其通过互联网传输数百 GB 或 TB 的数据,不如直接寄送硬盘来得快。本地存储不是问题,问题在于将海量数据从一处传输到另一处。如今,一旦数据到位,您总能找到足够的计算能力来运行测序项目,但如何将数据传输到机器上仍然是瓶颈所在。

患者来源的样本也是一个挑战。采集过程往往伴随痛苦,活检具有侵入性,患者也不愿多次提供样本。样本采集后,通常会经过福尔马林固定和石蜡包埋处理,这会导致核酸材料在一定程度上降解。虽然有方法可以提取并利用此类样本进行测序,但序列质量难免会受到影响。

对于小型公司而言,这项技术也非常昂贵——这些设备造价高昂。同样,虽然计算生物学家越来越普遍,但他们并非随处可见,且人才往往倾向于流向规模最大、待遇最好的企业。劳动力储备虽然在增长,但仍然有限。

在某种程度上,现在没人愿意从事序列分析了。大家都想开发下一个伟大的学习模型。重点不再是数字运算和数据分析,而是转向了先进的人工智能和机器学习。每个人都想投身于那些热门、前沿的新技术,而序列分析显然不在此列。因此,这在不久的将来会成为一个挑战。

CAS:现在真的还需要计算生物学家来做序列分析吗?

Jefferson:如果你只是在进行那些标准化、成熟、经过验证且有据可查的常规方法,那么不需要。你不需要一个能“另起炉灶”的人。市面上有大量的现成软件解决方案,可以处理来自各种测序仪的输入数据。你只需将数据导入,拖放所需的流程图标,然后点击运行。接着你可以去喝杯咖啡、吃顿午饭,或者根据机器的规模,甚至可以回家休息,第二天早上回来时,工作就已经完成了。你不需要像我这样的人来做这些。任何精通技术的科研助理都能操作。

另一方面,如果你正在使用尖端的测序设备,并试图开发一种前所未有的新分析方法,那么现成的解决方案就无能为力了。在这种情况下,你需要一个既懂生物学,又了解输入输出数据、数学原理以及其他相关知识的人。为了将所有这些整合在一起,并构建出一个尚不存在的新方案,那么你就需要“我”这样的人,或者说需要一个能理解所有这些环节的人。

CAS:你提到现在人们都想利用人工智能(AI)和机器学习(ML)。这些技术对序列分析有帮助吗?

Jefferson:如果拥有高质量的数据集,AI和机器学习绝对能提供帮助。我确信有些机构正在应用机器学习技术来分析文献并构建知识图谱,这方面确实大有可为。AI和机器学习能辅助序列组装吗?或许可以,但我不知道这是否属于过度设计。

CAS:说到AI,你对AlphaFold这种利用AI预测蛋白质结构的技术有什么看法?

Jefferson:我认为AlphaFold绝对是一个颠覆性的技术。它提供了一条通往结构解析的捷径,能比以往任何时候都更快地推动计算机辅助药物设计。你不再必须依赖核磁共振(NMR)或晶体结构作为起点。它能达到晶体结构的水平吗?可能还不行。真实的测量结果永远优于模拟。但就时间而言,你现在就能获得结果。它将产生的影响可能尚未完全显现。我觉得AlphaFold就像投入池塘的一块石头,它已经产生了冲击,但这仅仅是最初形成的涟漪。

CAS:你认为AI和机器学习在药物研发领域的前沿方向是什么?

Jefferson:是空间组学,这可以看作是单细胞技术的下一代演进。即多组学。将DNA、RNA、蛋白质、代谢组学数据整合在一起,甚至将其与细胞通路和细胞间通讯相结合。这不再仅仅局限于单细胞,而是关注单细胞及其周围细胞,以及它们之间是如何相互作用的。这就是未来的方向,也是目前正在发展的领域。

CAS:你认为我们未来能够创建生物系统的模型吗?

Jefferson:如果我在读研时被问到这个问题,我会说人类还没有掌握能够描述生物系统的数学工具。生物学是复杂的化学,化学是复杂的物理,而物理是复杂的数学。一切都基于此。物理学是一个数学上可解的问题,只是需要海量的数据,化学在某种程度上也是如此。但生物学……我曾经认为我们没有,也不可能具备从数学上模拟生物系统的能力。

但现在,这很可能就是未来发展的必然方向。这需要量子计算机吗?也许吧。这可能在我有生之年无法实现,但我现在可以自信地说,在未来的某个时刻,人类将能够对生命系统进行准确、可靠的计算模拟。这个结论甚至让我感到有些恐惧。我知道目前在“数字孪生”领域已经开展了大量工作。虽然目前还处于有限的初步阶段,但数字孪生技术已经上线并应用于临床试验。这算是迈出了第一步。

CAS:那么,你认为推动这些新前沿领域发展需要什么?我们需要新的算法或框架吗?还是说仅仅需要将现有的一切整合起来?

Jefferson:这些都需要——我们需要思考问题的新方式。这可能意味着应用旧算法,但采用新的设计或实现方式。对于表观基因组学、DNA动力学研究、非编码RNA领域,或者外显子组与其他组学的对比,这些都不同于单纯的序列分析。这是另一种思考方式。它依然涉及序列,但不仅仅是序列本身。这些看待问题的不同视角将需要不同的工具。

CAS:如果你能挥动魔杖解决序列分析和药物研发中的一个问题,你会解决什么?那会产生什么影响?

Jefferson:我会让所有数据都得到良好的注释并向所有人开放。包括来自公司、机构和大学的所有专有数据……无一例外。将它们整合在一个注释完善、记录清晰的统一存储平台上,供所有人自由使用。因为那样我们就有足够的数据来解决那些重大难题了。

Jefferson的科研生涯始于麻省理工学院,当时他研究的是革兰氏阳性土壤细菌红球菌(Rhodococcus aetherovorans)的异源生物代谢。在开发DNA微阵列时,面对海量的基因组注释数据,他开始接触计算领域,并从此深耕于生物学、计算和数学的交叉地带。他的职业生涯跨越了小型制药公司、大型制药公司以及诺华(Novartis)和汤森路透(Thomson Reuters)等咨询机构。在此过程中,他获得了宾夕法尼亚州立大学的应用统计学研究生证书和波士顿大学的计算机科学硕士学位。

如今,Jefferson正通过他创立的生物信息学咨询公司NullSet Informatics Solutions开辟新路径,提供数据分析、数据建模和技术项目管理服务。

相关 CAS 洞察

CAS Insights 制药专利格局网络研讨会精选内容

白色免疫细胞正在红色组织表面攻击一个巨大的粉色癌细胞。

免疫肿瘤学领域的转化研究新进展,有望惠及那些对现有疗法无响应的患者。

深色电路板背景下,一颗包含发光橙色 DNA 双螺旋结构的医药胶囊。

CAS 洞察报告:通过专利情报解锁制药创新的未来。

获取全新视角,助您加速实现目标,直接发送至您的收件箱。