执行摘要
- 斯坦福大学和 Arc 研究所的研究人员利用基因组语言模型 Evo 1 和 Evo 2 从零开始编写了完整的噬菌体基因组,合成了近 300 个设计,并成功获得了 16 种具有活性的病毒。
- 由人工智能设计的噬菌体组成的混合物清除了 大肠杆菌 菌株,这些菌株已对天然模板噬菌体产生了抗性,而同等规模的天然噬菌体混合物无法达到这一效果。
- 目前,治疗性噬菌体面临的剩余障碍已不再主要是计算问题,而是合成与活性问题,因为随着基因组长度的增加,需要构建和筛选的设计数量增长速度远超建模成本。
人工智能辅助生物部件设计已应用多年。蛋白质、CRISPR-Cas 复合物、转座元件、启动子以及毒素-抗毒素对等均已由各种人工智能模型生成。然而,设计基因组是另一个层面的难题,在此规模下的人工智能辅助设计此前一直难以实现。
近期,斯坦福大学和 Arc 研究所的研究人员 报告称已跨越这一界限。他们利用基因组语言模型 Evo 1 和 Evo 2 生成了完整的噬菌体基因组,化学合成了近 300 个基因组,并成功获得了 16 种具有活性的噬菌体。
这些设计组成的混合物成功抑制了已对模板噬菌体产生抗性的细菌菌株。而同等规模的天然噬菌体混合物无法做到这一点。
不到 1% 的基因组研究使用了人工智能
为了将这些结果置于更广阔的背景下,我们分析了从 CAS Content Collection™ 中检索到的 11,259 份涵盖 1989 年至 2026 年间人工智能/机器学习在基因组领域应用主题的文献。该语料库以预测基因组学和临床基因组学为主。真正利用人工智能设计基因组序列的研究非常罕见,仅占该语料库的 88 份文献,即 0.78%。
这 88 份文献的分类如下:
- CRISPR 和编辑设计(向导 RNA 选择、脱靶及编辑结果预测)是最普遍的主题,共有 42 份文献;这也是最成熟的领域,自 2018 年以来持续有相关研究。
- 调控元件设计(启动子、增强子、非翻译区)占 18 份文献。
- 生成式序列设计(指生成新核苷酸序列而非对现有序列进行评分的模型)占 10 份文献,是最新兴的领域,出版年份中位数为 2025 年。
- 全基因组和染色体规模设计仅占 8 份文献。
这些数字很小,且最新的类别规模最小,因此它们表明了活动的起点,而非增长率。在 88 份设计文献中,74 份是期刊文章,只有 8 份是专利:生成式基因组设计目前仍处于学术文献阶段。
目前有多少种“基因组语言模型”?
然而,基因组语言模型领域已十分拥挤。一项2026年的系统性综述筛选了469条记录,并确定了58项模型开发研究。其中大多数是编码器——输入序列,输出评分或嵌入向量。这类模型在语料库中占据主导地位。DNABERT和DNABERT-2出现在34篇文献中,Enformer出现在13篇中,Caduceus出现在5篇中,HyenaDNA和Nucleotide Transformer各出现在4篇中。然而,这些文献中只有三篇属于我们核实的基因组设计集。AlphaGenome是该类型中近期最强大的模型,它能读取长达一百万个碱基并预测调控后果,但无法编写序列。
除了已发表的模型外,还有少数处于开发阶段的序列生成模型,仅以预印本形式提供,并公开了代码和权重(见表1)。
表1。具备基因组设计能力的基因组大语言模型列表
目前的商业活动主要围绕该主题的边缘展开,而非处于核心地位。
- Profluent公司报告称已完全利用人工智能设计出一种CRISPR系统,并宣布与礼来公司(Eli Lilly)在用于基因药物的人工智能设计重组酶方面达成合作。
- Dyno Therapeutics公司设计用于基因递送的AAV衣壳,并已将其授权给安斯泰来(Astellas)和罗氏(Roche)。
- Ginkgo Bioworks和Basecamp Research提供的是训练数据,而非模型。
- NVIDIA与Arc Institute共同开发并发布了Evo 2。
- 非营利组织Tatta Bio发布了混合模态模型gLM2。
旨在设计基因组本身的计划仍然稀缺,迄今为止的基因组规模工作主要来自非营利组织和学术团体及其计算合作伙伴(这与我们语料库中的专利情况一致)。
在该群体中,Evo拥有更长的记录和更大的上下文窗口。Evo 1已经生成了功能性的CRISPR-Cas和转座子系统,以及具有合理基因组架构的兆碱基规模序列,而Evo 2能够在100万个token的窗口内实现单核苷酸分辨率的读取和写入。这种上下文窗口是决定性的特性:一个5.4千碱基的噬菌体基因组可以完整地放入其中,因此模型能够同时掌握基因顺序、调控位点和包装信号,而不是通过独立评分的片段来组装基因组。以噬菌体为主的预训练也至关重要,模型学习了超过200万个噬菌体基因组,从而将目标置于模型所学习的分布之内。
这些模型被要求执行什么任务?
The template was ΦX174: a small lytic member of the Microviridae, whose 5.4-kilobase genome carries 11 genes and at least seven regulatory elements. Compactness, decades of characterization, and a harmless laboratory host made it an unusually safe proving ground. Both models were fine-tuned on approximately 15,000 Microviridae sequences before any candidate went to synthesis.
作为六阶段流程中的一个环节
原始生成并未产生可行的基因组。这次尝试与失败尝试之间的区别主要在于模型周围的配套措施。作者描述了一个六阶段流程:
- 预训练
- 在微病毒科上的监督微调
- 使用ΦX174序列进行提示工程
- 通过对基因组架构进行评分和预测宿主范围的独立模型进行推理时引导
- 计算过滤
- 实验验证
仅靠提示词(Prompting)是不够的:无论提示词长度如何,基础模型都无法恢复 ΦX174 噬菌体,而经过微调的版本则做到了这一点。
筛选是大多数候选序列被淘汰的环节,主要分为三个层面:基础序列质量、对目标宿主的特异性,以及与天然序列的差异度。质量控制要求序列长度在 4 到 6 千碱基之间,GC 含量在 30% 到 65% 之间,且不存在超过 10 个碱基的同聚物。更严苛的检查在于生物学层面,这也是结构与功能预测介入设计循环而非仅用于后期总结的环节。生成的蛋白质通过 ESMFold 进行折叠,其平均 pLDDT 分数与天然蛋白质相当,且优于随机对照组,这证明了这些序列编码的是可折叠的蛋白质,而非看似合理的核苷酸串。基因组通过病毒分类器 geNomad 进行评分,其预测的蛋白质与 OpenGenome 和 PHROGs 数据库进行比对,尽管与已知序列的同一性较低,但仍呈现出符合预期的功能注释分布。
现有的六种主流基因注释工具均无法注释野生型 ΦX174 的全部 11 个基因,因为该基因组重叠的阅读框使标准的开放阅读框预测失效,因此团队专门构建了一个定制的编码序列预测器。没有它,就无法确认生成的基因组是否携带完整的基因集——这相当于一种没有过滤机制的“生成与过滤”策略。
AlphaFold 3 也参与其中,但处于设计流程的下游:用于预测 Evo-Φ36 衣壳中异常 J 蛋白的取向,并将耐药性相关突变定位在病毒体外部。结构预测发挥了双重作用:既是设计过程中的过滤器,也是事后的解释工具。
在 302 个精选设计中,285 个成功完成合成与组装。其余的因合成复杂性而失败。有 16 个设计抑制了 大肠杆菌 C (Escherichia coli C) 的生长——其中 Evo 1 的 227 个序列中有 12 个(5.3%),Evo 2 的 58 个序列中有 4 个(6.9%)。存活率与序列对天然基因组的相似度呈正相关,在最接近天然的设计中达到了 46.2%:模型偏离进化采样范围越远,失败率就越高。
这项研究取得实质性进展的三个原因
- 规模。 此前该领域所有生成式成功案例仅限于单一组件。而这是一个完整的、可自我复制的基因组,其组件必须在活体宿主中协同工作,且是通过端到端的框架实现,而非依靠单一的幸运构建。
- 这些设计并非模板的简单重组。对 Evo-Φ36(285 个合成的 AI 设计噬菌体之一)进行的 2.9 Å 分辨率冷冻电镜分析显示,该设计噬菌体携带了来自 大肠杆菌 G4 噬菌体的截短型 DNA 包装蛋白 J(由 25 个残基代替了原有的 38 个)。此前有报道称,这种替换在野生型 ΦX174 中是不可行的。模型构建了一个环境,使得原本不兼容的组件能够发挥功能,这是模型内化了上位性约束而非仅仅记忆序列的最有力证据。
- 这些设计具有真正的创新性。 包含无天然对应物的突变、发散基因、改变的调控序列以及可变的基因组长度。编辑主要集中在启动子 A、基因 J 和终止子 J:这些都是调控和结构的关键控制点。
超越细菌耐药性

噬菌体疗法 随着抗菌药物耐药性问题的加剧而持续受到关注,但仍受限于体内疗效不佳以及细菌对噬菌体产生耐药性的问题。世界卫生组织 将抗菌药物耐药性 (AMR) 列为 全球健康威胁 之一。
值得注意的是,King 等人报道的 AI 设计噬菌体混合物对 ΦX174 耐药的 大肠杆菌 菌株有效,而类似的天然 ΦX174 样噬菌体混合物则无效。
通往临床的距离
临床转化仍处于早期阶段,ClinicalTrials.gov 上列出的涉及噬菌体药物的干预性研究约为 96 项(截至 2026 年 8 月 12 日),其中近一半处于招募、进行中或尚未开始阶段。在报告了阶段的试验中,以 1 期和 2 期为主(71 项中的 62 项)。目标包括囊性纤维化中的 铜绿假单胞菌、尿路感染、糖尿病足溃疡和人工关节感染。工程化噬菌体已进入临床:SNIPR001 正处于 1b/2a 期研究(NCT06938867)中,用于治疗携带氟喹诺酮耐药 大肠杆菌 的造血干细胞移植患者。
在此规模下进行设计的挑战
这些设计出的噬菌体是在 大肠杆菌 C 中进行测试的,这是一种无害的实验室菌株,而非临床病原体。针对 克雷伯氏菌 或 铜绿假单胞菌 的噬菌体通常长达 40 到 100 千碱基,比此处使用的 5.4 千碱基模板大一个数量级,作者认为合成和组装如此大规模 DNA 的成本是设计它们的主要障碍。任何生物药物面临的常见难题(生产一致性、免疫原性、内毒素控制)并不会因基因组由 AI 设计而改变。
计算能力显然是人们预期的瓶颈,但在这里并非如此。Evo 不使用计算成本随序列长度平方增长的标准 Transformer 架构。相反,其成本增长接近 线性,因此 100 千碱基的噬菌体,甚至 4.6 兆碱基的细菌基因组,都是可控的升级。上下文长度在此处也未被拉伸:模型一次读取 8 千碱基,这足以覆盖它们正在编写的基因组。3.1 吉碱基的人类基因组则是另一回事,需要架构上的改进。真正难以扩展的是生存能力。在成功合成的 285 个基因组中,只有 16 个产生了有效的噬菌体(5.6%),且仅在最接近天然序列的设计中,这一比例才上升至 46.2%。任何位置的单一突变都可能导致基因组失效,而每增加一个千碱基,都会引入需要保持正确且相互兼容的基因、调控元件和包装信号。由此推断,随基因组长度增加而急剧增长的负担是实验性的,而非计算性的。为了获得一个有效的噬菌体,必须构建和筛选的设计数量,其增长速度远超编写它们所需的计算量。
训练数据的可用性设定了第二个限制。该结果基于预训练中超过 200 万个噬菌体基因组,以及微调中约 15,000 个与模板亲缘关系密切的序列,因此目标序列完全处于模型已学习的分布范围内。对于针对特定临床分离株的定制 100 千碱基噬菌体,这种近缘序列的密度是无法获得的;而对于真核生物基因组,问题性质则发生了变化。其功能取决于染色质状态、剪接和初级序列无法完全决定的长程调控。湿实验室的先例发人深省。2010 年,一个 1.08 兆碱基的 细菌基因组被化学合成 并移植成功,2016 年又出现了 最小化版本,然而一个完全 整合的合成酵母菌株 在经过约二十年后仍未完成。赋能 方法 正在 进步,但目前还没有哪种方法能提供在噬菌体规模下实现 285 个设计筛选所需的通量。
作者还建议在每个阶段都引入安全专家参与,随着研究目标从无害的实验室噬菌体转向临床病原体,这一建议显得愈发重要。
研究结果明确且扎实:在给定特征明确的模板前提下,语言模型编写的基因组不仅能转化为功能性病毒,在克服细菌耐药性方面也优于天然病毒。纵观相关文献,这是该领域的一个重要里程碑。该领域多年来致力于完善引导RNA的选择,直到最近才开始直接编写序列。如今,将噬菌体扩展至治疗用途,既是合成与安全问题,也是建模问题。
常见问题解答
问:什么是噬菌体?
答:噬菌体是一种感染并杀死细菌的病毒。噬菌体是地球上数量最多的生物实体,每种噬菌体通常只针对特定范围的细菌宿主。这种特异性使其成为抗生素的理想替代品,因为噬菌体可以在清除有害菌株的同时,不伤害有益菌。本研究使用的模板是ΦX174,这是一种小型且特征明确的噬菌体,拥有5.4千碱基对的基因组和无害的实验室宿主,是AI设计基因组的安全起点。
问:什么是基因组语言模型?
答:基因组语言模型将文本AI背后的架构应用于DNA,像语言模型学习散文模式一样学习遗传序列的模式。大多数现有模型是编码器,用于读取序列并返回评分或预测。更为罕见的生成式模型则可以直接编写新序列。本研究中使用的Evo 2模型,能够以单核苷酸分辨率读取和编写长达100万个标记的序列,足以容纳整个小型基因组。这种上下文感知能力使模型能够同时兼顾基因顺序、调控和包装信号。
问:AI是如何编写病毒基因组的?
答:仅靠原始生成无法产生功能性基因组。研究人员围绕该模型构建了一个六阶段流程:在超过200万个噬菌体基因组上进行预训练,在约1.5万个模板近亲上进行微调,利用ΦX174序列进行提示,通过评估基因组架构的独立模型进行引导,以及进行计算筛选和实验验证。大多数候选序列在检查序列质量、宿主特异性和与天然基因组距离的筛选环节中被淘汰。在合成的近300个设计中,有16个产生了存活病毒。存活率与序列对天然序列的接近程度相关,最接近的设计存活率达到46.2%。
问:为什么要利用AI来对抗耐药菌?
答:抗菌药物耐药性是世界卫生组织认定的全球重大健康威胁之一,噬菌体疗法作为一种潜在解决方案重新受到关注。其主要局限在于体内表现不佳,以及细菌对噬菌体本身产生耐药性的能力。AI基因组设计为解决后一个问题提供了途径。在本研究中,由AI设计的噬菌体混合物成功清除了已对天然模板噬菌体产生耐药性的大肠杆菌菌株,而同等规模的天然噬菌体混合物则无法做到,这表明生成式设计能够产生与细菌耐药性演变同步的噬菌体。





