Executive Summary
- 斯坦福大学和 Arc Institute 的研究人员使用基因组语言模型 Evo 1 和 Evo 2 从零开始编写了完整的噬菌体基因组,合成了近 300 个设计,并成功获得了 16 个具有活力的病毒。
- 一种人工智能设计的噬菌体混合物清除了 大肠杆菌 对天然模板噬菌体产生抗药性的菌株,这是同等数量的天然噬菌体混合物无法实现的结果。
- 目前,治疗性噬菌体的剩余障碍已不再是计算问题,而是合成与活力问题,因为随着基因组长度的增加,必须构建和筛选的设计数量增长速度远超建模成本。
人工智能已被用于辅助设计生物部件多年。蛋白质、CRISPR-Cas 复合物、转座元件、启动子以及毒素-抗毒素对均已由各种人工智能模型生成。然而,设计基因组是一个不同的问题,在此规模下的人工智能辅助设计迄今为止一直遥不可及。
最近,斯坦福大学和 Arc Institute 的研究人员 报告称已跨越了这一界限。他们利用基因组语言模型 Evo 1 和 Evo 2 生成了完整的噬菌体基因组,化学合成了近 300 个基因组,并获得了 16 个具有活力的噬菌体。
这些设计组成的混合物成功抑制了已进化出对模板噬菌体抗药性的细菌菌株。而同等数量的天然噬菌体混合物无法实现这一点。
不到 1% 的基因组研究使用了人工智能
为了将这些结果置于更广泛的背景下,我们分析了从 CAS Content Collection™ 中检索到的 11,259 份涵盖 1989 年至 2026 年间应用于基因组的人工智能/机器学习主题的文献。该文献库以预测基因组学和临床基因组学为主。真正利用人工智能设计基因组序列的研究非常罕见,仅占该文献库的 88 份,即 0.78%。
这 88 份文献的分类如下:
- CRISPR 和编辑设计 (引导 RNA 选择、脱靶和编辑结果预测)是最普遍的主题,共有 42 份文献;它也是最成熟的主题,自 2018 年以来持续有相关研究。
- 调控元件设计 (启动子、增强子、非翻译区)共计 18 篇文献。
- 生成式序列设计(指输出新核苷酸序列而非对现有序列进行评分的模型)共计 10 篇文献,是最新兴的领域,中位发表年份为 2025 年。
- 全基因组和染色体尺度设计 共计 8 篇文献。
这些数量较少,且最新的类别规模最小,因此它们反映的是活动的萌芽阶段,而非增长率。在 88 篇设计类文献中,74 篇为期刊文章,仅有 8 篇为专利:生成式基因组设计目前仍处于学术文献阶段。
“基因组语言模型”有多少?
然而,基因组语言模型是一个拥挤的领域。一项 2026 年的系统综述 筛选了 469 条记录,确定了 58 项模型开发研究。大多数是编码器——输入序列,输出评分或嵌入向量——它们在语料库中占据主导地位。DNABERT 和 DNABERT-2 出现在 34 篇文献中,Enformer 出现在 13 篇中,Caduceus 出现在 5 篇中,HyenaDNA 和 Nucleotide Transformer 各出现在 4 篇中。然而,这些文献中只有 3 篇属于我们核实的基因组设计集。 AlphaGenome是此类模型中近期最强大的,它能读取多达一百万个碱基并预测调控后果,但不会编写序列。
除了已发表的模型外,还有一些正在开发中且能生成序列的模型,它们仅以预印本形式提供,并公开了代码和权重(见表 1)。
表 1. 可进行基因组设计的基因组大语言模型列表
商业活动目前处于该主题的边缘,而非核心。
- Profluent 报告称其完全利用人工智能设计出一种 CRISPR 系统,并已宣布与礼来公司(Eli Lilly)建立合作伙伴关系,旨在 开发用于基因药物的人工智能设计重组酶。
- Dyno Therapeutics 致力于设计用于基因递送的 AAV 衣壳,并已将其授权给 安斯泰来(Astellas) 和 罗氏(Roche)。
- Ginkgo Bioworks 和 Basecamp Research 提供的是训练数据,而非模型。
- NVIDIA 与 Arc Institute 共同开发并发布了 Evo 2。
- 非营利组织 Tatta Bio 发布了混合模态模型 gLM2。
旨在设计基因组本身的程序仍然很少,迄今为止,基因组规模的研究主要来自非营利组织和学术团体及其计算合作伙伴(这与我们语料库中的专利情况一致)。
在这一群体中,Evo 拥有更长的记录和更大的上下文窗口。 Evo 1 已经生成了功能性的 CRISPR-Cas 和转座子系统,以及具有合理基因组架构的兆碱基规模序列,而 Evo 2 则能在 100 万个 token 的窗口内实现单核苷酸分辨率的读取和写入。这种上下文窗口是决定性的属性:一个 5.4 kb 的噬菌体基因组可以完整地放入其中,因此该模型能够同时掌握基因顺序、调控位点和包装信号,而不是通过独立评分的片段来组装基因组。以噬菌体为主的预训练也至关重要,超过 200 万个噬菌体基因组的训练使目标处于模型所学分布的范围内。
这些模型被要求执行什么任务?
模板是 ΦX174:一种小型裂解性 微小噬菌体科(Microviridae)成员其 5.4 kb 的基因组包含 11 个基因和至少 7 个调控元件。其紧凑的结构、数十年的表征研究以及无害的实验室宿主,使其成为一个异常安全的试验场。两个模型均在约 15,000 条 Microviridae 序列上进行了微调,之后才进入合成阶段。
将人工智能作为六阶段流程中的一步
原始生成并未产生可行的基因组。这次尝试与失败尝试之间的区别,很大程度上在于模型周围的配套机制。作者描述了一个 六阶段流程:
- 预训练
- 在 Microviridae
- 使用 ΦX174 序列进行提示工程
- 通过评估基因组结构和预测宿主范围的独立模型进行推理时引导
- 计算过滤
- 实验验证。
仅靠提示是不够的:基础模型在任何提示长度下都无法恢复 ΦX174,而微调后的版本则可以做到。
过滤是大多数候选序列被淘汰的环节,分为三个层级:基本序列质量、对目标宿主的特异性,以及与天然序列的差异度。质量控制要求长度在 4 到 6 kb 之间,GC 含量在 30% 到 65% 之间,且不存在超过 10 个碱基的同聚物。更严苛的检查是生物学层面的,这也是结构和功能预测进入设计循环而非仅用于撰写报告的环节。生成的蛋白质通过 ESMFold 进行折叠,其平均 pLDDT 分数与天然蛋白质相当,且优于乱序对照组,这证明了这些序列编码的是可折叠的蛋白质,而非仅仅是看起来合理的核苷酸串。基因组由病毒分类器 geNomad 进行评分,其预测的蛋白质与 OpenGenome 和 PHROGs 数据库进行了比对,尽管与已知序列的同一性较低,但仍返回了符合预期的功能注释分布。
六种广泛使用的基因注释工具中,没有一种能注释出野生型 ΦX174 的全部 11 个基因,因为该基因组重叠的阅读框使标准的开放阅读框预测失效,因此团队构建了一个定制的编码序列预测器。没有它,就无法确认生成的基因组是否携带完整的基因集——这相当于一种没有过滤器的“生成与过滤”策略。
AlphaFold 3 也发挥了作用,但处于设计流程的下游:用于预测 Evo-Φ36 衣壳中异常 J 蛋白的取向,并将与抗性相关的突变置于病毒体外部。结构预测发挥了双重作用:既是设计过程中的过滤器,也是事后的解释工具。
在 302 个收录的设计中,有 285 个成功合成并组装。其余的因合成复杂性而失败。其中 16 个抑制了 大肠杆菌 C - Evo 1 的 227 个序列中有 12 个(5.3%),Evo 2 的 58 个序列中有 4 个(6.9%)。生存能力与序列与天然基因组的相似度相关,在最接近的设计中达到了 46.2%:模型偏离进化采样范围越远,失败的频率就越高。
这是真正进步的三个原因
- 1. 规模。 该领域之前所有的生成式成功案例都仅限于局部。这是一个完整的、可自我复制的基因组,其组件必须在活体宿主中协同工作,并通过端到端的框架实现,而非单一的幸运构建体。
- 这些设计并非模板的重组。Evo-Φ36(285 个合成的 AI 设计噬菌体之一)的冷冻电子显微镜成像显示,在 2.9 Å 分辨率下,该设计噬菌体携带了一个截短的 DNA 包装蛋白 J,来源于 大肠杆菌 噬菌体 G4,一个远亲(用 25 个残基代替了 38 个)。该交换在野生型 ΦX174 中曾被报道为不可行。模型构建了一个环境,使得原本不兼容的部件能够发挥功能,这是该模型内化了上位性约束而非仅仅记忆序列的最有力证据。
- 这些设计具有真正的创新性 包含无天然对应物的突变、趋异基因、改变的调控序列以及可变的基因组长度。编辑集中在启动子 A、基因 J 和终止子 J:即调控和结构控制点。
超越细菌抗性

Questions and answers
问:什么是噬菌体?
答:噬菌体是一种感染并杀死细菌的病毒。噬菌体是地球上数量最多的生物实体,每种噬菌体通常只针对特定范围的细菌宿主。这种特异性使其成为抗生素的理想替代品,因为噬菌体可以在消除有害菌株的同时,不伤害有益细菌。本研究使用的模板是 ΦX174,这是一种小型、特征明确的噬菌体,拥有 5.4 kb 的基因组和无害的实验室宿主,这使其成为 AI 设计基因组的安全起点。
问:什么是基因组语言模型?
答:基因组语言模型将文本 AI 背后的架构应用于 DNA,像语言模型学习散文模式一样学习遗传序列中的模式。大多数现有模型是编码器,用于读取序列并返回评分或预测。更为罕见的生成式模型则直接编写新序列。本研究中使用的 Evo 2 模型能够以单核苷酸分辨率读取和写入长达 100 万个 token 的窗口,其宽度足以容纳整个小型基因组。这种上下文环境使模型能够同时兼顾基因顺序、调控和包装信号。
问:AI 是如何编写病毒基因组的?
仅靠原始生成无法产生可用的基因组。研究人员围绕该模型构建了一个六阶段流程:在超过 200 万个噬菌体基因组上进行预训练,在约 15,000 个模板近亲上进行微调,使用 ΦX174 序列进行提示,通过评估基因组结构的独立模型进行引导,以及进行计算过滤和实验验证。大多数候选方案未能通过检查序列质量、宿主特异性以及与天然基因组距离的过滤层。在合成的近 300 个设计中,有 16 个产生了可存活的病毒。存活率与序列对天然序列的接近程度相关,在最接近的设计中达到了 46.2%。
问:为什么要利用人工智能来针对耐药菌?
答:抗菌素耐药性是世界卫生组织认定的全球最严重的健康威胁之一,噬菌体疗法作为一种可能的解决方案已重新引起人们的关注。其主要局限在于体内表现不佳,以及细菌能够对噬菌体本身产生耐药性。人工智能基因组设计为解决第二个问题提供了途径。在这项工作中,一种由人工智能设计的噬菌体混合物清除了已经对天然模板噬菌体产生耐药性的大肠杆菌菌株,而同类的天然混合物却无法做到这一点,这表明生成式设计能够产生与细菌耐药性同步进化的噬菌体。





