斯坦福团队首次用AI从零设计出完整功能性病毒基因组,登上《Science》
斯坦福团队用AI基因组大模型首次从零设计出16种可自主复制的全新噬菌体,部分能杀死耐药菌,开启生成式基因组设计时代。
当地时间2026年8月6日,斯坦福大学计算生物学家Brian Hie团队在《Science》发表研究,首次利用生成式AI完成完整功能性病毒基因组设计。研究团队使用此前开发的基因组语言模型Evo-1和Evo-2,以约200万种噬菌体遗传数据训练,类比大语言模型生成文本的逻辑,生成全新噬菌体基因组序列。以天然噬菌体ΦX174(仅5000余碱基对,编码11种蛋白)为参考模板,AI生成了数千套候选基因组,经生物信息学筛选后,约300组进入实验室化学合成与细胞内重建,最终得到16种有活性、可自主复制的全新噬菌体。这些序列在自然界并不存在,在DNA序列、基因组结构和适应能力方面表现出丰富多样性。实验验证显示,部分AI设计噬菌体性能与自然界同类相当,一些新型噬菌体还能克服两种对ΦX174产生耐药性的大肠杆菌菌株的抗药性,支持了AI设计病毒推进噬菌体疗法的潜力。
团队在训练数据中严格排除了动植物和人类致病病毒序列,将宿主限定为非致病性大肠杆菌。研究同时引发强烈生物安全警示:科学界呼吁加快建立AI-合成生物学监管规范,完善全流程安全审查。英国雷丁大学专家Simon Clarke指出,虽然目前无证据表明该方法可生成人类病原体,但技术本身确认了"更高效生成更适应病毒"的能力已经到来。AI仅负责输出DNA序列,DNA合成与活体测试由人类完成。这是AI首次实现全基因组尺度的功能性生物设计,从单基因/蛋白质设计跃升至完整病毒基因组,是合成生物学的里程碑突破,同时引发重大生物安全监管讨论。
一、发布背景
在此之前,全球合成生物学领域的AI设计进展长期停留在单个基因、蛋白质片段的层面,即便最简单的病毒基因组,也包含数十个基因、调控元件和复杂的相互作用网络,单个碱基的突变就可能导致整个基因组彻底失去活性,全基因组级别的从头设计始终是行业难以突破的核心瓶颈。 与此同时,全球抗生素耐药危机持续加剧,传统抗生素对超级细菌的失效速度不断加快,噬菌体疗法被公认为最具潜力的替代方案,但传统从自然界筛选噬菌体的方式耗时漫长、靶向性差,始终难以大规模落地临床。而大语言模型在DNA序列学习领域的快速成熟,让科研团队看到了突破这一瓶颈的可能性,最终在2026年完成了这项跨越性的研究。
二、核心能力与升级
| 维度 | 当前值/能力 | 上代版本/行业常规 | 变化 | 提升幅度 |
|---|---|---|---|---|
| 全基因组生成能力 | 从零生成完整噬菌体基因组,总候选量达数千个 | 行业常规AI仅能设计单个基因或局部DNA片段 | 从局部片段设计升级为全基因组端到端生成 | 设计覆盖范围从数千碱基的局部片段扩展到5.4kb级别的完整病毒基因组 |
| 活性产出效率 | 合成302个候选后得到16株有完整活性的噬菌体 | 传统合成生物学全基因组设计的活性产出率不足1% | 活性噬菌体产出率大幅提升,且生成序列完全不依赖天然模板的局部拼接 | 活性产出效率较传统方式提升数倍 |
| 耐药菌突破能力 | AI噬菌体混合制剂可快速突破对天然噬菌体耐药的大肠杆菌 | 天然噬菌体混合物无法突破该类耐药菌的防御机制 | 获得了自然界噬菌体不具备的全新耐药菌攻击路径 | 实现了天然噬菌体无法完成的耐药菌清除效果 |
| 序列原创度 | 其中一株噬菌体的外壳蛋白在全球生物数据库中无任何同源参考序列 | 传统合成病毒的所有蛋白序列均能找到天然同源参考 | 生成了一条自然界从未通过进化诞生的全新生命设计路径 | 完全跳出了自然演化的序列边界 |
三、技术原理与架构解析
1 模型架构与训练范式
| 架构维度 | 具体设计/参数 | 技术说明 |
|---|---|---|
| 基础架构类型 | 基因组大语言模型,采用与ChatGPT同源的Transformer架构 | 将文本生成的大语言模型范式迁移到DNA序列领域,把DNA碱基对视为“文字”进行序列学习 |
| 训练数据集规模 | 覆盖数百万份来自病毒、细菌、植物等生命领域的全基因组序列 | 让模型充分学习自然界DNA序列的“语法规则”,掌握基因组的进化约束规律 |
| 专项微调策略 | 训练阶段刻意排除所有感染真核生物(人类、动物、植物)的病毒数据 | 从底层数据层面限制模型的生成边界,让模型仅专注于生成感染原核生物的噬菌体基因组 |
| 宿主特异性约束 | 生成阶段加入大肠杆菌C宿主的特异性序列约束 | 确保生成的噬菌体仅靶向指定宿主,大幅降低脱靶风险 |
2 核心技术创新点
| 创新点名称 | 技术原理专业表述 | 技术依据出处 | 相较上一代的技术突破点 | 对应量化能力表现 |
|---|---|---|---|---|
| 全基因组端到端生成框架 | 以天然噬菌体Phi X-174为参考模板,通过自回归生成方式输出完整的5.4kb级噬菌体基因组序列 | 《Science》论文原文 | 突破了此前AI只能生成局部DNA片段的限制,实现了包含11个基因、7个调控元件的完整基因组生成 | 生成的数千个候选基因组全部符合噬菌体的遗传结构规律,无明显生物学矛盾 |
| 进化约束学习机制 | 模型通过海量基因组预训练,自动识别自然演化中保留的关键序列约束,避免生成致死性突变 | 《Science》论文原文 | 大幅降低了无效候选序列的占比,让后续实验室合成的成功率显著提升 | 302个人工合成的候选基因组中,最终有16株表现出完整的噬菌斑活性 |
| 异源功能蛋白组装机制 | 模型自主将进化距离极远的噬菌体的DNA包装蛋白,整合到全新的噬菌体衣壳结构中 | 《Science》论文原文 | 跳出了天然噬菌体的蛋白组合边界,生成了自然界不存在的全新病毒结构 | 该特殊噬菌体的衣壳蛋白在全球公开生物数据库中无任何同源匹配记录 |
3 技术边界与工程权衡
研究团队在设计之初就做出了明确的安全导向权衡: 主动放弃了模型生成感染人类病毒的能力,通过限制训练数据的方式,从底层降低了技术被恶意滥用的基础可能性,同时所有实验环节全部在符合生物安全标准的BSL实验室中完成,用可控的小范围实验环境,换取了全基因组设计的技术突破,避免了高风险序列的泄露风险。
四、应用场景全景
1.耐药菌感染临床治疗场景
- 目标用户/行业:三甲医院感染科、临床抗感染治疗团队
- 具体应用形式:针对患者体内的耐药超级细菌,快速定制生成对应的靶向AI噬菌体制剂,精准清除感染
- 核心价值主张:解决传统抗生素和天然噬菌体都无法应对的耐药菌感染难题,大幅降低重症感染患者的死亡率
- 落地案例/合作进展:暂无公开临床落地案例,目前处于实验室验证阶段
- 版本与准入条件:后续将通过医疗级合规版本开放,需通过严格的临床生物安全审批
2.噬菌体药物快速研发场景
- 目标用户/行业:生物医药企业、噬菌体疗法研发机构
- 具体应用形式:利用AI模型批量生成不同靶向性的噬菌体候选株,大幅缩短噬菌体药物的研发周期
- 核心价值主张:将传统噬菌体疗法数年的研发周期压缩到数月级别,降低新药研发成本
- 落地案例/合作进展:暂无公开具名合作案例,已有多家海外生物医药机构公开表达合作意向
- 版本与准入条件:通过开源版本向科研机构开放基础能力,后续推出商业级API面向药企开放
3.环境微生物治理场景
- 目标用户/行业:环保企业、工业水处理机构
- 具体应用形式:定制靶向特定有害细菌的AI噬菌体,用于工业废水、养殖水体中的有害菌消杀
- 核心价值主张:替代传统化学消杀剂,实现精准、无残留的微生物治理,避免破坏水体整体微生态
- 落地案例/合作进展:暂无公开落地案例
- 版本与准入条件:处于实验室概念验证阶段,暂无对外开放计划
4.合成生物学基础研究场景
- 目标用户/行业:高校合成生物学实验室、基础生命科学研究机构
- 具体应用形式:生成不同序列特征的噬菌体样本,用于研究生命演化的边界、病毒与宿主的相互作用机制
- 核心价值主张:为生命科学基础研究提供海量自然界不存在的全新样本,拓展人类对生命设计空间的认知边界
- 落地案例/合作进展:全球已有数十家合成生物学实验室通过开源Evo模型开展相关研究
- 版本与准入条件:Evo 2开源版本已面向全球科研人员免费开放
五、开放策略
Evo 2为完全开源项目,全球所有科研人员均可免费获取模型权重与代码,用于非商业性的科研研究。
六、行业横向对比
| 维度 | 本次成果Evo 1/Evo 2 | 竞品A 传统蛋白质设计AI模型 | 竞品B 常规DNA序列生成AI工具 |
|---|---|---|---|
| 设计覆盖范围 | 完整5.4kb级噬菌体全基因组 | 单个蛋白质氨基酸序列 | 数百碱基以内的局部DNA片段 |
| 生成序列活性率 | 合成302个样本得到16株活性噬菌体 | 生成蛋白的功能活性率约10%-20% | 生成序列大多无完整生物学功能 |
| 宿主靶向性 | 可精准指定靶向大肠杆菌C宿主 | 无宿主靶向设计能力 | 无明确宿主特异性约束 |
| 开源开放状态 | 完全开源 | 多数为学术非商用开源 | 部分开源、部分为商业付费工具 |
七、产业链影响分析
1.上游影响:
全球DNA合成服务商的订单需求将迎来爆发式增长,全基因组级别的DNA合成需求将大幅提升,推动长片段DNA合成的成本进一步快速下降,适配AI生成海量基因组序列的合成需求。
2.下游影响
整个噬菌体疗法赛道的研发范式将被彻底重构,此前依赖人工筛选天然噬菌体的传统模式将逐步被AI生成模式替代,大量专注AI噬菌体新药研发的初创企业将快速涌现,推动整个抗感染药物赛道进入新一轮创新周期。
3.生态影响
开源的Evo模型将大幅降低全基因组设计的技术门槛,全球大量中小科研团队无需顶尖算力投入,即可开展全基因组合成生物学研究,推动整个合成生物学领域的科研产出速度大幅提升。
八、已知限制
| 限制项 | 说明 |
|---|---|
| 基因组规模上限 | 目前仅能完成噬菌体级别的小型病毒基因组设计,尚无法生成感染真核生物的复杂病毒基因组 |
| 宿主范围限制 | 生成的噬菌体仅能靶向大肠杆菌C,暂不支持其他细菌宿主的定向生成 |
| 生物安全风险 | 开源模型存在被恶意使用者微调后生成危险病原体的潜在可能性,目前尚无完善的全链条监管机制 |
| 临床落地距离 | 目前所有生成噬菌体仅完成实验室层面的活性验证,距离正式进入临床应用还有大量安全审批工作需要完成 |
九、团队与下一步计划
| 项目 | 详情 | | --- | --- | | 团队核心成员 | 斯坦福大学化学工程系助理教授Brian Hie担任通讯作者,联合Arc研究所多名合成生物学、AI领域研究者共同完成 | | 下一步研究方向 | 进一步拓展模型的生成能力,支持更多不同宿主的噬菌体基因组设计,同时优化模型的安全对齐机制 | | 开放合作计划 | 联合全球科研机构开展AI噬菌体的耐药菌治疗专项研究,推动相关成果的临床转化 | 总结
- 这项研究第一次用AI证明了人类可以从零写出自然界不存在的完整“生命代码”,它既为解决全球抗生素耐药危机打开了全新的技术窗口,也给全球生物安全治理体系提出了前所未有的新课题。
- 标志着生成式AI从数字世界跨入生命科学领域,实现了从单个蛋白质设计到完整功能性基因组设计的范式跃迁。
- 为新型抗感染药物开发和合成生物学开辟新路径,也首次将"AI设计活体生物"的生物安全风险从假想变为现实,将推动全球AI-生物安全监管框架的加速构建。