⚡ 前沿动态

津渡生科发布生命科学垂类大模型GeneLLM,被称为"中国版生物DeepSeek"

🕐 2026.08.05 星期三 来源 · 专刊 🔥 3 次点击

牛津归国团队发布GeneLLM,全球首个直接使用多组学原始数据预训练的生命科学大模型,已在Nature Communications与Advanced Science发表。

由四位牛津归国学者创立的津渡生科发布生命科学垂类大模型GeneLLM,被称为"中国版生物DeepSeek"。该模型是直接使用基因组学、蛋白质组学等原始数据进行预训练的生命科学大模型,可在低算力环境下高效处理基因组、转录组、蛋白质组等多维度生物数据,覆盖基础研究、医学诊断、药物研发等多个场景。已在Nature Communications与Advanced Science发表。 GeneLLM能直接从DNA、RNA、蛋白质、代谢物等分子层面"读取"生命信息,不再依赖文本或图像数据。其应用场景包括癌症靶点发现、遗传病根源修正、CRISPR基因编辑疗法设计、罕见病新药加速等。该成果被认为填补了中國在生命科学基础大模型领域的空白,是继谷歌AlphaFold、斯坦福EVO2之后的又一里程碑。

一、发布背景

此前生物科学领域的AI模型普遍存在算力需求高、普适性不足、复杂生物数据处理鲁棒性差的痛点,传统通用大模型无法适配PB级多组学数据的计算需求,行业长期缺乏轻量化、可落地的垂类科学大模型方案。

二、核心升级

1.传统行业方案

用大模型处理生物数据时,内存需求常超过1T,训练和推理成本高昂,且多数模型仅能针对单一特定任务设计,跨场景适配能力弱。

2.参数量优化升级

核心版本GeneLLM™参数量低至1.5B,通过底层架构创新大幅降低算力与存储需求,可在普通云平台和台式推理一体机上高效运行。

3.小样本适配升级

仅需低至百例的疾病相关数据,即可完成单个疾病分析任务的微调,大幅降低科研数据门槛。

4.多模态处理升级

配套Bioford™平台集成上百个生物模型,通过自适应学习技术,可稳定处理多组学异质性数据,算法鲁棒性显著提升。

三、技术原理

GeneLLM™从硬件、算法、架构、优化、数据五个维度完成全链路创新,通过智能资源调度技术压缩算力冗余,同时采用高效模型压缩技术保留核心生物特征,最终实现轻量化部署。 该方案能在当下落地,一方面依托近年垂类大模型的轻量化架构突破,解决了生物数据高维度、高复杂度带来的算力浪费问题;另一方面行业积累的大规模多组学公开数据集,为模型从原始测序数据自主学习生命规律提供了充足的训练基础。

四、应用场景

1. 临床基因诊断

适配中小型医疗机构的罕见病、肿瘤基因检测场景,解决传统基因诊断算力成本高、样本量不足难以建模的痛点,降低精准医疗落地门槛。

2. 新药研发

支持药物靶点筛选、分子动力学模拟等计算密集型任务,将传统数月的实验设计周期压缩至一周。

3. 基础生物研究

面向高校和科研院所,提供跨组学数据整合分析能力,支持RNA三维结构预测、宏基因组分析等前沿研究任务。

GeneLLM™通过全链路的轻量化创新,打破了生物大模型高算力、高成本的落地壁垒,为国内生命科学领域的AI普惠提供了可落地的国产方案。标志中国在生命科学基础大模型领域实现从跟跑到并跑;多组学预训练方法为理解生命系统复杂关联、攻克疑难疾病提供了新的AI基础设施。

← 返回 [前沿动态]