返回上一页
AI模型解读三十亿碱基的“语法”
来源:科技日报 作者:张梦然 2026-09-11
美国加州大学伯克利分校团队创建了基因组语言模型GPN-Star,可解读30亿碱基的“语法”,在识别人类遗传变异方面更快更准。该模型利用全基因组比对数据从进化中学习内容,并以远低于大型模型的计算成本完成训练。团队同步发布全基因组预测注释,供生物学家筛选优先实验的致病变异与调控元件。相关论文9日发表于《自然》杂志。
人类全基因组约30亿个碱基对中,仅1%—2%编码蛋白质,其余包含不编码的“垃圾DNA”及控制基因表达时间、位置和强度的调控序列。非编码区域与癌症、心脏病、自闭症等疾病性状相关。要对变异基因逐个开展实验不现实,GPN-Star以DNA序列为训练对象,把4种碱基A、C、G、T作为“字母”,通过模式识别学习基因组语法,预测变异致病性并标注功能性与非功能性元素。
多数基因组语言模型直接用未比对的单基因组或跨物种未比对序列训练,计算负担大。今年早些时候发布的Evo2覆盖逾10万个物种,可从零生成完整基因组,训练使用2000余块高性能NVIDIA处理器并耗时数月。GPN-Star改用以人类、小鼠、鸡、果蝇、秀丽隐杆线虫和拟南芥分别锚定的全基因组比对:算法把多物种序列与人等参照基因组对齐,突出进化中保守与变化区域。借助这种已筛选功能信号的数据,模型只需数台处理器,训练可压缩至几天甚至数小时,并减少非功能序列干扰。
人类部分使用3种以人为锚定的比对,分别对应不同进化尺度:仅其他灵长类、广义哺乳动物、更广泛的脊椎动物。研究显示,长进化尺度的比对更擅长预测蛋白质中罕见变异的影响,这类变异进化慢、跨物种保守;短进化尺度的比对更擅长预测复杂性状相关变异,例如精神分裂症风险所涉及的大量非编码突变。小鼠、鸡、果蝇、秀丽隐杆线虫与拟南芥的模型训练证明框架可迁移至其他物种。
团队表示,他们的工作目标是用生物学先验帮助模型聚焦功能元素,而非单纯扩大参数和语料。他们已发布基于模型的全基因组评分,突出可能影响性状的变异,用于优先安排致病性实验。
- 上一篇:主动防御型无人巡检系统护卫矿山安全
- 下一篇:最遥远原始星系团发现
最新资讯- 我们的“十五五”丨守护每个中国人的“药箱”,要“换
- 我国科学家破译原子核“形态密码”
- 宇宙神秘“小红点”去哪了 我国科学家有新发现
- 2026年中央本级科技支出预算增长10%——重点向
- 央企和中国科学院近年已投入超三百二十亿元开展合作
- “中国天眼”发现首例仍在演化脉冲星三体系统
- 新型电极突破电化学合成氨能效瓶颈
- 大面积钙钛矿太阳能电池光电转换效率创新高
- 借助“DNA打字机”技术——哺乳动物最大的细胞谱系
- AI企业向生物学研究链条上游延伸
- “梦想”号完成南海大洋钻探试钻任务 深海探“心”
- 田湾核电七号机组并网发电
- 打造一批“中国制造”卓著品牌 六论工信系统学习贯彻
- “人工智能+民航”迈向规模化落地
- 国务院国资委与中国科学院签署一批重大合作项目
手机版

公众号

头条号


