在人类基因组里,编码蛋白质的片段只占一小部分。大量序列参与调节:基因在什么细胞、什么时间、以多大强度被读取。
这也是许多遗传变异难以解释的原因。一个碱基改变了,我们知道它在哪里,却未必知道它会影响哪个基因。2026 年发表的 AlphaGenome 研究,试图从很长的 DNA 序列直接预测多种调控信号,为这种追问提供一张计算地图。
它预测的是什么?
模型可以处理长达约一百万碱基的序列,并输出细胞特异的多种预测:哪些区域更容易被读取、转录信号可能怎样变化、剪接可能受到什么影响。研究者还可以对比改变某个碱基前后的预测差异,筛选值得进一步实验的变异。
这种能力有价值,因为调控作用常常跨越很长的 DNA 距离。只看变异附近几个字母,容易错过较远处的关联。
一张预测地图不是诊断书
基准测试衡量模型在已定义任务上的表现。它无法自动证明:在某位患者的某种细胞中,同一变异就一定产生同样的生物效应。训练数据覆盖不足的细胞状态、复杂环境和多个变异之间的相互作用,仍会让预测失准。
更重要的是,模型输出常是分子层面的信号。要走到疾病机制,还需要实验确认、对照分析和临床证据。预测值得检验什么与已经知道发生了什么,是两种不同的知识。
最好的计算工具,不是替实验写下结论,而是帮实验找到更有价值的问题。
为什么仍值得关注?
过去研究者面对海量非编码变异,往往不知道从哪里开始。多任务模型若能稳定地缩小搜索范围,就可能改变实验设计的效率。接下来需要观察的是:独立实验室能否复现预测,在不同细胞和人群中是否可靠,以及模型错误是否会系统性地偏向某些变异。
基因组的“空白地带”正在变得可读,但读懂它,仍是一场计算与实验之间的往返。
我们知道什么,仍不知道什么
- 证据状态
- 模型在多项基因组预测任务的基准测试中表现突出;对真实个体疾病风险的判断仍需独立验证。
- 主要依据
- 发表于 Nature 的模型描述、跨任务基准评估与变异效应预测。
- 需要保留的边界
- 计算预测受训练数据、细胞类型和任务定义限制;相关性不等于生物因果关系。