在人类基因组里,编码蛋白质的片段只占一小部分。大量序列参与调节:基因在什么细胞、什么时间、以多大强度被读取。

这也是许多遗传变异难以解释的原因。一个碱基改变了,我们知道它在哪里,却未必知道它会影响哪个基因。2026 年发表的 AlphaGenome 研究,试图从很长的 DNA 序列直接预测多种调控信号,为这种追问提供一张计算地图。

它预测的是什么?

模型可以处理长达约一百万碱基的序列,并输出细胞特异的多种预测:哪些区域更容易被读取、转录信号可能怎样变化、剪接可能受到什么影响。研究者还可以对比改变某个碱基前后的预测差异,筛选值得进一步实验的变异。

这种能力有价值,因为调控作用常常跨越很长的 DNA 距离。只看变异附近几个字母,容易错过较远处的关联。

一张预测地图不是诊断书

基准测试衡量模型在已定义任务上的表现。它无法自动证明:在某位患者的某种细胞中,同一变异就一定产生同样的生物效应。训练数据覆盖不足的细胞状态、复杂环境和多个变异之间的相互作用,仍会让预测失准。

更重要的是,模型输出常是分子层面的信号。要走到疾病机制,还需要实验确认、对照分析和临床证据。预测值得检验什么与已经知道发生了什么,是两种不同的知识。

最好的计算工具,不是替实验写下结论,而是帮实验找到更有价值的问题。

为什么仍值得关注?

过去研究者面对海量非编码变异,往往不知道从哪里开始。多任务模型若能稳定地缩小搜索范围,就可能改变实验设计的效率。接下来需要观察的是:独立实验室能否复现预测,在不同细胞和人群中是否可靠,以及模型错误是否会系统性地偏向某些变异。

基因组的“空白地带”正在变得可读,但读懂它,仍是一场计算与实验之间的往返。

THE EVIDENCE CARD

我们知道什么,仍不知道什么

证据状态
模型在多项基因组预测任务的基准测试中表现突出;对真实个体疾病风险的判断仍需独立验证。
主要依据
发表于 Nature 的模型描述、跨任务基准评估与变异效应预测。
需要保留的边界
计算预测受训练数据、细胞类型和任务定义限制;相关性不等于生物因果关系。

原始来源.

02
AlphaGenome: AI for better understanding the genome Google DeepMind · 模型范围与使用边界