模型与研究

AlphaGenome Atlas:谷歌用 AI 绘制人类 DNA 变异影响图谱

谷歌 DeepMind 推出 AlphaGenome Atlas,对约 90 亿种单核苷酸变异的分子影响进行预计算并公开查询门户,辅以 AVI 优先级评分以帮助研究人员筛选候选变异,但并非临床诊断工具。该资源旨在把变异与基因调控、RNA 剪接和蛋白质生成等功能联系起来,缩小实验验证范围,同时强调模型局限性与需结合实验证据的重要性。

AlphaGenome Atlas:谷歌用 AI 绘制人类 DNA 变异影响图谱

谷歌 DeepMind 推出 AlphaGenome Atlas,对约 90 亿种单核苷酸变异的分子影响进行预计算并公开查询门户,辅以 AVI 优先级评分以帮助研究人员筛选候选变异,但并非临床诊断工具。该资源旨在把变异与基因调控、RNA 剪接和蛋白质生成等功能联系起来,缩小实验验证范围,同时强调模型局限性与需结合实验证据的重要性。

谷歌 DeepMind 发布 AlphaGenome Atlas,试图把人类基因组中数十亿个单字母变异对分子生物学的潜在影响,整理成一个可供研究人员查询的高分辨率数据库。

这项工作并不是在重新测序人类基因组,而是利用 AlphaGenome 模型,对人类基因组中约 90 亿种可能的单核苷酸变异进行预计算,预测它们可能如何影响基因调控、RNA 剪接和蛋白质生成等过程。谷歌称,AlphaGenome Atlas 现已通过网页门户开放,研究人员不需要编程即可使用。

从“基因是什么”转向“变异会改变什么”

人类基因组包含约 30 亿个 DNA 碱基对,但其中只有约 2% 的区域直接编码蛋白质。其余大部分被称为非编码区域,虽然不直接生成蛋白质,却参与调节基因何时、何地以及以多大程度被表达。

长期以来,科学家可以较容易地识别 DNA 序列上的差异,却很难判断一个位点的变化是否真的会改变细胞活动,更难在大规模范围内逐一验证。谷歌 DeepMind 在 AlphaGenome 的模型介绍 中表示,AlphaGenome 的目标正是预测单个 DNA 变异对多种基因调控过程的影响。

AlphaGenome 最多可以读取约 100 万个碱基对的 DNA 序列,并对基因表达、RNA 剪接、染色质特征和 DNA 接触图等多种分子特征作出预测。对于大多数输出,它可以达到单碱基分辨率。模型的训练数据来自 ENCODE、GTEx、4D Nucleome 和 FANTOM5 等公共研究项目。

在模型发布时,DeepMind 表示,AlphaGenome 在单序列预测任务中有 22 项评测优于当时表现最好的外部模型,在变异效应预测任务中有 24 项达到或超过领先模型。不过,这些是模型基准测试结果,并不等于它已经证明某个变异会导致某种疾病,也不等于临床诊断结果。

90 亿个变异被压缩成一个优先级分数

AlphaGenome Atlas 的核心是对人类基因组中约 90 亿种单字母变化进行预计算,并把结果整理为约 1 PB 的数据集。研究人员可以通过数据库查询某个变异可能造成的分子影响,而不必每次从头运行模型。

谷歌同时推出 AlphaGenome Variant Impact(AVI)分数。这个分数综合了编码区与非编码区的预测结果,用于帮助研究人员筛选值得进一步实验验证的变异。它更像是一个研究排序工具,而不是对疾病风险作出的最终判断。

谷歌在 AlphaGenome Atlas 官方介绍 中举了两个早期使用案例。Broad Institute 的研究人员利用 AVI 分数,为一宗尚未解决的罕见病病例筛选候选变异;模型指出,DNM1 基因中的一个变异可能制造了错误的 RNA 剪接位点,为最终解决该病例提供了支持性证据。

另一个案例涉及复杂性状。研究人员把 AlphaGenome Atlas 应用于超过 5.4 万名 UK Biobank 参与者的数据,通过按预测的分子影响对变异进行分组,发现的非编码遗传关联比原先多 22%。在影响最大的 1% 变异中,研究人员还找到了与身体质量指数相关的 19 个遗传区域。

这些例子显示,Atlas 的现实用途主要在于缩小实验搜索范围:它可以帮助研究人员先从大量可能的变异中挑出少数候选,再通过细胞实验、动物实验或其他生物学方法进行验证。

这不是临床诊断工具

AlphaGenome 的能力边界同样重要。DeepMind 在模型说明中承认,准确捕捉相距超过 10 万个 DNA 碱基的远距离调控元件仍然是挑战,模型对细胞和组织特异性模式的理解也需要继续改进。

DeepMind 还明确表示,AlphaGenome 并没有针对个人全基因组预测进行设计或验证。模型可以预测某个变异可能造成的分子结果,但不能单独解释复杂性状或疾病的全部成因,因为后者通常还涉及发育过程、环境因素和更广泛的生理机制。

AlphaGenome 的 API 和模型页面 目前将服务定位为非商业研究用途。API 可以处理最多约 100 万个碱基对的序列,但查询速率取决于需求规模,也不适合需要超过 100 万次预测的大规模分析。谷歌同时提醒,模型输出仅用于研究,尚未针对直接临床用途进行设计或验证。

这意味着 AlphaGenome Atlas 可以成为寻找候选机制的工具,却不能替代遗传咨询、临床检测或医生对患者情况的判断。即使模型预测某个变异具有较高影响,也仍需要独立实验和临床证据来确认其实际意义。

AI 正在把 DNA 研究推进到实验循环

AlphaGenome Atlas 的重要性不只在于数据库的规模,也在于它展示了基因组 AI 的一个发展方向:模型不再只负责识别序列或预测蛋白质结构,而是试图把 DNA 变化与细胞层面的功能联系起来。

此前,AI 已经开始参与更完整的 DNA 设计流程。例如,AIFlux 此前报道的 基因组语言模型设计噬菌体研究 已经把模型生成的序列带入合成和实验验证环节。AlphaGenome Atlas 的路径则更偏向“解释”和“优先排序”:先利用模型判断哪些变异可能重要,再决定哪些值得投入实验资源。

但从预测到生物学事实之间仍有距离。模型可能帮助研究人员更快提出假设,却不能保证所有高分变异都具有相同的实际效果,也不能保证在一种细胞类型中成立的预测会适用于另一种组织。如何把计算结果与实验、临床数据和群体遗传学证据结合起来,将决定这类工具能否真正加快疾病机制研究。

AlphaGenome 的基础研究论文已发表于《Nature》:Advancing regulatory variant effect prediction with AlphaGenome。就目前公开信息看,AlphaGenome Atlas 更准确的定位,是一个面向研究人员的基因变异影响导航系统,而不是一张已经完成的人类疾病地图。它扩大了科学家可以筛选和比较的范围,但最终答案仍需要生物学实验来确认。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读