Google DeepMind 刚刚绘制了90亿种遗传变异图谱。临床医学还未准备好。
Google DeepMind 发布了 AlphaGenome Atlas——一个 1PB 级别的数据库,可预测约 90 亿种人类遗传变异的影响。这项科学成就令人惊叹,但通向临床的路途仍遥远且充满不确定性。
无法停止的数据库
Google DeepMind 于 2026 年 9 月 9 日发布了 AlphaGenome Atlas。其中包含对数十种人类和小鼠细胞与组织类型中约 90 亿个单核苷酸变异的预测。该数据集容量约为 1 拍字节——是 AlphaFold 蛋白质结构数据库的 30 倍以上。
此刻最直观的感受是规模。AlphaFold 解决了折叠问题;AlphaGenome 正在尝试更难的事情——预测人类基因组中任何一个碱基的改变如何重塑数十种分子层面的调控输出。这包括染色质可及性、基因表达、RNA 剪接、蛋白质功能以及进化保守性。它还映射了超过 2500 种短重复 DNA 基序及其在基因组中的位置。
这种资源足以让基因组学实验室的同仁们长舒一口气。
谁首先接受检测
Broad 研究所已从中提取了一项发现。MIT 和哈佛的研究人员利用新的 AVI 评分——即融合 AlphaGenome 的非编码预测与 AlphaMissense 编码预测的 AlphaGenome 变异影响指标——缩小了一名癫痫性脑病患者候选基因的范围。最终锁定 DNM1。AlphaGenome 预测该变异创建了一个异常的剪接位点,产生了一条异常延长的蛋白质。实验工作随后证实了这一点。
埃克塞特大学的 Gareth Hawkins 将图谱与英国生物样本库超过 54000 名参与者的全基因组数据进行了比对。通过将稀有变异按预测的分子机制分组,他在非编码区域回收了比标准分析多出 22% 的关联——包括与衰老相关的 PLA2G7 附近的变异,以及影响 EGLN1 的调控突变,后者是细胞氧气感知通路的核心基因。
Hawkins 随后将焦点集中在 BMI 上。通过将英国生物样本库受试者筛选为仅携带图谱标记为影响排名前 1% 的变异者,他发现了 19 个与体质指数相关的遗传区域——这些区域被之前的方法所遗漏。
这些都是早期结果。但它们恰恰是正确的使用场景:更快生成假设,然后在实验室中进行测试。
非编码瓶颈终于被打开
多年来,人类遗传学的难题一直在于非编码基因组。编码变异是可处理的——错义、无义、移码——我们基本了解它们的作用。非编码变异位于增强子、启动子、剪接位点和结构区域,那里的规则更加复杂。大规模 GWAS 已绘制出数千个非编码性状关联,但要精确定位关联信号中哪个变异重要、以及它如何作用,一直是一个极其缓慢的过程。
AlphaGenome Atlas 并不能在一夜之间解决这个问题。但它为研究人员提供了一个排序列表——每个变异一个 AVI 评分,并按机制细分——而不是在没有优先级框架的情况下淹没在数百万候选者之中。这正是其核心价值所在。
DNM1 的案例表明,模型捕捉到了纯统计方法可能遗漏的内容:一个导致蛋白质延长的剪接位点破坏。Hawkins 的 BMI 研究则展示了它如何浮出标准分析中被噪声掩盖的非编码调控区域。
这对东亚医疗体系尤为重要。日本国立遗传学研究所、韩国的个人基因组计划以及中国的大规模生物银行项目,都承载着沉重的罕见病诊断和衰老相关性状映射负担。与欧洲血统队列相比,这些人群中的非编码变异研究不足,而主要基于欧洲中心数据训练的模型往往表现欠佳。AlphaGenome 在不同祖先间的迁移能力尚未公开说明。这一差距需要在任何临床推广之前得到检验。
尚未跨越的临床界线
DeepMind 正明确划定它所设置的边界。AlphaGenome Atlas 是一项研究资源。它未经临床用途验证。未获得监管批准。预测结果不应用于诊断或治疗决策。
将在 Google Cloud 上稍后推出的商业产品,会将研究数据集与未来可能推出的临床级服务分开。
这一区分既诚实又具有战略意义。它使当前版本留在学术轨道内,可以经受压力测试,而无需承担临床声明的法律责任。同时也为未来跨越到诊断的产品留出空间——但前提是完成临床验证,而这正是整个故事中最漫长、最昂贵的部分。
下一步会发生什么
有三件事将决定 AlphaGenome Atlas 是改变医学,还是仅仅改变论文。
第一:祖先覆盖。如果模型在欧洲以外血统的训练数据上表现下降,它将加剧而非缓解现有的健康不平等。图谱的创建者需要在声称普遍适用性之前,发表分层基准测试——最好按人群细分。
第二:功能跟进。预测一个变异会破坏剪接,直到有人进行测试前都只是预测。DNM1 和 Hawkins 的结果展示了正确的模式——预测之后是湿实验室确认——但这必须成为默认工作流程,而非例外。
第三:监管姿态。东亚卫生部——尤其是日本厚生劳动省和韩国食品医药品安全处——正密切关注 AI 驱动的诊断。具备如此能力的工具将面临责任归属的追问:当 AI 预测的变异导致临床决策时,谁应承担责任?答案将塑造这些资源进入医院实验室的速度。
真正的竞争不是另一个模型
对 AlphaGenome Atlas 最有趣的压力不会来自竞争对手的预测模型。它将来自湿实验室通量和政策。如果筛查患者基因组仍需数周的人工审读,那图谱只是一份更快的目录。如果监管框架拖慢部署,科学就会超越系统。
DeepMind 构建的是一张地图。下一个问题是,是否有人准备好去导航它。