El Atlas de 9 mil millones de mutaciones de DeepMind cambia las reglas de la genómica
Google DeepMind ha lanzado una base de datos gratuita que predice los efectos biológicos de cada posible cambio de una sola letra en el ADN humano. El Atlas AlphaGenome se centra en el 98% del genoma que a los científicos les ha costado interpretar, y podría redefinir cómo se diagnostican las enfermedades raras y se descubren nuevos fármacos.
Un manual de referencia para la mitad oscura del genoma
Durante veinte años, la genómica ha padecido una crisis de identidad crónica. El Proyecto Genoma Humano entregó el libro en 2003. Los científicos por fin contaban con la secuencia completa del ADN humano. Lo que les faltaba era la capacidad de leerlo.
Esa brecha se ha estrechado, lentamente, durante más de una década. Pero el lanzamiento este martes del Atlas AlphaGenome de Google DeepMind es de otro orden de magnitud. La base de datos predice las consecuencias biológicas de los nueve mil millones de sustituciones posibles de una sola letra a lo largo del genoma humano. En términos prácticos, es el primer mapa integral de cómo cualquier mutación dada podría alterar la maquinaria que enciende y apaga los genes. Los investigadores ahora pueden consultarlo a través de un navegador web en lugar de llevar a cabo semanas de experimentos de laboratorio por variante.
Pushmeet Kohli, vicepresidente de investigación de DeepMind, lo expresó con claridad en una llamada informativa: por primera vez, cualquier científico del mundo puede acceder a un mapa completo de la variación genética humana «simplemente abriendo un navegador». También enmarcó el lanzamiento como el cierre de una deuda pendiente del Proyecto Genoma Humano. «Compramos el libro», dijo Kohli, «pero no entendíamos cómo leerlo».
El problema del ADN no codificante, resuelto a gran escala
Las implicaciones biológicas de este lanzamiento giran en torno a un dato que muchos lectores encontrarán sorprendente: aproximadamente el dos por ciento del genoma humano codifica proteínas. El otro noventa y ocho por ciento regula cuándo y dónde se producen esas proteínas. Durante décadas, ese paisaje regulatorio fue terreno en gran parte inexplorado. Las mutaciones en regiones codificantes son relativamente sencillas de interpretar porque alteran directamente la estructura de las proteínas. Las mutaciones en regiones no codificantes son mucho más difíciles, porque sus efectos son indirectos, difusos y dependen del contexto. Activan o reprimen genes en tejidos específicos en momentos concretos.
AlphaGenome, el modelo de inteligencia artificial subyacente que DeepMind lanzó el año pasado, se construyó precisamente para predecir este tipo de efectos regulatorios. Atlas es lo que ocurre cuando lo ejecutas sobre un genoma de referencia entero y comparas cada base con cada alternativa posible. El resultado es un catálogo de aproximadamente 27 000 predicciones por variante, que abarca cientos de tipos celulares y tisulares humanos y de ratón. Incluye cómo una mutación afecta a la expresión génica, al empalme del ARN, a la unión de factores de transcripción y a la accesibilidad de la cromatina.
Para dar sentido a tal volumen, DeepMind introdujo la puntuación AVI (AlphaGenome Variant Impact). Combina las predicciones regulatorias de AlphaGenome con las de AlphaMissense, un modelo anterior de DeepMind centrado en los cambios que alteran las proteínas. Una puntuación AVI de diez sitúa a una variante en el diez por ciento superior de impacto; una puntuación de treinta la coloca en el milésimo superior. De manera crucial, la puntuación desglosa qué proceso biológico impulsa el impacto —el empalme, la expresión génica o el cambio en la proteína— para que los investigadores puedan distinguir una mutación que altera un promotor de otra que crea un sitio de empalme críptico.
Los primeros resultados sugieren un avance diagnóstico
La fase de pruebas beta, descrita en el artículo publicado ahora en bioRxiv, contiene resultados difíciles de descartar como meros avances incrementales.
En el Instituto Broad, Laura Covill y Anne O’Donnell-Luria trabajaron con el Consorcio GREGoR, que investiga trastornos genéticos raros de origen desconocido. Aplicaron Atlas a un paciente con encefalopatía epiléptica cuya condición se había resistido al diagnóstico. La puntuación AVI señaló una variante en el gen DNM1, implicado en la función sináptica de las células cerebrales. El sesenta y nueve por ciento de la puntuación provenía de efectos sobre el empalme: el modelo predijo que la variante crea un sitio de empalme falso en una versión específica del cerebro del gen, añadiendo trece aminoácidos a la proteína resultante. Como esa variante proteica apenas se expresa en sangre, los análisis previos de secuenciación de ARN en muestras sanguíneas no habían arrojado nada. Los experimentos de laboratorio confirmaron la predicción y la variante se reclasificó como probablemente patogénica.
En una prueba retrospectiva sobre casos del GREGoR ya resueltos, la puntuación AVI situó a la variante causal conocida entre los cincuenta principales candidatos de un paciente el 29,5 por ciento de las veces. El método de ranking CADD existente alcanzó el 12,5 por ciento. La diferencia no es menor.
Gareth Hawkes, de la Universidad de Exeter, ejecutó Atlas sobre datos de genoma completo de más de 54 000 participantes del Registro Biomédico del Reino Unido (UK Biobank), en busca de variantes raras no codificantes que influyen en los niveles de proteínas circulantes. Filtrar los candidatos por efecto molecular predicho produjo un 22 por ciento más de asociaciones que el mismo análisis sin Atlas. En un caso, la lista de candidatos se redujo de 526 a cuatro.
«El genoma humano es un espacio de búsqueda enorme», dijo Hawkes. «Podemos usarlo para reducir el tamaño del fardo de paja.»
Julia Zeitlinger, del Instituto Stowers, utilizó los mapas de motivos del atlas —un catálogo de más de 2 500 secuencias cortas de ADN recurrentes donde se unen los factores de transcripción— para clasificar los represores según su especificidad por tipo celular. Señaló que cartografiar experimentalmente miles de esos sitios «no habría sido posible» y que cuatro décadas de trabajo de laboratorio solo han validado una fracción minúscula de los motivos que predice el modelo.
Quién gana, quién pierde y lo que significa el modelo de acceso
DeepMind está poniendo Atlas a disposición gratuita de los investigadores académicos a través de un sitio web dedicado. El acceso comercial llegará mediante licencias de Google Cloud «próximamente», según Kohli. No reveló los términos. Isomorphic Labs, la filial de Alphabet centrada en el descubrimiento de fármacos mediante inteligencia artificial, ya tiene acceso, aunque también requiere una licencia comercial.
Esta arquitectura de acceso es significativa. La comunidad científica se beneficia de inmediato de la capa académica gratuita. Las farmacéuticas y las biorrupresas que busquen desplegar los datos para la identificación de dianas terapéuticas necesitarán negociar licencias. Sigue sin estar claro si los términos comerciales están diseñados para favorecer a los grandes incumbentes o para dejar espacio a las firmas más pequeñas. El patrón más amplio aquí replica lo ocurrido con AlphaFold, otro lanzamiento de DeepMind: abierto para uso académico, con acceso comercial restringido, y reformando inevitablemente la dinámica competitiva en campos basados en datos biológicos.
Las implicaciones para el descubrimiento de fármacos son enormes pero aún teóricas. La mayoría de las variantes genéticas vinculadas a la enfermedad se encuentran en regiones no codificantes, lo que significa que afectan a la regulación génica más que a la estructura de las proteínas. Si Atlas puede predecir de forma fiable qué mutaciones regulatorias son patogénicas, convierte una búsqueda de larga probabilidad en una búsqueda guiada. Eso resulta especialmente importante para las enfermedades raras, donde la odisea diagnóstica puede extenderse durante años y afectar a familias. También es relevante para las enfermedades comunes con fuerte componente genético, cuyas variantes de riesgo no codificantes han resultado difíciles de traducir en dianas para fármacos.
Ewan Birney, director del European Bioinformatics Institute (EMBL), ya está trabajando para integrar la puntuación AVI en el predictor de efecto de variantes de Ensembl, la herramienta de anotación utilizada por innumerables laboratorios de genómica en todo el mundo. Esa integración es una señal de que los datos se están absorbiendo en la infraestructura de investigación existente, no de que se trate como un producto autónomo.
Salvedades importantes
DeepMind no presenta esto como un reemplazo de la evidencia experimental. Žigas Avsec, líder de genómica de DeepMind, señaló que el modelo funciona bien para ciertas clases de variantes, como las que afectan al empalme o a los promotores, pero puede fallar en otras, particularmente en los potenciadores. Las predicciones son «suficientemente precisas para indicarnos la dirección correcta», dijo, pero no deben tratarse como verdad universal. Son menos confiables que las predicciones de estructura proteica de AlphaFold, otro hito de DeepMind.
El artículo también señala lagunas en los datos de entrenamiento y una capacidad limitada para capturar efectos indirectos, como las mutaciones que actúan a través de cambios en los niveles de las propias proteínas reguladoras. Estas son limitaciones reales, no notas al pie. Una variante que parece benigna en un tipo celular podría ser disruptiva en otro, y la cobertura tisular del modelo, aunque amplia, no es exhaustiva.
Para el diagnóstico clínico, DeepMind afirma explícitamente que las predicciones de Atlas solo forman parte de la cadena de evidencia. Deben orientar los estudios posteriores, no reemplazarlos.
Por qué importa más allá del laboratorio
La dimensión más convincente de este lanzamiento es su momento. El Proyecto Genoma Humano celebró este año su vigésimo aniversario. Dos décadas después de leer la secuencia, por fin estamos obteniendo una gramática práctica para el lenguaje que codifica, en especial el lenguaje regulatorio que constituye la gran mayoría del genoma.
Para los pacientes con enfermedades raras, la compresión del horizonte temporal es tangible. Un diagnóstico que antes exigía años de pruebas secuenciales podría, en principio, acortarse a semanas. Para los investigadores que estudian enfermedades complejas, las variantes no codificantes que la genética de poblaciones ha identificado durante años como asociadas a condiciones que van desde la diabetes hasta la esquizofrenia ahora cuentan con un marco predictivo attached.
Para la industria del descubrimiento de fármacos, la pregunta es si estos datos convierten dianas antes indrogables en dianas abordables. Las mutaciones regulatorias son más difíciles de tomar como diana que los pliegues erróneos de proteínas, pero comprender qué cambios regulatorios impulsan la enfermedad es el primer paso hacia el diseño de intervenciones que modulen la expresión génica en lugar de bloquear la función proteica.
El Atlas AlphaGenome no responde a todas las preguntas. No reemplaza a los experimentos. No curará enfermedades por sí solo. Pero hace algo que era imposible hasta ahora: hace navegable el panorama completo de la variación genética humana. Eso no es poco. Es la diferencia entre vagar por un vasto bosque oscuro y por fin tener un mapa.