Un equipo de investigadores de la Facultad de Ingeniería e Informática de la Florida Atlantic University ha encontrado una forma de predecir mutaciones del virus SARS-CoV-2.
Investigadores de la Facultad de Ingeniería e Informática de la Florida Atlantic University, en Estados Unidos, han desarrollado un nuevo método para predecir mutaciones en secuencias de proteínas que funciona a través de un modelo de inteligencia artificial que utiliza redes neuronales profundas. Lo han denominado Búsqueda Profunda de Mutaciones Novedosas (DNMS, por sus siglas en inglés), y con ello pretenden ayudar a entender cómo evolucionan, se propagan y afectan a la salud pública estas mutaciones.
El mejor ejemplo está en el COVID-19: a pesar de que ya han pasado cinco años desde que el virus SARS-CoV-2 fue declarado pandemia mundial, todavía siguen existiendo muchos interrogantes sobre cómo va a ser su evolución en el futuro. De hecho, indican los investigadores estadounidenses, es muy probable que todavía surjan nuevas variantes del virus, impulsadas por la selección selectiva de rasgos: mayor transmisibilidad, mayor duración de la infección y de su capacidad para evadir las defensas inmunitarias… todos estos cambios podrían permitir al virus propagarse entre poblaciones previamente inmunizadas, generando nuevas oleadas de infección.
No en vano, ha sido el virus SARS-CoV-2 el que han utilizado los investigadores para centrar su estudio. Más en concreto, se han enfocado en la proteína de la espícula (spike protein en inglés), la más grande de las cuatro principales proteínas estructurales que se encuentran en los coronavirus y la que le ayuda a entrar en las células humanas. De esta manera, utilizando un modelo de lenguaje proteico, han predecido posibles nuevas mutaciones en esta proteína que nunca antes se habían visto.
“Este método puede ser útil para orientar la investigación experimental, ya que proporciona predicciones sobre las mutaciones antes de que se observen en la población»
Dicho modelo de lenguaje fue el ProtBERT, que se ajustó “específicamente” para comprender el “dialecto” de las proteínas de la espícula del SARS-CoV-2. Este modelo examina las posibles mutaciones y las clasifica en función de varios factores, entre los que se encuentra la “gramaticalidad”, esto es, lo probable o “correcta” que es una mutación según las reglas gramaticales aprendidas por el modelo, así como lo parecida que es la secuencia mutada a la proteína original.
Los resultados del estudio muestran que su sistema puede separar secuencias en grupos en función de sus similitudes, y predecir qué mutaciones es probable que se produzcan buscando mutaciones que provoquen solo pequeños cambios en la estructura y función de la proteína, como suele ocurrir en la evolución del SARS-CoV-2, que evoluciona con ligeras modificaciones sin que estas alteren drásticamente su función general.
“Nuestro modelo clasifica todas las mutaciones posibles para encontrar las que tienen más probabilidades de ocurrir en el futuro, y demuestra que las que siguen las gramáticas de la proteína, con mínimos cambios respecto de la secuencia original y escasas diferencias de atención, son las que más probablemente vayan a sufrir cambios”, explica Xingquan Hill Zhu, autor principal del estudio y profesor en el Departamento de Ingeniería Eléctrica y Ciencias de la Computación de la Florida Atlantic University.
Eficiencia demostrada
La clave de su método, apunta, está en utilizar el contexto que proporciona la secuencia original, algo “crucial” para evaluar si una posible mutación se ajusta a la gramática de la proteína. Y parece que funciona: el equipo de investigadores comprobó la eficacia del DNMS mediante análisis estadísticos, y sus resultados, afirman, superan a otros métodos en la predicción de nuevas mutaciones, ya que combinan todos los “factores relevantes” en un único modelo de predicción más preciso.
“Creemos que, por sí solo, el uso de datos de secuencia puede ayudar a hacer estas predicciones, ya que las proteínas siguen ciertas reglas biológicas”, destaca Zhu. “Este método puede ser útil para orientar la investigación experimental, ya que proporciona predicciones sobre las mutaciones antes de que se observen en la población, lo que ayuda a los responsables de la sanidad pública a rastrear nuevas mutaciones y a prepararse antes de que se propaguen ampliamente”, añade la doctora Stella Batalama, decana de la Facultad de Ingeniería Informática de la citada universidad estadounidense.
































