Científicos muestran los beneficios de la bioinformática con la herramienta PlasmidHawk
Crédito: Unsplash/CC0 Dominio público
Rastrear el origen del código genético sintético nunca ha sido sencillo, pero se puede hacer a través de enfoques computacionales bioinformáticos o, cada vez más, de aprendizaje profundo.
Aunque este último recibe la mayor parte de la atención, una nueva investigación realizada por el científico informático Todd Treangen de la Escuela de Ingeniería Brown de la Universidad de Rice se centra en si la alineación de secuencias y los métodos basados en el genoma completo pueden superar los enfoques recientes de aprendizaje profundo en esta área.
«En cierto sentido, esto va en contra de la corriente dado que los enfoques de aprendizaje profundo han superado recientemente a los enfoques tradicionales, como BLAST», dijo. «Mi objetivo con este estudio es iniciar una conversación sobre cómo combinar la experiencia de ambos dominios para lograr mejoras adicionales para este importante desafío computacional».
Treangen, que se especializa en el desarrollo de soluciones computacionales para bioseguridad y microbios aplicaciones forenses y su equipo en Rice han presentado PlasmidHawk, un enfoque bioinformático que analiza secuencias de ADN para ayudar a identificar la fuente de plásmidos modificados de interés.
«Demostramos que un enfoque basado en la alineación de secuencias puede superar a un método de aprendizaje profundo de la red neuronal convolucional (CNN) para la tarea específica de predicción del laboratorio de origen», dijo.
Los investigadores dirigidos por Treangen y el autor principal Qi Wang, un estudiante graduado de Rice, informaron su da como resultado un artículo de acceso abierto en Nature Communications.
El software de código abierto está disponible aquí: gitlab.com/treangenlab/plasmidhawk.
El programa puede ser útil no solo para rastrear correos electrónicos potencialmente dañinos secuencias sino también para proteger la propiedad intelectual.
«El objetivo es ayudar a proteger los derechos de propiedad intelectual de los contribuyentes de las secuencias o ayudar a rastrear el origen de una secuencia sintética si algo malo sucede», dijo Treangen. .
Treangen señaló un artículo reciente de alto perfil que describe una técnica de aprendizaje profundo de red neuronal recurrente (RNN) para rastrear el laboratorio de origen de una secuencia. Ese método logró una precisión del 70% en la predicción del único laboratorio de origen. «A pesar de este importante avance sobre el enfoque de aprendizaje profundo anterior, PlasmidHawk ofrece un rendimiento mejorado sobre ambos métodos», dijo.
El programa Rice alinea directamente las cadenas de código desconocidas de los conjuntos de datos del genoma y las compara con pan- regiones genómicas que son comunes o exclusivas de los laboratorios de investigación de biología sintética
«Para predecir el laboratorio de origen, PlasmidHawk puntúa cada laboratorio en función de las regiones coincidentes entre una secuencia no clasificada y el pangenoma del plásmido, y luego asigna la secuencia desconocida a un laboratorio con la puntuación mínima», dijo Wang.
En el nuevo estudio, utilizando el mismo conjunto de datos que uno de los experimentos de aprendizaje profundo, los investigadores informaron la predicción exitosa de «secuencias desconocidas ‘ laboratorios de depósito» el 76% del tiempo. Descubrieron que el 85 % de las veces el laboratorio correcto estaba entre los 10 candidatos principales.
A diferencia de los enfoques de aprendizaje profundo, dijeron que PlasmidHawk requiere un preprocesamiento de datos reducido y no necesita volver a capacitarse al agregar nuevas secuencias. a un proyecto existente. También difiere al ofrecer una explicación detallada de sus predicciones de laboratorio de origen en contraste con los enfoques de aprendizaje profundo anteriores.
«El objetivo es llenar su caja de herramientas computacionales con tantas herramientas como sea posible», dijo el coautor Ryan Leo Elworth, investigador postdoctoral en Rice. «En última instancia, creo que los mejores resultados combinarán el aprendizaje automático, técnicas computacionales más tradicionales y una comprensión profunda del problema biológico específico que está abordando».
Los estudiantes graduados de Rice Bryce Kille y Tian Rui Liu son co- autores del artículo. Treangen es profesor asistente de informática.
La investigación fue apoyada por los Institutos Nacionales de Salud a través del Instituto Nacional de Trastornos Neurológicos y Accidentes Cerebrovasculares, la Oficina del Director de Inteligencia Nacional y la Oficina de Investigación del Ejército. Addgene proporcionó acceso a las secuencias de ADN de los plásmidos depositados.
Explore más
DeepTFactor predice factores de transcripción Más información: Qi Wang et al. PlasmidHawk mejora la predicción del laboratorio de origen de plásmidos modificados mediante alineación de secuencias, Nature Communications (2021). DOI: 10.1038/s41467-021-21180-w
Ethan C. Alley et al. Un conjunto de herramientas de aprendizaje automático para la atribución de ingeniería genética para facilitar la bioseguridad, Nature Communications (2020). DOI: 10.1038/s41467-020-19612-0 Información de la revista: Nature Communications