4–6 de agosto de 2026
America/Costa_Rica zona horaria

Reproducibilidad y preparación de datos transcriptómicos mediante flujos de trabajo abiertos en HPC

No programado
1h
Póster Infraestructuras abiertas de ciencia Pósters

Descripción

La transcriptómica basada en secuenciación de ARN (RNA-seq) constituye una herramienta fundamental para estudiar la expresión génica y comprender mecanismos biológicos asociados a diferentes condiciones fisiológicas y patológicas. Sin embargo, la diversidad de herramientas bioinformáticas disponibles puede generar resultados distintos aun cuando se utilicen los mismos datos de entrada, lo que representa un desafío para la reproducibilidad computacional y para la posterior integración de técnicas de inteligencia artificial en investigación biomédica.
Este trabajo presenta una experiencia orientada a la ciencia abierta mediante la evaluación de tres flujos de trabajo para análisis transcriptómico: un enfoque paso a paso (step-by-step), el pipeline reproducible nf-core/rnaseq y la plataforma gráfica OneStopRNAseq. Como caso de estudio se utilizaron datos públicos del repositorio Gene Expression Omnibus (GEO), correspondientes al proyecto GSE130437, que incluye líneas celulares MCF7 de cáncer de mama con fenotipos sensibles y resistentes a palbociclib.
Los análisis fueron ejecutados en distintos entornos computacionales, incluyendo la infraestructura académica abierta Kabré Supercomputer del Centro Nacional de Alta Tecnología (CeNAT-CONARE). Se compararon aspectos relacionados con reproducibilidad, facilidad de uso, escalabilidad, personalización y preparación de datos para aplicaciones de aprendizaje automático. Los resultados mostraron que los tres enfoques identificaron aproximadamente 14 000 genes por condición, aunque se observaron diferencias importantes en los conjuntos de genes diferencialmente expresados detectados por cada pipeline. Asimismo, se identificaron transcritos reproducibles entre todos los enfoques evaluados, incluyendo LUM, KCNK2 y LINC00052, mientras que otros genes fueron exclusivos de determinadas estrategias debido a diferencias metodológicas, parámetros predeterminados y modelos estadísticos utilizados durante el procesamiento.
Desde la perspectiva de ciencia abierta, el estudio destaca la importancia de combinar datos abiertos, software de código abierto, documentación accesible y recursos computacionales compartidos para fortalecer la transparencia y la reutilización de resultados. El uso de flujos de trabajo reproducibles facilita la validación independiente de los análisis y contribuye a la generación de matrices transcriptómicas preparadas para aplicaciones de inteligencia artificial, tales como clasificación de muestras, identificación de biomarcadores y modelos predictivos en salud.
La experiencia evidencia que la selección de pipelines bioinformáticos no solo impacta los resultados biológicos obtenidos, sino también la capacidad de reproducir, compartir y reutilizar conocimiento científico. Se propone que la adopción de infraestructuras abiertas, flujos documentados y repositorios públicos de código y datos constituye una estrategia clave para fortalecer ecosistemas de investigación colaborativa y reproducible en América Latina.

Autor

Nicole Arias-Espinoza (Centro Nacional de Alta Tecnología (CeNAT-CONARE))

Coautores

Alonso Segura-Valverde (Centro Nacional de Alta Tecnología (CENAT-CONARE)) Susana Mesén-Porras (Centro Nacional de Alta Tecnología (CENAT-CONARE))

Materiales de la presentación