Charlie Charlie·Biodata – Bioinformática
Preguntas frecuentes — el recorrido, los resultados, la confianza

Preguntas frecuentes — Charlie Bioinformática

Charlie le ayuda a explorar e interpretar datos de expresión génica sin escribir código. Estas respuestas siguen el hilo de su descubrimiento de la aplicación: de dónde parten sus datos, lo que puede hacer con ellos en cada etapa del recorrido, cuánto valen los resultados, y hasta dónde puede confiar en él.

1¿Qué tipos de datos puedo analizar?

Charlie trabaja a partir de una matriz de expresión: una tabla donde los genes figuran en filas y sus muestras en columnas. Dos grandes familias de datos se admiten de extremo a extremo — los microarrays de ADN (microarray), cuyos valores ya están en escala logarítmica, y el RNA-seq ya normalizado (en CPM, TPM o FPKM).

También puede cargar conteos brutos de RNA-seq. Charlie los acepta y los prepara correctamente para la exploración (análisis de componentes principales, mapas de calor, agrupamientos). En cambio, el análisis de expresión diferencial sobre conteos brutos sigue siendo exploratorio: el método estadístico de referencia para este caso — un modelo binomial negativo, como DESeq2 — está en desarrollo. Charlie se lo señala antes de lanzar el análisis.

La tabla siguiente se lee fila por fila: el tipo de archivo que tiene a mano, la escala de sus valores, el tratamiento que Charlie le aplica automáticamente, y los análisis que quedan entonces disponibles.

Sus datosEscala de los valoresLo que Charlie aplicaLo que puede hacer
Microarray de ADN (microarray)log2nada: los valores ya están listosExploración y análisis de expresión diferencial (limma por defecto, Welch a elección)
RNA-seq normalizado (CPM, TPM, FPKM)lineal o logpaso a log2 si los valores son linealesExploración y análisis de expresión diferencial (limma por defecto, Welch a elección)
RNA-seq en conteos brutoslinealcorrige la profundidad de secuenciación (CPM), luego pasa a log2Exploración fiable; análisis de expresión diferencial exploratorio (DESeq2 próximamente)
Archivos de secuenciación (FASTQ)No admitido

Todos estos datos miden lo mismo — la expresión génica, es decir el ARN. Microarray y RNA-seq solo difieren en la forma de medirla. La mención « ya normalizado » remite a la corrección de la profundidad de secuenciación, propia del RNA-seq: una muestra más secuenciada da valores más elevados en todas partes sin que ningún gen esté realmente más expresado, y CPM, TPM o FPKM corrigen este sesgo puramente técnico. Como un microarray no secuencia, esta noción no le concierne.

Una última palabra sobre el término « bruto », que abarca dos realidades muy diferentes. Unos conteos brutos son ya una tabla de genes y muestras, simplemente aún no corregida de la profundidad de secuenciación: Charlie los acepta. Los archivos de secuenciación (FASTQ) son algo muy distinto — las lecturas que salen del secuenciador, mucho antes de cualquier tabla. Charlie no los procesa: siempre parte de una matriz de expresión ya constituida.

2¿De dónde provienen los datos: mis archivos o una base pública?

Puede trabajar a partir de sus propios archivos o de un conjunto de datos público. En el primer caso, importa una tabla desde su equipo, en los formatos Excel, CSV o TSV. En el segundo, basta con indicar un identificador GEO (de la forma GSE…): Charlie recupera entonces el conjunto de datos directamente desde la base pública NCBI GEO, sin que tenga que descargarlo usted mismo.

Límite actual — importación GEO

La recuperación automática funciona para los microarrays de ADN (microarray). Para los estudios RNA-seq, GEO no publica los valores en la tabla estándar que Charlie sabe leer, sino en archivos anexos propios de cada estudio. Por eso Charlie no puede cargarlos a partir del identificador únicamente — se lo señala en lugar de dejarle con un proyecto vacío. El procedimiento a seguir: recuperar la matriz de expresión desde la página GEO del estudio, y luego importarla como un archivo. Una vez importada, se analiza exactamente como cualquier otro conjunto de datos.

Cada proyecto muestra en su encabezado su origen y sus características principales — el título del estudio, el número de muestras y de genes, la escala detectada, y, para un conjunto GEO, sus identificadores de acceso y de plataforma. Además, un conjunto de datos ya importado puede reutilizarse para un nuevo proyecto, sin reimportarlo.

3¿Cómo se desarrolla un análisis, de principio a fin?

Charlie organiza el trabajo en cinco pestañas, que siguen el orden natural de un análisis.

Todo parte de la pestaña Datos, donde prepara su conjunto: Charlie reconoce en ella sus genes, controla la escala de las mediciones, le permite definir sus grupos de comparación y recorrer una vista previa de sus variables. Viene luego Análisis, donde construye sus representaciones — componentes principales, mapas de calor, volcano — en forma de etapas que encadena a lo largo de su investigación. Los genes que captan su atención, los reúne en la Cesta. A partir de esa cesta, la pestaña Enriquecimiento extrae las funciones y vías biológicas sobrerrepresentadas. Por último, la Bibliografía, próximamente, vinculará sus genes con la literatura científica.

4¿Qué puedo hacer en la pestaña « Datos »?

La pestaña Datos reúne todo lo que prepara y describe su conjunto antes del análisis, en tres apartados.

El primero, Preparación de los datos, es su núcleo. En él Charlie reconoce sus genes (véase la pregunta siguiente), y luego le permite descartar los identificadores que no ha podido anotar y las columnas que no son genes, filtrar los valores faltantes, y — si el control de calidad lo sugiere — normalizar las muestras para hacerlas comparables. Cada vez, Charlie propone una recomendación, pero la decisión es suya.

El segundo apartado le permite crear sus propios grupos de muestras a partir de sus variables (por tratamiento, por condición…), a fin de preparar las comparaciones de la pestaña Análisis.

El tercero, Vista previa de los datos, ofrece una visión de conjunto inmediata: un extracto de la matriz, un resumen de las variables categóricas detectadas (tratamiento, fuente, etc.), y la clasificación de los cincuenta genes más variables — una primera mirada a lo que distingue sus muestras, incluso antes de haber lanzado un análisis.

5¿Qué me aporta el reconocimiento de mis genes (la anotación)?

Un archivo de expresión rara vez contiene nombres de genes legibles: lo más frecuente es que sean números de sondas (por ejemplo ILMN_1802380) o identificadores de bases de datos (Entrez, Ensembl). Emparejarlos uno a uno con los nombres de genes es un trabajo largo y propenso a errores, tanto más cuanto que hay que tener en cuenta los nombres que han cambiado con el tiempo.

Charlie se encarga de ello automáticamente. Al importar, reconoce el tipo de sus identificadores, los traduce a nombres de genes, y actualiza los que han quedado obsoletos hacia la nomenclatura vigente. Así obtiene un conjunto de datos listo para analizar, cuyos genes llevan su nombre actual — sin haber escrito una línea de código ni consultado ninguna tabla de correspondencia.

Sobre todo, el resultado se le presenta sin ambigüedad. El banner « Anotación » indica la proporción de genes reconocidos (por ejemplo « 8 763 de 9 980 »), la procedencia de la anotación, y la lista de los identificadores que no han podido vincularse — descartados de los análisis en lugar de contabilizarse por error. Así, siempre sabe qué ha reconocido Charlie y qué ha dejado de lado.

6¿En qué especies reconoce Charlie mis genes?

Charlie anota automáticamente los genes de nueve especies estudiadas con frecuencia: el humano, el ratón, la rata, la mosca de la fruta, el pez cebra, el gusano C. elegans, la levadura de panadería, la planta modelo Arabidopsis y la bacteria E. coli. Para lograrlo, combina varias fuentes de anotación, cuya disponibilidad depende de la especie. La tabla siguiente recapitula los medios movilizados para cada una.

EspecieMicroarray IlluminaAnotación desde GEOTraducción de los identificadores Entrez/EnsemblActualización de los nombres
Humanoorg.Hs.eg.db✅ HGNC
Ratónorg.Mm.eg.db✅ MGI
Rataorg.Rn.eg.db✅ RGD
Mosca de la frutaorg.Dm.eg.db✅ FlyBase
Pez cebraorg.Dr.eg.db✅ ZFIN
Gusano (C. elegans)org.Ce.eg.db✅ WormBase
Bacteria (E. coli)org.EcK12.eg.db✅ NCBI / EcoCyc
Planta (Arabidopsis)org.At.tair.db
Levaduraorg.Sc.sgd.db
Otra especie✅ (si está disponible)

Para estas nueve especies, la traducción de los identificadores se apoya en las bases de anotación Bioconductor de referencia (la columna « Traducción »), garantía de nombres de genes fiables. La actualización de los nombres obsoletos se basa en la autoridad de nomenclatura propia de cada especie — HGNC para el humano, FlyBase para la mosca de la fruta, y así sucesivamente. No está disponible para la levadura ni para Arabidopsis, cuyas bases no proporcionan una tabla de sinónimos; la pérdida es menor, ya que estas especies tienen pocos nombres antiguos en circulación. Por último, el reconocimiento directo de los microarrays Illumina solo concierne al humano, al ratón y a la rata, a falta de microarrays equivalentes para las otras especies.

Si trabaja sobre una especie ausente de esta lista, el análisis sigue siendo posible: Charlie utiliza la anotación proporcionada por GEO cuando existe, y de lo contrario sus identificadores se conservan tal cual y usted puede proporcionar su propio archivo de correspondencia. En todos los casos, le indica claramente cuándo la anotación automática no está disponible, en lugar de dejarle creer en un resultado.

7¿Cómo sabe Charlie qué tratamiento aplicar a mis datos?

Antes de todo análisis, Charlie detecta la escala de sus valores: ¿se trata de conteos brutos, de datos normalizados, o de valores ya en escala logarítmica? Esta detección determina el tratamiento aplicado. Por ejemplo, para un análisis de componentes principales, los conteos brutos se normalizan primero y luego se pasan a logaritmo, para que la profundidad de secuenciación no oculte la señal biológica; los datos ya logarítmicos, en cambio, se dejan intactos para evitar un doble paso al log.

Todo lo que Charlie detecta y aplica se muestra: la escala reconocida, la transformación utilizada, los genes eventualmente descartados. Puede verificarlo y, si la detección automática se equivoca o permanece incierta, corregir la escala usted mismo.

Según lo que Charlie detecta, esto es lo que prepara y lo que puede hacer con ello:

Charlie detecta…Prepara / propone…Lo que puede hacer
log2 (microarray, log-CPM)nada — ya está listotodos los análisis, con confianza
conteos brutoscorrige la profundidad de secuenciación (CPM) y luego pasa a log2exploración fiable; análisis de expresión diferencial exploratorio
escala lineal normalizada (TPM, FPKM)pasa a log2todos los análisis, con confianza
escala ambiguano adivina: sin log automático, y señala la incertidumbreel análisis se ejecuta en modo exploratorio; puede precisar la escala usted mismo
distribuciones desfasadas entre muestrasun control (boxplot + densidad) y una recomendaciónaplicar la normalización por cuantiles sugerida — salvo en conteos brutos, donde se requiere un método dedicado

Para todo análisis de expresión diferencial, el resultado es un fold-change en log2, se aplica una corrección por pruebas múltiples (Benjamini-Hochberg por defecto), y unas alertas señalan los grupos demasiado pequeños.

8¿Qué análisis puedo realizar, y cómo lanzarlos?

La pestaña Análisis abarca las representaciones más habituales: control de calidad de las muestras, análisis de componentes principales y UMAP para visualizar la estructura de los datos, mapas de calor y correlaciones, distribuciones, y expresión diferencial (volcano y MA-plot). Para lanzar uno, añade una etapa y designa, según el análisis, los grupos a comparar o los parámetros deseados.

Puede proceder de dos maneras. O bien construye sus análisis usted mismo, eligiendo cada etapa y sus ajustes. O bien se apoya en el asistente Charlie, que puede proponerle un análisis a partir de sus criterios y guiarle (véase más abajo). En ambos casos, es usted quien valida y lanza el cálculo.

9¿Qué contiene un análisis, concretamente?

Cada análisis se presenta en forma de una etapa añadida a su informe, que reúne en un mismo lugar todo el contexto del resultado. Allí encuentra el gráfico en sí, acompañado de la información que lo describe; unos parámetros de ajuste que puede modificar, y cuyo efecto se refleja a veces en directo sobre la figura; una leyenda explicativa, generada bajo demanda, para interpretar el resultado; el detalle del cálculo, que recuerda el método y los ajustes aplicados; eventuales alertas de calidad; y una vista previa de los datos que sirvieron para producir el gráfico. Así ve no solo el resultado, sino también cómo se obtuvo.

Estas etapas se encadenan libremente: las acumula para llevar a cabo su investigación, de una visión de conjunto hacia los genes precisos que le interesan — que deposita entonces en la Cesta.

10En un volcano, ¿cómo elegir la prueba estadística y la corrección?

El volcano es el análisis de expresión diferencial: responde a la pregunta « ¿qué genes se expresan de forma diferente entre mis dos grupos? ». Cada gen se sitúa en él según dos ejes — la magnitud del cambio (el log2 fold-change, en horizontal) y la solidez estadística del resultado (la p-value corregida, en vertical). Un gen solo se declara « significativo » si supera a la vez un umbral de magnitud y un umbral de p-value: un cambio fuerte poco fiable, o un resultado fiable pero minúsculo, no basta. Dos ajustes, reunidos en las opciones avanzadas del análisis, gobiernan este veredicto.

La prueba estadística se adapta a la naturaleza de sus datos. Charlie retiene por defecto la prueba t moderada (limma), la referencia histórica del análisis de expresión: en lugar de estimar la variabilidad de cada gen de forma aislada — lo que es muy incierto cuando las muestras son poco numerosas — consolida esta estimación apoyándose en la totalidad de los genes del conjunto de datos. La ganancia es clara en los grupos pequeños, la situación más frecuente. La prueba de Welch, más clásica, sigue estando disponible: en grupos amplios, ambos métodos convergen hacia el mismo resultado, de modo que la elección entonces casi no tiene incidencia.

Sus datosPrueba recomendada
Microarray, o RNA-seq ya normalizadolimma (por defecto) — tanto más útil cuanto más pequeños son los grupos
Los mismos datos, con grupos amplioslimma o Welch: resultados equivalentes
RNA-seq en conteos brutosmétodo dedicado (DESeq2) próximamente — la prueba t solo es una aproximación

En conteos brutos de RNA-seq, ninguna de estas dos pruebas es ideal: los métodos de referencia se basan en un modelo concebido para los conteos, como DESeq2 o edgeR, todavía en desarrollo. Charlie aplica entonces una prueba t a modo de aproximación y le avisa de que el resultado es exploratorio.

La corrección por pruebas múltiples, por su parte, es indispensable. Un volcano prueba miles de genes de una sola vez; sin corrección, una parte de ellos aparecería como « significativa » por puro azar. Charlie aplica por defecto la corrección de Benjamini-Hochberg, que controla la tasa de falsos descubrimientos — el buen compromiso para un análisis a esta escala. Las correcciones de Bonferroni o de Holm, también disponibles, son mucho más severas: pensadas para descartar el menor falso positivo, se vuelven demasiado conservadoras con miles de genes y corren el riesgo de borrar una señal que sin embargo es real. Resérvelas para casos particulares.

Por último, es el tamaño de los grupos lo que determina la potencia del análisis. Con una sola muestra por grupo, ninguna prueba es posible; con dos a cuatro, la potencia sigue siendo muy limitada y los resultados solo valen a título indicativo; solo con grupos más amplios las conclusiones se vuelven sólidas. Charlie señala estas situaciones directamente allí donde configura el análisis, pues unos tamaños muestrales pequeños asociados a umbrales estrictos desembocan a menudo en « ningún gen significativo », incluso cuando existe realmente una señal débil.

El consejo — cuando el volcano no devuelve ningún gen significativo

Antes de relajar los umbrales, compruebe que los dos grupos comparados correspondan realmente a un verdadero contraste biológico, y no a una agrupación arbitraria. Ninguna prueba ni ninguna corrección hará surgir jamás una señal de una comparación que no la contiene.

11¿Cómo puede ayudarme el asistente Charlie?

Junto a sus análisis, un asistente conversacional conoce su conjunto de datos y la totalidad de sus resultados. Puede pedirle que explique una etapa, una elección o una figura en lenguaje claro, que comente un resultado, o que le proponga un análisis correspondiente a lo que busca — es libre de ajustarlo, validarlo y lanzarlo. Como se apoya en sus datos reales y no en generalidades, sus sugerencias siguen siendo concretas y adaptadas a su conjunto de datos. La asistencia se enriquece progresivamente: a día de hoy, la definición de los grupos de comparación, por ejemplo, sigue estando en sus manos.

12¿Cómo saber si mi análisis es fiable?

La fiabilidad de un análisis depende ante todo de sus datos y de sus decisiones; Charlie no las sustituye, pero señala lo que merece su atención, directamente allí donde configura el análisis. Le alerta en particular cuando un grupo cuenta con muy pocas muestras para una comparación sólida, cuando la escala de los datos es ambigua, o cuando se trata de conteos brutos, para los cuales el análisis de expresión diferencial sigue siendo exploratorio (el método dedicado, como DESeq2, está en desarrollo).

La elección del método estadístico se adapta además a sus datos — la prueba t moderada (limma) por defecto, la prueba de Welch si la prefiere. Y si algún punto se le escapa, el asistente puede explicarle una reserva o sugerirle un ajuste más prudente. El objetivo no es decidir en su lugar, sino evitarle concluir sobre una base frágil sin saberlo.

13¿Para qué sirven la cesta y el enriquecimiento?

A lo largo de sus análisis, detecta genes interesantes — los más fuertemente diferenciales, por ejemplo. Los reúne en la Cesta, que se convierte en su lista de trabajo. La pestaña Enriquecimiento aprovecha luego esta lista para responder a una pregunta de fondo: ¿comparten estos genes una función, una vía o un proceso biológico? Charlie consulta las grandes bases de conocimiento — Gene Ontology, KEGG, Reactome, entre otras — y pone de relieve los términos significativamente sobrerrepresentados, a fin de pasar de una simple lista de genes a una interpretación biológica.

14¿Puedo confiar en los resultados?

Charlie está concebido para que pueda juzgar por sí mismo, en lugar de conceder una confianza ciega. Tres principios lo guían.

El primero es la transparencia: cada decisión tomada sobre sus datos — la escala detectada, la transformación aplicada, los genes descartados, las alertas de calidad — se muestra y es modificable. Nada ocurre en silencio.

El segundo es la explicación: el asistente integrado puede explicarle en lenguaje claro una etapa, una elección o un resultado, y llamar su atención sobre las trampas de interpretación.

El tercero es la validación sobre datos reales: los métodos de Charlie se confrontan con conjuntos de datos publicados, cuya biología es conocida, a fin de verificar que efectivamente recuperan las señales esperadas (véase la pregunta siguiente).

Un punto de honestidad, por último: Charlie reduce el riesgo de error silencioso y señala sus límites, pero no reemplaza su juicio científico. Para una publicación, la revisión por un experto sigue siendo recomendable.

15¿Cómo saben que el tratamiento del RNA-seq es fiable?

Confrontamos regularmente a Charlie con una serie de conjuntos de datos publicados, cuya respuesta biológica se conoce de antemano, y verificamos que recupere las señales correctas — no solo que el cálculo se ejecute. Dos estudios sirven hoy de referencia: uno en el humano (células de las vías respiratorias tratadas con dexametasona), el otro en la mosca de la fruta (inactivación del gen Pasilla).

En cada una, verificamos por ejemplo que los grupos esperados se separen bien tras la preparación de los datos, que la profundidad de secuenciación ya no domine el análisis, y que los genes esperados aparezcan en el sentido correcto — como CRISPLD2, inducido por la dexametasona en el estudio humano, o el propio gen Pasilla, reprimido en el estudio donde precisamente fue inactivado.

Dos precisiones importantes. Esta validación se refiere a una muestra de conjuntos de referencia (dos hoy, otros por venir), y no a « todos los RNA-seq »: acredita la fiabilidad del método, no la exactitud de un análisis particular realizado sobre sus propios datos. Por otra parte, confirma que la biología aparece correctamente, pero no busca la igualdad cifra a cifra con un método RNA-seq dedicado (DESeq2), todavía en desarrollo.

Charlie · Biodata – Bioinformática — análisis de expresión génica Sus datos → la exploración → la interpretación biológica