1¿Qué tipos de datos puedo analizar?
Charlie trabaja a partir de una matriz de expresión: una tabla donde los genes figuran en filas y sus muestras en columnas. Dos grandes familias de datos se admiten de extremo a extremo — los microarrays de ADN (microarray), cuyos valores ya están en escala logarítmica, y el RNA-seq ya normalizado (en CPM, TPM o FPKM).
También puede cargar conteos brutos de RNA-seq. Charlie los acepta y los prepara correctamente para la exploración (análisis de componentes principales, mapas de calor, agrupamientos). En cambio, el análisis de expresión diferencial sobre conteos brutos sigue siendo exploratorio: el método estadístico de referencia para este caso — un modelo binomial negativo, como DESeq2 — está en desarrollo. Charlie se lo señala antes de lanzar el análisis.
La tabla siguiente se lee fila por fila: el tipo de archivo que tiene a mano, la escala de sus valores, el tratamiento que Charlie le aplica automáticamente, y los análisis que quedan entonces disponibles.
| Sus datos | Escala de los valores | Lo que Charlie aplica | Lo que puede hacer |
|---|---|---|---|
| Microarray de ADN (microarray) | log2 | nada: los valores ya están listos | Exploración y análisis de expresión diferencial (limma por defecto, Welch a elección) |
| RNA-seq normalizado (CPM, TPM, FPKM) | lineal o log | paso a log2 si los valores son lineales | Exploración y análisis de expresión diferencial (limma por defecto, Welch a elección) |
| RNA-seq en conteos brutos | lineal | corrige la profundidad de secuenciación (CPM), luego pasa a log2 | Exploración fiable; análisis de expresión diferencial exploratorio (DESeq2 próximamente) |
| Archivos de secuenciación (FASTQ) | — | — | No admitido |
Todos estos datos miden lo mismo — la expresión génica, es decir el ARN. Microarray y RNA-seq solo difieren en la forma de medirla. La mención « ya normalizado » remite a la corrección de la profundidad de secuenciación, propia del RNA-seq: una muestra más secuenciada da valores más elevados en todas partes sin que ningún gen esté realmente más expresado, y CPM, TPM o FPKM corrigen este sesgo puramente técnico. Como un microarray no secuencia, esta noción no le concierne.
Una última palabra sobre el término « bruto », que abarca dos realidades muy diferentes. Unos conteos brutos son ya una tabla de genes y muestras, simplemente aún no corregida de la profundidad de secuenciación: Charlie los acepta. Los archivos de secuenciación (FASTQ) son algo muy distinto — las lecturas que salen del secuenciador, mucho antes de cualquier tabla. Charlie no los procesa: siempre parte de una matriz de expresión ya constituida.