1Welke gegevenstypen kan ik analyseren?
Charlie werkt op basis van een expressiematrix: een tabel waarin de genen in rijen staan en uw monsters in kolommen. Twee grote gegevensfamilies worden van begin tot eind ondersteund — de DNA-chips (microarray), waarvan de waarden al op logaritmische schaal staan, en de reeds genormaliseerde RNA-seq (in CPM, TPM of FPKM).
U kunt ook ruwe tellingen van RNA-seq laden. Charlie accepteert ze en bereidt ze correct voor op de verkenning (hoofdcomponentenanalyse, warmtekaarten, clustering). De differentiële analyse op ruwe tellingen blijft daarentegen exploratief: de statistische referentiemethode voor dit geval — een negatief-binomiaal model, zoals DESeq2 — is in ontwikkeling. Charlie wijst u hierop voordat de analyse wordt gestart.
De onderstaande tabel leest u rij voor rij: het bestandstype dat u bij de hand hebt, de schaal van de waarden, de bewerking die Charlie er automatisch op toepast, en de analyses die u dan openstaan.
| Uw gegevens | Schaal van de waarden | Wat Charlie toepast | Wat u kunt doen |
|---|---|---|---|
| DNA-chip (microarray) | log2 | niets: de waarden zijn al klaar | Verkenning en differentiële analyse (limma standaard, Welch naar keuze) |
| Genormaliseerde RNA-seq (CPM, TPM, FPKM) | lineair of log | omzetting naar log2 als de waarden lineair zijn | Verkenning en differentiële analyse (limma standaard, Welch naar keuze) |
| RNA-seq in ruwe tellingen | lineair | corrigeert de sequencingdiepte (CPM) en zet dan om naar log2 | Betrouwbare verkenning; exploratieve differentiële analyse (DESeq2 binnenkort) |
| Sequencingbestanden (FASTQ) | — | — | Niet ondersteund |
Al deze gegevens meten hetzelfde — de genexpressie, oftewel het RNA. Microarray en RNA-seq verschillen alleen in de manier waarop die wordt gemeten. De vermelding „reeds genormaliseerd” verwijst naar de correctie van de sequencingdiepte, eigen aan RNA-seq: een monster met een grotere sequencingdiepte geeft overal hogere waarden zonder dat enig gen werkelijk sterker tot expressie komt, en CPM, TPM of FPKM corrigeren deze zuiver technische vertekening. Omdat een microarray niet op sequencing berust, is dit begrip er niet op van toepassing.
Tot slot een woord over de term „ruw”, die twee heel verschillende werkelijkheden dekt. Ruwe tellingen vormen al een tabel van genen en monsters, alleen nog niet gecorrigeerd voor de sequencingdiepte: Charlie accepteert ze. De sequencingbestanden (FASTQ) zijn iets heel anders — de reads die uit de sequencer komen, ruim vóór ook maar enige tabel. Charlie verwerkt ze niet: het vertrekpunt is altijd een reeds samengestelde expressiematrix.