Charlie Charlie·Biodata – Bioinformatik
Ofte stillede spørgsmål — forløbet, resultaterne, tilliden

Ofte stillede spørgsmål — Charlie Bioinformatik

Charlie hjælper dig med at udforske og fortolke genekspressionsdata uden at skrive kode. Disse svar følger tråden i din opdagelse af applikationen: hvor dine data kommer fra, hvad du kan gøre med dem i hvert trin af forløbet, hvad resultaterne er værd, og hvor langt du kan stole på den.

1Hvilke typer data kan jeg analysere?

Charlie arbejder ud fra en ekspressionsmatrix: en tabel, hvor generne står i rækker og dine prøver i kolonner. To store datafamilier understøttes hele vejen igennem — DNA-chips (microarray), hvis værdier allerede er i logaritmisk skala, og allerede normaliseret RNA-seq (i CPM, TPM eller FPKM).

Du kan også indlæse rå tællinger fra RNA-seq. Charlie accepterer dem og forbereder dem korrekt til udforskning (principalkomponentanalyse, varmekort, klyngedannelse). Derimod forbliver differentiel analyse på rå tællinger eksplorativ: den statistiske referencemetode til dette tilfælde — en negativ binomial model som DESeq2 — er under udvikling. Charlie gør dig opmærksom på det, før analysen startes.

Tabellen nedenfor læses række for række: filtypen, du har ved hånden, skalaen for dens værdier, den behandling Charlie automatisk anvender på den, og de analyser, der så bliver tilgængelige for dig.

Dine data Værdiernes skala Hvad Charlie anvender Hvad du kan gøre
DNA-chip (microarray) log2 intet: værdierne er allerede klar Udforskning og differentiel analyse (limma som standard, Welch valgfrit)
Normaliseret RNA-seq (CPM, TPM, FPKM) lineær eller log omdannelse til log2, hvis værdierne er lineære Udforskning og differentiel analyse (limma som standard, Welch valgfrit)
RNA-seq i rå tællinger lineær korrigerer sekventeringsdybden (CPM) og omdanner derefter til log2 Pålidelig udforskning; differentiel analyse eksplorativ (DESeq2 snart)
Sekventeringsfiler (FASTQ) Ikke understøttet

Alle disse data måler det samme — genekspression, altså RNA. Microarray og RNA-seq adskiller sig kun ved måden at måle den på. Betegnelsen »allerede normaliseret« henviser til korrektionen af sekventeringsdybden, som er særegen for RNA-seq: en prøve, der er sekventeret mere, giver højere værdier overalt, uden at noget gen reelt er mere udtrykt, og CPM, TPM eller FPKM korrigerer denne rent tekniske skævhed. Da et microarray ikke sekventerer, vedrører dette begreb det ikke.

Et sidste ord om betegnelsen »rå«, der dækker over to meget forskellige virkeligheder. Rå tællinger er allerede en tabel over gener og prøver, blot endnu ikke korrigeret for sekventeringsdybden: Charlie accepterer dem. Sekventeringsfiler (FASTQ) er noget helt andet — de læsninger, der kommer ud af sekventeringsmaskinen, længe før nogen som helst tabel. Charlie behandler dem ikke: den tager altid udgangspunkt i en allerede dannet ekspressionsmatrix.

2Hvor kommer dataene fra: mine egne filer eller en offentlig database?

Du kan arbejde ud fra dine egne filer eller et offentligt datasæt. I det første tilfælde importerer du en tabel fra din computer i formaterne Excel, CSV eller TSV. I det andet er det nok at angive et GEO-id (på formen GSE…): Charlie henter så datasættet direkte fra den offentlige database NCBI GEO, uden at du selv skal downloade det.

Nuværende begrænsning — GEO-import

Den automatiske hentning fungerer for DNA-chips (microarray). For RNA-seq-studier offentliggør GEO ikke værdierne i den standardtabel, som Charlie kan læse, men i tillægsfiler, der er specifikke for hvert studie. Charlie kan derfor ikke indlæse dem ud fra id'et alene — den gør dig opmærksom på det i stedet for at efterlade dig med et tomt projekt. Fremgangsmåden: hent ekspressionsmatrixen fra studiets GEO-side, og importér den derefter som en fil. Når den først er importeret, analyseres den nøjagtigt som ethvert andet datasæt.

Hvert projekt viser øverst sin oprindelse og sine vigtigste kendetegn — studiets titel, antallet af prøver og gener, den detekterede skala, og for et GEO-datasæt dets accessions- og platforms-id'er. Et allerede importeret datasæt kan i øvrigt genbruges til et nyt projekt uden at skulle importeres igen.

3Hvordan forløber en analyse fra start til slut?

Charlie organiserer arbejdet i fem faner, der følger den naturlige rækkefølge i en analyse.

Det hele starter i fanen Data, hvor du forbereder dit datasæt: Charlie genkender dine gener, kontrollerer målingernes skala, lader dig definere dine sammenligningsgrupper og gennemse et overblik over dine variabler. Derefter kommer Analyser, hvor du opbygger dine visualiseringer — principalkomponenter, varmekort, volcano — i form af trin, som du sætter sammen i takt med din undersøgelse. De gener, der fanger din opmærksomhed, samler du i Kurven. Ud fra denne kurv fremdrager fanen Berigelse de overrepræsenterede biologiske funktioner og signalveje. Endelig vil Bibliografi, som er på vej, forbinde dine gener med den videnskabelige litteratur.

4Hvad kan jeg gøre i fanen »Data«?

Fanen Data samler alt det, der forbereder og beskriver dit datasæt før analysen, i tre dele.

Den første, Dataforberedelse, er kernen i det. Charlie genkender dine gener (se det næste spørgsmål) og lader dig derefter frasortere de id'er, den ikke kunne annotere, og de kolonner, der ikke er gener, filtrere manglende værdier fra, og — hvis kvalitetskontrollen tilsiger det — normalisere prøverne, så de bliver sammenlignelige. Hver gang foreslår Charlie en anbefaling, men beslutningen er din.

Den anden del lader dig oprette dine egne grupper af prøver ud fra dine variabler (efter behandling, efter tilstand…) for at forberede sammenligningerne i fanen Analyser.

Den tredje, Dataoverblik, giver et umiddelbart samlet overblik: et uddrag af matrixen, et resumé af de detekterede kategoriske variabler (behandling, kilde, osv.) og rangordningen af de halvtreds mest variable gener — et første blik på det, der adskiller dine prøver, allerede før du har startet en analyse.

5Hvad giver genkendelsen af mine gener (annoteringen) mig?

En ekspressionsfil indeholder sjældent læsbare gennavne: som oftest er det probenumre (for eksempel ILMN_1802380) eller id'er fra databaser (Entrez, Ensembl). At sammenholde dem én for én med gennavne er et langt og fejlbehæftet arbejde, ikke mindst fordi man skal tage højde for navne, der har ændret sig med tiden.

Charlie klarer det automatisk. Ved importen genkender den typen af dine id'er, oversætter dem til gennavne og opdaterer dem, der er blevet forældede, til den gældende nomenklatur. Du får dermed et datasæt, der er klar til analyse, og hvis gener bærer deres gængse navn — uden at have skrevet en linje kode eller slået op i en opslagstabel.

Frem for alt præsenteres resultatet for dig uden tvetydighed. Banneret »Annotering« angiver andelen af genkendte gener (for eksempel »8.763 af 9.980«), annoteringens oprindelse og listen over de id'er, der ikke kunne knyttes — frasorteret fra analyserne i stedet for fejlagtigt talt med. Du ved derfor altid, hvad Charlie har genkendt, og hvad den har ladet ligge til side.

6For hvilke arter genkender Charlie mine gener?

Charlie annoterer automatisk generne for ni almindeligt studerede arter: mennesket, musen, rotten, bananfluen, zebrafisken, ormen C. elegans, bagegæren, modelplanten Arabidopsis og bakterien E. coli. For at nå dertil kombinerer den flere annoteringskilder, hvis tilgængelighed afhænger af arten. Tabellen nedenfor opsummerer de midler, der tages i brug for hver enkelt.

Art Illumina-chip Annotering fra GEO Oversættelse af Entrez/Ensembl-id'er Opdatering af navne
Menneske org.Hs.eg.db✅ HGNC
Mus org.Mm.eg.db✅ MGI
Rotte org.Rn.eg.db✅ RGD
Bananflue org.Dm.eg.db✅ FlyBase
Zebrafisk org.Dr.eg.db✅ ZFIN
Orm (C. elegans) org.Ce.eg.db✅ WormBase
Bakterie (E. coli) org.EcK12.eg.db✅ NCBI / EcoCyc
Plante (Arabidopsis) org.At.tair.db
Gær org.Sc.sgd.db
Anden art ✅ (hvis tilgængelig)

For disse ni arter bygger oversættelsen af id'erne på de anerkendte Bioconductor-annoteringsdatabaser (kolonnen »Oversættelse«), hvilket sikrer pålidelige gennavne. Opdateringen af forældede navne hviler på den nomenklaturmyndighed, der er særegen for hver art — HGNC for mennesket, FlyBase for bananfluen, og så videre. Den er ikke tilgængelig for gæren eller Arabidopsis, hvis databaser ikke leverer en synonymtabel; tabet er mindre, da disse arter har få gamle navne i omløb. Den direkte genkendelse af Illumina-chips vedrører endelig kun mennesket, musen og rotten, da der ikke findes tilsvarende chips for de øvrige arter.

Hvis du arbejder med en art, der ikke er på denne liste, er analysen stadig mulig: Charlie bruger den annotering, GEO leverer, når den findes, ellers bevares dine id'er som de er, og du kan levere din egen opslagsfil. Under alle omstændigheder angiver den tydeligt, når den automatiske annotering ikke er tilgængelig, i stedet for at få dig til at tro på et resultat.

7Hvordan ved Charlie, hvilken behandling der skal anvendes på mine data?

Før enhver analyse detekterer Charlie skalaen for dine værdier: er der tale om rå tællinger, normaliserede data eller værdier, der allerede er i logaritmisk skala? Denne detektion afgør den anvendte behandling. For eksempel normaliseres rå tællinger til en principalkomponentanalyse først og omdannes derefter til logaritme, så sekventeringsdybden ikke skjuler det biologiske signal; data, der allerede er logaritmiske, lades derimod urørt for at undgå en dobbelt log-omdannelse.

Alt, hvad Charlie detekterer og anvender, bliver vist: den genkendte skala, den anvendte transformation, de eventuelt frasorterede gener. Du kan kontrollere det, og hvis den automatiske detektion tager fejl eller er usikker, kan du selv rette skalaen.

Afhængigt af, hvad Charlie detekterer, er her, hvad den forbereder, og hvad du kan gøre med det:

Charlie detekterer… Den forbereder / foreslår… Hvad du kan gøre
log2 (microarray, log-CPM) intet — det er allerede klar alle analyser, med tillid
rå tællinger korrigerer sekventeringsdybden (CPM) og omdanner derefter til log2 pålidelig udforskning; eksplorativ differentiel analyse
normaliseret lineær skala (TPM, FPKM) omdanner til log2 alle analyser, med tillid
tvetydig skala gætter ikke: ingen automatisk log, og signalerer usikkerheden analysen kører som eksplorativ; du kan selv angive skalaen
forskudte fordelinger mellem prøver en kontrol (boxplot + tæthed) og en anbefaling anvende den foreslåede kvantilnormalisering — undtagen på rå tællinger, hvor en dedikeret metode er påkrævet

For enhver differentiel analyse er resultatet et fold-change i log2, en korrektion for multiple test anvendes (Benjamini-Hochberg som standard), og advarsler gør opmærksom på for små grupper.

8Hvilke analyser kan jeg udføre, og hvordan starter jeg dem?

Fanen Analyser dækker de mest almindelige visualiseringer: kvalitetskontrol af prøverne, principalkomponentanalyse og UMAP til at visualisere datastrukturen, varmekort og korrelationer, fordelinger og differentiel ekspression (volcano og MA-plot). For at starte en tilføjer du et trin og angiver, alt efter analysen, de grupper, der skal sammenlignes, eller de ønskede parametre.

Du kan gå frem på to måder. Enten opbygger du dine analyser selv ved at vælge hvert trin og dets indstillinger. Eller du støtter dig til Charlie-assistenten, der kan foreslå dig en analyse ud fra dine kriterier og vejlede dig (se længere nede). I begge tilfælde er det dig, der godkender og starter beregningen.

9Hvad indeholder en analyse helt konkret?

Hver analyse fremstår som et trin, der føjes til din rapport, og som samler hele resultatets kontekst ét sted. Her finder du selve grafen ledsaget af de oplysninger, der beskriver den; justeringsparametre, som du kan ændre, og hvis virkning undertiden slår igennem direkte på figuren; en forklarende figurtekst, genereret efter behov, til at fortolke resultatet; beregningsdetaljen, der minder om den anvendte metode og de anvendte indstillinger; eventuelle kvalitetsadvarsler; og et dataoverblik over de data, der blev brugt til at frembringe grafen. Du ser dermed ikke blot resultatet, men også hvordan det blev opnået.

Disse trin sættes frit sammen: du hober dem op for at føre din undersøgelse, fra et samlet overblik mod de præcise gener, der interesserer dig — som du så lægger i Kurven.

10Hvordan vælger man den statistiske test og korrektionen på et volcano?

Volcano er den differentielle ekspressionsanalyse: den besvarer spørgsmålet »hvilke gener udtrykkes forskelligt mellem mine to grupper?«. Hvert gen placeres efter to akser — ændringens størrelse (log2 fold-change, vandret) og resultatets statistiske soliditet (den korrigerede p-value, lodret). Et gen erklæres kun »signifikant«, hvis det både overskrider en størrelsestærskel og en p-value-tærskel: en kraftig, men upålidelig ændring, eller et pålideligt, men minimalt resultat, er ikke nok. To indstillinger, samlet i analysens avancerede muligheder, styrer denne dom.

Den statistiske test tilpasser sig dine datas natur. Charlie vælger som standard den modererede t-test (limma), den historiske reference inden for ekspressionsanalyse: i stedet for at estimere hvert gens variabilitet isoleret — hvilket er meget usikkert, når prøverne er få — konsoliderer den dette estimat ved at støtte sig til samtlige gener i datasættet. Gevinsten er tydelig ved små grupper, den hyppigste situation. Welch-testen, mere klassisk, tilbydes fortsat: ved rigelige grupper konvergerer de to metoder mod det samme resultat, så valget da næsten ingen betydning har.

Dine data Anbefalet test
Microarray eller allerede normaliseret RNA-seq limma (som standard) — så meget desto mere nyttig, jo mindre grupperne er
De samme data, med rigelige grupper limma eller Welch: tilsvarende resultater
RNA-seq i rå tællinger dedikeret metode (DESeq2) på vej — t-testen er blot en tilnærmelse

På rå tællinger fra RNA-seq er ingen af disse to test ideelle: referencemetoderne hviler på en model, der er udviklet til tællinger, som DESeq2 eller edgeR, endnu under udvikling. Charlie anvender da en t-test som en tilnærmelse og advarer dig om, at resultatet er eksplorativt.

Selve korrektionen for multiple test er uundværlig. Et volcano tester tusindvis af gener på én gang; uden korrektion ville en del af dem fremstå »signifikante« alene på grund af tilfældet. Charlie anvender som standard Benjamini-Hochberg-korrektionen, der styrer falsk opdagelsesrate — det gode kompromis for en analyse i denne størrelsesorden. Korrektionerne Bonferroni og Holm, som også tilbydes, er langt mere strenge: tænkt til at frasortere selv den mindste falske positive bliver de for konservative på tusindvis af gener og risikerer at udviske et signal, der ellers er reelt. Reservér dem til særlige tilfælde.

Endelig er det gruppestørrelsen, der bestemmer analysens styrke. Med kun én prøve per gruppe er ingen test mulig; med to til fire forbliver styrken meget begrænset, og resultaterne er kun vejledende; det er først med mere rigelige grupper, at konklusionerne bliver solide. Charlie gør opmærksom på disse situationer direkte dér, hvor du konfigurerer analysen, for små størrelser sammen med strenge tærskler fører ofte til »ingen signifikante gener«, selv når et svagt signal reelt findes.

Rådet — når volcano ikke returnerer nogen signifikante gener

Før du løsner tærsklerne, så kontrollér, at de to sammenlignede grupper faktisk svarer til en ægte biologisk kontrast og ikke til en vilkårlig gruppering. Ingen test og ingen korrektion vil nogensinde få et signal til at dukke op af en sammenligning, der ikke bærer noget.

11Hvordan kan Charlie-assistenten hjælpe mig?

Ved siden af dine analyser kender en samtaleassistent dit datasæt og alle dine resultater. Du kan bede den om at forklare et trin, et valg eller en figur i et klart sprog, kommentere et resultat eller foreslå dig en analyse, der svarer til det, du søger — du kan frit justere, godkende og starte den. Da den støtter sig til dine reelle data og ikke til generaliteter, forbliver dens forslag konkrete og tilpasset dit datasæt. Assistancen udbygges gradvist: indtil videre er definitionen af sammenligningsgrupperne for eksempel fortsat op til dig.

12Hvordan ved jeg, om min analyse er pålidelig?

En analyses pålidelighed afhænger først og fremmest af dine data og dine valg; Charlie træder ikke i stedet for dem, men den gør opmærksom på det, der fortjener din opmærksomhed, direkte dér, hvor du konfigurerer analysen. Den advarer dig navnlig, når en gruppe har for få prøver til en solid sammenligning, når dataenes skala er tvetydig, eller når der er tale om rå tællinger, for hvilke den differentielle analyse forbliver eksplorativ (den dedikerede metode, som DESeq2, er under udvikling).

Valget af statistisk metode tilpasser sig i øvrigt dine data — den modererede t-test (limma) som standard, Welch-testen, hvis du foretrækker den. Og hvis noget undslipper dig, kan assistenten forklare dig et forbehold eller foreslå dig en mere forsigtig indstilling. Formålet er ikke at beslutte i dit sted, men at spare dig for at konkludere på et skrøbeligt grundlag uden at vide det.

13Hvad bruges kurven og berigelsen til?

I løbet af dine analyser opdager du interessante gener — de mest kraftigt differentielle, for eksempel. Du samler dem i Kurven, der bliver din arbejdsliste. Fanen Berigelse udnytter derefter denne liste til at besvare et grundlæggende spørgsmål: deler disse gener en funktion, en signalvej eller en biologisk proces? Charlie forespørger de store videnbaser — Gene Ontology, KEGG, Reactome, blandt andre — og fremhæver de signifikant overrepræsenterede termer for at gå fra en simpel liste af gener til en biologisk fortolkning.

14Kan jeg stole på resultaterne?

Charlie er udviklet, så du kan bedømme selv i stedet for at give blind tillid. Tre principper leder den.

Det første er gennemsigtighed: hver beslutning, der træffes om dine data — den detekterede skala, den anvendte transformation, de frasorterede gener, kvalitetsadvarslerne — vises og kan ændres. Intet sker i stilhed.

Det andet er forklaring: den indbyggede assistent kan forklare dig i et klart sprog et trin, et valg eller et resultat og henlede din opmærksomhed på fortolkningsfælderne.

Det tredje er validering på reelle data: Charlies metoder konfronteres med offentliggjorte datasæt, hvis biologi er kendt, for at verificere, at de faktisk genfinder de forventede signaler (se det næste spørgsmål).

Et punkt om ærlighed til sidst: Charlie reducerer risikoen for tavse fejl og angiver sine begrænsninger, men den erstatter ikke din videnskabelige dømmekraft. Til en publikation forbliver gennemlæsning af en ekspert anbefalet.

15Hvordan ved I, at behandlingen af RNA-seq er pålidelig?

Vi konfronterer regelmæssigt Charlie med en samling af offentliggjorte datasæt, hvis biologiske respons er kendt på forhånd, og vi verificerer, at den genfinder de rigtige signaler — ikke blot at beregningen udføres. To studier tjener i dag som reference: det ene hos mennesket (luftvejsceller behandlet med dexamethason), det andet hos bananfluen (knockout af genet Pasilla).

For hver af dem verificerer vi for eksempel, at de forventede grupper adskiller sig tydeligt efter dataforberedelsen, at sekventeringsdybden ikke længere dominerer analysen, og at de forventede gener træder frem i den rigtige retning — som CRISPLD2, induceret af dexamethason i det humane studie, eller selve genet Pasilla, undertrykt i studiet, hvor det netop blev inaktiveret.

To vigtige præciseringer. Denne validering vedrører et udsnit af referencedatasæt (to i dag, flere på vej) og ikke »alle RNA-seq«: den attesterer metodens pålidelighed, ikke korrektheden af en bestemt analyse udført på dine egne data. Desuden bekræfter den, at biologien træder korrekt frem, men den sigter ikke mod overensstemmelse på tallet nær med en dedikeret RNA-seq-metode (DESeq2), endnu under udvikling.

Charlie · Biodata – Bioinformatik — genekspressionsanalyse Dine data → udforskningen → den biologiske fortolkning