Charlie Charlie·Biodata – Bioinformatik
Vanliga frågor — förloppet, resultaten, förtroendet

Vanliga frågor — Charlie Bioinformatik

Charlie hjälper dig att utforska och tolka genuttrycksdata utan att skriva kod. Dessa svar följer tråden i din upptäckt av applikationen: varifrån dina data kommer, vad du kan göra med dem i varje steg av förloppet, vad resultaten är värda, och hur långt du kan lita på det.

1Vilka typer av data kan jag analysera?

Charlie arbetar utifrån en uttrycksmatris: en tabell där gener står i rader och dina prover i kolumner. Två stora datafamiljer stöds från början till slut — DNA-chip (microarray), vars värden redan är i logaritmisk skala, och redan normaliserad RNA-seq (i CPM, TPM eller FPKM).

Du kan även ladda upp råa räknetal från RNA-seq. Charlie tar emot dem och förbereder dem korrekt för utforskning (principalkomponentanalys, värmekartor, grupperingar). Däremot förblir differentiell analys på råa räknetal utforskande: den statistiska referensmetoden för detta fall — en negativ binomialmodell, såsom DESeq2 — är under utveckling. Charlie påpekar det för dig innan analysen startas.

Tabellen nedan läses rad för rad: filtypen du har till hands, skalan på dess värden, behandlingen som Charlie tillämpar automatiskt, och de analyser som då blir tillgängliga för dig.

Dina data Värdenas skala Vad Charlie tillämpar Vad du kan göra
DNA-chip (microarray) log2 ingenting: värdena är redan klara Utforskning och differentiell analys (limma som standard, Welch som alternativ)
Normaliserad RNA-seq (CPM, TPM, FPKM) linjär eller log övergång till log2 om värdena är linjära Utforskning och differentiell analys (limma som standard, Welch som alternativ)
RNA-seq i råa räknetal linjär korrigerar sekvenseringsdjupet (CPM), övergår sedan till log2 Tillförlitlig utforskning; utforskande differentiell analys (DESeq2 snart)
Sekvenseringsfiler (FASTQ) Stöds inte

Alla dessa data mäter samma sak — genuttrycket, det vill säga RNA. Microarray och RNA-seq skiljer sig endast åt i sättet att mäta det. Uttrycket ”redan normaliserad” syftar på korrigeringen av sekvenseringsdjupet, som är specifik för RNA-seq: ett prov som sekvenserats mer ger högre värden överallt utan att någon gen faktiskt uttrycks mer, och CPM, TPM eller FPKM korrigerar denna rent tekniska snedvridning. Eftersom en microarray inte sekvenserar berör detta begrepp den inte.

Slutligen ett ord om termen ”rå”, som täcker två mycket olika verkligheter. Råa räknetal är redan en tabell över gener och prover, bara ännu inte korrigerad för sekvenseringsdjupet: Charlie tar emot dem. Sekvenseringsfilerna (FASTQ) är något helt annat — läsningarna som kommer ut ur sekvenseraren, långt före den minsta tabell. Charlie behandlar dem inte: den utgår alltid från en redan färdigställd uttrycksmatris.

2Varifrån kommer data: mina egna filer eller en offentlig databas?

Du kan arbeta utifrån dina egna filer eller ett offentligt dataset. I det första fallet importerar du en tabell från din dator, i formaten Excel, CSV eller TSV. I det andra räcker det att ange ett GEO-id (av formen GSE…): Charlie hämtar då datasetet direkt från den offentliga databasen NCBI GEO, utan att du själv behöver ladda ner det.

Nuvarande begränsning — GEO-import

Den automatiska hämtningen fungerar för DNA-chip (microarray). För RNA-seq-studier publicerar GEO inte värdena i den standardtabell som Charlie kan läsa, utan i separata filer specifika för varje studie. Charlie kan därför inte ladda dem utifrån enbart id:t — den påpekar det för dig i stället för att lämna dig med ett tomt projekt. Så här gör du: hämta uttrycksmatrisen från studiens GEO-sida, och importera den sedan som en fil. När den väl är importerad analyseras den exakt som vilket annat dataset som helst.

Varje projekt visar i sitt sidhuvud sitt ursprung och sina viktigaste egenskaper — studiens titel, antalet prover och gener, den upptäckta skalan, och, för ett GEO-dataset, dess accessions- och plattforms-id. Ett redan importerat dataset kan för övrigt återanvändas för ett nytt projekt, utan att importeras på nytt.

3Hur går en analys till, från början till slut?

Charlie organiserar arbetet i fem flikar, som följer den naturliga ordningen i en analys.

Allt utgår från fliken Data, där du förbereder ditt dataset: Charlie känner där igen dina gener, kontrollerar mätningarnas skala, låter dig definiera dina jämförelsegrupper och bläddra i en förhandsvisning av dina variabler. Sedan kommer Analyser, där du bygger dina representationer — principalkomponenter, värmekartor, volcano — i form av steg som du kedjar samman under din undersökning. De gener som fångar din uppmärksamhet samlar du i Korgen. Utifrån denna korg lyfter fliken Anrikning fram de biologiska funktioner och vägar som är överrepresenterade. Slutligen kommer Bibliografin, som är på väg, att koppla dina gener till den vetenskapliga litteraturen.

4Vad kan jag göra i fliken ”Data”?

Fliken Data samlar allt som förbereder och beskriver ditt dataset före analysen, i tre delar.

Den första, Förberedelse av data, är dess kärna. Charlie känner där igen dina gener (se följande fråga), och låter dig sedan utesluta de id:n som den inte har kunnat annotera och de kolumner som inte är gener, filtrera bort saknade värden, och — om kvalitetskontrollen antyder det — normalisera proverna för att göra dem jämförbara. Varje gång ger Charlie en rekommendation, men beslutet är ditt.

Den andra delen låter dig skapa dina egna grupper av prover utifrån dina variabler (per behandling, per tillstånd …), för att förbereda jämförelserna i fliken Analyser.

Den tredje, Översikt av data, ger en omedelbar helhetsbild: ett utdrag ur matrisen, en sammanfattning av de upptäckta kategoriska variablerna (behandling, källa, osv.), och rangordningen av de femtio mest variabla generna — en första inblick i vad som skiljer dina prover åt, redan innan du har startat en analys.

5Vad ger igenkänningen av mina gener (annoteringen) mig?

En uttrycksfil innehåller sällan läsbara gennamn: oftast är det sondnummer (till exempel ILMN_1802380) eller id:n från databaser (Entrez, Ensembl). Att matcha dem en och en mot gennamn är ett långt arbete som är känsligt för fel, i synnerhet eftersom man måste ta hänsyn till namn som har ändrats med tiden.

Charlie sköter det automatiskt. Vid importen känner den igen typen av dina id:n, översätter dem till gennamn, och uppdaterar de föråldrade till gällande nomenklatur. Du får på så sätt ett dataset klart att analysera, vars gener bär sitt aktuella namn — utan att ha skrivit en rad kod eller konsulterat en korrespondenstabell.

Framför allt presenteras resultatet för dig utan tvetydighet. Bannern ”Annotering” anger andelen igenkända gener (till exempel ”8 763 av 9 980”), annoteringens ursprung, och listan över de id:n som inte har kunnat kopplas — uteslutna ur analyserna snarare än felaktigt medräknade. Du vet alltså alltid vad Charlie har känt igen och vad den har lämnat åt sidan.

6Vilka arter känner Charlie igen mina gener för?

Charlie annoterar automatiskt generna hos nio ofta studerade arter: människa, mus, råtta, bananfluga, zebrafisk, masken C. elegans, bagerijäst, modellväxten Arabidopsis och bakterien E. coli. För att lyckas med det kombinerar den flera annoteringskällor, vars tillgänglighet beror på arten. Tabellen nedan sammanfattar de medel som tas i bruk för var och en.

Art Illumina-chip Annotering från GEO Översättning av Entrez/Ensembl-id:n Uppdatering av namn
Människa org.Hs.eg.db✅ HGNC
Mus org.Mm.eg.db✅ MGI
Råtta org.Rn.eg.db✅ RGD
Bananfluga org.Dm.eg.db✅ FlyBase
Zebrafisk org.Dr.eg.db✅ ZFIN
Mask (C. elegans) org.Ce.eg.db✅ WormBase
Bakterie (E. coli) org.EcK12.eg.db✅ NCBI / EcoCyc
Växt (Arabidopsis) org.At.tair.db
Jäst org.Sc.sgd.db
Annan art ✅ (om tillgänglig)

För dessa nio arter bygger översättningen av id:n på de gällande Bioconductor- annoteringsdatabaserna (kolumnen ”Översättning”), en garant för tillförlitliga gennamn. Uppdateringen av föråldrade namn vilar på den nomenklaturauktoritet som är specifik för varje art — HGNC för människa, FlyBase för bananfluga, och så vidare. Den är inte tillgänglig för jäst eller för Arabidopsis, vars databaser inte tillhandahåller någon synonymtabell; förlusten är obetydlig, då dessa arter har få gamla namn i omlopp. Den direkta igenkänningen av Illumina-chip, slutligen, berör endast människa, mus och råtta, i brist på motsvarande chip för övriga arter.

Om du arbetar med en art som saknas i denna lista är analysen fortfarande möjlig: Charlie använder annoteringen från GEO när den finns, annars bevaras dina id:n som de är och du kan tillhandahålla din egen korrespondensfil. I samtliga fall anger den tydligt när den automatiska annoteringen inte är tillgänglig, snarare än att låta dig tro på ett resultat.

7Hur vet Charlie vilken behandling den ska tillämpa på mina data?

Före varje analys upptäcker Charlie skalan på dina värden: rör det sig om råa räknetal, normaliserade data, eller värden som redan är i logaritmisk skala? Denna detektering avgör vilken behandling som tillämpas. Till exempel, för en principalkomponent- analys normaliseras råa räknetal först och övergår sedan till logaritm, så att sekvenseringsdjupet inte maskerar den biologiska signalen; redan logaritmiska data, å sin sida, lämnas orörda för att undvika en dubbel logtransformering.

Allt som Charlie upptäcker och tillämpar visas: den igenkända skalan, den använda transformeringen, de gener som eventuellt uteslutits. Du kan kontrollera det och, om den automatiska detekteringen tar fel eller förblir osäker, korrigera skalan själv.

Beroende på vad Charlie upptäcker, här är vad den förbereder och vad du kan göra med det:

Charlie upptäcker … Den förbereder / föreslår … Vad du kan göra
log2 (microarray, log-CPM) ingenting — det är redan klart alla analyser, med förtroende
råa räknetal korrigerar sekvenseringsdjupet (CPM) och övergår sedan till log2 tillförlitlig utforskning; utforskande differentiell analys
normaliserad linjär skala (TPM, FPKM) övergår till log2 alla analyser, med förtroende
tvetydig skala gissar inte: ingen automatisk log, och påpekar osäkerheten analysen körs som utforskande; du kan ange skalan själv
förskjutna fördelningar mellan prover en kontroll (boxplot + densitet) och en rekommendation tillämpa den föreslagna kvantilnormaliseringen — utom på råa räknetal, där en dedikerad metod krävs

För varje differentiell analys är resultatet en fold-change i log2, en korrigering för multipla tester tillämpas (Benjamini-Hochberg som standard), och varningar påpekar alltför små grupper.

8Vilka analyser kan jag göra, och hur startar jag dem?

Fliken Analyser täcker de vanligaste representationerna: kvalitetskontroll av proverna, principalkomponentanalys och UMAP för att visualisera datastrukturen, värmekartor och korrelationer, fördelningar, och differentiellt uttryck (volcano och MA-plot). För att starta en lägger du till ett steg och anger, beroende på analysen, grupperna som ska jämföras eller de önskade parametrarna.

Du kan gå tillväga på två sätt. Antingen bygger du dina analyser själv, genom att välja varje steg och dess inställningar. Eller så stödjer du dig på Charlie-assistenten, som kan föreslå en analys utifrån dina kriterier och vägleda dig (se längre ner). I båda fallen är det du som godkänner och startar beräkningen.

9Vad innehåller en analys, konkret?

Varje analys presenteras i form av ett steg som läggs till i din rapport, och som samlar hela resultatets sammanhang på ett och samma ställe. Där hittar du grafen själv, åtföljd av den information som kvalificerar den; justeringsparametrar som du kan ändra, och vars effekt ibland återspeglas direkt på figuren; en förklarande bildtext, genererad på begäran, för att tolka resultatet; beräkningens detaljer, som påminner om den tillämpade metoden och inställningarna; eventuella kvalitetsvarningar; och en förhandsvisning av de data som använts för att skapa grafen. På så sätt ser du inte bara resultatet, utan också hur det har erhållits.

Dessa steg kedjas samman fritt: du samlar på dem för att driva din undersökning, från en helhetsbild mot de specifika gener som intresserar dig — som du sedan lägger i Korgen.

10På en volcano, hur väljer jag statistiskt test och korrigering?

Volcano är den differentiella uttrycksanalysen: den besvarar frågan ”vilka gener uttrycks olika mellan mina två grupper?”. Varje gen placeras där längs två axlar — förändringens omfattning (log2 fold-change, horisontellt) och resultatets statistiska styrka (det korrigerade p-value, vertikalt). En gen förklaras ”signifikant” endast om den överskrider både en omfattningströskel och en p-value-tröskel: en stark men föga tillförlitlig förändring, eller ett tillförlitligt men obetydligt resultat, räcker inte. Två inställningar, samlade i analysens avancerade alternativ, styr detta utslag.

Det statistiska testet anpassar sig till dina datas natur. Charlie väljer som standard det modererade t-testet (limma), den historiska referensen för uttrycks- analys: i stället för att skatta varje gens variabilitet isolerat — vilket är mycket osäkert när proverna är få — konsoliderar den denna skattning genom att stödja sig på samtliga gener i datasetet. Vinsten är tydlig för små grupper, den vanligaste situationen. Welch-testet, mer klassiskt, erbjuds fortfarande: på välförsedda grupper konvergerar de två metoderna mot samma resultat, så att valet då knappast har någon inverkan.

Dina data Rekommenderat test
Microarray, eller redan normaliserad RNA-seq limma (standard) — desto mer användbart ju mindre grupperna är
Samma data, med välförsedda grupper limma eller Welch: likvärdiga resultat
RNA-seq i råa räknetal dedikerad metod (DESeq2) på väg — t-testet är bara en approximation

På råa räknetal från RNA-seq är inget av dessa två test idealiskt: referens- metoderna vilar på en modell utformad för räknetal, såsom DESeq2 eller edgeR, som fortfarande är under utveckling. Charlie tillämpar då ett t-test som en approximation och varnar dig för att resultatet är utforskande.

Korrigeringen för multipla tester, å sin sida, är oumbärlig. En volcano testar tusentals gener på en enda gång; utan korrigering skulle en del av dem framstå som ”signifikanta” enbart genom slumpen. Charlie tillämpar som standard Benjamini-Hochberg-korrigeringen, som behärskar andelen falska upptäckter — den goda kompromissen för en analys av denna omfattning. Korrigeringarna Bonferroni och Holm, som också erbjuds, är mycket strängare: utformade för att avvisa minsta falska positiva blir de alltför konservativa på tusentals gener och riskerar att radera en signal som ändå är verklig. Reservera dem för särskilda fall.

Slutligen är det gruppstorleken som styr analysens styrka. Med ett enda prov per grupp är inget test möjligt; med två till fyra förblir styrkan mycket begränsad och resultaten gäller endast som vägledande; det är först med mer välförsedda grupper som slutsatserna blir solida. Charlie påpekar dessa situationer direkt där du konfigurerar analysen, eftersom små antal i kombination med strikta trösklar ofta mynnar ut i ”ingen signifikant gen”, även när en svag signal faktiskt finns.

Rådet — när volcano inte returnerar någon signifikant gen

Innan du släpper på trösklarna, kontrollera att de två jämförda grupperna verkligen motsvarar en verklig biologisk kontrast, och inte en godtycklig gruppering. Inget test och ingen korrigering kommer någonsin att få en signal att framträda ur en jämförelse som inte bär på någon.

11Hur kan Charlie-assistenten hjälpa mig?

Vid sidan av dina analyser känner en konversationsassistent till ditt dataset och samtliga dina resultat. Du kan be den förklara ett steg, ett val eller en figur i klarspråk, kommentera ett resultat, eller föreslå en analys som motsvarar det du söker — det står dig fritt att justera den, godkänna den och starta den. Eftersom den stödjer sig på dina verkliga data och inte på allmänna sanningar, förblir dess förslag konkreta och anpassade till ditt dataset. Assistansen berikas efterhand: i dagsläget ligger till exempel definitionen av jämförelsegrupper fortfarande i din hand.

12Hur vet jag om min analys är tillförlitlig?

En analys tillförlitlighet beror först och främst på dina data och dina val; Charlie ersätter dem inte, men den påpekar det som förtjänar din uppmärksamhet, direkt där du konfigurerar analysen. Den varnar dig särskilt när en grupp har för få prover för en solid jämförelse, när dataskalan är tvetydig, eller när det rör sig om råa räknetal, för vilka den differentiella analysen förblir utforskande (den dedikerade metoden, såsom DESeq2, är under utveckling).

Valet av statistisk metod anpassar sig för övrigt till dina data — det modererade t-testet (limma) som standard, Welch-testet om du föredrar det. Och om något undgår dig kan assistenten förklara en reservation för dig eller föreslå en mer försiktig inställning. Målet är inte att besluta i ditt ställe, utan att bespara dig att dra slutsatser på en bräcklig grund utan att veta om det.

13Vad används korgen och anrikningen till?

Under dina analyser upptäcker du intressanta gener — de starkast differentiella, till exempel. Du samlar dem i Korgen, som blir din arbetslista. Fliken Anrikning använder sedan denna lista för att besvara en grundläggande fråga: delar dessa gener en funktion, en väg eller en biologisk process? Charlie efterfrågar de stora kunskapsbaserna — Gene Ontology, KEGG, Reactome, bland andra — och lyfter fram de termer som är signifikant överrepresenterade, för att gå från en enkel genlista till en biologisk tolkning.

14Kan jag lita på resultaten?

Charlie är utformad för att du ska kunna bedöma själv, snarare än att ge ett blint förtroende. Tre principer vägleder den.

Den första är transparensen: varje beslut som fattas om dina data — den upptäckta skalan, den tillämpade transformeringen, de uteslutna generna, kvalitetsvarningarna — visas och kan ändras. Ingenting sker i tysthet.

Den andra är förklaringen: den integrerade assistenten kan förklara ett steg, ett val eller ett resultat för dig i klarspråk, och rikta din uppmärksamhet mot tolkningsfällorna.

Den tredje är valideringen på verkliga data: Charlies metoder ställs mot publicerade dataset, vars biologi är känd, för att kontrollera att de verkligen återfinner de förväntade signalerna (se följande fråga).

Slutligen en ärlighetens punkt: Charlie minskar risken för tyst fel och påpekar sina begränsningar, men den ersätter inte ditt vetenskapliga omdöme. För en publikation, förblir granskning av en expert rekommenderad.

15Hur vet ni att behandlingen av RNA-seq är tillförlitlig?

Vi ställer regelbundet Charlie mot en uppsättning publicerade dataset, vars biologiska svar är känt i förväg, och vi kontrollerar att den återfinner rätt signaler — inte bara att beräkningen körs. Två studier tjänar i dag som referens: den ena hos människa (celler från luftvägarna behandlade med dexametason), den andra hos bananfluga (inaktivering av genen Pasilla).

På var och en kontrollerar vi till exempel att de förväntade grupperna separerar väl efter förberedelsen av data, att sekvenseringsdjupet inte längre dominerar analysen, och att de förväntade generna framträder i rätt riktning — såsom CRISPLD2, inducerad av dexametason i studien på människa, eller genen Pasilla själv, nedreglerad i studien där den just hade inaktiverats.

Två viktiga förtydliganden. Denna validering avser ett urval av referensdataset (två i dag, fler på väg), och inte ”alla RNA-seq”: den intygar metodens tillförlitlighet, inte riktigheten i en särskild analys som utförts på dina egna data. För övrigt bekräftar den att biologin framträder korrekt, men syftar inte till överensstämmelse på siffran när med en dedikerad RNA-seq-metod (DESeq2), som fortfarande är under utveckling.

Charlie · Biodata – Bioinformatik — genuttrycksanalys Dina data → utforskningen → den biologiska tolkningen