Charlie Charlie·Biodata – Біоінформатика
Часті запитання — шлях, результати, довіра

Часті запитання — Charlie Біоінформатика

Charlie допомагає Вам досліджувати та інтерпретувати дані генної експресії без написання коду. Ці відповіді слідують за ходом Вашого знайомства із застосунком: звідки походять Ваші дані, що Ви можете з ними робити на кожному етапі шляху, чого варті результати та наскільки Ви можете йому довіряти.

1Які типи даних я можу аналізувати?

Charlie працює на основі матриці експресії: таблиці, де гени розташовані в рядках, а Ваші зразки — у стовпцях. Дві великі родини даних підтримуються від початку до кінця — ДНК-мікрочипи (microarray), значення яких уже в логарифмічній шкалі, та вже нормалізований RNA-seq (у CPM, TPM чи FPKM).

Ви також можете завантажити сирі підрахунки RNA-seq. Charlie їх приймає та належним чином готує до дослідження (аналіз головних компонент, теплові карти, кластеризація). Натомість диференційний аналіз на сирих підрахунках залишається дослідницьким: еталонний статистичний метод для цього випадку — негативна біноміальна модель, як-от DESeq2 — перебуває в розробці. Charlie Вас про це попереджає перед запуском аналізу.

Таблиця нижче читається рядок за рядком: тип файлу, який Ви маєте під рукою, шкала його значень, обробка, яку Charlie застосовує до нього автоматично, та аналізи, що стають Вам доступними.

Ваші даніШкала значеньЩо застосовує CharlieЩо Ви можете робити
ДНК-мікрочип (microarray)log2нічого: значення вже готовіДослідження та диференційний аналіз (limma за замовчуванням, Welch на вибір)
Нормалізований RNA-seq (CPM, TPM, FPKM)лінійна чи логарифмічнапереведення в log2, якщо значення лінійніДослідження та диференційний аналіз (limma за замовчуванням, Welch на вибір)
RNA-seq у сирих підрахункахлінійнакоригує глибину секвенування (CPM), потім переводить у log2Надійне дослідження; диференційний аналіз дослідницький (DESeq2 незабаром)
Файли секвенування (FASTQ)Не підтримується

Усі ці дані вимірюють те саме — експресію генів, тобто РНК. Microarray і RNA-seq відрізняються лише способом її вимірювання. Позначка «вже нормалізований» стосується корекції глибини секвенування, притаманної RNA-seq: більш глибоко секвенований зразок дає скрізь вищі значення без того, щоб будь-який ген був справді сильніше експресований, а CPM, TPM чи FPKM коригують це суто технічне зміщення. Оскільки microarray не секвенує, це поняття його не стосується.

Насамкінець кілька слів про термін «сирий», що охоплює дві дуже різні реальності. Сирі підрахунки — це вже таблиця генів і зразків, просто ще не скоригована на глибину секвенування: Charlie їх приймає. Файли секвенування (FASTQ) — це зовсім інше — прочитання, що виходять із секвенатора, задовго до будь-якої таблиці. Charlie їх не обробляє: він завжди відштовхується від уже сформованої матриці експресії.

2Звідки походять дані: мої файли чи публічна база?

Ви можете працювати на основі власних файлів або публічного набору даних. У першому випадку Ви імпортуєте таблицю зі свого комп'ютера у форматах Excel, CSV чи TSV. У другому — достатньо вказати ідентифікатор GEO (у форматі GSE…): Charlie тоді отримує набір даних безпосередньо з публічної бази NCBI GEO, без того, щоб Вам довелося завантажувати його самостійно.

Поточне обмеження — імпорт GEO

Автоматичне отримання працює для ДНК-мікрочипів (microarray). Для досліджень RNA-seq GEO не публікує значення у стандартній таблиці, яку Charlie вміє читати, а в додаткових файлах, притаманних кожному дослідженню. Тому Charlie не може завантажити їх лише за ідентифікатором — він Вас про це попереджає, а не залишає Вас із порожнім проєктом. Порядок дій: отримайте матрицю експресії зі сторінки GEO дослідження, потім імпортуйте її як файл. Після імпорту вона аналізується точно так само, як будь-який інший набір даних.

Кожен проєкт показує вгорі своє походження та основні характеристики — назву дослідження, кількість зразків і генів, виявлену шкалу, а для набору GEO — його ідентифікатори доступу та платформи. До того ж уже імпортований набір даних можна повторно використати для нового проєкту без повторного імпорту.

3Як відбувається аналіз від початку до кінця?

Charlie організовує роботу у п'яти вкладках, що відповідають природному порядку аналізу.

Усе починається із вкладки Дані, де Ви готуєте свій набір: Charlie тут розпізнає Ваші гени, перевіряє шкалу вимірювань, дає Вам змогу визначити Ваші групи порівняння та переглянути огляд Ваших змінних. Далі йдуть Аналізи, де Ви будуєте свої представлення — головні компоненти, теплові карти, volcano — у вигляді кроків, які Ви поєднуєте в ході свого дослідження. Гени, що привертають Вашу увагу, Ви збираєте у Кошику. На основі цього кошика вкладка Збагачення виявляє надмірно представлені біологічні функції та шляхи. Нарешті, Бібліографія, що з'явиться згодом, пов'яже Ваші гени з науковою літературою.

4Що я можу робити у вкладці «Дані»?

Вкладка Дані об'єднує все, що готує та описує Ваш набір перед аналізом, у трьох розділах.

Перший, Підготовка даних, є її серцем. Charlie тут розпізнає Ваші гени (див. наступне запитання), потім дає Вам змогу відкинути ідентифікатори, які він не зміг анотувати, і стовпці, що не є генами, відфільтрувати відсутні значення, а — якщо контроль якості це підказує — нормалізувати зразки, щоб зробити їх порівнянними. Щоразу Charlie пропонує рекомендацію, але рішення за Вами.

Другий розділ дає Вам змогу створювати власні групи зразків на основі Ваших змінних (за обробкою, за станом…), щоб підготувати порівняння у вкладці Аналізи.

Третій, Огляд даних, дає негайне загальне уявлення про них: фрагмент матриці, зведення виявлених категоріальних змінних (обробка, джерело, тощо) та рейтинг п'ятдесяти найбільш варіабельних генів — перший погляд на те, що вирізняє Ваші зразки, ще до запуску аналізу.

5Що мені дає розпізнавання моїх генів (анотація)?

Файл експресії рідко містить читабельні назви генів: найчастіше це номери зондів (наприклад, ILMN_1802380) або ідентифікатори баз даних (Entrez, Ensembl). Зіставляти їх один за одним із назвами генів — це тривала й схильна до помилок робота, тим паче що потрібно враховувати назви, які змінювалися з часом.

Charlie робить це автоматично. Під час імпорту він розпізнає тип Ваших ідентифікаторів, перекладає їх у назви генів та оновлює ті, що застаріли, до чинної номенклатури. Так Ви отримуєте готовий до аналізу набір даних, у якому гени мають свою поточну назву — без жодного рядка коду та звертання до таблиці відповідності.

Головне, що результат подається Вам без жодної двозначності. Банер «Анотація» показує частку розпізнаних генів (наприклад, «8 763 з 9 980»), джерело анотації та список ідентифікаторів, які не вдалося зіставити — вилучених з аналізів, а не помилково врахованих. Тож Ви завжди знаєте, що Charlie розпізнав, а що залишив осторонь.

6Для яких видів Charlie розпізнає мої гени?

Charlie автоматично анотує гени дев'яти широко досліджуваних видів: людини, миші, щура, дрозофіли, даніо-реріо, черв'яка C. elegans, пекарських дріжджів, модельної рослини Arabidopsis та бактерії E. coli. Щоб цього досягти, він поєднує кілька джерел анотації, доступність яких залежить від виду. Таблиця нижче підсумовує засоби, задіяні для кожного.

ВидЧип IlluminaАнотація з GEOПереклад ідентифікаторів Entrez/EnsemblОновлення назв
Людинаorg.Hs.eg.db✅ HGNC
Мишаorg.Mm.eg.db✅ MGI
Щурorg.Rn.eg.db✅ RGD
Дрозофілаorg.Dm.eg.db✅ FlyBase
Даніо-реріоorg.Dr.eg.db✅ ZFIN
Черв'як (C. elegans)org.Ce.eg.db✅ WormBase
Бактерія (E. coli)org.EcK12.eg.db✅ NCBI / EcoCyc
Рослина (Arabidopsis)org.At.tair.db
Дріжджіorg.Sc.sgd.db
Інший вид✅ (якщо доступно)

Для цих дев'яти видів переклад ідентифікаторів спирається на еталонні бази анотацій Bioconductor (стовпець «Переклад»), що гарантує надійні назви генів. Оновлення застарілих назв ґрунтується на власному органі номенклатури кожного виду — HGNC для людини, FlyBase для дрозофіли й так далі. Воно недоступне для дріжджів та Arabidopsis, чиї бази не надають таблиці синонімів; втрата незначна, адже ці види мають мало старих назв в обігу. Нарешті, пряме розпізнавання чипів Illumina стосується лише людини, миші та щура, через брак еквівалентних чипів для інших видів.

Якщо Ви працюєте з видом, якого немає в цьому списку, аналіз усе одно можливий: Charlie використовує анотацію, надану GEO, якщо вона існує, інакше Ваші ідентифікатори зберігаються як є, і Ви можете надати власний файл відповідності. У будь-якому разі він чітко вказує Вам, коли автоматична анотація недоступна, а не залишає Вас вірити в результат.

7Як Charlie дізнається, яку обробку застосувати до моїх даних?

Перед будь-яким аналізом Charlie визначає шкалу Ваших значень: чи це сирі підрахунки, нормалізовані дані, чи значення вже в логарифмічній шкалі? Це визначення зумовлює застосовувану обробку. Наприклад, для аналізу головних компонент сирі підрахунки спочатку нормалізуються, а потім переводяться в логарифм, щоб глибина секвенування не приховувала біологічний сигнал; уже логарифмічні дані натомість залишаються незмінними, щоб уникнути подвійного логарифмування.

Усе, що Charlie визначає та застосовує, відображається: розпізнана шкала, застосоване перетворення, можливо вилучені гени. Ви можете це перевірити і, якщо автоматичне визначення помиляється чи залишається невизначеним, скоригувати шкалу самостійно.

Залежно від того, що визначає Charlie, ось що він готує та що Ви можете з цим робити:

Charlie визначає…Він готує / пропонує…Що Ви можете робити
log2 (microarray, log-CPM)нічого — це вже готовеусі аналізи, з упевненістю
сирі підрахункикоригує глибину секвенування (CPM), потім переводить у log2надійне дослідження; диференційний аналіз дослідницький
нормалізована лінійна шкала (TPM, FPKM)переводить у log2усі аналізи, з упевненістю
неоднозначна шкалане вгадує: без автоматичного логарифмування, і сигналізує про невизначеністьаналіз виконується як дослідницький; Ви можете уточнити шкалу самостійно
зміщені розподіли між зразкамиперевірка (boxplot + щільність) та рекомендаціязастосувати запропоновану квантильну нормалізацію — окрім сирих підрахунків, де потрібен спеціальний метод

Для будь-якого диференційного аналізу результатом є fold-change у log2, застосовується корекція на множинне тестування (Benjamini-Hochberg за замовчуванням), а попередження сигналізують про надто малі групи.

8Які аналізи я можу виконати та як їх запустити?

Вкладка Аналізи охоплює найпоширеніші представлення: контроль якості зразків, аналіз головних компонент та UMAP для візуалізації структури даних, теплові карти й кореляції, розподіли та диференційну експресію (volcano і MA-plot). Щоб запустити один із них, Ви додаєте крок і вказуєте, залежно від аналізу, групи для порівняння чи потрібні параметри.

Ви можете діяти двома способами. Або Ви будуєте свої аналізи самостійно, обираючи кожен крок і його налаштування. Або Ви спираєтеся на асистента Charlie, який може запропонувати Вам аналіз на основі Ваших критеріїв і скерувати Вас (див. нижче). В обох випадках саме Ви підтверджуєте та запускаєте обчислення.

9Що конкретно містить аналіз?

Кожен аналіз має форму кроку, доданого до Вашого звіту, який збирає в одному місці весь контекст результату. Тут є сам графік разом із інформацією, що його характеризує; параметри налаштування, які Ви можете змінювати і вплив яких іноді відображається наживо на рисунку; пояснювальна легенда, згенерована на вимогу, для інтерпретації результату; деталі обчислення, що нагадують застосований метод і налаштування; можливі попередження про якість; та попередній перегляд даних, що послужили для створення графіка. Так Ви бачите не лише результат, а й те, як його було отримано.

Ці кроки поєднуються вільно: Ви накопичуєте їх, щоб вести своє дослідження, від загального огляду до конкретних генів, що Вас цікавлять — які Ви тоді складаєте до Кошика.

10На volcano, як обрати статистичний тест і корекцію?

Volcano — це аналіз диференційної експресії: він відповідає на запитання «які гени експресуються по-різному між моїми двома групами?». Кожен ген розміщується за двома осями — величина зміни (log2 fold-change, по горизонталі) та статистична надійність результату (скоригована p-value, по вертикалі). Ген оголошується «значущим», лише якщо він долає водночас поріг величини та поріг p-value: сильна, але ненадійна зміна, чи надійний, але крихітний результат не є достатніми. Два налаштування, зібрані в розширених параметрах аналізу, керують цим вердиктом.

Статистичний тест адаптується до природи Ваших даних. За замовчуванням Charlie обирає модерований t-тест (limma), історичний еталон аналізу експресії: замість оцінювати варіабельність кожного гена окремо — що дуже непевно, коли зразків небагато — він консолідує цю оцінку, спираючись на всю сукупність генів набору. Виграш очевидний на малих групах, найпоширенішій ситуації. Тест Welch, більш класичний, залишається доступним: на достатньо великих групах обидва методи збігаються до того самого результату, тож вибір тоді майже не має жодного значення.

Ваші даніРекомендований тест
Microarray чи вже нормалізований RNA-seqlimma (за замовчуванням) — тим корисніший, чим менші групи
Ті самі дані, з достатньо великими групамиlimma чи Welch: еквівалентні результати
RNA-seq у сирих підрахункахспеціальний метод (DESeq2) незабаром — t-тест є лише наближенням

На сирих підрахунках RNA-seq жоден із цих двох тестів не є ідеальним: еталонні методи ґрунтуються на моделі, розробленій для підрахунків, як-от DESeq2 чи edgeR, ще в розробці. Charlie тоді застосовує t-тест як наближення й попереджає Вас, що результат є дослідницьким.

Корекція на множинне тестування натомість є необхідною. Volcano тестує тисячі генів за один раз; без корекції частина з них виявилася б «значущою» лише через випадковість. За замовчуванням Charlie застосовує корекцію Benjamini-Hochberg, яка контролює частоту хибних відкриттів — вдалий компроміс для аналізу такого масштабу. Корекції Bonferroni чи Holm, також доступні, значно суворіші: задумані, щоб відкинути найменший хибнопозитивний результат, вони стають надто консервативними на тисячах генів і ризикують стерти цілком реальний сигнал. Залиште їх для окремих випадків.

Нарешті, саме розмір груп визначає потужність аналізу. За одного зразка на групу жоден тест неможливий; за двох-чотирьох потужність залишається дуже обмеженою, а результати мають лише орієнтовну цінність; тільки з більшими групами висновки стають надійними. Charlie сигналізує про ці ситуації безпосередньо там, де Ви налаштовуєте аналіз, адже мала чисельність у поєднанні зі строгими порогами часто призводить до «жодного значущого гена», навіть коли слабкий сигнал справді існує.

Порада — коли volcano не повертає жодного значущого гена

Перш ніж послаблювати пороги, переконайтеся, що дві порівнювані групи справді відповідають справжньому біологічному контрасту, а не довільному групуванню. Жоден тест і жодна корекція ніколи не породять сигнал із порівняння, яке його не несе.

11Як асистент Charlie може мені допомогти?

Поряд із Вашими аналізами розмовний асистент знає Ваш набір даних та всю сукупність Ваших результатів. Ви можете попросити його пояснити крок, вибір чи рисунок зрозумілою мовою, прокоментувати результат або запропонувати Вам аналіз, що відповідає тому, що Ви шукаєте — Ви вільні його налаштувати, підтвердити та запустити. Оскільки він спирається на Ваші реальні дані, а не на загальні положення, його пропозиції залишаються конкретними та пристосованими до Вашого набору. Асистування збагачується поступово: на сьогодні, наприклад, визначення груп порівняння залишається у Ваших руках.

12Як дізнатися, чи надійний мій аналіз?

Надійність аналізу залежить насамперед від Ваших даних і Ваших рішень; Charlie їх не замінює, але сигналізує про те, що заслуговує на Вашу увагу, безпосередньо там, де Ви налаштовуєте аналіз. Він застерігає Вас, зокрема, коли група має надто мало зразків для надійного порівняння, коли шкала даних неоднозначна, або коли йдеться про сирі підрахунки, для яких диференційний аналіз залишається дослідницьким (спеціальний метод, як-от DESeq2, перебуває в розробці).

Вибір статистичного методу до того ж адаптується до Ваших даних — модерований t-тест (limma) за замовчуванням, тест Welch, якщо Ви йому надаєте перевагу. І якщо якийсь момент від Вас вислизає, асистент може пояснити Вам застереження чи запропонувати обережніше налаштування. Мета не в тому, щоб вирішувати замість Вас, а в тому, щоб уберегти Вас від висновків на хиткій основі, самі того не знаючи.

13Для чого слугують кошик і збагачення?

У ході Ваших аналізів Ви помічаєте цікаві гени — наприклад, найсильніше диференційні. Ви збираєте їх у Кошику, який стає Вашим робочим списком. Далі вкладка Збагачення використовує цей список, щоб відповісти на ґрунтовне запитання: чи мають ці гени спільну функцію, шлях чи біологічний процес? Charlie звертається до великих баз знань — Gene Ontology, KEGG, Reactome та інших — і виявляє статистично значущо надмірно представлені терміни, щоб перейти від простого списку генів до біологічної інтерпретації.

14Чи можу я довіряти результатам?

Charlie розроблений так, щоб Ви могли судити самостійно, а не надавати сліпу довіру. Ним керують три принципи.

Перший — це прозорість: кожне рішення, прийняте щодо Ваших даних — виявлена шкала, застосоване перетворення, вилучені гени, попередження про якість — відображається і може бути змінене. Ніщо не відбувається мовчки.

Другий — це пояснення: вбудований асистент може пояснити Вам зрозумілою мовою крок, вибір чи результат і привернути Вашу увагу до пасток інтерпретації.

Третій — це валідація на реальних даних: методи Charlie зіставляються з опублікованими наборами даних, чия біологія відома, щоб перевірити, що вони справді знаходять очікувані сигнали (див. наступне запитання).

Насамкінець момент чесності: Charlie зменшує ризик безмовної помилки й сигналізує про свої обмеження, але він не замінює Ваше наукове судження. Для публікації перечитування експертом залишається рекомендованим.

15Звідки Ви знаєте, що обробка RNA-seq є надійною?

Ми регулярно зіставляємо Charlie з набором опублікованих наборів даних, чия біологічна відповідь відома заздалегідь, і перевіряємо, що він знаходить правильні сигнали — а не лише що обчислення виконується. Два дослідження сьогодні слугують еталоном: одне на людині (клітини дихальних шляхів, оброблені дексаметазоном), інше на дрозофілі (нокаут гена Pasilla).

На кожному ми перевіряємо, наприклад, що очікувані групи добре розділяються після підготовки даних, що глибина секвенування більше не домінує в аналізі, і що очікувані гени виявляються в правильному напрямку — як-от CRISPLD2, індукований дексаметазоном у дослідженні на людині, чи сам ген Pasilla, репресований у дослідженні, де його якраз було нокаутовано.

Два важливі уточнення. Ця валідація стосується вибірки еталонних наборів (два сьогодні, інші згодом), а не «усіх RNA-seq»: вона засвідчує надійність методу, а не правильність окремого аналізу, проведеного на Ваших власних даних. Крім того, вона підтверджує, що біологія виявляється коректно, але не має на меті точну до цифри рівність зі спеціальним методом RNA-seq (DESeq2), ще в розробці.

Charlie · Biodata – Біоінформатика — аналіз генної експресії Ваші дані → дослідження → біологічна інтерпретація