У Nature представили Delphy для швидкого байєсівського аналізу спалахів
Nature представив Delphy — вебінструмент для швидкого байєсівського філогенетичного аналізу геномних даних під час спалахів.
У журналі Nature представили Delphy — вебінструмент для масштабованого майже реального часу байєсівського філогенетичного аналізу даних про спалахи інфекцій. Розробка має пришвидшити реконструкцію дерев спорідненості патогенів на основі геномних послідовностей, зберігаючи оцінку невизначеності, яку дають байєсівські методи.
Філогенетика допомагає встановлювати ймовірні зв'язки походження між зразками патогенів, датувати початок спалахів, відстежувати поширення ліній та аналізувати передачу інфекцій. Водночас великі масиви геномних даних є складними для обробки: автори наводять приклад понад 17 мільйонів публічно доступних геномів SARS-CoV-2.
Мутації замість повного перерахунку
Delphy використовує явні дерева з анотаціями мутацій — часово прив'язані філогенетичні дерева, у яких зафіксовано мутації між предковою послідовністю та датованими зразками. Такий підхід особливо ефективний для даних спалахів, де близькі послідовності нерідко відрізняються лише в нулі-двох позиціях геному.
Традиційні байєсівські інструменти, зокрема BEAST, BEAST2, MrBayes і RevBayes, є гнучкими, але потребують значних обчислювальних ресурсів і спеціалізованої підготовки. Через це системи відстеження спалахів часто покладаються на наближені методи максимальної парсимонії або максимальної правдоподібності, які зазвичай будують одну топологію дерева, а невизначеність оцінюють окремо.
Локальні зміни та паралельні обчислення
У Delphy алгоритм Монте-Карло пропонує локальні перестановки піддерев, а співвідношення ймовірностей для таких змін обчислюється за невеликою кількістю зачеплених мутацій. Автори зазначають, що це потребує на порядки менше операцій, ніж аналогічні розрахунки із застосуванням класичної правдоподібності дерева Фельзенштейна.
Програма також може ділити дерево на піддерева та паралельно виконувати локальні кроки алгоритму, після чого знову об'єднувати їх для глобальних змін. Для роботи з пропущеними даними запропоновано метод N-pruning, який не змушує алгоритм штучно відновлювати невідомі нуклеотиди під час перестановок.
Робота у браузері та обмеження
Delphy реалізовано як клієнтський вебзастосунок, який може працювати безпосередньо в браузері; базовим вхідним файлом є вирівнювання послідовностей. Розробники повідомляють, що ретельно перевірили коректність основної реалізації за допомогою Well-Calibrated Simulation Study.
На поточному етапі Delphy не враховує помилки секвенування: імовірність даних дорівнює одиниці, якщо послідовності на кінцях дерева збігаються зі спостереженнями, і нулю — в іншому разі. Автори також вказують, що інструмент наразі непридатний для наборів даних, де дати зразків мають значну невизначеність.