Мутация vs Полиморфизм
Классические задачи по генетике настойчиво пытались научить нас предсказывать, какие дети родятся, если мужчина гемофилик встретит женщину с полидактилией. Но почему-то очень мало говорится о том, чем занимаются генетики большую часть своего времени.
Сравнивают данные, полученные в результате генетического исследования пациента, с референсной последовательностью и геномами множества других людей.
Как появилась первая референсная последовательность? — с того момента, как появились технологии, позволяющие читать последовательность ДНК, зародилась идея прочесть геном человека. В 1990 году начался международный проект "Геном человека", а вскоре у него появился конкурент — коммерческий проект по расшифровке ДНК человека компании Celera Genomics. Каждая научная группа использовала ДНК нескольких различных добровольцев. То есть одного человека, чья ДНК стала бы считаться референсной, нет. Правда, около 70% все-таки принадлежали одному добровольцу с кодовым именем RP11. Большую часть добровольцев, конечно же, составляли европейцы.
В 2004 году был готов финальный вариант первого генома человека.
Как получали данные о последовательности ДНК? — если говорить упрощенно, то сначала ДНК разбивали на фрагменты, затем определяли последовательность каждого фрагмента, а после восстанавливали единую последовательность путём объединения перекрывающихся участков.
Как отдельные фрагменты ДНК-секвенирования объединились в единую последовательность? — фрагменты соединялись на основе общих нуклеотидных последовательностей. Грубо говоря, фрагменты подбирали так, чтобы конец одного фрагмента совпадал с началом следующего (перекрытие). Затем их объединяли с другими перекрывающимися фрагментами и восстанавливали все более крупные сегменты.
Однако местоположение не всех фрагментов можно легко узнать. Особую сложность представляют участки ДНК, состоящие из множества повторов. Мне понравилось сравнение с пазлом: полосу голубого неба собрать сложнее всего, потому что рисунок на каждой детали одинаковый и непросто понять, в какой последовательности они должны располагаться.
Подобных повторяющихся участков в геноме множество. К ним относятся тандемные повторы — короткие мотивы, повторяющиеся множество раз подряд, и диспергированные (рассеянные) повторы — участки, копии которых разбросаны по всему геному. Существуют и другие примеры непростых для анализа задач, но современные методы все успешнее справляются с подобными трудностями.
Какая последовательность считается референсной на сегодняшний день? — современная референсная последовательность значительно дополнена, что стало возможным за счет объединения технологий секвенирования и вычислительных методов сборки. Текущая референсная сборка генома человека — GRCh38 (обозначается также как hg38, расшифровывается как "Genome Reference Consortium Human Build 38"). Она используется для решения большинства задач, но является неполной т.к. не покрывает 100% генома.
В 2022 году консорциум T2T (Telomere-to-Telomere) опубликовал первый полностью завершённый геном человека — T2T-CHM13, который закрыл пробелы, существующие в GRCh38. Интересно, что в данном случае исследовали не ДНК нескольких добровольцев, а геном диплоидной, но практически полностью гомозиготной клеточной линии CHM13.
Если ДНК человека идентична более чем на 99%, имеет ли смысл искать отличия? — учитывая, что в геноме около 3,2 миллиарда пар оснований, даже 0,1% различий — это примерно 3–4 миллиона однонуклеотидных вариантов на один геном.
Где накапливаются данные об отличиях между ДНК? — существуют крупные популяционные базы данных, в которых собирается информация о геномах людей из различных популяций. Среди наиболее значимых — gnomAD (Genome Aggregation Database), dbSNP и ClinVar. Подобные базы данных позволяют судить о частоте варианта.
Ими можно воспользоваться и самостоятельно. Например, перейти на сайт ClinVar, ввести интересующий генетический вариант и узнать о его клинической значимости и связи с заболеваниями (бесплатно и без регистрации).
Но вернемся к терминам мутация и полиморфизм. Разделение, основанное на встречаемости, все больше теряет свою актуальность. К высказываниям “против” можно отнести следующее:
- вариант, являющийся мутацией у пациентов азиатского происхождения, в другой популяции может быть полиморфизмом;
- нет единого мнения относительно того, насколько большой должна быть выборка для классификации варианта как полиморфизма.
Современный подход предлагает использовать нейтральный термин “вариант” и отдельно описывать его клиническую значимость. Классификация ACMG/AMP построена на совокупности множества критериев, а не только встречаемости, и позволяет отнести вариант к одной из 5 категорий:
- Патогенный (Pathogenic) вариант
- Вероятно патогенный (Likely Pathogenic)
- Вариант неопределённого значения (Variant of Uncertain Significance, VUS)
- Вероятно доброкачественный (Likely Benign)
- Доброкачественный (Benign)
Важно помнить, что данная классификация используется для интерпретации генетических вариантов, являющихся наследственными (герминальными). Если мы говорим о соматических мутациях в опухолевых клетках, то используем другие классификации. Например, мутации могут быть драйверными и пассажирскими, а также обладать разной клинической значимостью, которую, к примеру, можно оценить по шкале ESCAT.