К книге
Простое начало. Как четыре закона физики формируют живой мирЧасть III. Конструирование организмов. Глава 13. Как мы читаем ДНК
71%
Часть III. Конструирование организмов. Глава 13. Как мы читаем ДНК
15

Из предыдущих глав мы узнали, что жизнь предполагает тесное взаимодействие физических объектов и физических законов: молекулы, клетки и органы подчиняются принципам самосборки, регулирования, случайности и масштабирования. Категории объектов и законов не могут быть изолированы друг от друга. Например, белок такой, какой он есть, благодаря самосборке его аминокислот: подталкиваемые беспрестанным броуновским танцем, они исследуют возможности разных трехмерных форм. Геном организма связывает осязаемую материю с силами, которые придают ей форму, кодируя последовательности аминокислот и регуляторные мотивы, объединяющиеся физическими взаимодействиями. Следовательно, если изменить геном, изменится и создаваемый на его основе организм.

До сих пор в этой книге я подсвечивал главным образом проявления физических законов в естественных процессах живого мира. Теперь, в третьей части, мы рассмотрим, как полученные знания применяются для внесения минимальных либо выраженных изменений в жизнедеятельность существ. Физическая природа биологической материи имеет решающее значение не только для внедрения новых технологий, но и для следствий их применения. Например, выводы, которые мы можем сделать из различий между последовательностями ДНК, или спектры вероятных и невероятных исходов изменения этих последовательностей зависят от организации процессов считывания ДНК; от архитектуры белков, синтезируемых в клетках; от сил, направляющих и ограничивающих самосборку; от случайности, присущей микроскопической среде, и от иных биофизических факторов. Помня о физическом контексте жизни, мы научимся различать варианты с высокой и низкой вероятностью, осуществимые и надуманные, а это поможет нам составить реалистичное представление о влиянии биотехнологий настоящего и будущего.

В главе 15 мы доберемся до методов переписывания генома. Но прежде чем писать геном, нужно научиться его читать, распознавая последовательности A, Ц, Г и T, характерные именно для него. Мы овладели этим навыком, создав поразительные технологии, которые используют физические свойства молекулы жизни и созидательную силу самосборки вкупе с микроскопической случайностью.

Почему читать ДНК сложно?

Даже само по себе чтение ДНК дает нам ценные сведения, на основе которых можно делать практические выводы. Например, выявление необычных нуклеотидных последовательностей (мутаций), сопряженных с повышенной вероятностью развития рака или других серьезных заболеваний может подтолкнуть нас к принятию превентивных мер. Или, секвенируя геномы клеток злокачественных опухолей и находя в них специфические генетические «подписи», мы можем подбирать более подходящее лечение. Эти и многие другие применения прочтения ДНК требуют картирования молекулы диаметром два нанометра и длиной метр.

В главе 1 мы узнали, что молекула ДНК напоминает цепочку из звеньев всего четырех типов. Почему же тогда нам нелегко читать последовательность этих звеньев? Если я напишу слово «молекула», вы сразу увидите последовательность букв в нем: М-О-Л-Е-К-У-Л-А. Проблема ДНК в ее малом размере. Длина каждого нуклеотида составляет около трети нанометра, а нанометр – это миллиардная доля, или 10–9, метра. Такой размер очень мал не только для человеческого глаза, но и для любого светового микроскопа. Свет, как и радиоволны или рентгеновские лучи, представляет собой электромагнитную волну – распространяющееся в пространстве возмущение электрического и магнитного полей. У видимого света длина волны, то есть расстояние между ее гребнями, составляет несколько сотен нанометров, а точная величина зависит от цвета этого света. По законам оптики мельчайшие детали, которые можно различить, по размеру сопоставимы с длиной волны падающего на них света – и неважно, какие линзы, зеркала и микроскопы создает человек. Все, что меньше, сливается воедино. Даже если бы мы пометили A, Ц, Г и T разными цветами или маячками, метки отдельных нуклеотидов потерялись бы в море из тысяч соседних – не было бы никакой надежды прочитать ДНК.

Вы можете предположить, что выйти из затруднения позволит получение изображения с помощью не видимого света, а чего-то другого. Но и это не работает. Более короткие волны, несомненно, существуют. Так, длина волны рентгеновского излучения составляет от 0,01 до 10 нанометров. Электроны ведут себя как волны, и если направить их в электронные микроскопы, то длины их волн составляют десятые доли нанометра и даже меньше. Теоретически нуклеотиды ДНК позволила бы разглядеть любая из этих техник, однако на практике возникает множество проблем: рентгеновское излучение сложно фокусировать; высокие энергии рентгеновских лучей и электронных пучков разрушительны; к тому же разные типы нуклеотидов для рентгена и электронов почти идентичны, поэтому мы не смогли бы прочитать последовательность ДНК, даже если бы получили ее изображение. Тем, кто читал главу 1, может показаться странным, что рентгеновское излучение в этом случае бесполезно, ведь именно с его помощью в 1953 году была открыта двойная спиральная структура ДНК. Но для этого рентгеном просвечивали целый кристалл ДНК – решетку из триллионов идентичных молекул. При взаимодействии волн со всеми этими нитями ДНК обнажается общая для них структура винтовой лестницы, последовательность же отдельной нити различить нельзя.

Составляем слова из букв

Получается, читать ДНК нелегко. Через 15 лет после открытия пространственной структуры ДНК Рэй Ву и Дейл Кайзер сумели распознать 12 нуклеотидов в геноме вируса[49]. Весь этот геном содержит около 48 тысяч нуклеотидов. Пять лет спустя Аллан Максам и Уолтер Гилберт получили последовательность из 24 нуклеотидов ДНК – область lac-оператора (см. главу 4). Для этого потребовалось два года напряженной работы – на секвенирование с такой скоростью генома человека ушло бы 250 миллионов лет. Явно были нужны куда более эффективные методы.

И такие методы появились1. Несколько следующих страниц мы посвятим именно им – и не только из-за их значимости в современном мире, но и потому, что одним своим существованием они заявляют о важности познания физической природы ДНК и других биомолекул. Понятийным фоном для этой практической главы послужат такие свойства, как размер, жесткость и электрический заряд, и такие темы, как самосборка и предсказуемая случайность.

В 1976–1977 годах появились два остроумных метода определения последовательности ДНК: один разработали те самые Максам и Гилберт, а другой – Фредерик Сэнгер с коллегами. Метод Сэнгера оказался проще и в итоге доминировал в отрасли больше двух десятилетий. Я начну рассказ о техниках чтения ДНК именно с секвенирования по Сэнгеру.

Представьте, что у вас нет возможности последовательно, буква за буквой читать слово М-О-Л-Е-К-У-Л-А, но вы видите перед собой множество оборванных копий этого слова, в каждой из которых различима лишь последняя буква: «??Л», «?О», «?????У» и так далее. Заметив, что все трехбуквенные фрагменты оканчиваются на Л, все четырехбуквенные – на Е и так далее, вы установите, что вместе они образуют слово МОЛЕКУЛА. В принципе, в этом и состоит суть метода Сэнгера и еще нескольких подходов: чтение осуществляется путем распознавания отдельных кусочков, а не последовательного движения по цепи.

В главе 1 мы уже описывали несколько шагов из этого рецепта. Представьте себе не весь геном, а что-то более податливое – скажем, фрагмент ДНК размером несколько сотен пар нуклеотидов. Полимеразная цепная реакция (ПЦР) создает несметное число копий этого фрагмента, а тепло разделяет каждую двойную спираль на одноцепочечные половинки. Пока забудьте об одной из них и представьте миллионы идентичных одноцепочечных ДНК. Как вы помните, ДНК-полимераза создает идеальный комплемент любой цепи ДНК: руководствуясь принципом комплементарности, она сшивает из свободных нуклеотидов новую партнерскую цепь. А теперь представьте, что ученый применяет ДНК-полимеразу для репликации ДНК, как в нормальной ПЦР, но вводит в массив свободных нуклеотидов небольшое количество дефектных молекул: они мало отличаются от обычных A, Ц, Г, T и по-прежнему встраиваются в растущую цепь ДНК, но уже к ним новые нуклеотиды присоединиться не могут. Полимераза не умеет отбраковывать такое строительное сырье, и если ей попадается нормальный свободный нуклеотид, новая цепь удлиняется, если же встраивается измененный вариант, он блокирует дальнейший синтез и остается в цепи последним. Поскольку добавление терминирующих нуклеотидов происходит по воле случая и сравнительно редко, ученый получает множество цепочек ДНК, которые начинаются одинаково, но различаются по длине.

Пока складывается впечатление, что измененные нуклеотиды просто нарушают ход ПЦР, однако они сконструированы так, чтобы не только препятствовать удлинению ДНК, но и работать «маячками» – испускать свет одного из четырех цветов, уникальных для не-совсем-A, не-совсем-Ц, не-совсем-Г и не-совсем-T. Распознаваемым сигналом могут служить не только цвета. Сначала в секвенировании по Сэнгеру использовали радиоактивные метки, а вместо ПЦР (которую тогда еще не изобрели) для клонирования ДНК привлекали бактерий. Здесь мы описываем более поздние и эффективные разновидности метода, основанные, однако, на тех же принципах[50].

На последнем этапе плавления ДНК-дуплекс разделяется на две нити, и фрагменты разной длины оказываются маркированными на концах: теперь они напоминают те куски слов, где видно лишь последнюю букву. Ученый по-прежнему не знает длину конкретных фрагментов, и они слишком малы, чтобы наблюдать их в видимом свете. Как мы узнали из главы 1, ПЦР эксплуатирует одну из важных физических характеристик ДНК – плавление, то есть разделение двойной спирали на отдельные цепи при превышении специфической температуры. Секвенирование по Сэнгеру задействует и другое важное свойство ДНК – электрический заряд.

Как мы отметили в главе 3, описывая наматывание ДНК на гистоны, ДНК заряжена отрицательно, а значит, ее можно перемещать с помощью электрических полей: притягивать к положительно заряженным электродам и отталкивать от отрицательно заряженных2. В обычной воде кусочки ДНК движутся со сходной скоростью вне зависимости от размера. У крупных фрагментов заряд больше, а следовательно, их толкает бо́льшая электрическая сила, но и сопротивление жидкости они встречают бо́льшее. Физика масштабирования этих двух сил в зависимости от размера фрагмента сложна и неочевидна, но в итоге их эффекты почти нивелируют друг друга, и в негустой жидкости подвижность фрагмента слабо зависит от его длины. А вот в гелевых пластинах ситуация меняется. Длинные молекулярные цепочки пищевого желатина, например, спутываются и формируют пористую трехмерную сеть, пропускающую воду. Чтобы перемещаться по гелю, однонитевая ДНК (черная на рисунке) должна змейкой пробираться через поры – по-научному это называется рептацией. ДНК приходится то и дело извиваться, с чем короткие молекулы справляются гораздо быстрее, чем длинные.

Предсказуемая случайность броуновского движения – важнейшее условие для такого способа перемещения. Без нее ДНК застревала бы в геле, каким бы сильным ни было электрическое поле: попади концы нити в разные поры, молекула повисла бы на препятствии, как полотенце на веревке, и не смогла бы высвободиться. Но благодаря броуновскому движению ДНК постоянно колеблется и переориентируется, выбираясь из одного отверстия и проскальзывая сквозь другое. Статистическая прогнозируемость микроскопической случайности дает нам четко определенную и поддающуюся математической обработке скорость движения молекулы.

Итак, после амплификации ДНК с проставлением концевых меток и прогона фрагментов ДНК через гель под действием электрического поля[51] мы получаем возможность прочитать нуклеотидную последовательность. Все фрагменты одной и той же длины будут светиться одним цветом. Допустим, нити из 27 нуклеотидов заканчиваются модифицированным Ц, несущим, скажем, красную метку. А нити из 28 нуклеотидов заканчиваются модифицированным T с синей меткой. И так далее. Среди нитей из 27 нуклеотидов нет ни одной синей, поскольку все фрагменты этой длины, как точные копии друг друга, должны заканчиваться Ц, а все терминирующие Ц – красные. (Быть может, читая последние страницы, вы переживали за выпавшую из нашего поля зрения вторую исходную цепь ДНК, которая могла бы стать матрицей для второго набора молекулярных фрагментов. Не бойтесь: в секвенировании по Сэнгеру особый подбор праймеров заставляет ДНК-полимеразу работать только с одной из цепей двойной спирали, потому вторая вообще не реплицируется.)

Все фрагменты ДНК совместно попадают в тонкую трубку с гелем, проходя по которой, разделяются из-за разной скорости движения. Наблюдая за флуоресценцией проходящих через трубку точек, ученый фиксирует, например, вначале красный сигнал, затем синий, еще один синий, за ним зеленый и так далее, и интерпретирует их как последовательность ЦTTA+++++. Вот мы и прочитали ДНК.

Секвенирование по Сэнгеру и его вариации, которые совершенствовались по мере развития технологий, сегодня часто называют методами секвенирования первого поколения. В середине 1980-х они позволяли читать ежедневно около тысячи нуклеотидов, или, как принято говорить, оснований. Разницей между нуклеотидами и основаниями здесь можно пренебречь. (Но если быть точными, нуклеотид состоит из аденинового, цитозинового, гуанинового или тиминового азотистого основания, сахара под названием дезоксирибоза и нескольких атомов фосфора и кислорода, объединенных в фосфатную группу. Сахара соседних нуклеотидов связываются друг с другом через фосфатные группы, формируя нить ДНК.)

Чтобы установить последовательность всего генома, нужно виртуально соединить друг с другом все фрагменты. В 1982 году мы собрали полный геном бактериального вируса из 40 тысяч оснований, малый фрагмент которого в 1968 году прочитали Ву и Гилберт. Геном дрожжей S. cerevisiae (12 миллионов оснований) полностью секвенировали в 1996-м, а геном круглого червя C. elegans (100 миллионов оснований) – в 1998-м. Но самой желанной целью был, конечно же, геном Homo sapiens. Секвенирование по Сэнгеру в принципе могло бы справиться с этой задачей, но применение этого метода в отношении генома с миллиардами оснований представлялось огромным технологическим вызовом. Такая задача требовала усовершенствований не только в биохимии – связанных, например, с терминирующими нуклеотидами, – но и в инструментарии физической работы с ДНК: нужно было повышать скорость и надежность плавления и перемещения молекул, детекции световых сигналов и многого другого.

В 1988 году Конгресс США одобрил выделение средств на проект «Геном человека», который планировали запустить в 1990-м и потратить на его реализацию 15 лет и 3 миллиарда долларов. (Для сравнения: в 1990 году совокупные расходы федерального бюджета США на исследования вне оборонного сектора составили около 23 миллиардов.) Подобно космической программе «Аполлон» в 1960-х, проект «Геном человека» ассоциировался с покорением новых рубежей – на сей раз во внутренней вселенной клетки. Государство осуществляло финансирование и управление проектом через Национальные институты здоровья и Министерство энергетики США, хотя и при значительном участии партнеров из других стран. В 1998 году финансируемая из частного капитала группа биотехнолога Крейга Вентера объявила, что планирует самостоятельно секвенировать геном человека, причем быстрее и дешевле. Это положило начало яростной гонке. Обе группы добились успеха и в 2001 году сообщили о прочтении 90 % генома человека. В 2003-м доля покрытия выросла до 99 %, что позволило заявить о выполнении задачи, по сути, на два года раньше намеченного срока. Но нужно было дочитать еще несколько фрагментов, которые не удалось секвенировать сразу из-за сложностей типа длинных нуклеотидных повторов, и к 2004 году геном был определен уже на 99,7 %3.

Вам, возможно, интересно, чей геном тогда секвенировали. В обоих проектах геномы были коллективными: ДНК брали у нескольких человек, и разные прочитанные фрагменты от разных людей должны были дать общую для нашего вида картину. В итоге, однако, вышло так, что бо́льшая часть генетического материала принадлежала двум персонам: в проекте «Геном человека» – вроде бы анониму из города Буффало в штате Нью-Йорк, а в проекте Вентера – анониму, которым, как выяснилось позже, был… сам Крейг Вентер. Эти люди, разумеется, не представляют все человечество: чтобы изучить целый вид, нам нужно добыть его статистический портрет, то есть секвенировать гораздо больше человеческих геномов. Точно так же, если бы у меня обнаружили рак, мой врач захотел бы взглянуть на геном моих, а не средневидовых, злокачественных клеток. Чтобы преодолеть эти ограничения, требовались гораздо более быстрые и дешевые технологии. К счастью, их внедрение было уже не за горами.

Читаем много слов одновременно

При общей стоимости 3 миллиарда долларов чтение каждой пары оснований в проекте «Геном человека» обходилось примерно в доллар. Это было поразительным достижением с учетом того, что еще не сменилось даже поколение, не знавшее структуру ДНК, но все же недостаточным, чтобы применять такую технологию рутинно. В начале XXI века появилось несколько новых хитроумных методов, разработанных отчасти благодаря госфинансированию инноваций в сфере секвенирования. В совокупности эти методы второго поколения называют еще высокопроизводительными, но чаще просто секвенированием нового поколения4. В секвенировании первого поколения (по Сэнгеру) намноженные фрагменты читаются по очереди. Их смешивание обернулось бы катастрофой, поскольку мы потеряли бы уникальное соответствие между длиной оборванного субфрагмента и его меченым нуклеотидом-терминатором. В методы второго поколения изначально заложена параллельность: они позволяют анализировать множество фрагментов одновременно, а в ряде случаев даже читать цепи ДНК по мере их синтеза. Давайте познакомимся с несколькими новыми методами. Различаясь массой деталей, все они используют физические свойства ДНК и (или) связанных с ДНК материалов.

Пиросеквенирование появилось отчасти благодаря удивительным способностям светлячков5. Как мы знаем, ДНК-полимераза прикрепляет новые нуклеотиды к растущим нитям ДНК. Тщательно пересчитав атомы в составе свободного нуклеотида и в составе встроенного в нить, мы обнаружим, что соответствие между ними не полное. В ходе реакции пришивания нуклеотида к цепочке ДНК высвобождается крошечная молекула из двух атомов фосфора и семи атомов кислорода – пирофосфат. Особый белок в составе смеси для пиросеквенирования превращает пирофосфат в АТФ – энергетическую молекулу, которую клетки используют для разных операций. Одна из них – светоиспускающая химическая реакция, выполняемая белками люциферазами, которые расходуют АТФ в качестве топлива. (В переводе с латыни lucifer означает «несущий свет».) Такие организмы, как светлячки, жуки-щелкуны и светящиеся грибы, сами производят люциферазы. Как мы узнали, рассматривая в главе 2 зеленый флуоресцентный белок медузы, многообразие жизни предоставляет нам уйму инструментов, которые можно творчески приспособить для множества задач.

Пиросеквенирование работает следующим образом. Как и в методе Сэнгера, все начинается с множественного копирования фрагментов ДНК и их разделения на одиночные цепи нагреванием. И снова ДНК-полимераза строит вторую, комплементарную цепь по матрице одиночной. Представьте, что у нас в реакционной лунке закреплена единственная одноцепочечная молекула ДНК. Ученый наливает в эту лунку раствор, содержащий люциферазу и другие ингредиенты, но из четырех типов нуклеотидов там есть только один – скажем, А. Если за этим следует световой импульс, значит, ДНК-полимераза встроила А в растущую цепь, то есть он оказался подходящим, комплементарным первому неспаренному нуклеотиду матрицы. Если вспышки нет, А не подошел и нужно пробовать другие нуклеотиды. Ученый выливает из лунки раствор с A и трижды повторяет процесс – с Ц, Г и T. Лишь в одном случае из четырех он видит вспышку света. Теперь очередная буква известна. Повторяя процесс снова, он по излучению кванта света узнает следующую букву, затем еще одну и так далее. То есть ДНК читается по мере синтеза ее комплемента.

Я не объяснил, как можно распараллелить процесс. Помимо этой задачи у метода крайне высоки требования к чувствительности: высвобождение единственного пирофосфата должно неизбежно вести к тому, чтобы единственная люцифераза испустила одиночный, очень слабый световой импульс, который мы во что бы то ни стало обязаны засечь. Если на любом из этапов произойдет сбой, мы пропустим букву. Обе задачи, параллелизм и надежность, решаются с помощью одной физической тактики – объединения идентичных фрагментов ДНК в массивы.

Как и в секвенировании по Сэнгеру, геномную ДНК дробят на случайные фрагменты длиной до тысячи оснований, к их концам пришивают короткие универсальные адаптеры с известными нуклеотидными последовательностями. Затем плавлением разделяют все фрагменты на отдельные цепи (см. главу 1) и смешивают в растворе с микроскопическими шариками, к поверхности которых привязаны маленькие «якоря», комплементарные одному из ДНК-адаптеров. Пропорции смеси продумывают так, чтобы шариков оказалось значительно больше, чем ДНК, и вероятность заякоривания на каждом шарике сразу нескольких фрагментов ДНК стремилась к нулю.

Шарики и ДНК плавают в водном растворе. Если смешать его с маслом, при взбалтывании или в потоке образуются окруженные маслом капли раствора, заключающие в себе не более одного шарика и размером не сильно его превосходящие.

Те самые «якоря» на поверхности шариков служат праймерами для инициации синтеза цепи ДНК, комплементарной взаимодействующему с якорем фрагменту. В каждой капле раствора содержится все необходимое для ПЦР[52]: ДНК-полимераза, нуклеотиды и праймеры для последующих раундов репликации. Так в капле можно создать около миллиона копий исходного фрагмента. По окончании репликации капли собирают вместе и добавляют к ним мыло или спирт, чтобы уменьшить силу поверхностного натяжения, благодаря которой каждая капля в масле оставалась изолированной (см. главу 11). Капли сливаются, и раствор течет по плашке с крошечными лунками диаметром чуть больше шарика. В результате в каждую лунку попадает по одной сфере, покрытой множеством одинаковых двуцепочечных ДНК; одна из цепей каждого дуплекса удерживается на шарике якорными праймерами. Когда мы плавим эту ДНК и смываем высвобожденные нити, у нас остается множество распределенных по лункам сфер, каждая из которых покрыта своим типом леса из идентичных однонитевых ДНК.

Теперь можно приступать к пиросеквенированию и фиксировать в каждой лунке вспышки света. Они возникают то и дело по мере синтеза цепей ДНК, комплементарных миллиону связанных с шариком матриц. Соответственно, вспышки эти в миллион раз ярче, чем при испускании света одной молекулой ДНК. Если в последовательности ДНК несколько раз подряд повторяется одна и та же буква, яркость вспышки растет пропорционально числу повторов (до некоторого предела): двойная А, например, дает вспышку вдвое ярче. Ученые, а точнее их аппараты, фиксируют последовательность и интенсивность световых сигналов и таким образом читают ДНК.

Эта сложная схема действительно работает и благодаря приемлемой надежности стала первым коммерциализированным методом секвенирования нового поколения: в 2005 году его вывела на рынок компания 454 Life Sciences. Примерно за 500 тысяч долларов можно было купить прибор для пиросеквенирования, выдающий в виде длинной череды букв нуклеотидную последовательность загруженной в него ДНК6. При такой стоимости вы вряд ли украсили бы им свою гостиную, но исследовательским институтам среднего размера он был вполне по карману. (Для сравнения: в 2005 году дом в США можно было купить в среднем за 240 тысяч долларов.) Сегодня пиросеквенаторы не продаются: их уже успели вытеснить новые, не менее впечатляющие технологии.

В близком к пиросеквенированию методе – полупроводниковом секвенировании – ставка делается на другой элемент, высвобождаемый при встраивании нуклеотида в растущую нить ДНК7. Он настолько мал и вроде бы незначителен, что опора на его детекцию кажется совсем уж удивительной. Это одиночный протон. Все, что окружает нас, состоит из протонов, нейтронов и электронов. Легчайший из химических элементов, водород, представляет собой совокупность одного положительно заряженного протона и одного отрицательно заряженного электрона. Одинокий протон и того меньше. Обнаруживать его быстро и надежно позволяет совершенно не биологическая технология – транзистор.

Транзисторы – основные компоненты электрических схем мобильных телефонов, компьютеров и несметного числа других электронных устройств. В каждом транзисторе электрический ток течет от одной точки к другой, ориентируясь на указания, поступающие из третьей точки, примерно как движение речных судов подчиняется командам оператора разводного моста. В так называемых полевых транзисторах контролирующим фактором выступает электрическое поле – например, поле протона, находящегося вблизи поверхности транзистора.

Как и при пиросеквенировании, шарики, покрытые фрагментами клонированной ДНК, распределяются по отдельным микролункам. Но эти лунки размещены на полупроводниковом чипе, где у дна каждой из них работает особый полевой транзистор. Вместо вспышек света здесь регистрируются импульсы электрического тока[53]. Эту технологию коммерциализировала компания Ion Torrent, основанная весьма продуктивным биотехнологом Джонатаном Ротбергом, который раньше возглавлял 454 Life Sciences. Ion Torrent представила свой секвенатор Personal Genome Machine в 2010 году8. Он умещался на столе и стоил всего 50 тысяч долларов – меньше удвоенной средней стоимости нового автомобиля в том же году.

Однако господствующая технология секвенирования нового поколения полагается на искусную химическую модификацию ДНК, а не на замысловатую детекцию встраивания нуклеотидов9. Как вы помните, в секвенировании по Сэнгеру рост новой цепи ДНК прерывается присоединением модифицированного нуклеотида. К концу 1990-х созрело более гибкое решение – обратимо терминирующие и флуоресцирующие нуклеотиды. Во время репликации, то есть синтеза комплементарной цепи, изучаемого ДНК-фрагмента ученый вводит модифицированные A, Ц, Г или T, каждый из которых флуоресцирует уникальным цветом и обрывает дальнейшее наращивание цепи[54]. После отмывки образца от не встроившихся молекул ученый с помощью лазера регистрирует цвет только что добавленного в цепь нуклеотида. Флуоресцирующий участок и участок, блокирущий работу полимеразы, крепятся к нормальному «телу» нуклеотида цепочкой из атомов, которую можно химически расщеплять. После обработки расщепляющими агентами ученый получает обычную, без терминаторов и меток ДНК, готовую к присоединению следующего нуклеотида, и так процесс раз за разом повторяется. Как правило, реакции проводят на стеклянных плашках, усеянных кластерами реплицирующихся фрагментов ДНК, а камеры фиксируют цветовые вспышки, которые появляются и исчезают в каждом кластере.

Эта технология известна как метод Illumina – по названию компании, которая приобрела ее разработчика. Инструментарий для такого секвенирования стоит где-то от 100 тысяч до миллионов долларов в зависимости, например, от количества оснований, определяемых за одно прочтение. Как и в других технологиях секвенирования, нужно немало времени и денег, чтобы подготовить образцы ДНК, стеклянные плашки с образцами или другие платформы. Без учета расходов на покупку секвенатора прочитать миллиард ДНК-оснований методом Illumina стоит от 5 до 150 долларов, а методом полупроводникового секвенирования – около 10 тысяч долларов, и это существенно повышает привлекательность первого метода. Ниже я еще вернусь к вопросу стоимости, но хочу отметить, что все эти суммы в любом случае гораздо меньше тех 3 миллиардов долларов, которые ушли на секвенирование 3 миллиардов оснований в исходном проекте «Геном человека».

Читаем слова по одному

Провести черту между вторым и третьим поколениями методов секвенирования сложнее, чем между первым и вторым. Новые техники появляются не взрывоподобно, перемежаясь затишьями, а рождаются в результате непрерывной деятельности на множестве пересекающихся фронтов. Но все же есть удобный и относительно корректный с хронологической точки зрения способ выделить третье поколение: эти методы предполагают секвенирование одиночных молекул ДНК без их амплификации.

Так, в рамках одномолекулярного секвенирования в реальном времени (SMRT), выведенного на рынок компанией Pacific Biosciences, отдельные молекулы нетипичной ДНК-полимеразы фиксируют в наноячейках на кремниевой подложке с алюминиевым напылением и, прицельно освещая через дно, наблюдают за их работой10. Подложка обладает такими оптическими характеристиками, что флуоресцирующие разными цветами нуклеотиды видны только в момент их встраивания в растущую молекулу ДНК[55].

В самой интересной из новых технологий секвенирования ДНК, нанопоровой, не используют ни растущую ДНК, ни цветные нуклеотиды, ни даже ДНК-полимеразу11. Здесь можно пренебречь всем, что на последних страницах было написано о методах, в которых секвенирование привязано к синтезу, и вернуться к тому, с чего мы начинали: поочередно определять нуклеотиды на уже сформированной нити ДНК. Как мы помним, различать основания с помощью света невозможно, зато можно рассчитывать на электричество.

Представьте единственную пору нанометрового масштаба в мембране, разделяющей резервуар с жидкостью на два отсека. В водном растворе по обе стороны от нее содержатся ионы – электрически заряженные атомы или молекулы. При приложении к резервуару напряжения ионы начинают проходить сквозь пору, и силу этого электрического тока можно измерить. Если пора частично перекрыта, ток будет слабее – иными словами, сила тока показывает, насколько пора доступна ионам. Теперь представьте, что через пору протискивается нить ДНК. Ее основания – A, Ц, Г и T – различаются числом атомов и размерами, а следовательно, попадая в пору, по-разному снижают силу тока. Чтобы превратить этот принцип в метод секвенирования, нужно уметь оптимально протаскивать ДНК сквозь пору. В первых устройствах отрицательно заряженная по своей природе ДНК перемещалась, как и прочие ионы, под действием разности потенциалов на сторонах мембраны. Но работало это плохо – в основном потому, что молекула проскальзывала через пору слишком быстро и точно измерить силу тока при прохождении каждого нуклеотида не получалось. Как же решили эту проблему? Один из подходов задействовал белки. Существует немало белков, которые в норме передвигаются вдоль ДНК и совершают с ней какие-то действия, – например, ДНК-полимеразы или хеликазы. Если зафиксировать один из таких белков у входа в нанопору (на следующем рисунке изображен как светло-серые спирали12), он будет своим обычным рабочим инструментарием размеренно направлять ДНК в пору. Из главы 2 мы узнали, что многие белки можно считать природными машинами нанометровых масштабов. Здесь одну из них нагрузили работой в месте, недоступном для других исполнителей. Кроме того, белки способны формировать и сами поры: как мы выяснили в главе 2, многие пронизывающие мембрану белки могут укладываться так, что внутри них образуется сквозной канал. И вот мы снова наблюдаем самосборку.

Концепция нанопорового секвенирования проста, и еще в 1980-х в ней читались задатки перспективной технологии. Ее реализация, однако, потребовала немалых усилий. Сначала ученые показали надежность внедрения нанопор в искусственные барьеры – тогда еще не с целью секвенирования, а просто для понимания структуры пор и разработки платформ, позволяющих работать с мембранно-белковыми комплексами. Первые опыты по переносу ДНК через поры с помощью электрического поля помогли разобраться в физике движения в ограниченных пространствах. Хотя к началу 2000-х специалисты уже располагали основными принципами, многим сторонним наблюдателям, включая меня, было сложно разглядеть в нанопоровом секвенировании мощную и надежную технологию будущего. Необходимо было искусно скомпоновать поры, ДНК-связывающие белки, мембраны в несколько нанометров толщиной и электроды. Затем нужно было отработать высокочувствительные измерения силы тока и исключить при этом закупорку пор примесями или поврежденными белками. Эту пугающую инженерную задачу взвалила на себя компания Oxford Nanopore, которая занимается, как можно догадаться, в основном нанопоровой детекцией молекул. Первый прибор ученым представили в 2014 году – это была пилотная версия для оценки эффективности метода, – а теперь на рынке мы можем выбирать уже из нескольких разных аппаратов. Самый маленький сравним по размеру с большим пальцем или флешкой и, прямо как она, подключается к компьютеру через USB-порт. Привлекательность прибора во многом объясняется портативностью и низкой стоимостью. Например, в 2014-м с его помощью секвенировали геном эболавирусов, выделенных из 14 гвинейских пациентов. Его картировали уже через два дня после взятия проб, блестяще продемонстрировав потенциал скоростного секвенирования в полевых условиях. Эта технология позволяет оперативно выявлять источник распространения болезни и потенциально опасные варианты патогенов.

Недостаток нанопорового секвенирования в его не самой высокой точности: несколько процентов оснований может читаться некорректно, при том что метод Illumina допускает лишь около 0,1 % ошибок. Величина погрешности, правда, важна не всегда. При составлении подробной карты генома и в пренатальных анализах на точечные, но значимые мутации нам критически важно сводить число ошибок к минимуму. В мониторинге потенциально опасных патогенов и состава микробных сообществ сниженная точность метода вполне компенсируется его быстротой и удобством[56].

Геном дешевеет и дешевеет

Прорывы в секвенировании ДНК оказались поразительными, и от будущего, вероятно, следует ожидать еще большего. Я уже упоминал рыночную стоимость этих технологий, а теперь давайте посмотрим, во что ученым обходится определение нуклеотидной последовательности образца ДНК. Удобной мерой будет стоимость секвенирования одного человеческого генома – иными словами, 3 миллиардов оснований. Как вы помните, на первый геном ушло 3 миллиарда долларов США, по доллару на основание. Уже к 2006 году затраты снизились больше чем на 99 % – примерно до 13 миллионов долларов. График изменения стоимости секвенирования во времени просто изумляет.

Стоимость секвенирования одного человеческого генома

Вертикальная ось на этом графике логарифмическая, горизонтальная – обычная. Стоимость секвенирования снижается быстро и непрерывно13. Обвал 2007–2008 годов – удешевление в тысячу раз за полдесятилетия – знаменует переход к методам секвенирования нового поколения. Вместе со стоимостью стремительно сокращается продолжительность секвенирования одного генома – с нескольких лет в проекте «Геном человека» до нескольких дней при использовании современных техник.

С похожей скоростью, пожалуй, развивались технологии производства транзисторов. Первые транзисторы были капризными и громоздкими, миллиметрового масштаба. Теперь мы без труда помещаем миллиарды транзисторов на чипы площадью в квадратный сантиметр и стоимостью несколько долларов за штуку. В 1965 году Гордон Мур, впоследствии возглавивший компанию Intel, заметил, что количество транзисторов на чипе удваивается каждый год (позже он скорректировал оценку с года на два). Это наблюдение вошло в историю под названием «закон Мура» и служило одновременно описанием и манифестом электронных технологий. Прогресс в секвенировании ДНК, по крайней мере измеряемый затратами на чтение одного нуклеотида, был даже более стремительным. Неудивительно, что первым человеком, геном которого секвенировали с помощью Personal Genome Machine компании Ion Torrent, стал именно Гордон Мур. Революцию в технологиях секвенирования породило множество факторов: человеческая изобретательность, экономические стимулы компаний-производителей, государственное финансирование теоретических исследований и спецпрограмм, нацеленных на инновации в области секвенирования14, ну и, конечно, накопленные нами знания по биологии, химии и физике.

Когда секвенатор ДНК не соответствует своему названию?

Последовательности ДНК сообщают нам немало информации: например, как на генетическом уровне различаются виды, особи одного вида, раковые и нормальные клетки. Тем не менее главной миссией технологий секвенирования может оказаться вовсе не чтение генов и геномов, а помощь в постижении внутренней жизни клеток.

Рассмотрим для примера РНК. В первой части книги мы говорили, что чтение генов обеспечивает фермент РНК-полимераза: она транскрибирует последовательность ДНК в последовательность РНК, которая затем может транслироваться в цепочку из аминокислот – белок. Не считая яйцеклеток, сперматозоидов и некоторых иммуноцитов, все клетки вашего организма имеют одинаковый геном, поэтому секвенировать ДНК каждой клетки было бы избыточным. Зато интересно было бы знать, какие молекулы РНК синтезируются в каждой клетке: так мы могли бы понять, какие гены включаются и выключаются, когда клетки в ходе развития становятся кровяными тельцами или нейронами либо когда реагируют на изменения в питании или на стресс. Для этого нам необходимо секвенировать молекулы РНК, четко зная, из какой клетки они получены. Вы уже, наверное, представляете характерные черты нашей методологии: мы используем физические силы и свойства, дополняя их биологическими инструментами, разработанными природой.

На этот раз вместо медуз и светлячков нашими помощниками станут вирусы. Центральная догма молекулярной биологии гласит, что ДНК кодирует РНК, которая кодирует белки. Когда в 1970-м исследовательские группы Дэвида Балтимора и Говарда Темина независимо друг от друга открыли способность некоторых вирусов обращать этот процесс вспять – транскрибировать свой РНК-геном в ДНК, которая еще и внедряется в геном клетки-хозяина, – эта новость многих потрясла. Вирусный белок, производящий, по сути, обратную транскрипцию, назвали соответственно – обратной транскриптазой (ревертазой)15. Теперь мы умеем использовать ее в своих целях, как обычную ДНК-полимеразу и другие подобные инструменты.

Выделив РНК из клетки, мы можем добавить к ней обратную транскриптазу и свободные нуклеотиды, чтобы синтезировать ДНК, комплементарные однонитевым РНК. Например, в случае РНК-последовательности ЦAГУУГГA мы получим ДНК-комплемент ГTЦAAЦЦT (как вы помните из главы 3, У в РНК заменяет T в ДНК). С помощью секвенирования мы узнаем точную нуклеотидную последовательность этой комплементарной ДНК (кДНК), а значит, и исходной РНК. Чтобы изучить полный набор РНК (транскрипто́м) отдельной клетки, ученые применяют методы вроде тех, что мы уже рассматривали: например, изолируют одиночные клетки с шариками и необходимыми ингредиентами в каплях водно-масляной эмульсии16. Каждая молекула РНК транскрибируется в ДНК, которая затем секвенируется – и вот мы уже знаем, какие гены были «включены» в той или иной клетке.

Хотя секвенирование транскриптома одиночных клеток и предполагает их разрушение, они служат типичными представителями той или иной клеточной популяции, траекторию развития которой можно проследить, отбирая из нее такие вот жертвенные единицы на разных этапах какого-то процесса либо после специфического воздействия. Так ученые исследовали, например, ответные изменения экспрессии генов у иммуноцитов организмов, вступивших либо не вступивших в контакт с интересующим патогенным стимулом. Или вот другой пример: по РНК, выделяемой из эмбрионов данио-рерио и мышей на разных этапах после зачатия, можно отслеживать динамику профилей экспрессии генов, направляющую клетку по тому или иному пути специализации.

Секвенирование РНК – одна из множества технологий, опирающихся на секвенирование ДНК[57]. Сегодня ученые уже умеют определять, какие сегменты ДНК намотаны на гистоны, к каким нуклеотидам прикреплены метильные группы, какие участки генома покрыты факторами транскрипции и многое другое. В заголовке мы спросили: «Когда секвенатор ДНК не соответствует своему названию?» И каков же ответ? Когда он секвенирует РНК, или когда картирует элементы упаковки ДНК, или когда исследует регуляцию работы генов, да вообще много когда.

Живые существа постоянно обрабатывают информацию, закодированную в ДНК: они копируют ее при делении клеток и рутинно считывают, транскрибируя и транслируя гены в РНК и белки. Результаты этих процессов зависят от последовательности нуклеотидов A, Ц, Г и T, то есть сами процессы в каком-то смысле сводятся к чтению молекул ДНК. Примерно 4 миллиарда лет других методов чтения ДНК не существовало. Теперь мы изобрели радикально новые инструменты – быстрые, дешевые, едва ли не сказочно эффективные, – и они открывают нам доступ к информации, зашифрованной в каждом организме. Эта поразительная технологическая трансформация случилась потому, что мы серьезно подошли к осязаемым физическим характеристикам биомолекул и наладили их взаимодействие с другими аспектами наших технологий. Ну а мы теперь посмотрим, что можно узнать из информации, зашифрованной в ДНК.

Предыдущая главаГлава 15 из 21Следующая глава