До сих пор мы говорили о молекулах и материалах, которые химик придумывает и синтезирует сам: лекарства, полимеры, катализаторы. Но есть класс молекул, который природа оттачивала миллиарды лет, — белки. Они умеют сворачиваться в эффективные наномашины, ускорять реакции в миллионы раз и собираться в сложные ансамбли. Ещё вчера расшифровка структуры одного-единственного белка занимала годы и стоила как крыло самолёта. А сегодня школьник с ноутбуком может за минуту получить трёхмерную модель белка, более того, он может придумать совершенно новый белок, которого нет в природе. Давай посмотрим, как искусственный интеллект превратил биологию в раздел химии, а химиков — в архитекторов живых молекул.
Как известно, от уникальной трёхмерной структуры белка зависит, будет ли он переносить кислород (как гемоглобин), переваривать пищу (как пепсин) или поглощать и излучать свет (как флуоресцентный белок). Понять, какая структура получится из данной последовательности аминокислот, — это и есть «проблема фолдинга белка». Экспериментальные методы вроде рентгеноструктурного анализа были дорогими и медленными, а компьютерные расчёты вязли в астрономическом числе возможных конформаций. В 2020 году компания DeepMind представила AlphaFold2 — нейросеть, которая по аминокислотной последовательности предсказывала структуру белка с точностью, сопоставимой с экспериментом. Это было не просто улучшение на пару процентов — это было решение задачи, над которой бились полвека. В 2024 году Нобелевская премия по химии была присуждена Демису Хассабису, Джону Джамперу (создателям AlphaFold) и Дэвиду Бейкеру — пионеру вычислительного дизайна белков. Обрати внимание: премия по химии, а не по биологии. Потому что предсказание и дизайн структуры белков — это химия, просто молекула очень большая и сложная.
Если без формул: AlphaFold работает как умный детектив, который ищет корреляции в базе данных известных белковых структур и множественных выравниваний последовательностей. Он берёт цепочку аминокислот и строит попарные карты расстояний между всеми парами остатков, а затем итеративно «лепит» трёхмерную модель, похожую на оригами. Нейросеть учится на примерах: вот так выглядят альфа-спирали, вот так — бета-листы, а если в поворотной петле стоит глицин, то здесь будет резкий изгиб. Это аналог графовых и трансформерных моделей, только для последовательностей. Через несколько дней после выхода AlphaFold2 учёные по всему миру начали предсказывать структуры белков, которые раньше были недоступны, включая белки вирусов и ключевые ферменты.
В 2024 году вышла следующая версия — AlphaFold3. Она шагнула дальше и научилась предсказывать не только одиночные белки, но и их комплексы — с ДНК, РНК, маленькими молекулами-лигандами (лекарствами), кофакторами, ионами металлов. Теперь можно посмотреть, как потенциальное лекарство «садится» в активный центр фермента, ещё до того, как ты его синтезировал. Можно увидеть, как РНК-полимераза связывается с ДНК-матрицей или как хлорофилл с ионом магния удерживается в активном центре светособирающего белка. AlphaFold3 объединяет все эти взаимодействия в единой модели, и это уже прямой мост от генетики к химическому синтезу. Потенциально ты можешь придумать ингибитор для вирусного белка, загрузить последовательность белка и свою молекулу в AlphaFold3 и через минуту получить картину их совместной укладки.
Но самое захватывающее — это не предсказание существующего, а создание нового. Группа Дэвида Бейкера (того самого нобелевского лауреата) разработала RFdiffusion — диффузионную модель, которая генерирует белки «с нуля» под заданную функцию. Ты помнишь, как диффузионные модели вроде MatterGen рождают кристаллы из шума? Здесь тот же принцип, только для полипептидных цепей. Ты говоришь: «Хочу белок, который будет связывать молекулу X и катализировать реакцию Y, а активный центр пусть содержит цинк и два гистидина». Модель, обученная на десятках тысяч реальных белковых структур, «вытанцовывает» из случайного шума аминокислотную последовательность и её трёхмерную укладку, которые удовлетворяют этим условиям. Такой дизайн ферментов-катализаторов — это ретросинтез наоборот. В обычном ретросинтезе ты смотришь на сложную молекулу и думаешь, из каких простых кубиков её собрать. В дизайне белка ты смотришь на желаемую реакцию и думаешь, какой катализатор её осуществит. Раньше химики пытались конструировать активные центры вручную, полагаясь на интуицию и квантовые расчёты, и часто терпели неудачу: белок не сворачивался или не работал. RFdiffusion и её расширение RFdiffusion3 учатся на удачных и неудачных дизайнах и выдают кандидатов с высокой вероятностью успеха. Уже сейчас получены десятки искусственных ферментов, для которых природа не создала аналогов.
Попробуй сам
Это как раз тот случай, когда слова «Нобелевская премия» и «твои руки» стоят в одном предложении. Зайди на сайт UniProt и найди запись для инсулина человека (например, P01308). Обрати внимание: инсулин состоит из двух цепей (A и B), соединённых дисульфидными мостиками. Открой AlphaFold Server, вставь эту последовательность (тебе понадобится скопировать обе цепи через двоеточие как разделитель, например цепь_A:цепь_B) и запусти предсказание структуры. Внимание: для работы с мультимерными белками в AlphaFold Server используется режим предсказания комплексов. Через несколько минут ты получишь трёхмерную модель белка, за расшифровку которого когда-то давали отдельные премии. Покрути её, найди альфа-спирали (они похожи на пружинки) и бета-листы (стрелочки). А теперь сравни свою модель с реальной структурой инсулина в банке данных RCSB PDB (код 1TRZ). Насколько они похожи? И эта симуляция — та самая технология, за которую дали Нобелевскую премию по химии 2024 года.
Глава 9. Волшебство, которому решили научить машину
В первой главе мы оставили химика начала 21-го века счастливым обладателем электронного карандаша и быстрого поиска. Но рисовать формулы и искать статьи — это лишь подготовка к главному таинству. Главное — придумать, как собрать сложную молекулу из простых кубиков. Это называется ретросинтетический анализ, и им химик занимается в тишине, глядя в потолок и беззвучно шевеля губами. Долгое время считалось, что это чистая магия, передаваемая от гуру к ученику. Но один человек решил: магии нет, есть алгоритм. Этого человека звали Элайас Кори, и его история — пример того, как хорошая идея может обогнать своё время ровно настолько, чтобы провалиться. А потом воскреснуть уже в мире нейросетей.
Из каких фрагментов можно слепить молекулу сложного природного соединения — скажем, хинина или пенициллина? В голове крутятся десятки известных реакций и такие понятия, как «чутьё», «опыт», «интуиция». При этом мэтры синтеза многозначительно поднимают палец, а молодые аспиранты записывают за ними каждое слово, надеясь, что когда-нибудь и на них снизойдёт откровение. А вот Элайас Кори, тогда ещё молодой профессор Гарварда, в эту магию не верил. Он был убеждён: если химик может объяснить, почему он выбрал именно этот разрыв связи, значит, это можно записать в виде правил, то есть алгоритма. Так родилась идея LHASA (Logic and Heuristics Applied to Synthetic Analysis) — первой в мире программы для ретросинтетического анализа.
Кори не просто написал код. Он вместе с коллегами проанализировал интуицию и опыт многих химиков-синтетиков, вытащив оттуда эвристики — приёмы, которыми мы пользуемся при планировании синтеза. Например: «Избегай реакций, которые дают смеси продуктов», «Начинай с разрыва связи рядом с функциональной группой», «Не трогай ароматическое кольцо без крайней необходимости». Эти правила он формализовал и скормил компьютеру, и в 1969 году LHASA начала предлагать первые синтетические маршруты. А в 1990 году Кори получил Нобелевскую премию по химии — в том числе за доказательство того, что «химическая интуиция» — это не магия, а система правил.
Звучит триумфально, правда? Человек оцифровал интуицию, машина думает как химик! Но на практике всё оказалось не так радужно. Нередко LHASA формально соблюдала все химические правила, но игнорировала контекст. Программа могла предложить синтез, в котором на одной стадии получается кислота, а на следующей — добавляется щёлочь, потому что правило «нейтрализуй кислоту» не было явно прописано для этого конкретного случая. Она генерировала тысячи вариантов, и большинство из них были бессмысленными с практической точки зрения — требовали несуществующих реагентов, не учитывали побочные реакции, игнорировали то, что какой-нибудь промежуточный продукт быстро разложится. Кори это понимал. Он ввёл систему оценки маршрутов, пытаясь отсеять самые безумные идеи. Но жёсткие правила оценки — это всё же правила, которые можно обойти. Получался порочный круг: чтобы отличить хороший маршрут от плохого, нужна была та самая интуиция, которую LHASA и пыталась заменить.
Пример LHASA (как и многих других экспертных систем той эпохи) преподнёс химикам важный урок. Химия не сводится к списку из ста или даже тысячи «если… то…». Химическое пространство настолько огромно и причудливо, что любое конечное множество правил рано или поздно наткнётся на исключение. А исключений в химии ненамного меньше, чем самих правил. Кори показал, что интуицию можно формализовать лишь частично. Каждый раз, когда LHASA выдавала очередную глупость, программистам приходилось дописывать новое правило-заплатку. Это была бесконечная гонка: сегодня ты запретил программе смешивать кислоту с мылом, завтра она предложит смешать кислоту с содой, послезавтра — кислоту с аммиаком. Ты не успеешь записать все запреты, потому что их бесконечно много. Нужен был принципиально другой подход: не вбивать правила в голову машины, а дать ей возможность выучить их самой — на примерах. Показать ей тысячи удачных реакций и сказать: «Смотри и запоминай, что работает, а что нет». Но для этого в 1969 году не было ни достаточного количества данных, ни необходимых вычислительных мощностей. Прошло пятьдесят лет, и учёные перестали объяснять машине правила, а просто дали ей прочитать все доступные лабораторные журналы мира. Сегодняшние системы ретросинтеза похожи на бывалого мастера, который повидал миллион синтезов и говорит тебе: «Слушай, вот этот путь — дорогой, но быстрый, а вот этот — копеечный, но придётся повозиться с колонкой. Выбирай».
Помнишь метафору про яичницу? Можно записать роботу инструкцию: «Разбей яйцо, посоли, жарь три минуты». А можно показать тысячу фотографий хорошей яичницы — и робот сам поймёт, что с ней надо делать. В ретросинтезе случилось ровно то же самое. Вместо того чтобы дописывать бесконечные правила «если в молекуле есть карбонил и сопряженная с ним двойная связь, то примени реакцию Михаэля, но только если нет стерических помех, и не забудь про растворитель…», инженеры просто взяли базы данных, где собраны тысячи реально проведённых реакций. Каждая запись — это молекула-мишень и набор исходных веществ, из которых она получилась. Дальше в дело вступают хитрые алгоритмы. Они учатся на этих примерах точно так же, как ты учился отличать кошек от собак в Google Teachable Machine. Только вместо пикселей они анализируют молекулярные графы и SMILES-строки. И постепенно у них вырабатывается статистическая «интуиция»: «Если в молекуле есть пиридиновое кольцо и сложноэфирная группа, то с вероятностью 87% первым шагом надо разорвать эфирную связь гидролизом, а не трогать кольцо». Такой подход не только в разы ускоряет планирование, но и часто находит маршруты, которые химику просто не пришли бы в голову — просто потому что никто не держит в уме всю мировую литературу за последние два века.
Один из самых доступных инструментов этого класса — ASKCOS, разработанный в Массачусетском технологическом институте. Он бесплатный, работает через браузер и умеет сразу несколько вещей: предсказывать одностадийный ретросинтез, искать полные многостадийные маршруты, рекомендовать условия реакции и даже оценивать растворимость промежуточных продуктов. В основе ASKCOS лежит так называемый поиск по дереву Монте-Карло (Monte Carlo Tree Search) — звучит мудрёно, но идея простая. Представь, что тебе нужно пройти лабиринт от выхода к старту. Ты можешь пойти направо или налево, потом ещё раз и ещё — вариантов множество. Чтобы не перебирать всё, ты запускаешь тысячу виртуальных мышей, которые бегут случайно, но каждая запоминает, как далеко она смогла убежать и не упёрлась ли в тупик. Через некоторое время самые успешные маршруты протаптываются, и ты понимаешь: скорее всего, правильный путь — вот этот. MCTS делает то же самое с деревом химических превращений: пробует случайные разрывы связей, оценивает перспективность каждого промежуточного соединения и шаг за шагом выстраивает оптимальный маршрут. При этом ASKCOS использует не одну модель ретросинтеза, а целых четыре — шаблонные и бесшаблонные, что повышает надёжность предсказаний.
Другой гигант на этом поле — облачная платформа IBM RXN for Chemistry. Если ASKCOS больше полагается на поиск по дереву, то IBM RXN — это чистокровный трансформер, родной брат тех моделей, что переводят текст с английского на русский. Вспомни: молекулу можно записать в виде строки SMILES. Для трансформера реакция — это просто «перевод» строки реагентов в строку продуктов. Он обучается на миллионах таких «предложений» и учится достраивать недостающие атомы и связи с высокой точностью: в девяти случаях из десяти трансформер правильно угадывает, что получится в колбе, даже если он никогда не видел именно эту комбинацию реагентов. Базовая версия IBM RXN бесплатна и умеет предлагать полные синтетические маршруты. Ты просто рисуешь целевую молекулу, нажимаешь кнопку — и через минуту получаешь несколько вариантов со всеми промежуточными стадиями, ссылками на литературу и оценкой вероятности успеха.
Но химия — это не только вопрос «можно ли синтезировать». Это всегда баланс цены, безопасности и практичности. Можно синтезировать целебную молекулу за 10 стадий через цианиды и кипящий диоксан — но токсичность зашкалит, а цена будет как у острова на Мальдивах. А можно найти четырёхстадийный маршрут с использованием копеечных реагентов и воды как растворителя. Как научить машину выбирать не просто возможный, а оптимальный маршрут? Здесь в игру вступают ещё более продвинутые системы.