К книге
Химик в мире нейросетейСтраница 3
27%
Страница 3
3

Итак, нейросеть — это не страшный чёрный ящик, а просто ученик, который учится на примерах. Ты уже пользуешься этим каждый день, когда смотришь рекомендованные видео на YouTube или когда твой телефон распознаёт лицо. В химии этот подход тоже начинает широко применяться, ведь теперь не нужно выписывать правила — сеть сама в своих глубинах выведет их из данных. И она же не умолчит про исключения, ведь статистика не делит мир на чёрное и белое. Но если ты думаешь, что достаточно взять одну гигантскую нейросеть, скормить ей все реакции мира — и готов универсальный химик-предсказатель, то спешу тебя разочаровать. Одна большая сеть похожа на одного универсального сотрудника, который пытается делать всё сразу: синтезировать новые вещества, чинить ЯМР, мыть посуду и писать статьи. Получается медленно и посредственно. К счастью, природа (и инженеры) придумали выход — артель экспертов, или Mixture of Experts (MoE).

Допустим, тебе надо создать нейросеть, которая предсказывает исход химической реакции. Ты обучаешь её на миллионах примеров: реакции в воде, в органических растворителях, с катализаторами и без, при высоком давлении и при комнатной температуре. Сеть старается запомнить всё сразу и неизбежно усредняет: реакции с водой она предсказывает чуть хуже, чем хотелось бы, реакции с палладием — тоже с огрехами, а уж если речь заходит о редких стереоспецифических превращениях — пиши пропало. Это называется «проблема размазанной памяти»: пытаясь объять необъятное, сеть теряет точность в каждом конкретном случае. А что если внутри одной большой сети создать много маленьких, каждая из которых будет специализироваться на своём типе задач, а маршрутизацией заказов займётся отдельный «диспетчер»? Когда поступает заказ, роутер-диспетчер смотрит, откуда и куда ехать, и мгновенно решает, кому передать «пассажира». Так устроена Mixture of Experts (MoE).

Теперь замени пассажиров молекулами. Есть молекула, для которой нужно предсказать растворимость, или токсичность, или лучший способ синтеза. Роутер (это тоже небольшая нейросеть) смотрит на молекулярную «подпись»: есть ли в ней атомы металлов, много ли водородных связей, насколько она гибкая. И отправляет запрос одному или нескольким экспертам: «Эй, эксперт по водным растворам, это к тебе!», «А эту ароматическую систему пусть забирает себе эксперт по каталитическому кросс-сочетанию». Эксперты — небольшие суб-нейросети (слои), натренированные на своих узких задачах, — выдают предсказание, а роутер взвешивает их ответы и выдаёт итоговый вердикт с вероятностью. Это позволяет одновременно быть и достаточно точным в каждом конкретном случае, и покрывать всё разнообразие химического пространства.

Самое удивительное — специализация экспертов возникает сама, в процессе обучения. Ты не задаёшь вручную: «Ты будешь экспертом по сольватации, а ты — по стереохимии». Ты просто подаёшь на вход миллионы примеров, и сеть в ходе настройки весов сама обнаруживает, что выгоднее разделиться на специализированные суб-нейросети (блоки, «эксперты»). Один «эксперт» начинает чаще срабатывать для молекул с гидроксильными группами и даёт для них меньшую ошибку — и роутер, видя это, всё чаще направляет «спиртовые» запросы именно к нему. Другой «эксперт» случайно лучше предсказал несколько реакций с участием переходных металлов — и постепенно закрепляет за собой нишу металлоорганической химии.

Это очень похоже на то, как в настоящей артели ремесленников плотник сам берётся за работу с деревом, а кузнец — за работу с металлом, хотя никакой начальник им этого не навязывал. Просто разделение труда эффективнее, и оно проявляется в процессе совместной работы. В химических MoE-моделях исследователи после обучения нейросети с удивлением обнаруживают, что эксперт №3 специализируется на предсказании ЯМР-сдвигов атомов в ароматических кольцах, а эксперт №7 — на реакциях элиминирования. Никто их этому не учил специально, просто так сложились веса.

Архитектура Mixture of Experts — не просто академическая игрушка. Она лежит в основе многих передовых моделей. Например, современные большие языковые модели (такие как Mixtral) используют MoE, чтобы быстро отвечать на вопросы, задействуя лишь малую часть параметров для каждого запроса. В химии этот подход позволяет строить предсказательные системы, которые одновременно могут оценивать и физико-химические свойства, и биологическую активность, и пути синтеза, не ориентируясь на «среднюю температуру по больнице». Когда мы позже будем обсуждать ретросинтез в ASKCOS или мультимодальные модели IBM, знай: под капотом у них часто находится именно такая «артель экспертов» (MoE-модель).

В следующей главе мы вспомним наших старых знакомых — DFT и квантовые расчёты — и поймём, почему их «честная физика» всё чаще проигрывает обученным моделям. А пока — давай сами создадим простенькую нейросеть, чтобы ты почувствовал, как она нащупывает закономерности.

Попробуй сам

Открой браузер и найди сайт Teachable Machine от Google. Это такая песочница, где можно обучить нейросеть прямо в браузере, без регистрации и смс. Создай проект «Изображения» и придумай два класса: «Кошки» и «Собаки». Теперь загрузи по десятку фотографий тех и других — просто натаскай из интернета первые попавшиеся снимки. Нажми «Обучить модель». Через минуту у тебя будет готовая нейросеть, которая распознаёт кошек и собак по веб-камере. Поднеси к камере картинку с котом — она уверенно скажет: «Кошка, 99%». Поднеси плюшевого тигра — может выдать «Кошка, 70%», потому что он полосатый и усатый, и плевать, что он игрушечный. Ты не писал ни строчки правил про уши и хвосты. Сеть просто просмотрела твои примеры и сама вывела, кто есть кто. А теперь представь, что вместо кошек и собак ты загружаешь картинки со структурными формулами спиртов и альдегидов. Ровно так работают и химические нейросети — только примеров у них не двадцать, а миллионы, и вместо пикселей они переваривают хитрые молекулярные дескрипторы.

Если хочешь прямо сейчас почувствовать себя химиком-кибернетиком, открой любой редактор формул (например, Ketcher), нарисуй штук тридцать разных спиртов и тридцать альдегидов, сохрани их как картинки и скорми Teachable Machine в качестве двух новых классов. Обучи модель и проверь на тех молекулах, которые не показывал. Где она ошибётся? Может, перепутает бензальдегид с ароматическим спиртом? Или не узнает вторичный спирт, потому что ты показал ей только первичные? Это и есть главный урок: нейросеть хороша ровно настолько, насколько разнообразны её тренировочные данные. А в следующей главе мы посмотрим, почему даже очень «умная» физика иногда проигрывает такому вот обучению на примерах.

Глава 3. Почему DFT перестала быть главной надеждой

В прошлой главе мы выяснили: нейросеть — это не магия, а просто очень быстрый ученик, который смотрит на миллионы примеров и находит закономерности. Но у тебя, возможно, остался вопрос: а зачем вообще нужен этот ученик, если есть «честная» физика? Есть же квантовая механика, уравнение Шрёдингера, точные расчёты электронной структуры. Неужели недостаточно просто взять и посчитать молекулу из первых принципов? Ведь программы вроде GAMESS и GAUSSIAN позволяют рассчитать электронную структуру молекул, предсказывать геометрию, энергии связей и даже моделировать переходные состояния реакций. Звучит круто, правда? Но, как часто бывает, вся соль в деталях.

Чтобы предсказать погоду на завтра, ты можешь пойти «честным» путём: взять уравнения гидродинамики, учесть каждую молекулу воздуха, каждую каплю воды, каждый порыв ветра. Проблема в том, что для этого тебе понадобится суперкомпьютер размером с галактику и несколько миллионов лет на расчёт. А пока он считает, погода уже наступит. Примерно так работает DFT — теория функционала плотности, главный инструмент квантовой химии последних сорока лет. Но вместо того чтобы решать уравнение Шрёдингера для каждого электрона, метод работает с электронной плотностью — более грубой, но доступной величиной. Зная, как «размазаны» электроны, можно вычислить энергию молекулы, её геометрию и даже предсказать, как пойдёт реакция. Нобелевская премия по химии 1998 года была вручена в том числе за развитие DFT. Но вот нюанс: DFT работает тем точнее, чем меньше молекула. Для атома гелия — хорошо, для бензола — терпимо, для белка из тысячи атомов — всё, приехали. Точный расчёт требует времени, которое быстро растёт с размером системы. Это как пытаться описать ураган, отслеживая траекторию каждой снежинки: физика верна, но масштаб делает её бесполезной. Ты можешь рассчитать геометрию аспирина, но попроси DFT

Но даже для маленьких молекул DFT преподносит сюрпризы. Дело в том, что химическая точность — это не когда «похоже», а когда «попадание в яблочко». Энергия активации реакции — горка, на которую должен взобраться реагент, чтобы превратиться в продукт, — определяет скорость реакции через уравнение Аррениуса. В этом уравнении энергия активации — в показателе экспоненты. Это значит: ошибка всего в 5 ккал/моль даёт ошибку в скорости реакции на порядки! Допустим, DFT предсказала энергию активации 20 ккал/моль. Ты радостно рассчитываешь выход за час — 90%. Но реальная энергия активации — 25 ккал/моль, то есть на 5 ккал/моль выше. При комнатной температуре это различие (всего-то 20% от числа) означает, что скорость реакции упадёт не на 20%, а примерно в 4500 раз. Ты ждёшь час, а ждать придётся полгода. Или наоборот: DFT обещает, что реакция еле ползёт, а происходит взрыв, потому что энергия оказалась на 5 ккал/моль ниже. Вот почему ошибка в 5 ккал/моль — это вовсе не мелочь. Химия не прощает таких приближений.

И вот тут на сцену выходят ML-потенциалы — гибридные модели, которые решают проблему без ручной подгонки. Вместо того чтобы каждый раз заново решать уравнение Шрёдингера, они учатся на готовых данных: либо на результатах очень точных (и очень дорогих) квантовых расчётов для маленьких систем, либо сразу на экспериментальных величинах. Нейросеть запоминает: «Если окружение у атома углерода такое-то, его энергия будет примерно такой-то». И когда ей показывают новую, большую молекулу, она не считает всё с нуля, а собирает ответ из выученных кусочков.

Итак, главный вывод: честная физика — это прекрасно, но непрактично. DFT научила нас многому, дала язык для обсуждения электронных эффектов, помогла объяснить тысячи реакций. Но она не стала тем универсальным предсказателем, о котором мечтали в 1990-е. Потому что химия слишком сложна, слишком многомерна, слишком нелинейна, чтобы её можно было «просто посчитать». Сегодня мы перестаём спрашивать: «Какова точная волновая функция этой молекулы?» Мы спрашиваем: «На какие из миллиона известных реакций похожа эта, и какой у них был исход?» Это не значит, что мы отказались от физики. Мы просто перестали делать вид, что можем вывести всю химию из уравнения Шрёдингера, и начали использовать пресловутую «химическую интуицию», только теперь носитель интуиции — не человек, а нейросеть, обученная на огромном массиве химического знания. А пока попробуй прикоснуться к DFT и понять, почему мы так долго на неё надеялись и почему всё же пошли дальше.

Попробуй сам

Открой любой бесплатный онлайн-калькулятор квантовой химии (например, WebMO Demo) и попробуй посчитать энергию молекулы воды. Просто воды, H₂O. Сначала с одним базисом (скажем, STO-3G), потом с другим (6-31G). Сравни результаты — они будут разными. А теперь подумай: ты ведь не менял саму молекулу, так почему ответ плывёт? Поздравляю, ты только что прикоснулся к той самой проблеме, из-за которой DFT-расчёты называли «подгоночными». А теперь нарисуй аспирин и запусти оптимизацию геометрии с самым простым DFT-методом, например B3LYP/3-21G. Засеки время. А теперь сделай мысленное упражнение: представь, что тебе нужно посчитать поведение не одной молекулы, а ста тысяч похожих — например, ты ищешь новое лекарство и перебираешь все возможные варианты. Умножь свои минуты на сто тысяч. Получились месяцы. Именно поэтому DFT-расчёт, как бы ни был он прекрасен в теории, не тянет на роль массового экспресс-предсказателя.

Теперь зайди в любой чат-бот и спроси: «Почему DFT ошибается в энергии активации на 5 ккал/моль?» Сравни ответ с тем, что ты только что прочитал. Если бот начнёт сыпать формулами, скажи: «Объясни проще, будто я школьник, который только что провёл свой первый DFT-расчёт». Заодно потренируешь критическое мышление: вдруг бот слукавит? Ты же теперь знаешь, что 5 ккал/моль — это ошибка не в проценты, а в сотни раз по скорости. Если бот этого не упомянул — ты только что нашёл его слабое место.

Ну и для тех, кто уже подружился с Python: скачай датасет растворимости ESOL (он в открытом доступе), переведи молекулы в молекулярные фингерпринты с помощью библиотеки RDKit и обучи простенький Random Forest предсказывать растворимость в воде. Это займёт полчаса, но ты в миниатюре повторишь именно то, о чём мы говорили: модель учится на готовых экспериментальных данных и предсказывает свойство за секунды, не решая уравнение Шрёдингера. DFT считала бы каждую молекулу час, а твоя модель — меньше секунды. Почувствуй разницу. Именно так машинное обучение заменяет «честную физику» там, где скорость важнее безупречной точности.

Глава 4. Библиотека в кармане: как ИИ ищет и читает за тебя

Помнишь главу 1? Компакт-диски, карточки Chemical Abstracts и героический поиск статьи вручную, с перебиранием подшивок и немецким словарём. Тогда главным врагом химика было время, потраченное на поиск. Сегодня враг сменился: это избыток. Статей так много, что прочитать всё физически невозможно. Но появился и новый союзник: ИИ, который не просто находит нужную статью, а читает её за тебя, пересказывает и ссылается на источник. Давай посмотрим, как карманная библиотека с искусственным интеллектом превращает поиск информации из пытки в удовольствие.

До последнего времени ты вбивал ключевые слова, и поисковик выдавал список ссылок, отсортированный по загадочному алгоритму. Но он не понимал смысла. Запрос «синтез аспирина без уксусного ангидрида» мог привести тебя на страницу о том, как аспирин влияет на желудок, просто потому что там тоже встретились слова «аспирин» и «уксусный». Это был поиск по совпадению строк, а не по смыслу. Сегодняшние инструменты — Elicit, Consensus, scite — работают иначе. Это системы семантического поиска, которые понимают контекст. Ты спрашиваешь: «Какие методы использовали для восстановления нитрогруппы в присутствии сложноэфирной?» — и они не просто ищут слова, а находят статьи, где реально изучали эту конкретную химическую проблему. Более того, они могут суммаризовать результаты: «Вот 10 статей: в трёх использовали палладий на угле, в двух — железо в уксусной кислоте, и в одной — родий. Наибольший выход (92%) был с железом». Ты получаешь не гору ссылок, а готовую аналитическую

Предыдущая главаГлава 3 из 11Следующая глава