А когда наиграешься, загляни на сайт PhET Interactive Simulations и запусти виртуальное титрование. Добавляй основание в кислоту и наблюдай, как меняется pH и молекулярная картина. Попробуй другие симуляции — растворимость солей, закон Бойля-Мариотта. Что ты увидел на экране такого, чего не видно в пробирке? Симуляция не заменит запах аммиака и случайный пожар, но она даёт суперспособность — увидеть молекулярный уровень. Так вот, ИИ-репетитор и виртуальная лаборатория — это два тренажёра, которыми ты можешь пользоваться уже сегодня, пока живой учитель ставит тебе цель и верит в тебя. В следующей главе мы перейдём от обучения к самому творческому процессу — генерации идей: как ИИ помогает химикам придумывать молекулы, которых никогда не существовало.
Глава 6. Как молекула становится вектором
Мы все привыкли, что молекулу можно нарисовать палочками и подписать атомы, но когда молекула попадает в нейросеть, с ней происходит нечто странное: она исчезает как картинка и превращается в длинный столбик чисел, в точку в многомерном пространстве, где расстояние между такими точками означает химическую похожесть одной молекулы на другую. Это представление в многомерном пространстве свойств и отношений также называется вектором. Давай разберёмся, зачем понадобилась эта магия и как она работает.
Вспомни ChemDraw — программу, которая умела превращать нарисованную структуру в название и молекулярную массу. Это было первое превращение картинки в данные. Но для нейросети «картинка» — это просто набор пикселей, она не понимает, где атом, а где связь. Ей нужен язык, который сохраняет химический смысл и одновременно является математическим. Нужен вектор — упорядоченный набор чисел, описывающий молекулу так, чтобы похожие молекулы имели похожие векторы, а разные — разные. Именно здесь начинается самое интересное: химики придумали сразу несколько способов перевести молекулу в вектор, и каждый из них открыл дверь определённому типу нейросетей. Трансформеры научились читать молекулы как текст. Диффузионные модели — вылеплять их из шума, словно скульпторы. А графовые нейросети — общаться между атомами, как друзья в чате.
Когда в детстве осваиваешь язык, общаясь с родителями и другими людьми, ты постепенно и непроизвольно начинаешь замечать закономерности: «я иду», «он идёт». Так учатся и трансформеры — архитектура нейросетей, которая революционизировала машинный перевод, а сейчас и химию. В химии «предложение» — это молекула, записанная в виде строки SMILES. Например, этанол выглядит как CCO, а аспирин — как CC(=O)OC1=CC=CC=C1C(=O)O. Трансформер учится на миллионах пар «реагенты → продукты» и начинает «понимать», что карбоксильная группа C(=O)O часто превращается в ацилхлоридную C(=O)Cl в присутствии тионилхлорида. Он не знает правил нуклеофильного ацильного замещения, но статистически угадывает следующее «слово» в химическом предложении с высокой точностью. Так работают IBM RXN и другие предсказатели реакций: они «переводят» реагенты на язык продуктов, достраивая последовательность атомов и связей. Фактически, трансформер — это «переводчик» с языка исходных веществ на язык конечных, который сам выучил грамматику на примерах.
Совсем другой подход — диффузионные модели. Ты, наверное, видел, как Midjourney или DALL-E генерируют изображения по текстовому описанию. Ты пишешь «кот в скафандре на Марсе», и программа из случайного цифрового «шума» шаг за шагом проявляет картинку. Оказывается, ровно то же можно делать с молекулами и кристаллическими решётками: берётся реальная трёхмерная структура молекулы и постепенно добавляются в неё лёгкие случайные смещения атомов — шум. Через много шагов молекула превращается в бесформенное облако, где уже непонятно, где какой атом. А теперь мы учим нейросеть обратному процессу: из шума восстанавливать исходную структуру. Когда обучение закончено, мы можем подать сети случайный набор координат и сказать: «А теперь сделай из этого молекулу, похожую на лекарство от головной боли». И сеть шаг за шагом, слой за слоем «очищает» шум, расставляя атомы углерода, азота, кислорода в нужные позиции и создавая связи. Так работают современные генераторы новых материалов: они не перебирают триллионы вариантов, а лепят молекулу из тумана вероятностей, словно гончар из глины.
Третий способ увидеть молекулу — посмотреть на неё как на граф. В математике граф — это набор точек (вершин), соединённых линиями (рёбрами). В химии вершины — атомы, рёбра — связи. Графовые нейросети (GNN) работают так: каждый атом «рассылает» сообщения своим соседям о том, какой он (углерод, азот), с кем связан и в каком окружении находится. Соседи получают сообщения, обновляют своё представление о себе и снова рассылают. Через несколько раундов каждый атом «знает» не только о ближайших соседях, но и о том, что где-то на другом конце молекулы есть, скажем, гидроксильная группа. Это похоже на обмен сообщениями в групповом чате: через некоторое время ты уже в курсе, кто с кем встречается и где отдыхает, даже если этих людей и не знаешь лично. Схожим образом в GNN каждый атом становится носителем богатой информации о всей молекуле, и эту информацию можно потом использовать, чтобы предсказать растворимость, токсичность или энергию связывания с мишенью. Графовые сети особенно хороши для кристаллов и материалов — там, где важна
Итак, мы видим, что химики больше не привязаны к карандашу и бумаге. Молекула стала текучей: она может быть строкой символов для трансформера, облаком вероятностей для диффузионной модели или графом для GNN. Это и есть та самая смена языка, о которой мы говорили во введении: от дискретных палочек Кекуле мы перешли к непрерывным векторам, тензорам, скрытым пространствам. Так что в тот момент, когда ты нарисовал молекулу в ChemDraw и нажал «Copy as SMILES», ты уже превратил химию в текст, который понимает нейросеть.
Попробуй сам
Зайди на сайт Molecule of the Month или просто открой Википедию со статьёй про кофеин. Найди строчку SMILES — для кофеина это CN1C=NC2=C1C(=O)N(C(=O)N2C)C. Скопируй её. А теперь представь, что это не просто символы, а координаты молекулы в особом пространстве, где каждая буква и скобка имеют свой числовой код. Ты можешь прямо сейчас вставить этот SMILES в онлайн-конвертер вроде Chemicalize (он бесплатный для небольших молекул) и увидеть, как машина мгновенно вычисляет свойства, даже не «глядя» на формулу. Попробуй мысленно проделать обратный путь: глядя на длинный вектор чисел, восстанови структуру. Именно это делают диффузионные модели — но, конечно, с нечеловеческой скоростью. Если хочешь прикоснуться к идее графов, скачай бесплатную программу Cytoscape и построй простейший граф метана — четыре водорода вокруг углерода. А потом вообрази, что по этим рёбрам бегают сообщения от атома к атому, и каждый атом постепенно узнаёт, что он — часть тетраэдра. Вот так графовые нейросети и улавливают стереохимию.
Ну а для тех, кто уже не боится Python: найди в открытом доступе датасет растворимости ESOL, с помощью библиотеки RDKit переведи молекулы в молекулярные фингерпринты и обучи простенький Random Forest предсказывать растворимость в воде. Ты в миниатюре повторишь ровно то, о чём мы говорили: модель превращает молекулы в векторы и учится на готовых экспериментальных данных, предсказывая свойство за секунды — без всяких квантовых расчётов.
Глава 7. Некоторые модели: от GNoME до MatterGen
В прошлой главе мы научились превращать молекулы в векторы, графы и даже в облака вероятностей. Но всё это были одиночные молекулы, а что если тебе нужно спроектировать материал-кристалл, в котором миллиарды атомов выстроены в строгом порядке и от которого зависит, будет ли твой телефон работать сутки без подзарядки, а электромобиль проезжать тысячу километров? Раньше поиск такого материала был сродни прочёсыванию миллионов стогов сена в поисках одной иголки. Но сегодня у нас есть такие помощники, как графовые пророки вроде GNoME и диффузионные творцы вроде MatterGen.
Допустим, нам нужно найти новый материал для катода литиевого аккумулятора — такой, который был бы стабилен, не разлагался при зарядке и при этом хорошо проводил ионы лития. Пространство возможных комбинаций химических элементов практически бесконечно. Даже если ограничиться разумными рамками, речь идёт о десятках миллиардов потенциальных кандидатов. Сколько из них стабильны? Традиционная квантовая химия (DFT) могла проверить стабильность одной структуры за часы или дни. С такими темпами на перебор ушли бы столетия. К тому же слепой перебор давал мизерный выход: «попаданий» — реально стабильных новых соединений — было около одного процента.
И тут в игру вступает GNoME (Graph Networks for Materials Exploration) от компании Google DeepMind, о котором мир узнал в 2023 году. GNoME — это графовая нейросеть, обученная на сотнях тысяч известных кристаллических структур из Materials Project и других баз. Помнишь, как графовые сети позволяют атомам «общаться» и собирать информацию о соседях? Здесь та же идея, но для периодических решёток. GNoME представляет кристалл не как картинку, а как граф с атомами в узлах и связями между ними. Она проглатывает известные стабильные и нестабильные структуры и учится по одним только графовым признакам угадывать, «выживет» ли данный кандидат. Точность предсказания стабильности новых кристаллов взлетела с ~1% у DFT-скрининга до более чем 80%. Так, GNoME предложила ~2,2 млн кандидатов, из которых ~380 тыс. сочтены стабильными.
GNoME — мощный фильтр, но она оценивает уже готовые структуры, предложенные человеком или случайным генератором. А что если мы хотим не выбирать из меню, а заказать блюдо по вкусу? Нужен материал с определённой шириной запрещённой зоны для солнечной батареи или с максимальным модулем упругости для корпуса космического спутника? Именно это умеет MatterGen — модель от Microsoft Research, представленная в 2025 году. MatterGen — диффузионная модель, которая не ищет готовые структуры, а генерирует кристалл «с нуля», стартуя из шума. Вспомни, как Midjourney рисует кота по описанию. Здесь то же самое, только вместо пикселей — положения атомов, тип элемента и параметры решётки. Ты задаёшь целевое свойство (например, «ширина запрещённой зоны 1,5 эВ»), и MatterGen шаг за шагом проявляет из шума кристаллическую структуру, которая с высокой вероятностью будет обладать именно этим свойством. Это прямой наследник диффузионных моделей для молекул, но масштабированный на периодические твёрдые тела. Создатели называют её «первой универсальной генеративной моделью для неорганических материалов, способной превзойти традиционные подходы».
GNoME и MatterGen — это математические модели. Они оперируют векторами, энергиями решёток и структурными фингерпринтами (типичными структурными блоками). Так что предсказанная стабильность ещё не означает, что материал можно получить в колбе (или в печи). Часть кандидатов, предложенных GNoME, при ближайшем рассмотрении оказались неупорядоченными твёрдыми растворами, которые не имеют строгой периодичности, а значит, не могут считаться новым соединением. Другие и вовсе были синтезированы ещё в 1970-х годах и хранились в малоизвестных базах данных: нейросеть «переоткрыла» велосипед, просто потому что он не попал в её обучающую выборку. Это хороший урок критического мышления, к которому мы ещё вернёмся позже. Искусственный интеллект генерирует гипотезы, а не истины. Каждый предсказанный материал — это приглашение к эксперименту, а не готовый патент. И тут на сцену выходит тот, кто умеет превращать цифру в вещество: робот-химик.
Представь лабораторию, где вообще нет людей. Манипулятор взвешивает порошки оксидов, загружает их в печь, обжигает при точной температуре, а потом другой автомат снимает рентгеновскую дифрактограмму. Это и есть автономная лаборатория в Беркли (A-Lab). Она построена как раз для того, чтобы ставить опыты по заявкам от ИИ вроде GNoME. Цикл выглядит так: GNoME или MatterGen выдаёт список перспективных структур. Автономная лаборатория берёт их в работу: дозирует прекурсоры, спекает, отжигает. Встроенный рентгеновский дифрактометр анализирует продукт. Алгоритм сравнивает полученную картину с предсказанной и решает: успех или нужно изменить условия. Результат идёт обратно ИИ, улучшая следующие предсказания. За несколько месяцев непрерывной работы такая лаборатория синтезировала и подтвердила десятки новых соединений из списка GNoME, показав, что замкнутый цикл «гипотеза → синтез → проверка → новая гипотеза» — это не фантастика, а реальность. Раньше такой путь от идеи до публикации занимал годы; теперь — дни.
Попробуй сам
Зайди на сайт Materials Project. В строке поиска набери LiFePO₄ — это материал катода твоего будущего электросамоката. Ты увидишь его кристаллическую структуру: как шарики кислорода, железа, фосфора и лития складываются в решётку, увидишь предсказанную энергию образования и зонную диаграмму. Поиграй с другими материалами: NaCl (поваренная соль), SiO₂ (кварц). Сравни, насколько они стабильны, как выглядят их графовые сети связей. А теперь попробуй найти материал с конкретным свойством — например, шириной запрещённой зоны около 1,5 эВ для солнечной батареи. Почувствуй себя материаловедом, который ищет иголку в стоге сена, но с мощнейшим ИИ-фонариком. Обрати внимание на статус каждого кандидата: где-то написано «predicted», где-то — «experimental». Что это значит? Если материал только предсказан, а экспериментально никто его ещё не получил, — это всё ещё гипотеза. GNoME может считать его стабильным, но пока A-Lab или другая лаборатория не подтвердит это, красивая решётка остаётся просто картинкой. Именно здесь проходит граница между «ИИ нарисовал» и «материал синтезировали». И это возвращает нас к важнейшей теме критического мышления: не всё, что предсказано, можно подержать в руках. Ну а пока — представляй, как робот-манипулятор взвешивает порошки для твоего будущего рекордного аккумулятора.
Глава 8. На стыке химии и биологии