Максимилиан Копылович
Химик в мире нейросетей
Table of Contents
Введение: от «гармони» к «оркестру»
Попробуй сам
Глава 1. Компьютер-секретарь: мир статьи 2000 года
Попробуй сам
Глава 2. Нейросеть — наша новая знакомая
Попробуй сам
Глава 3. Почему DFT перестала быть главной надеждой
Попробуй сам
Глава 4. Библиотека в кармане: как ИИ ищет и читает за тебя
Попробуй сам
Глава 5. Экран вместо учителя?
Попробуй сам
Глава 6. Как молекула становится вектором
Попробуй сам
Глава 7. Некоторые модели: от GNoME до MatterGen
Попробуй сам
Глава 8. На стыке химии и биологии
Попробуй сам
Глава 9. Волшебство, которому решили научить машину
Попробуй сам
Глава 10. Роботы-химики
Попробуй сам
Глава 11. Когда ИИ берёт в руки инструменты
Попробуй сам
Глава 12. Призрак в спектре
Попробуй сам
Глава 13. Лабораторный дневник 2.0
Попробуй сам
Глава 14. «Нет» как признак мастерства
Попробуй сам
Глава 15. Ты — детектив, а не лаборант
Попробуй сам
Глава 16. Твой химический стартап на коленке (практикум)
Твой цифровой набор юного химика
Проект № 1: Научи машину различать спирты и альдегиды
Проект № 2: Ретросинтез-дуэль
Проект № 3: Предскажи растворимость
Заключение. Взгляд из вытяжного шкафа в 2075 год
Попробуй сам
Приложения
Приложение А. Словарик химика-кибернетика
Приложение Б. Краткий гид по инструментам
Введение: от «гармони» к «оркестру»
Три часа ночи, вытяжной шкаф гудит так, будто ему тоже не нравится результат. В колбе, где должны были сверкать прозрачные кристаллы, плещется что-то бурое и подозрительно похожее на плохой кофе. Ты всё делал по методике из статьи: температура — точь-в-точь, реактивы — свежие, растворитель — сухой (ну, ты так думал). И при этом — непонятно что, точнее, понятно — полный провал.
В такие моменты нормальный химик идёт спать и делает вид, что ничего не было, или пытается побыстрее забыть случившееся. Но ты вместо этого открываешь ноутбук и печатаешь в чат-боте примерно следующее: «Смешал то-то и то-то, получилась ерунда. Что я сделал не так?» И нейросеть, обученная на тысячах чужих провалов, через секунду выдаёт: «Похоже, ты добавил катализатор слишком быстро, и он разложился от локального перегрева. Попробуй капать шприцевым насосом и держи баню при плюс пяти. И да, кстати, растворитель лучше досуши молекулярными ситами». Меня отчитала программа. За растворитель. В три часа ночи.
Ты пробуешь снова — и наутро в колбе сверкают ровные прозрачные кристаллы. Обидно, что нейросеть оказалась права, но факт остаётся фактом: именно так сегодня выглядят «отношения» химика с искусственным интеллектом, этим довольно едким коллегой, который никогда не спит. Но давай отмотаем на четверть века назад — там всё было куда зануднее.
В 2000 году я написал статью, где пытался проанализировать роль компьютера в химической лаборатории того времени. И как вывод — компьютер химику всё же нужен! Сегодня это звучит как «вода мокрая», но тогда во многих лабораториях водился скептик, который смотрел на аспиранта с новым компьютером как на человека, купившего в лабораторию аквариум с рыбками. «Зачем нам компьютер? Мы химики, а не программисты!» Тогда я сравнил компьютер с гармошкой в деревенском ансамбле: без неё прожить можно, но с ней веселее. Умел тогда компьютер немного: рисовал красивые формулы, искал рефераты статей на CD-ROM, снимал показания с приборов, проводил предварительную обработку экспериментальных данных и считал кое-что по квантовой химии. Молчаливый писарь, архивариус, программируемый калькулятор. Никак не соавтор.
Прошло 25 лет. Сегодня, когда я пишу эту книгу, вопрос звучит иначе: не «зачем компьютеру быть в лаборатории?», а «на каком языке мы с ним разговариваем и кто кого при этом учит?». Та самая «гармонь» превратилась в целый оркестр из нейросетей, роботов и облачных сервисов. И мы с тобой попробуем разобраться, как дирижировать этим оркестром так, чтобы он не фальшивил, а ты не потерял себя как химик в мире нейросетей.
Чтобы почувствовать разницу, давай пройдём по реальному маршруту любой химической работы — от идеи до статьи. В каждой точке мы увидим не просто ускорение, а смену мышления.
Планирование синтеза: от «эврики» к промпту. Тогда ты садился с бумагой, рисовал молекулу и начинал мучительно вспоминать именные реакции, которые проходил на третьем курсе. Потом лез в толстенные тома Chemical Abstracts или вставлял диск в компьютер и ждал несколько минут, пока отобразятся рефераты. Компьютер был лишь шкафом с цифровыми карточками. Сейчас ты открываешь чат с ИИ-агентом и пишешь примерно так: «Мне нужен синтез этого пиримидинового производного. Выход не ниже 60%, колоночную хроматографию не предлагать, отсортируй по цене и токсичности». За кулисами начинается магия. Системы вроде ASKCOS или IBM RXN for Chemistry прочёсывают тысячи реакций. Они не просто ищут готовый рецепт, а разбирают твою молекулу на части и собирают обратно разными путями, используя алгоритмы с именами один звучнее другого: Monte Carlo Tree Search, Decision Transformer, сети Хопфилда. Появились даже гибриды вроде DeepRetro, где большая языковая модель советуется с традиционными движками и в итоге говорит тебе человеческим языком: «Смотри, я нашёл три пути. Первый дешёвый, но кипятить долго. Второй быстрый, но реагент редкий. Третий — через старую добрую реакцию Гриньяра, но там нужен абсолютно сухой эфир». Ты больше не тратишь недели на поиск. Ты тратишь часы на проверку. Главный навык теперь — не хранить в памяти тысячи реакций, а уметь задать правильный вопрос и вовремя сказать: «Не верю! Покажи литературный источник». Машина стала соавтором гипотезы.
Синтез: от магии к автономным лабораториям. Полвека назад химик ставил реакцию, выкручивал нагрев «на глаз», следил за цветом и каждую минуту бегал к УФ-лампе с хроматографической пластинкой. Вся магия держалась на опыте и интуиции, которые передавались от старших товарищей почти как заклинания. Сейчас автоматические реакторы подключаются к ML-моделям, которые в реальном времени командуют температурой и скоростью перемешивания. Более того, перед реальным опытом можно прогнать симуляцию процесса — «цифровой двойник» реакции. Но самое крутое — автономные лаборатории вроде AlphaFlow. Это роботизированная установка, которая ставит реакцию, смотрит, что получилось, и сама решает, что менять в следующей попытке. AlphaFlow без всякой подсказки нашла и оптимизировала некоторые многостадийные синтезы так, что они оказались лучше общепринятых прописей. Искусственный интеллект находит скрытые закономерности там, где ты бы их даже не искал. Десять раз робот получал выход 40%, а на одиннадцатый чуть изменил скорость мешалки — и получилось 65%. Оказывается, ты просто не обращал внимания на этот параметр. Теперь твоя задача — не крутить ручки, а пытаться осмыслить, почему машинный комплекс нашёл лучшее решение.
Очистка: конец гадания на элюенте. Раньше ты готовил хроматографическую колонку и начиналось священнодействие: ты смешивал гексан с этилацетатом в разных пропорциях, капал на пластинку, светил ультрафиолетом и молился, чтобы пятна разделились. Метод назывался «доверься интуиции, Богу помолясь». Сейчас ты вводишь структуру смеси в программу, и она, покопавшись в тысячах опубликованных значений Rf, выдаёт: «Бери 15% этилацетата, колонку на 20 см, и твой продукт выйдет через 12 минут».
Расшифровка спектров: от линейки к детективу. Когда-то ты получал листок с ЯМР-спектром, вооружался линейкой и карандашом, считал интегралы, спорил с коллегами о том, какой пик от какого протона. На расшифровку сложной молекулы уходили дни, а то и недели. Сейчас спектрометр отправляет данные нейросети, и она тут же сообщает: «Это 2,3-диметилбензойная кислота с вероятностью 96%». Модели вроде IMPRESSION-G2 предсказывают химические сдвиги во много раз быстрее, чем самые мощные квантовые расчёты, а ChefNMR, глядя только на протонный спектр и брутто-формулу, восстанавливает структуру неизвестного природного соединения с точностью выше 65% для симулированных спектров на бенчмарках. Раньше ты строил структуру по кирпичикам. Теперь ты работаешь как детектив: проверяешь версию, которую выдвинула машина. Твоё время уходит не на подсчёт пиков, а на размышления: «Почему нейросеть так уверена, если интеграл протона NH должен быть меньше? Может, там таутомерия?»
Лабораторный журнал: от помятой тетради к соавтору статьи. До последнего времени мы записывали всё от руки в толстую тетрадь, часто залитую реагентами. При работе над статьёй нередко приходилось расшифровывать собственные каракули. Сейчас электронные лабораторные журналы (ELN) с элементами искусственного интеллекта распознают фото твоих ТСХ-пластинок, сами подтягивают данные с весов и спектрометров и предлагают заполнить поля протокола. А главное — они накапливают данные так, что черновик статьи может генерироваться прямо по ходу работы. Если реакция пошла не по плану, система тут же подсунет альтернативный маршрут из чужих успешных опытов. Раньше ты сначала делал, потом писал. Теперь исследование и документирование идут параллельно, и ты в любой момент можешь спросить у своего «дневника»: «А что, если завтра попробовать другой катализатор?»
За всеми этими чудесами прячется одна простая вещь. В 2000 году компьютер думал на языке структурных формул — атомы, соединяющие их палочки-связи, заряды. Это был дискретный, символьный язык, доставшийся нам от Кекуле и Бутлерова. В 2026 году компьютер думает на языке многомерных векторов и полей электронной плотности. Для него молекула — не картинка, а точка в гигантском пространстве свойств. Реакция — не уравнение на бумаге, а траектория на энергетической поверхности. Именно поэтому трансформеры и диффузионные модели легко решают задачи, на которых спотыкались старые добрые DFT-расчёты. Главный вызов сегодня — построить мост между этими двумя языками, чтобы ты мог сказать: «Мне нужна молекула, которая будет светиться синим», — и получить не просто формулу, а связный рассказ, почему она будет светиться.
Эта книга — не скучный учебник по программированию и не философский трактат о конце профессии химика. Это приглашение порассуждать на равных с твоим новым когнитивным партнёром. Мы вместе пройдём по всем этапам исследовательского конвейера и увидим, что изменилось не только «железо», но и стиль мышления. Я надеюсь, что через 25 лет кто-то прочтёт эту книгу и улыбнётся так же, как я сегодня улыбаюсь своей старой статье про применение компьютеров в химии. И, возможно, напишет продолжение — про то, как химики общаются уже не с нейросетями, а с квантовыми компьютерами или с чем-то, что мы даже не можем сейчас представить. Но одно останется неизменным: слова «искусство эксперимента» и «интуиция» не исчезнут. Они просто приобретут новый смысл.
Попробуй сам
Чтобы ты не потерялся в названиях, вот краткий обзор тех инструментов, которые мелькали во введении. Это не список для заучивания, а скорее список действующих лиц нашего оркестра. ASKCOS (бесплатный проект MIT) умеет планировать синтез, перебирая дерево вариантов, предсказывать условия реакций и даже оценивать растворимость — почти как швейцарский нож для ретросинтеза. IBM RXN for Chemistry работает на трансформерах и предсказывает исход многих реакций с точностью выше 90%, а ещё строит маршруты синтеза прямо в облаке. DeepRetro — это открытый проект, в котором языковая модель общается с традиционными ретросинтетическими движками и уточняет результаты вместе с химиком. AlphaFlow — автономная проточная лаборатория, которая методом проб и ошибок сама оптимизирует синтез. IMPRESSION-G2 — трансформер, который за секунды предсказывает химические сдвиги ЯМР, обгоняя DFT-расчёты во много раз. ChefNMR — диффузионная модель, способная восстановить структуру природного соединения по протонному спектру и брутто-формуле, даже для сложных молекул. И MHNpath, использующий сети Хопфилда, планирует синтез с учётом цены, температуры и токсичности — чтобы ты не разорился и не отравился.
А теперь хватит читать — давай что-нибудь сделаем. Открой браузер и зайди на rxn.res.ibm.com (это IBM RXN) или askcos.mit.edu (это ASKCOS). Нарисуй аспирин — 2-ацетоксибензойную кислоту. Нажми «предсказать синтез» и смотри, что выдаст машина. Ты увидишь дерево вариантов: дешёвые, дорогие, безопасные и те, после которых надпись «лучше не дыши». Сравни с тем, что ты знаешь из учебника. Если нейросеть предложит синтез из углекислого газа и солнечного света — не верь, это она шутит. Но если найдёт путь короче и элегантнее, чем ты ожидал, — привыкай. Теперь ты не солист, а дирижёр. И оркестр уже настроился. Поехали дальше.
Глава 1. Компьютер-секретарь: мир статьи 2000 года
«Компьютер в химической лаборатории — это уже не роскошь, а необходимость», — бодро начинал я свою статью. Тогда мне казалось, что я описываю вершину технического прогресса. Сегодня, перечитывая тот текст, я испытываю примерно то же, что испытывает владелец смартфона, глядя на печатную машинку: трогательную смесь ностальгии и изумления от того, как далеко мы ушли. Давай отправимся в эту экспедицию в прошлое и посмотрим, что же умел компьютер на рубеже тысячелетий — это поможет понять, почему сегодня мы даём ему право «думать».
Итак, ты уже знаешь: компьютер в химической лаборатории был чем-то вроде гармошки на свадьбе — без него можно было обойтись, но с ним душевнее. Та самая «гармонь» сегодня превратилась в оркестр с искусственным интеллектом. Но чтобы понять, как мы оказались дирижёрами, давай сначала переоденемся в халаты прошлого и честно ответим: почему раньше химикам-экспериментаторам было непросто? Почему каждое рутинное действие требовало столько нервов, времени и бумаги? Давай пройдём по таким частям жизни химика, как рисование формул, номенклатура веществ и поиск информации. В каждую из них компьютер сначала проник как скромный помощник, но очень скоро стал незаменимым.