К книге
Химик в мире нейросетейСтраница 8
73%
Страница 8
8

Одним из первых таких агентов стал ChemCrow — проект, соединивший большую языковую модель (на основе GPT-4) с восемнадцатью химическими инструментами. Это как швейцарский нож, где есть такие «лезвия», как RXN for Chemistry (предсказать реакцию), AiZynthFinder (найти путь синтеза), модули поиска литературы, расчёта свойств и даже генератор синтеза полимеров. Ты даёшь ChemCrow текстовое задание: «Синтезируй репеллент от комаров, используя доступные реагенты, и предложи методику». Модель анализирует запрос и выбирает нужные инструменты: сначала запускает ретросинтез, чтобы понять, из чего сделать диэтилтолуамид (DEET), потом проверяет свойства реагентов в базе данных, генерирует протокол и может передать его роботу-исполнителю. При этом ChemCrow не просто копирует готовый рецепт, а рассуждает (или, по крайней мере, имитирует рассуждение) о том, какой растворитель выбрать, почему эта стадия может пойти с плохим выходом и стоит ли попробовать альтернативный путь. Это шаг к тому, чтобы машина стала не просто библиотекарем, а напарником в мозговом штурме.

Ещё интереснее системы, которые называют AI co-scientist (ИИ-соучёный). Их задача — не просто выполнить приказ, а помочь тебе придумать гипотезу. Например, ты хочешь разработать новый катализатор для расщепления воды. В мире опубликованы тысячи статей по катализу. Прочитать их все невозможно. Но ИИ-агент может «проглотить» эту гору текстов за часы и найти закономерности, которые никто не замечал. Он говорит: «Смотри, в таких-то статьях 2015, 2018 и 2022 годов упоминаются похожие комбинации металлов, но никто не пробовал их при высоком давлении. Давай проверим?» Такие агенты формулируют гипотезы, ищут «белые пятна» — области, где данных мало, а потенциальный прорыв велик. Фактически они работают как идеальный ассистент, который никогда не спит и помнит каждую прочитанную статью. Конечно, окончательное решение, какую гипотезу проверять, остаётся за тобой. Но перебрать миллион вариантов и отсеять заведомо безнадёжные машина может за минуты.

А что будет, если запустить не одного, а нескольких ИИ-агентов, у каждого из которых своя специализация (вспомни принцип MoE)? Один — эксперт по термодинамике, второй — по кинетике, третий — по токсичности. Они получают общую задачу и начинают спорить друг с другом, пока не придут к согласованной гипотезе. Такие мультиагентные системы, например SciAgents, работают как научная группа. Один агент предлагает: «Давайте использовать марганцевый катализатор». Второй возражает: «Но побочная реакция с водой даст нестабильный интермедиат». Третий подсказывает: «Если добавить хлорид-ион, он стабилизирует комплекс, смотрите статью 2024 года». В итоге они вырабатывают взвешенное предложение, которое уже потом предъявляют человеку. Это похоже на консилиум врачей или защиту диплома, только очень быстро.

Теперь соедини агента-стратега с роботом-исполнителем. Получится полностью автономный цикл: ты ставишь общую задачу («найди новый ингибитор для этого белка»), агент формулирует гипотезы, выбирает кандидатов, планирует синтез, а робот выполняет реакцию и проводит тесты. Результат возвращается агенту, и тот уточняет модель. Так работают самые продвинутые лаборатории уровня 4, и именно этот альянс — главный тренд ближайших лет. Скорее всего, химик будущего будет не столько стоять у прибора или лабораторного стола, сколько управлять парком ИИ-агентов, как дирижёр оркестром.

Попробуй сам

Для начала почувствуй себя в роли «агента» с самым простым инструментом — обычным чат-ботом. Открой ChatGPT или любой аналогичный сервис с доступом в интернет и дай ему задание: «Предложи план синтеза аспирина из подручных средств, найди методики и сравни их по безопасности. Аргументируй выбор». Ты увидишь, как он «размышляет»: проверяет несколько источников, взвешивает плюсы и минусы, даже указывая, какой растворитель безопаснее. Это и есть упрощённая модель того, как работают химические агенты: они точно так же комбинируют информацию. Если чат-бот сказал что-то подозрительное, не поленись перепроверить источники — мы же помним про критическое мышление.

Теперь шаг посложнее — для тех, кто не боится Python. Настоящий ChemCrow устроен так: языковая модель не просто общается, а дергает за ниточки, запуская определённые функции — например, запускает расчёт молярной массы. Ты можешь собрать своего мини-агента прямо сейчас. Напиши простенькую функцию на Python, которая принимает химическую формулу (строку вроде C6H12O6) и возвращает молярную массу. Затем подключи эту функцию к языковой модели через механизм function calling — в OpenAI API это делается парой строк кода. Задай боту вопрос: «Какая молярная масса у глюкозы?». Вместо того чтобы угадывать число из памяти или лезть в интернет, бот вызовет твою функцию, получит точный расчёт и выдаст ответ со ссылкой на неё. Ты только что собрал простейшую версию ChemCrow: связку «языковая модель + инструмент». Не магия, а архитектура, которую ты можешь повторить сам.

Если хочешь увидеть, как выглядит взрослая версия, загляни на GitHub по запросу «ChemCrow» — там выложен открытый код, который при желании можно запустить с настоящими химическими API. Но даже просто полистать документацию полезно: ты увидишь, как языковая модель вызывает внешние сервисы, и поймёшь, что под капотом у агентов нет никакого волшебства — только грамотно связанные друг с другом программы. В следующей главе мы спустимся на ступеньку ниже — от планирования к анализу. Ты синтезировал вещество, теперь надо понять, что получилось. И тут в игру вступают нейросети-спектроскописты.

Глава 12. Призрак в спектре

Ты сидишь в лаборатории, перед тобой — колба с вязкой жидкостью, брутто-формула вещества C₁₇H₂₁NO₄, но ты понятия не имеешь, как именно атомы сложились в пространстве. Рядом лежит листок с ЯМР-спектром — десятки пиков, дублетов, триплетов, мультиплетов. Твоя задача: восстановить полную структуру молекулы. Без этого ты не можешь публиковать статью, не можешь продолжать синтез, не можешь даже толком понять, что создал. Ты — детектив, спектр — улика, а неизвестная молекула где-то прячется за частоколом сигналов. Ещё двадцать лет назад ты потратил бы на решение этой задачи несколько дней, а то и недель. Сегодня ты открываешь ноутбук, загружаешь файл и через секунду получаешь ответ: «Вероятнее всего, это скополамин — природный алкалоид, содержащийся в растениях семейства паслёновых».

В главе 1 мы вспоминали, как химики конца XX века «расшифровывали» спектры вручную. Ты получал бумажную ленту самописца с пиками, похожими на кардиограмму, и начинал священнодействие. Для каждого сигнала нужно было измерить химический сдвиг (в миллионных долях, линейкой по распечатке!), посчитать интеграл (площадь под пиком — сколько протонов), оценить мультиплетность (расщепление) и константы взаимодействия. Потом всё это складывалось в мозаику: «Если тут дублет на 2.1 м.д. и интеграл 3Н, а там квартет на 4.0 м.д. и интеграл 2Н, то, кажется, это этильная группа, соседствующая с карбонилом…». Ты сидел с карандашом, рисовал возможные фрагменты, перебирал варианты, спорил с коллегами. Это было искусство, требовавшее колоссального опыта и пространственного воображения. Параллельно существовал и «компьютерный» путь: запустить расчёт для предполагаемой структуры и предсказать спектр. Но такой расчёт работал медленно и требовал подгонок. На один спектр нередко уходили часы машинного времени, а ошибки всё равно оставались.

Сегодня же предсказание ЯМР-спектра (химические сдвиги и константы связи для ¹H, ¹³C, ¹⁵N, ¹⁹F) можно получить меньше чем за секунду. Именно так работает IMPRESSION-G2 — трансформерная нейросеть, обученная на огромной базе квантово-химических расчётов и экспериментальных данных. Помнишь трансформеры, которые «переводят» молекулы в свойства? Здесь тот же принцип: на вход подаётся трёхмерная структура молекулы, а нейросеть мгновенно выдаёт значения всех химических сдвигов с точностью, почти неотличимой от DFT, но во много раз быстрее. На обычном ноутбуке за минуту можно обсчитать сотни молекул — задача, на которую у суперкомпьютера с DFT ушли бы недели. Как это меняет работу? Раньше, чтобы проверить гипотезу о структуре, ты должен был либо полагаться на интуицию, либо запускать долгий расчёт. Теперь ты спрашиваешь: «А что если это не пара-изомер, а орто-изомер?» — и через секунду видишь предсказанный спектр для каждого варианта. Наложил на экспериментальный — и сразу видно, какой лучше подходит.

Но и это не вершина. IMPRESSION-G2 предсказывает спектр по структуре. А что, если мы хотим обратного: из спектра получить структуру? Именно это делает ChefNMR — диффузионная модель, которая по протонному спектру и брутто-формуле восстанавливает молекулярную структуру. Помнишь диффузионные модели (MatterGen, RFdiffusion), которые лепят молекулы из шума? Здесь шум — это не координаты атомов, а спектральные данные, которые постепенно «очищаются» до конкретной формулы. Для сложных природных соединений точность ChefNMR превышает 65% на симулированных бенчмарках; на реальных экспериментальных спектрах этот показатель ниже. Тем не менее, для полностью автоматического метода это весьма солидно, ведь природные молекулы часто имеют запутанные полициклические скелеты с десятками стереоцентров. Можно сказать, что ChefNMR работает как опытный шеф-повар: по «аромату» спектра (пикам) и «весу» молекулы (брутто-формуле) восстанавливает рецепт укладки. И пусть пока точность не 100%, для первичного скрининга неизвестного вещества это удобный инструмент. За считанные минуты ты получаешь нескольких правдоподобных кандидатов и затем проверяешь их другими методами.

Что всё это значит для тебя, химика? Твоя роль принципиально меняется. Раньше ты был криминалистом с лупой, который часами сличал отпечатки пальцев (спектры) с картотекой. Теперь нейросеть делает это за тебя. Ты же превращаешься в Шерлока Холмса, который смотрит на результат и задаёт неочевидные вопросы: «Почему машина уверена, что гидроксильная группа находится именно здесь, хотя интеграл протона чуть меньше ожидаемого? Может, происходит таутомерия? Или внутримолекулярная водородная связь?». Ты начинаешь думать не только о формуле, а о динамике молекулы, о её поведении в растворе. Нейросеть даёт версию — ты её критически осмысливаешь. Это то самое партнёрство «человек + ИИ», где рутина отдана машине, а стратегия и интерпретация — тебе. И, конечно, не забывай: нейросети иногда ошибаются, особенно если молекула содержит редкие атомы или находится в необычном окружении. Поэтому окончательный вердикт всегда за экспериментом, но при этом скорость выдвижения гипотез возрастает в разы.

Попробуй сам

Сейчас ты сам станешь детективом по отпечаткам молекул. Зайди на nmrdb.org — это бесплатный предсказатель ЯМР-спектров, который работает прямо в браузере. Нарисуй структуру этанола и нажми «Predict NMR». Ты увидишь модельный протонный спектр с пиками, мультиплетностью и интегралами. Найди в интернете реальный спектр этанола (просто введи в поиск картинок «ethanol 1H NMR») и сравни: где совпало идеально, а где разошлось? Подумай, почему: может, модель не учитывает растворитель, или реальный спектр снят на приборе с иным разрешением?

Потом перейди к детективной задаче: найди в сети спектр кофеина и попробуй вручную, с линейкой, определить структуру — как химик из девяностых. А теперь скорми этот же спектр модели в nmrdb.org и посмотри, что предложит машина. Сравни свой вариант с машинным. Где ты ошибся? Где машина была слишком самоуверенна? Именно так работает современная спектроскопия: нейросеть выдвигает версию, а ты её допрашиваешь. Не принимай предсказание на веру — помни, что редкие атомы и необычные условия могут сбить даже самую умную модель с толку. В следующей главе мы посмотрим, как лабораторный журнал, который раньше был просто тетрадкой с кляксами, превращается в интеллектуального ассистента и сам пишет черновик статьи.

Глава 13. Лабораторный дневник 2.0

Мы прошли долгий путь от бумажных картотек и трафаретов до роботов, которые сами ставят реакции, и нейросетей, которые читают спектры. Всё это — про работу руками и головой. Но есть одна вещь, которую ненавидят многие химики мира — и это лабораторный журнал.

Вот он, классический лабораторный журнал: толстая тетрадь в коленкоровом переплёте, страницы пронумерованы вручную, записи сделаны ручкой (обязательно! карандаш — несерьёзно). Туда вклеивали распечатки спектров, фотографии ТСХ-пластинок, рисовали схемы установок. Если ты проливал кофе — страница шла волнами, но данные оставались. Если терял тетрадь — терял год работы. Если хотел найти эксперимент трёхмесячной давности — листал, чертыхаясь, пока не находил нужную страницу.

Проблема была не только в неудобстве. Главная беда — тетрадь была мёртвой. Она не могла тебе сказать: «Слушай, ты уже пробовал этот растворитель в прошлом ноябре, и выход был всего 20%». Она не умела сама строить графики зависимости выхода от температуры. И когда приходило время писать статью, ты садился и вручную перепечатывал все методики, сверялся с записями и мучительно вспоминал, почему в тот четверг ты решил добавить именно 5 мкмоль катализатора. Ведь когда ты в десятый раз перекристаллизовываешь одно и то же вещество, мысль «записать всё это в тетрадь» вызывает примерно такой же энтузиазм, как мытьё посуды после новогоднего застолья.

Но без журнала ты не химик, без него твои результаты — просто грязные колбы. И вот тут в игру вступает Лабораторный дневник 2.0 (Electronic Lab Notebook, ELN) — электронный журнал, который не просто хранит записи, а превращается в соавтора статьи и персонального ассистента. Первые электронные лабораторные журналы появились ещё в конце 1990-х. Но поначалу они были просто текстовыми файлами с прикреплёнными картинками — не сильно умнее бумаги. Сегодняшний ELN — это облачная платформа, часто с элементами искусственного интеллекта, которая делает гораздо больше, чем просто хранит записи.

Предыдущая главаГлава 8 из 11Следующая глава