Петер Фишли и Давид Вайс — легендарный швейцарский дуэт художников, известный своими удивительными инсталляциями. Их самая знаменитая работа 1987 года называется «Ход вещей» (Der Lauf der Dinge / The Way Things Go). Скорее всего, ничего подобного вы раньше не видели.[*1] Снятая на видео в их огромной, похожей на пещеру мастерской, эта инсталляция собрана из хлама, который обычно валяется на заброшенных фабриках: автомобильных шин, кирпичей, бочек из-под масла. В течение получаса предметы поочередно приходят в движение, создавая длинный, медленный эффект домино, подпитываемый огнем, паром, бензином, смазочными материалами, кислотами и взрывами. Постепенно догорающий фитиль высвобождает катапульту, которая выстреливает горящим снарядом и поджигает лужу бензина, что приводит в движение шину; та медленно катится по наклонной плоскости и подталкивает свечу, от которой лопается воздушный шар, высвобождающий пенящееся зеленое химическое вещество, которое растворяет веревку, которая… и так далее. Наблюдая за развитием этой цепной реакции, невозможно не восхититься изобретательностью авторов. Должно быть, они в деталях просчитали, как физические и химические свойства объектов на каждом шаге запустят следующий этап, и создали гигантскую машину Руба Голдберга, соединив промышленный хлам, токсичные химикаты и неуемную страсть к пиромании.
В будущем людям потребуются системы ИИ, способные действовать в реальном мире. Чтобы БЯМ могла работать цифровым ассистентом, способным, скажем, надежно спланировать поездку за границу, ей нужно уметь нечто большее, чем просто поддерживать разговор. К сожалению, решать практические задачи в реальном мире гораздо труднее, чем давать бойкие ответы на каверзные вопросы. Чтобы успешно достигать жизненных целей, нам нужны те самые терпение и креативность, благодаря которым родился «Ход вещей». Представьте себе архитектора, создающего проект элегантного семейного дома, биолога, разрабатывающего вакцину против нового штамма гриппа, или пару, организующую свадьбу своей мечты в тропиках. Подобные реальные задачи требуют сложного планирования на многие шаги вперед, с сотнями точек принятия решений и тысячами мелочей, которые могут пойти не так. Если вы попросите современные БЯМ помочь с такими сложными проектами, как проектирование здания или планирование свадьбы, они, без сомнения, с радостью откликнутся — но предложат лишь банальные советы о том, как обеспечить достаточное естественное освещение, или порекомендуют праздничное меню. Они пока не умеют составлять разумные пошаговые планы, применимые в реальной жизни. У нас еще нет моделей, способных спроектировать подвесной мост, провести биологический эксперимент или продемонстрировать стальные нервы, необходимые для проведения детского праздника для шумной оравы пятилеток. Решение таких задач потребует создания нового поколения систем ИИ, способных к гораздо более сложному планированию.
Проблемы реального мира обладают тремя свойствами, которые делают их особенно сложными: они открыты (не имеют жестких рамок), неопределенны и протяженны во времени. Открытые проблемы — это те, где число возможных альтернатив практически безгранично. Фишли и Вайс выбирали из миллиона способов поджечь фитиль, точно так же как турист в Нью-Йорке может остановиться где угодно — от отеля «Уолдорф-Астория» до «Челси». Задачи с неопределенностью могут пойти наперекосяк из-за случайных событий. Крошечные неровности поверхности, разная концентрация серной кислоты или случайная осечка пиротехники — всё это могло сорвать «Ход вещей», подобно тому как при планировании поездки отель или рейс могут оказаться совершенно пустыми в одни выходные и переполненными в другие. Поэтому планирование в реальном мире требует резервных вариантов на случай непредвиденных обстоятельств. Наконец, протяженные во времени проблемы требуют планов, рассчитанных на долгосрочную перспективу. Если вы хотите стать барристером, вы не можете просто встать с постели и попросить местных солиситоров взять вас на работу. Вам нужно окончить юридическую школу, на что уйдут годы, а затем сдать квалификационный экзамен адвоката, требующий сотен часов прилежной учебы. Как и Фишли с Вайсом, в реальной жизни вам обычно приходится запускать сложную цепочку тщательно продуманных событий, чтобы достичь своих долгосрочных целей.
В части 1 мы видели, как первые исследователи ИИ, воспитанные в рационалистической традиции, представляли себе интеллектуальные системы, которые решали бы проблемы реального мира путем символьных рассуждений от средств к цели. Вспомните «Универсальный решатель задач» из 1950-х годов, создатели которого, Ньюэлл и Саймон, надеялись, что он сможет рассуждать о том, как отвезти детей в школу в дождливый день, когда у машины спущено колесо. Чтобы проверить свои идеи на практике, пионеры ИИ обратились к настольным играм, таким как шахматы, нарды и шашки, которые, как и реальный мир, протяженны во времени и потому требуют долгосрочного планирования для достижения конечной цели — победы над соперником. Сегодня, спустя десятилетия, у нас есть системы ИИ, способные разгромить гроссмейстеров-людей в шахматах и других высокостратегических настольных играх, таких как го и сёги. Stockfish и Leela Chess Zero, нынешние соперники в борьбе за звание ведущего шахматного движка, сочетают в себе нейронные сети с явными механизмами «поиска по дереву», которые сканируют возможные будущие состояния доски в систематических поисках выигрышного пути, чтобы загнать вашего короля в угол.
Однако, вопреки убеждениям таких светил, как Ньюэлл и Саймон, настольные игры на самом деле гораздо проще, чем решение повседневных жизненных задач — например, как вовремя доставить детей в школу. Дело в том, что настольные игры разворачиваются в крошечных детерминированных мирах вроде шестидесяти четырех клеток шахматной доски, а потому обходят стороной безграничность выбора, свойственную естественной среде — возможность делать все, что душе угодно, и когда угодно. Шахматные движки, по сути, работают за счет созданных вручную эвристик, которые целенаправленно сужают эту безграничность задачи. Один из примеров таких уловок — рассматривать только ходы по правилам, что кардинально ограничивает пространство возможных действий (ведь слоны могут ходить только по диагонали, а кони — буквой «Г»). Напротив, человеку — например, любителям, которые каждый день толпятся у шахматных столов в нью-йоркском Вашингтон-сквер-парке — приходится анализировать гораздо более широкое пространство возможных действий, ведь они вольны двигать своими руками как им вздумается. Теоретически они могли бы перепрыгнуть королем через всю доску, украдкой спрятать в карман вражеского ферзя или в порыве раздражения смахнуть все фигуры на пол — пусть даже после этого их вряд ли снова пригласят сыграть.
Пространство действий больших языковых моделей (БЯМ) огромно: оно сопоставимо с количеством токенов, которые модель способна сгенерировать — в большинстве случаев не менее 50 000. Из-за этого при игре в шахматы БЯМ оказывается в крайне невыгодном положении по сравнению с традиционными шахматными движками вроде Stockfish или Leela Chess Zero, поскольку физически не может просчитывать будущие состояния доски в поисках пути к победе. Чтобы понять почему, обратимся к недавней статье, авторы которой пытались научить языковую модель на базе трансформера играть в шахматы, генерируя состояния доски на языке шахматной нотации — например, вот так:
rnbqkbnr/pppppppp/8/8/4P3/8/PPPP1PPP/RNBQKBNR b KQkq e3 0 1
Хотя это похоже на результат случайного стука младенца по клавишам печатной машинки, на самом деле перед нами код для описания расстановки фигур на доске: каждая буква означает конкретную фигуру (например, r — это ладья), косая черта разделяет ряды шахматной доски, а цифры указывают количество пустых клеток подряд. Так, последовательность pppppppp — это непрерывная линия пешек, с которой начинает каждый игрок.[*2]
Авторы использовали тонкую настройку с учителем (которая, как мы видели в части 4, предполагает подачу дополнительных обучающих данных для направления модели к определенным типам ответов) на миллионах партий экспертного уровня, описанных как последовательности состояний доски в этой нотации. Такое дообучение побуждало модель предсказывать следующее состояние шахматной доски (выраженное в этой нотации) на основе предыдущего — точно так же, как тонкая настройка безопасности учит модель предсказывать одно (вежливое) предложение за другим. Поскольку модель обучалась на играх профессионалов, авторы ожидали, что предсказанные ею состояния доски будут отражать хитрые шахматные ходы, позволяя БЯМ играть на уровне профи.
К сожалению, этот остроумный подход не увенчался успехом. Всему виной гигантское пространство действий. Наличие 50 000 возможных выходных токенов означает, что количество последовательностей, которые может сгенерировать БЯМ, равно 50 000n, где n — это длина последовательности (например, даже если бы одно состояние доски кодировалось всего двумя символами, у вас было бы по 50 000 вариантов для каждого, что дает 50 0002 возможных результатов). Таким образом, даже для совершения одного-единственного хода модели приходится выбирать из астрономического числа возможных последовательностей токенов. На самом деле ничто не мешает БЯМ выдать полную белиберду вместо разрешенного правилами хода в шахматной нотации. Так что у нее нет реальной возможности искать решение в языковом пространстве так, как это делает Stockfish, детально просчитывая будущие состояния доски, пока не найдет способ вас обыграть. Соответственно, в матчах один на один БЯМ оказалась совершенно не способна защититься от Stockfish — хотя время от времени ей удавалось продержаться несколько десятков ходов, прежде чем ее разносили в пух и прах, предположительно потому, что ее квазислучайная игра замедляла темп партии.[*3]
Другая исследовательская группа создала систему под названием ChessGPT — версию базовой модели GPT-4, которую в процессе тонкой настройки буквально засыпали шахматными партиями в виде нотации, шахматными задачами, книгами и блогами о шахматах и даже обсуждениями этой игры на Reddit. Несмотря на все это профильное шахматное обучение, система была способна найти мат в один ход лишь примерно в 60% случаев (да и то только после жирного намека на то, что победа уже близко). Получив состояние доски (опять же в виде нотации), ChessGPT могла предсказать исход партии (победа белых, победа черных или ничья) лишь в чуть более чем 50% случаев — результат, который лишь немногим лучше случайного угадывания и, пожалуй, не превосходит возможности не по годам развитого десятилетнего ребенка. Этот проект, очевидно, потребовал титанических усилий, но, увы, результаты оказались весьма скромными, и авторы даже не потрудились выставить ChessGPT на соревнования.[*4]
Еще одной сложнейшей задачей для исследований в области ИИ является разгадывание кроссвордов. В американском мире любителей кроссвордов головоломка New York Times — которую последние тридцать лет редактирует Уилл Шортс, единственный человек в мире с ученой степенью по энигматологии (науке о головоломках), — славится тем, что ее сложность возрастает с каждым днем недели. Даже опытные любители кроссвордов начинают испытывать трудности по четвергам, а к субботе большинство заходит в полный тупик. Тем не менее системы ИИ уже зарекомендовали себя как неплохие разгадыватели головоломок. В 2017 году система ИИ по имени Dr. Fill заняла 11-е место на Американском турнире по разгадыванию кроссвордов (своего рода Суперкубке для кроссвордистов), используя сочетание методов обработки естественного языка, поиска в Google и проверенных лайфхаков (таких как сверка со списком распространенных сокращений). С появлением трансформеров ее разработчики объединились с исследовательской группой по NLP в Калифорнийском университете в Беркли и создали гибридную систему, известную как Берклийский решатель кроссвордов (BCS). Используя языковую модель, специально адаптированную для генерации и проверки подсказок, она может разгадать криптический кроссворд New York Times примерно в 80% случаев,[*5] что весьма недурно — и уж точно лучше результатов среднестатистического пассажира пригородного поезда на железной дороге Лонг-Айленда.
Тем не менее БЯМ всё еще с трудом справляются с кроссвордами. Я попросил ChatGPT разгадать несколько подсказок для британских криптических кроссвордов, и результаты оказались довольно блеклыми. В режиме zero-shot (то есть без добавления в промпт примеров подсказок с соответствующими ответами) GPT-4 оказалась почти полностью неспособна справиться с криптическими подсказками из ведущих британских газет (в чем она, конечно, мало отличается от 99% людей). Вот один из примеров, где она хотя бы угадала правильный ответ: «One criticized about nothing becomes cut off (8)». Однако, к сожалению, предложенное ею объяснение было совершенно нелогичным:
«ISO» можно получить путем перестановки букв или как синоним слов «One criticized» (раскритикованный) или «censured» (порицаемый).
«LATE» — это синоним слова «about» (около) в значении «находящийся поблизости» или «рядом».
«D» означает «nothing» (ничто) или ноль, часто обозначаемый как «O».
Всё это, боюсь, полная чушь (хотя, честно говоря, я бы справился не лучше). На самом деле фраза «criticized about nothing» (раскритикованный вокруг «ничего») указывает на слово «slated» (раскритикованный), в которое помещается ноль (буква «O»), а «one» (один) — это римская цифра I в самом начале, что в итоге дает правильный ответ: Isolated (изолированный). К сожалению, пока никто не сообщал о создании БЯМ, способной систематически решать криптические кроссворды — как и в шахматах, БЯМ здесь сильно уступают специализированным программам-решателям. И понятно почему. Подсказки здесь представляют собой замысловатые ребусы, в которых смешиваются игра слов, анаграммы и малоизвестные факты. Чтобы просто понять, с чего начать, требуются недели практики даже для людей, прекрасно владеющих словом. Более того, ответы должны идеально стыковаться друг с другом в сетке кроссворда, причем каждая догадка накладывает ограничения на последующие — а это классическая задача многошагового планирования. Как в шахматах и го, цель достигается только через длинную последовательность тщательно выверенных ходов по мере постепенного заполнения сетки. Всё это пока не под силу современным БЯМ.
Однако в данный момент, когда я пишу эти строки, исследователи работают над БЯМ, способными составлять четкие, явные планы. Ирония судьбы заключается в том, что для этого многие обратились к идеям, восходящим к символьному ИИ. Классическая идея из области исследований ИИ конца XX века состоит в том, что задачу планирования можно представить в виде дерева решений, где каждая развилка — это выбор, а каждая ветвь — возможное действие. Например, если вы находитесь на станции «Шепердс-Буш» лондонского метро и хотите доехать до «Олд-стрит», мы можем представить дерево возможных маршрутов, состоящее из развилок (пересадочных станций) и ветвей (перегонов между ними). Не каждая ветвь в итоге приведет вас к цели: если вы сделаете пересадку на «Ноттинг-хилл» и поедете на юг по линии Дистрикт, то окажетесь в Уимблдоне — это здорово для любителей тенниса, но это очень далеко от вашего пункта назначения. Поэтому вам нужно заняться поиском, мысленно перебирая возможные маршруты и представляя последствия выбора ветви x на развилке y. Примерно так работают алгоритмы поиска в шахматах — как в современных гибридных системах, так и в старых символьных моделях вроде Deep Blue, которая в 1997 году обыграла чемпиона мира Гарри Каспарова, просчитывая 200 миллионов возможных ходов в секунду.
В ряде недавних публикаций авторы черпают вдохновение напрямую из методов символьного ИИ, чтобы помочь БЯМ с планированием. В некоторых из них модель просят явно генерировать «мысли», развивая фундаментальные идеи CoT-промптинга (метода цепочки рассуждений). Мы можем определить «мысли» как предварительные формулировки на естественном языке (произносимые вслух или во внутренней речи), которые помогают в достижении конечной цели. Что важно, «мысли» могут использоваться для рассуждений без обязательства немедленно выдать ответ — подобно тому, как вы можете мысленно сформулировать реплику, затем отбросить эту идею, передумать и выдать в качестве окончательного ответа совершенно другое, правильное суждение.
В качестве примера можно привести одну работу, где БЯМ оснастили двумя спаренными модулями для планирования: один генерирует целое «дерево мыслей», а другой отслеживает, помогает ли каждая отдельная «мысль» приблизить достижение цели.[*6] Каждая мысль представляет собой суждение, выраженное на естественном языке, о том, как один шаг рассуждения ведет к другому. Так, в нашем примере со схемой лондонского метро генератор мыслей мог бы выдать следующее:
Если поехать на север по Кольцевой линии от «Ноттинг-хилл», вы приедете на «Кингс-Кросс»
Если поехать на юг по линии Дистрикт от «Ноттинг-хилл», вы приедете в Уимблдон
Если поехать на юг по Кольцевой линии от «Ноттинг-хилл», вы приедете на «Саут-Кенсингтон»
Модуль оценки также использует естественный язык, чтобы судить о том, приближает ли каждый шаг к цели. Например, БЯМ знает, что «Кингс-Кросс» находится ближе к «Олд-стрит», чем Уимблдон или «Саут-Кенсингтон», поскольку хранит эту информацию в своей семантической памяти. Она может использовать это знание, чтобы пойти по ветви (1), отбросив альтернативы (2) и (3), и сгенерировать мысль о том, куда двигаться дальше от «Кингс-Кросс». Таким образом, менее перспективные ветви «отсекаются», что позволяет модели сосредоточиться на тех, которые могут привести к цели, — опираясь на старую идею из области классического планирования. Если параллельно активировано много потенциально полезных «мыслей», БЯМ может сохранять или отбрасывать их, используя эвристические алгоритмы, получившие популярность в 1990-х годах, такие как поиск в ширину и поиск в глубину, которые начинают соответственно с исследования широкого спектра вариантов или продвижения по одной ветви глубоко в дерево. Именно о таком логическом, пошаговом мышлении всегда мечтали рационалисты — с той лишь разницей, что теперь оно реализовано в огромной глубокой нейронной сети на базе трансформеров.
Добавление модуля «дерева мыслей» (tree of thought, ToT) помогло GPT-4 решать задачи на поиск путей достижения цели (means–end reasoning) гораздо эффективнее, чем метод цепочки рассуждений (CoT). Например, «Игра в 24» — это математическая головоломка, цель которой состоит в том, чтобы с помощью четырех чисел и базовых арифметических операций (сложения, вычитания, умножения и деления) получить в итоге ровно 24. При наличии четырех чисел, четырех арифметических операций и возможности использования скобок существует не менее 9000 возможных уравнений, из которых лишь крошечная часть дает в результате 24, что делает эту задачу похожей на поиск иголки в стоге сена. К примеру, если даны числа 10, 9, 13 и 4, правильным решением будет (10 − 4) × (13 − 9) = 24. Модель ToT решала 70% подобных задач, в то время как все варианты CoT буксовали на уровне ниже 10%. Хотя кроссворд из New York Times по-прежнему остается не по зубам для БЯМ, ToT оказалась способна разгадать большинство словесных подсказок в более простом мини-кроссворде 5 × 5, тогда как другие модели справлялись лишь с единичными вопросами. Она также хорошо проявила себя в задании на творческое письмо, где требовалось сочинить короткий рассказ из четырех абзацев, каждый из которых должен был заканчиваться заранее заданной, случайно выбранной фразой (например, «Его застало врасплох то, что в помещении пахло жареным стейком» или «Сделать стойку на руках несложно, если просто стоять на руках»). Люди-оценщики сочли получившиеся рассказы более связными в тех случаях, когда модель предварительно обдумывала возможные сюжетные линии с помощью подхода ToT.
В рамках другого аналогичного проекта используется целая череда подсказок, побуждающих БЯМ формулировать промежуточные цели (подцели), стремиться к ним и отслеживать прогресс на пути к их достижению. Это привело к улучшению результатов в задачах, связанных с перемещением по графу от узла к узлу — наподобие описанной выше задачи с навигацией по лондонскому метро.[*7] Но БЯМ часто испытывают трудности с подобными задачами. При планировании модель может выдумывать несуществующие маршруты (например, предлагая поехать по линии «Виктория» от «Оксфорд-серкус» до «Марбл-арч»), даже если при прямом запросе она способна верно ответить, что «Марбл-арч» находится на Центральной линии. Эту пропасть между знанием фактов и их успешным использованием для многошаговых рассуждений называют разрывом композиционности (compositionality gap).[*8]
В части 1 мы познакомились с Cyc — экспертной системой из 1980-х годов, созданной для логических рассуждений на основе жестко запрограммированных правил («если X больше, чем Y, то Y меньше, чем X») и прописанной вручную базы знаний («млекопитающие не откладывают яйца»). Проект Cyc в конечном счете потерпел неудачу в своем стремлении создать универсальную мыслящую систему, поскольку наши семантические знания полны странных исключений, что лишает нас возможности создать компактную систему для ручной записи всего, что мы знаем (как известно, утконосы откладывают яйца, хотя и являются млекопитающими). Но прекрасная особенность БЯМ заключается в том, что они уже впитали в себя гигантские объемы знаний, извлеченных из интернета и заложенных в их веса на этапе предварительного обучения (GPT-4 может во всех подробностях рассказать мне о яйцекладущих млекопитающих, если я решу поинтересоваться). Поскольку БЯМ опираются на целые океаны семантических знаний, они могут использовать сам язык, чтобы генерировать возможные шаги в дереве рассуждений, предсказывать их последствия, рассматривать гипотетические сценарии и отбрасывать тупиковые теории. Вероятно, это очень похоже на то, как рассуждают люди в реальном мире: архитектор решает, стоит ли добавить огромные окна, чтобы выигрышно использовать великолепный вид; биолог размышляет о том, как вирус связывается с мембранами клеток хозяина; а свадебный распорядитель не забывает снабдить каждый стол на праздничном банкете средством от комаров, чтобы защитить гостей от голодных летающих нахлебников.
Так что же стоит между нами и языковыми моделями, способными к первоклассному планированию? Весьма вероятно, что не за горами еще более изобретательные способы использования «мыслей», которые позволят БЯМ рассуждать на языке внутренней речи — обдумывать возможные варианты ответов, прежде чем выдать окончательный вариант. Если это так, то подобные методы, скорее всего, дадут языковым моделям колоссальное преимущество в планировании и, возможно, позволят им решать задачи, требующие долгосрочного планирования, такие как игра в шахматы, бронирование отелей или проведение научных экспериментов. В следующем разделе мы исследуем, как БЯМ могут совершать действия непосредственно от имени пользователя с помощью цифровых инструментов, а не просто давать советы посредством слов.
Впрочем, стоит также отметить, что даже у нас, людей, мастерство рассуждения в специализированных областях не появляется в одночасье. Напротив, это результат многолетней упорной работы, как правило, под руководством опытных наставников. Шахматные гроссмейстеры и чемпионы по разгадыванию кроссвордов тренируются часами напролет каждый день, соревнуясь с игроками схожего ранга. Архитекторы и юристы учатся почти десятилетие, перенимая ремесло у преподавателей и опытных коллег, прежде чем им доверят проектировать небоскреб или выступать обвинителем в деле об убийстве. Возможно, даже существующие БЯМ смогли бы научиться решать задачи планирования в реальном мире, если бы для них были созданы специальные программы обучения, включающие огромные массивы качественных данных. Так что, возможно, нам стоит серьезнее задуматься о том, чтобы отправить системы ИИ обратно за парту.
Пропустить примечания
*1 Его можно посмотреть здесь: www.facebook.com/earways/videos/der-lauf-der-dinge-the-way-things-go-fischli-weiss/570376236477565/.
*2 Это называется нотацией Форсайта — Эдвардса (FEN). Показанная здесь запись соответствует доске, на которой белые сделали первый ход королевской пешкой, а ход черных обозначен одиночной буквой «b». Буквы обозначают фигуры белых (прописные) и черных (строчные) игроков.
*3 DeLeo and Guven, 2022.
*4 Feng et al., 2023.
*5 Wallace et al., 2022.
*6 Yao, Yu et al., 2023.
*7 Webb et al., 2023.
*8 Press et al., 2023.