К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значит21. Эмерджентное познание.
46%
21. Эмерджентное познание.
24

Трудно осознать, как сложность может рождаться из простоты. Один из вечных примеров — то, с каким трудом мы принимаем мысль, будто замысловатые чудеса природы возникли без направляющей руки божественного творца. Возьмем человеческий глаз, который, кажется, был создан с исключительным тщанием, чтобы проецировать изображение на сетчатку. Зрачок идеально приспособлен для регулирования общего уровня освещенности за счет расширения и сужения, а хрусталик становится то более выпуклым, то более плоским, чтобы точно сфокусировать изображение на фоторецепторах сетчатки, чья чувствительность к длине волны идеально настроена для различения ключевых цветов. Как нечто столь совершенное могло возникнуть случайно? Наиболее известное изложение этого аргумента принадлежит скромному английскому священнику Уильяму Пейли, который в 1802 году заявил: подобно тому, как механическое совершенство карманных часов требует существования часового мастера, безупречное устройство Вселенной служит неопровержимым доказательством существования разумного создателя. Аргумент Пейли о «часовщике» так никогда полностью и не ушел в прошлое. Сегодня в США христианские активисты продолжают ратовать за то, чтобы «разумный замысел» преподавали в школах как законную альтернативу эволюционной теории Дарвина.

У систем ИИ, конечно, есть создатель, и в некоторых случаях — разумный. Но возникает тот же соблазн: кажется почти чудом, что система ИИ способна демонстрировать такие формальные способности, как математика, логика и синтаксис, без того, чтобы они были заложены в нее вручную. Однако при решении новых математических задач GPT-4 не обращается к специализированной программе и не запрашивает библиотеку канонических уравнений, которую исследователь ИИ заботливо загрузил в ее «мозг»[*1]. Напротив, ее способность справляться с этим классом задач возникает сама по себе в процессе обучения сети предсказывать следующий токен — что и порождает контекстное обучение. В LLM, как и в эволюции, сложность рождается из простоты. Вычисления, выполняемые трансформером, относительно просты: они включают в себя встраивание (эмбеддинг) векторов признаков, их взвешивание с помощью механизма самовнимания и распределение вычислений по головкам внимания и слоям. Даже формальное алгоритмическое описание трансформера относительно компактно: в одной из недавних статей, исчерпывающе подробно описывающей каждый вычислительный шаг, оно заняло менее десяти страниц[*2]. Но в процессе обучения возникает непостижимо сложная модель человеческого языка, закодированная в миллиардах параметров. Термин «эмерджентность» означает, что при наличии достаточного времени, данных и вычислительных мощностей сложные функции могут развиваться на основе базового набора принципов. Человеческий глаз не был спроектирован вручную благосклонным творцом, а развился в процессе естественного отбора, когда крошечные светочувствительные участки кожи (глазные пятна) постепенно, на протяжении бесчисленных поколений, превращались в мощный зрительный аппарат. Естественный отбор — это слепой вычислительный процесс, в котором генетический код успешных фенотипов с большей вероятностью передается дальше по наследственной линии. Апеллируя к Пейли, биолог Ричард Докинз назвал эволюцию «слепым часовщиком».

Таким образом, рецепт интеллектуальных вычислений опирается на несколько удивительно простых ингредиентов. Эти ингредиенты представляют собой процессы, которые обучают колоссальную нейросеть тому, что с чем сочетается в потоке входных данных, чтобы предсказать, какой токен будет следующим. Кажется почти чудом, что, следуя этому рецепту, трансформеры способны улавливать все невероятное семантическое богатство человеческого языка. Поразителен тот факт, что, изучив статистические закономерности языка, LLM, похоже, обретают способность «мыслить» над совершенно новыми задачами — они научились учиться, совсем как люди. Как такое возможно?

Чтобы понять, как работает контекстное обучение, представьте себе трансформер, обученный на довольно скучном корпусе текстов, где речь идет исключительно о том, как добраться от одного ориентира к другому в нью-йоркском районе Манхэттен. Вот пример промпта из этого корпуса:

Эмпайр-стейт-билдинг находится в 3 кварталах к востоку и в 9 кварталах к югу от Крайслер-билдинг. Крайслер-билдинг находится в 3 кварталах к западу и в 7 кварталах к югу от Рокфеллер-центра. Рокфеллер-центр находится в 26 кварталах к северу от Флэтайрон-билдинг. Ориентир, который находится в 10 кварталах к югу от Эмпайр-стейт-билдинг, называется __________.

Представьте, что мы обучаем нейросеть на задачах, связанных исключительно с Манхэттеном (назовем это узким режимом обучения). Сеть, несомненно, научится определять пространственные отношения между такими ориентирами, как Крайслер-билдинг и Флэтайрон-билдинг. Но вообразите, что на этапе тестирования вы предлагаете ей следующий запрос, где ориентирами выступают станции метро в аккуратной сетке улиц района Эшампле в Барселоне:

Пасео-де-Грасия находится в 4 кварталах к западу и в 1 квартале к югу от Жироны. Вердагер находится в 1 квартале к востоку и в 4 кварталах к северу от Жироны. Диагональ находится в 6 кварталах к северу от Пасео-де-Грасия. Ориентир, который находится в 5 кварталах к востоку и в 1 квартале к югу от Диагонали, называется __________.

Сеть, обученная в узком режиме, будет совершенно сбита с толку, поскольку никогда раньше не слышала ни о Жироне, ни о Диагонали. Этих мест просто нет в ее обучающих данных, основанных на Нью-Йорке, поэтому она не сможет ничего рассказать о них и потерпит катастрофическую неудачу при попытке дать ответ.

Но теперь давайте рассмотрим обучение сети на корпусе, состоящем из задач той же формы, что и оба запроса выше, но теперь города и ориентиры отличаются в каждом конкретном примере. Таким образом, каждый запрос описывает отношения между различными ориентирами в совершенно иной городской сетке (широкий режим обучения). В широком режиме у сети нет возможности узнать что-то конкретное о Нью-Йорке или Барселоне. Вместо этого единственный способ предсказать пропущенный финальный токен — разобраться в структуре самой задачи, абстрагируясь от того, какие именно города или ориентиры в ней упоминаются. Здесь структура задачи задается пространственными отношениями между ориентирами (A, B, C), направлениями (С, Ю, В, З) и расстояниями (количеством кварталов) на сетке. Вооружившись базовыми геометрическими знаниями, вы, конечно, могли бы решить любую задачу такого типа, даже если бы ориентиры принадлежали научно-фантастическому городу, который я только что придумал. На самом деле было бы несложно написать символьную компьютерную программу, способную решить любую подобную задачу: для этого достаточно закодировать местоположение каждого ориентира относительными значениями x и y и с помощью простой арифметики вычислить их взаимное расположение в декартовых координатах. Но наша человеческая способность написать такую программу опирается на понимание значения таких слов, как «север» и «пять кварталов». Для нейросети это кажется невозможным, ведь, если рассуждать наивно, соответствующие токены, кодирующие эти понятия, — всего лишь длинные числовые векторы, допускающие бесконечное множество интерпретаций. И тем не менее на практике трансформеры отлично справляются с подобными задачами. Как же они понимают, что эти слова обозначают направления или расстояния, и используют их для решения головоломки?

Ответ заключается в том, что сама структура языка отражает структуру внешнего мира. Например, в нашей задаче с ориентирами синтаксис предложений вида «A находится в x кварталах к западу и в y кварталах к северу от B» определяет относительное положение токенов A, B, x и y в предложении. В то же время правильный ответ (предсказание следующего токена) определяется базовыми геометрическими фактами о том, как устроено пространство в реальном мире — или, в данном случае, на двумерной решетке с симметрией четвертого порядка (что является замысловатым названием для сетки, состоящей из квадратов). Язык, используемый для описания задачи, внутренне непротиворечив по отношению к реальному миру. Например, если верно, что «A находится в двух кварталах к северу от B, а B — в двух кварталах к северу от C», то должно быть верно и то, что «A находится в четырех кварталах к северу от C». Если оказывается, что «A находится в трех кварталах к востоку от B», то должно выполняться и то, что «B находится в трех кварталах к западу от A». Таким образом, структура языка соответствует тому, как работают пространство и расстояние на карте в условиях евклидовой геометрии.

По мере оптимизации трансформера его бесчисленные параметры постепенно адаптируются, чтобы найти такую конфигурацию, которая минимизирует перплексию — то есть обеспечит правильное предсказание того, где каждый ориентир расположен относительно всех остальных. Разумеется, при наличии миллиардов параметров существует огромное множество их возможных конфигураций, способных привести сеть к такому результату. Однако в широком режиме обучения, когда каждая задача совершенно уникальна, единственной конфигурацией, обеспечивающей эффективное прогнозирование, будет та, которая правильно проецирует структуру предложения на структуру мира — то есть кодирует осмысленную взаимосвязь между токенами, соответствующими A, B, x и y. На самом деле трансформер устроен для этого идеальным образом, поскольку механизм самовнимания — это, по сути, инструмент для определения того, что с чем связано, позволяющий напрямую усваивать отношения между токенами в промпте.

Другой важнейшей особенностью трансформера является использование позиционных эмбеддингов (position embeddings). Позиционные эмбеддинги представляют собой дополнительные входные данные, передаваемые сети; они объединяются с эмбеддингами токенов и явно указывают на то, какое место каждый токен занимал в последовательности. Так, в промпте «Пекин находится к северу от Шанхая» относительные позиционные эмбеддинги для этих двух китайских городов помогают сети отличить эту фразу от ее географически ошибочного перевертыша «Шанхай находится к северу от Пекина» (любопытно, что человеческий мозг, по-видимому, также обрабатывает входящую информацию о «что» и «где» в раздельных потоках, и это вполне может вносить важный вклад в нашу собственную способность к рассуждению). Благодаря этим инновациям в нейросети возникает своего рода программа, эквивалентная той символьной программе, которую программист-человек написал бы вручную. Именно так глубокие нейросети, которые обучаются методом проб и ошибок, подобно Советнику 1, могут быть обучены приближенно воспроизводить точные символьные вычисления, обычно ассоциирующиеся с Советником 2. Таким образом, трансформеры способны осваивать ментальные программы, которые принимают язык в качестве входных данных и обрабатывают его в соответствии с реальной структурой мира, выраженной формальными математическими или логическими системами — такими как геометрия положений на сетке в нашей задаче с ориентирами.

На самом деле, когда GPT-4 решает эту задачу, она объясняет свою логику как последовательность операций, аналогичных тем, которые использовал бы символьный алгоритм для барселонской версии задачи:

1. Определить координаты Жироны: мы примем Жирону за точку отсчета (0, 0):

Жирона = (0, 0)

2. Найти Пасео-де-Грасия:

Пасео-де-Грасия находится в 4 кварталах к западу и в 1 квартале к югу от Жироны.

Пасео-де-Грасия = (−4, −1)

3. Найти Вердагер:

Вердагер находится в 1 квартале к востоку и в 4 кварталах к северу от Жироны.

Вердагер = (1, 4)

4. Найти Диагональ:

Диагональ находится в 6 кварталах к северу от Пасео-де-Грасия.

Диагональ = (−4, −1 + 6) = (−4, 5)

5. Найти искомую станцию:

Нам нужно найти станцию, которая находится в 5 кварталах к востоку и в 1 квартале к югу от Диагонали.

Искомая станция = (−4 + 5, 5 − 1) = (1, 4)

6. Определить станцию с координатами (1, 4):

Это координаты Вердагера.

Задача с ориентирами сильно схематизирована. Каждый промпт имеет однородный синтаксис, и всегда существует единственный верный ответ, поэтому трансформеру было бы легко усвоить эквивалентность между лингвистической и геометрической структурой. В реальных условиях, однако, естественный язык ведет себя далеко не так послушно. Гигантские корпуса текстов, на которых обучались LLM, обсуждают всё на свете на множестве языков, смешивая сленг и высоколобую прозу, книги, полные сложного формализма, и компьютерный код, кулинарные рецепты и спортивные альманахи, бульварное чтиво и крикливую желтую прессу. Тем не менее внутренние структурные взаимосвязи в естественном языке выдают информацию о том, как устроен мир, — а ведь именно для этого, в конце концов, язык и предназначен. Внушительные объемы компьютерного кода, усвоенные моделями во время обучения, возможно, помогают сделать их рассуждения более систематическими, поскольку синтаксис кода напрямую реализует логические операции вроде условных операторов «если — то».[*3]

Таким образом, обработка естественного языка — это просто более масштабная и хаотичная версия задачи с ориентирами. Пространство возможных высказываний астрономически велико, но информация, которую несут в себе предложения, связана — невероятно сложным, но в конечном счете закономерным образом — с тем, что логично или истинно в мире. Таким образом, язык обретает смысл не только потому, что он указывает на внешние физические объекты, которые можно взять в руки, но и потому, что его собственная внутренняя структура отражает структуру внешнего мира. LLM способны «мыслить» и «рассуждать», потому что титанические вычислительные мощности позволяют им кодировать эту структуру в своих весах с помощью серии ментальных программ, реализующих операции, которые лежат в основе таких формальных способностей, как алгебра и логика предикатов, а также гораздо более неформальных связей, составляющих повседневное общение. Эти ментальные программы закодированы в (миллиардах) весов сети, точно так же как ваши знания о том, как устроен мир, закодированы в (триллионах) синапсов вашего мозга. Именно по этой удивительной причине глубокие нейронные сети, чьи связи безнадежно лишены структуры и запутаны, словно гигантский клубок ниток, тем не менее способны выполнять вычисления, строго структурированные по тем логическим и рациональным принципам, с помощью которых мы, люди, осмысляем мир.

Пропустить примечания

*1 Хотя см. обсуждение использования инструментов в части 5.

*2 Phuong and Hutter, 2022.

*3 Madaan et al., 2022.

Предыдущая главаГлава 24 из 52Следующая глава