К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значит9. Смысл и бессмыслица.
23%
9. Смысл и бессмыслица.
12

В абсурдистской пьесе Сэмюэла Беккета «В ожидании Годо» главные герои — Владимир и Эстрагон — разговаривают бесконечно, ухитряясь при этом не сказать абсолютно ничего. Вот как GPT-4 представляет себе диалог в подобном ключе:

Эстрагон: Это ожидание — абсурд.

Владимир: Не больший абсурд, чем если бы мы не ждали.

Эстрагон: Значит, могло быть и хуже?

Владимир: Мог бы пойти дождь. Или снег. Или разразиться буря.

Эстрагон: Ах, погода. Это было бы хоть что-то.

Владимир: О чем поговорить?

Эстрагон: Чтобы развеять монотонность.

Владимир: Посмотри на нас: находим утешение в возможности плохой погоды.

Эстрагон: Лишь бы как-то скоротать время.

Владимир: Кстати, о времени — как думаешь, оно движется?

Эстрагон: Трудно сказать. Оно кружит вокруг нас.

Владимир: Или мы кружим вокруг него.

Эстрагон: Хождение по кругу. Мы топчемся на месте.

Владимир: Именно там, где нам и положено быть.

Эстрагон: Нигде, в ожидании Годо.

Вся пьеса состоит из подобных диалогов. Каждая реплика выглядит вполне логичным ответом на предыдущую, но разговор беспечно скачет с темы на тему, лишенный какого-либо общего повествовательного смысла. Персонажи словно навечно застыли в своего рода семантическом лимбе, где слова — лишь пустые сосуды, лишенные значения, а единственная цель каждого высказывания — поддерживать беседу ради нее самой.

Пьеса Беккета напоминает нам: то, что диалог на естественном языке звучит правдоподобно, еще не делает его осмысленным. Человеческое общение часто бывает глупым или пустым. Мы неверно понимаем друг друга, говорим каждый о своем или согласно киваем, втайне думая о чем-то более интересном. Я могу увильнуть от ответа, превратив ваше последнее утверждение в вопрос. Могу вставлять короткие слова согласия, подталкивая вас продолжать говорить (это называют бэкченнелингом), чтобы самому спокойно унестись мыслями куда-то далеко. Возможно, я не могу понять, о чем вы говорите, но притворяюсь, что все понял, дабы избежать долгих и утомительных объяснений. Может быть, я считаю, что вы неправы, но соглашаюсь из вежливости, чтобы избежать потенциально неловкого спора (сугубо британский порок). Иными словами, пока академические лингвисты корпят над моделированием языка как системы передачи смыслов с помощью строгих синтаксических правил, в реальной жизни наше общение — это скорее игра без правил. Слова и фразы служат социальным клеем — способом укрепить наши связи друг с другом — в той же степени (если не в большей), в какой они служат средством обмена достоверной информацией.

Самые ранние попытки создания систем обработки естественного языка в области искусственного интеллекта неизбежно опирались на этот факт. В середине 1960-х годов исследователь из Массачусетского технологического института (MIT) Джозеф Вейценбаум разработал один из первых чат-ботов (или «болтунов», как их тогда называли) под названием Элиза.[*1] Его вдохновил пример светской беседы на вечеринке (которая в Кембридже, штат Массачусетс, естественно, велась о квантовой физике):

«Я могу сказать вам: "Ну, это чем-то похоже на квантово-механическое то да се", а вы ответите: "Понимаю". Но ведь, возможно, вы ничего не понимаете. Может, вы вообще ничего не знаете о квантовой механике, кроме самых элементарных вещей [...] Вы даже можете попытаться выудить все возможное из скудного багажа своих квантово-механических знаний и сказать: "О, вы имеете в виду принцип Гейзенберга?", хотя на самом деле это все, что вам известно. А я отвечу: "Да, замечательно — вы действительно все понимаете", ну и все в таком духе».

Элиза была создана для имитации этой светской болтовни без малейших попыток наполнить диалог смыслом. Для этого она использовала скрипты — шпаргалки, которые Вейценбаум запрограммировал лично; каждая из них задавала шаблон для сопоставления входящих реплик с правдоподобными ответами. Например, Элиза могла распознать высказывание типа «Я думаю, что Х» и подобрать к нему кажущийся естественным ответ: «Что заставляет вас думать, будто Х?». Каждый скрипт представлял собой длинный список таких прописанных вручную правил. Самый известный из этих скриптов под названием «Доктор» предназначался для работы в сфере, где, по мнению Вейценбаума, можно было обойтись практически бессмысленным обменом репликами — в психотерапии. Психоаналитик Карл Роджерс выступал за преимущественно неструктурированную форму терапии, при которой клиенту предлагается исследовать собственные чувства, а терапевту — рефлексивно слушать и сопереживать. Иными словами, Элизе (в роли терапевта) не нужно было делать практически ничего, кроме как подталкивать клиента продолжать говорить. Вейценбаум рассудил, что если Элиза скажет какую-нибудь глупость, пользователь спишет это на загадочную, но почему-то важную часть терапевтического процесса.

Вейценбаум оказался прав. Элиза пользовалась огромным успехом, и многие пользователи с удовольствием часами болтали с ней, порой откровенно рассказывая о своих самых сокровенных проблемах. Одним из них был выдающийся специалист по компьютерным наукам, приехавший в MIT из Советского Союза. Одинокий и находящийся вдали от дома, он оказался буквально заворожен программой — и в итоге поделился глубоко личными переживаниями по поводу своего брака и разлаживающихся отношений с детьми, к крайнему смущению принимающей стороны. Сегодня легко найти сайты, где вы можете сами пообщаться с Элизой. Вот разговор, который приводит сам Вейценбаум:

Пользователь: Все мужчины одинаковы.

Элиза: В каком смысле?

Пользователь: Они вечно донимают нас по какому-нибудь поводу.

Элиза: Можете привести конкретный пример?

Пользователь: Ну, мой парень заставил меня прийти сюда.

Элиза: Ваш парень заставил вас прийти сюда?

Пользователь: Он говорит, что я почти всегда в депрессии.

Элиза: Мне жаль слышать, что вы в депрессии.

Сегодня под термином «эффект Элизы» понимают нашу склонность антропоморфизировать компьютеры, особенно чат-ботов, даже когда их действия или слова могут быть глупыми или бессмысленными. Он показывает, что мы — возможно, излишне — склонны авансом доверять компьютерам при оценке их языковых навыков. Элиза способна играть на наших слабостях в ведении беседы точно так же, как Ним умел пользоваться нашей щедростью на фрукты и щекотку. Но, пожалуй, нет ничего удивительного в том, что у нас столь низкая планка для приписывания владения языком другим агентам, учитывая, что — подобно персонажам «В ожидании Годо» — в наших собственных словах зачастую так мало смысла.

В ретроспективе Элиза кажется довольно странной системой NLP, поскольку она намеренно имитировала понимание — создавала иллюзию того, что улавливает суть сказанного, даже не пытаясь делать это на самом деле. Однако на рубеже 1960-х и 1970-х годов начался бурный расцвет попыток написать программы, о которых действительно можно было бы сказать, что они «понимают» вводимые пользователем данные. Вместо того чтобы блефовать в ходе разговора, используя встречные вопросы и реплики в сторону, цель исследований теперь состояла в том, чтобы ИИ действительно обрабатывал входные данные, делал логические выводы и отвечал разумно, правдиво и информативно. Например, мы могли бы захотеть, чтобы система ИИ разумно реагировала на подобные запросы:

Если красный блок находится справа от синего, а зеленый — справа от красного, то как расположены синий и зеленый блоки?

Какое самое большое простое число меньше 20?

Как называется самая высокая гора на Луне?

Фоном для этих стремлений было движение за символический ИИ, которое приближалось к своему зениту в 1960-х годах и (как мы видели в части 1) рассматривало рассуждение как инструмент для получения знаний. Однако важным сопутствующим интеллектуальным толчком стал рост влияния лингвистической теории Ноама Хомского. Хомский предложил этой дисциплине радикально новую формализацию естественного языка, в которой предложения рассматривались так, будто они были инструкциями в компьютерном коде. К 1960-м годам Хомский и его (становившиеся все более строптивыми) последователи все больше внимания уделяли глубинным ментальным процессам, стоящим за языком. Для многих исследователей в области NLP эти труды послужили прямым приглашением к попытке написать компьютерные программы, способные плавно переключаться между хаотичной поверхностной структурой языка — словами, слетающими с губ или напечатанными на странице, — и лежащим в основе формальным языком, на котором формируются наши мысли и в котором, в конечном счете, кроется смысл.

Идея о том, что предложения порождаются грамматическими правилами, впервые возникла в Индии в VI веке до н. э. — её предложил ученый-санскритолог Панини. Спустя несколько веков Аристотель в своем труде De Interpretatione («Об истолковании») предположил, что предложение можно разделить на субъект и предикат. Но Хомский пошел гораздо дальше. В книге «Синтаксические структуры», впервые опубликованной в 1957 году, он сформулировал полноценную «грамматику непосредственных составляющих» (phrase structure grammar), согласно которой предложения последовательно разбираются на составляющие части, начиная с его знаменитой формулы S NP VP. Она означает, что любое предложение (S) состоит из именной группы (NP), за которой следует глагольная группа (VP). Например, английское предложение «Дракон с удовольствием съел жареных детей на обед» состоит из именной группы («дракон») и глагольной группы («с удовольствием съел жареных детей на обед»). Это разложение является иерархическим. Здесь сама глагольная группа VP содержит именную группу NP («жареных детей»), которая, в свою очередь, представляет собой сочетание «прилагательное + существительное». Главным прорывом Хомского стала разработка набора «трансформационных правил», которые устанавливали соответствия между различными синтаксическими структурами с предположительно эквивалентным значением. Эти трансформационные правила делали задачу понимания предложений похожей на доказательство теорем в математике. Например, после применения трансформационной операции под названием Tpass, которая включает в себя перестановку слов и добавление аффиксов, приведенное выше предложение принимает пассивную форму: «Жареные дети были с удовольствием съедены драконом на обед». Это очень похоже на то, как можно преобразовать уравнение 2n + 1 = 0 в эквивалентную форму наподобие 4n = −2. Эта научная область мгновенно пленилась трансформационными правилами, которые, казалось, вырывали лингвистику из окутанной трубочным дымом неточности гуманитарных наук и бросали ее в чистые, свежие, облаченные в белые халаты объятия математики и компьютерных наук.

Безусловно, самыми мощными операциями в арсенале Ноама Хомского были обобщенные трансформации, такие как Tconj и Tso. Они позволяли присоединять одни предложения к другим путем вставки союзов, наделяя язык свойством рекурсии — способностью вкладывать одно выражение в другое, создавая бесконечный цикл. Например, в одном популярном мюзикле Вест-Энда активно используется Tconj при описании фантастического одеяния под названием «Удивительный разноцветный плащ Иосифа»: «Он был красным и желтым, зеленым и коричневым, а еще алым, черным, охристым, персиковым, рубиновым, оливковым и [вставьте любой другой цвет, какой только сможете вспомнить], розовым, оранжевым и синим».

Позже, совершив радикальный шаг, Ноам Хомский отказался от обобщенных трансформаций и пересмотрел свою базовую грамматику непосредственных составляющих так, что именная группа теперь определялась как NPDet + N + (S). Это волшебство заставило лингвистов трепетать от восторга еще сильнее. Своим решением он сделал саму грамматику составляющих рекурсивной (помимо того, что она оставалась иерархической), благодаря чему целые новые фразы могли встраиваться в середину других фраз, как в этой запутанной конструкции: «дракон съел детей, которые не сделали домашнее задание, которое должно было быть выполнено в тот день, когда ее муж забыл приготовить ужин, лежавший в холодильнике». Более того, позже Хомский стал ярым сторонником идеи о том, что рекурсия — вычислительная операция, способная вызывать саму себя и приводить к бесконечным циклам обработки, — и есть главный секрет усвоения языка. Позже в своей карьере он утверждал, что люди (и только они) способны порождать и понимать язык благодаря генетической мутации, которая делает возможными рекурсивные вычисления в нашем мозге. Это интересная идея, но большинству нейробиологов она кажется не слишком убедительной, поскольку даже дрозофила обладает мозгом, способным к рекурсивным вычислениям, но при этом она не слишком сильна в построении предложений.

Теория грамматики непосредственных составляющих Ноама Хомского придает языку сходство с конструктором Lego. Если дать ребенку игрушку вроде Playmobil, в которой есть пластиковые фигурки, здания и аксессуары, он сможет придумывать самые фантастические сюжеты, необычным образом комбинируя имеющиеся предметы — например, заставит пластиковую женщину-полицейского делать операцию на открытом сердце пластиковой курице в пластиковой больнице. Однако количество возможных комбинаций ограничено, и игры, в которые можно играть, лимитированы имеющимися деталями (если только не искромсать курицу ножницами, что, к сожалению, необратимо). Молодой Ноам Хомский, осаждавший академическую цитадель лингвистики, обвинял ее защитников — своих старших коллег, известных как блумфилдианцы, — в том, что они играют с языком как с Playmobil, бесконечно переставляя, сортируя и каталогизируя его части, но так и не добираясь до фундаментальных кирпичиков, из которых строится язык. Если же дать ребенку космический корабль, собранный из конструктора вроде Lego, он сможет разобрать его на полезные составные блоки и перестроить во что угодно — в пожарную машину, подъемный кран или иглу. Вооружившись дополнительным ведром Lego, ребенок может развить конструкцию до машины втрое большего размера — с сиренами, реактивными двигателями или бесстрашным водителем-человечком. Проект Хомского похож на попытку определить фундаментальные формы, которые могут принимать детали Lego, и базовые правила их соединения. Легко понять, почему его идеи были с жадностью подхвачены ранними исследователями ИИ, привыкшими думать о мышлении как о цепочках логических операций, реализованных в программном коде. Их энтузиазм удваивался благодаря очевидному сходству между трансформационными правилами в лингвистической теории Хомского и базовыми принципами программирования, такими как иерархии (вложенные структуры), рекурсия (самореферентные структуры, например циклы FOR) и условные конструкции (правила IF-THEN / «ЕСЛИ — ТО»). Ноам Хомский позволил взглянуть на порождение предложений сквозь ту же алгоритмическую призму, которую специалисты по компьютерным наукам использовали для доказательства теорем и решения логических головоломок.

Это слияние идей подтолкнуло исследователей в области обработки естественного языка (NLP) к попыткам сопоставить входные данные на естественном языке с красивыми, чистыми формальными языками — например, теми, что допускают логический вывод в логике первого порядка. В качестве иллюстрации рассмотрим один пример, ставший знаковым для того времени — роботизированную вопросно-ответную систему под названием ENGROB, созданную Л. Стивеном Коулзом в Стэнфорде в 1969 году. Она умела довольно эффективно переводить с английского языка на исчисление предикатов, пока входные фразы оставались простыми.[*2] Чтобы понять, как работает подобная система, представьте, что вы играете в настольную игру Cluedo, где нужно раскрыть убийство в духе Агаты Кристи в жутковатом английском особняке. Ваша задача — задавать вопросы другим игрокам, чтобы отгадать преступника (например, полковника Мастарда), орудие убийства (подсвечник) и место (бильярдную); соответствующие им карты спрятаны в секретном конверте, поэтому их не может быть ни у кого на руках. Весомые выводы можно делать методом исключения: например, если у вас лично нет карты мисс Скарлетт, вы знаете, что она либо на руках у другого игрока, либо сама мисс Скарлетт — убийца. В нашей вопросно-ответной системе парсер должен взять предложение на естественном языке «У меня нет мисс Скарлетт» и сопоставить его со списком утверждений вроде ~p2(have,MS) (перевод: «у игрока 2 нет мисс Скарлетт»). Система уже знает, что (∀,x){p1(have,x)∨p2(have,x)∨p3(have,x)∨guilty(is,x)}, — что означает: «для любого x либо у игрока 1, игрока 2 или игрока 3 есть x на руках, либо x виновен». Таким образом, если список в памяти компьютера уже включает ~p1(have,MS) и ~p3(have,MS) (что означает «ни у игрока 1, ни у игрока 3 нет мисс Скарлетт»), то путем отрицания система может с уверенностью сделать вывод, что ни у кого нет карты мисс Скарлетт, а значит, именно она — коварная преступница. Увы, систему ENGROB не обучали играть в Cluedo, но она использовала аналогичную логику для ответов на более приземленные вопросы об окружающем мире, такие как «находишься ли ты рядом с большой красной призмой?» (что переводилось как (∃s,x){At(r,s,x)∧In(x,big)∧In(x,red)∧In(x,prism)}).

Одной из самых успешных среди таких ИИ-систем была программа с несуразным названием SHRDLU. Она была создана в начале 1970-х годов другим известным стэнфордским исследователем по имени Терри Виноград.[*3] Позже, в 1990-х годах, Виноград станет научным руководителем аспиранта по имени Ларри Пейдж, чьи исследования ссылочной структуры зарождающейся Всемирной паутины приведут к созданию поискового алгоритма PageRank и выведут основанную им компанию Google на лидирующие позиции в гонке за монетизацию интернета. SHRDLU — получившая свое довольно неуклюжее название из-за порядка клавиш на линотипе, использовавшемся тогда для набора текста, — для своего времени была очень передовой. Она принимала запросы на естественном языке и выдавала информацию о мире, состоящем из блоков разного цвета и формы, сложенных в импровизированный макет городского пейзажа. К счастью, хотя правила «мира блоков» не так просты, как в Cluedo, они все же вполне поддаются формализации. Например, ни один блок не может лежать на вершине пирамиды (слишком неустойчиво), и если красный куб находится над зеленым, а синий — над красным, то вы точно знаете, что синий куб находится над зеленым (это называется транзитивностью).

С непринужденностью, напоминающей ChatGPT, SHRDLU могла отвечать на довольно сложные запросы:

Пользователь: Есть ли большой блок за пирамидой?

SHRDLU: Да, три: большой красный, большой зеленый куб и синий.

Она также могла отвечать на вопросы, начинающиеся со слов «сколько?» или «почему ты сделал...», и даже умела разучивать новые слова: если вы упоминали, что «шпиль» — это пирамида на кубе, система впоследствии без труда отвечала на вопросы об этом новом типе блоков. Кроме того, она была способна на довольно дерзкие ответы:

Пользователь: Почему ты его уронила?

SHRDLU: Под «этим», полагаю, ты имеешь в виду суперблок. Я не могу объяснить событие, которого не было.

Под капотом SHRDLU опиралась на сложный набор правил синтаксического анализа предложений, которые начинались с грамматики непосредственных составляющих Ноама Хомского, но шли гораздо дальше, чтобы учесть все граничные случаи, какие только можно представить при описании мира, состоящего исключительно из блоков. Например, она явно определяла, было ли высказывание говорящего повествовательным (утверждающим то, что может быть правдой), побудительным (просящим ИИ что-то сделать) или вопросительным (задающим вопрос), а также использовался ли действительный или страдательный залог. Вместо того чтобы использовать логику предикатов, она применяла новый язык программирования под названием Micro-Planner, который сопоставлял входные данные на естественном языке («положи синий цилиндр на зеленый куб») с внутренним целевым состоянием blue_cylinder(is,green_cube,on), а затем искал возможные действия, которые необходимо предпринять для его достижения. Подобный подход назывался процедурным программированием.

SHRDLU произвела на всех глубокое впечатление. Даже сэр Джеймс Лайтхилл в своем знаменитом мрачном обзоре состояния исследований в области ИИ 1972 года[*4] особо выделил SHRDLU как проект, представляющий исключительный интерес, — несмотря на «явно выраженное чувство разочарования» по поводу прогресса в этой области в более широком смысле (его доклад привел к повсеместному прекращению финансирования исследований, известному как «зима ИИ»). Но, как признавал сам Виноград, хотя многие ответы SHRDLU казались вполне правдоподобными, не было никакой возможности «просто передать ее кому-то, чтобы этот человек мог использовать ее для перемещения блоков». Несмотря на амбициозные цели проекта — Виноград назвал статью с описанием этой работы «Понимание естественного языка» (Understanding Natural Language) — и тщательно срежиссированные демонстрации, SHRDLU была бесконечно далека от того, чтобы осмысленно общаться с людьми в рамках свободного диалога. Как мы видели в части 1, этим классическим попыткам «приручить» естественный язык — записать исчерпывающий набор правил, позволяющих сопоставить его с логической или процедурной программой, — так и не суждено было принести плоды.

Таким образом, на протяжении 1960-х и 1970-х годов исследователи многое узнали о том, чем естественный язык не является. Язык — это не просто случайный набор слов, подобный языку L или той мешанине знаков, которую Уошо и Ним лихорадочно выдавали всякий раз, когда хотели поиграть или поесть. Язык также не является просто формулой для преобразования утверждений в вопросы или шпаргалкой для поддержания непринужденного разговора с помощью поверхностных острот или реплик — как в тех случаях, когда Элиза одурачивала пользователей, заставляя их изливать свои тревоги. Но точно так же естественный язык не является формальным языком. Это не просто логическая система, позволяющая делать выводы из посылок. Попытки систематизировать естественный язык — разложить его с помощью деревьев разбора Хомского и реконструировать так, чтобы придать ему логический или процедурный смысл, — так и не удалось масштабировать за пределы мира блоков или других узких областей, таких как ответы на запросы о расписании авиарейсов или графике бейсбольных матчей. Естественный язык — вопреки надеждам Ноама Хомского — устроен не как Lego. Но, как мы увидим далее, идея, вдохновлявшая классическую обработку естественного языка (NLP), — о том, что система ИИ в принципе не может демонстрировать «понимание», если она явно не рассуждает о языке, который получает на вход, — до сих пор подпитывает многие сегодняшние дискуссии вокруг LLM.

Пропустить примечания

*1 Вейценбаум, 1966.

*2 См. www.ijcai.org/Proceedings/69/Papers/052.pdf.

*3 Виноград, 1972.

*4 https://www.aiai.ed.ac.uk/events/lighthill1973/lighthill.pdf.

Предыдущая главаГлава 12 из 52Следующая глава