Искусственные нейронные сети не просто предлагали альтернативу правилам и символам. В своей самой амбициозной форме они предлагали их полную замену. В одной из глав книг по PDP, которая в конце 1980-х годов вызвала настоящую бурю, Румельхарт и Макклелланд заявили: «Мы предполагаем, что закономерное поведение и суждения могут порождаться механизмом, в котором нет явного представления правил. Вместе с тем мы полагаем, что механизмы, обрабатывающие язык и выносящие суждения о грамматической правильности, устроены таким образом, что их работу можно охарактеризовать с помощью правил, однако сами эти правила нигде в механизме в явном виде не записаны».
В этой главе была представлена простая модель того, как люди образуют прошедшее время глаголов — тема, казалось бы, безобидная, но наносившая удар в самое сердце когнитивистики Восточного побережья. Со времен новаторских работ Хомского в 1950-х годах язык служил одним из лучших доказательств силы правил и символов. Показав, что язык можно представить — и даже выучить — с помощью системы, не содержащей явных правил, Румельхарт и Макклелланд подрывали один из самых сильных аргументов в пользу анализа разума как формальной системы. Ответная реакция последовала незамедлительно и была весьма жесткой.
Спор о прошедшем времени был лишь началом. В течение следующих нескольких десятилетий нейронные сети станут использоваться для воссоздания аспектов синтаксиса и семантики. Обучаясь предсказывать следующее слово в последовательности, простые модели могли отличать существительные от глаголов. Обучаясь тому, как частота слов варьируется в различных документах, можно было уловить значение этих слов. И по мере того как для обучения этих нейросетей становилось доступно всё больше данных, их возможности возрастали.
Большие языковые модели, лежащие в основе современных систем ИИ, — прямые потомки тех ранних нейросетевых моделей языка, вобравшие в себя идеи нескольких поколений когнитивистов. Но даже наглядно демонстрируя поразительную способность нейросетей выявлять закономерности в данных, они в то же время подчеркивают, насколько сильно современные системы ИИ отличаются от человеческого разума.
Прошедшее время накаляется
Когда Джин Берко зашла в книжный магазин Гарварда, чтобы купить каталожные карточки размером пять на семь дюймов и цветные карандаши, она и не подозревала, что закладывает основы для одной из самых ожесточенных дискуссий в когнитивистике.
Берко родилась в семье иммигрантов из Трансильвании и выросла в Кливленде вместе с братом, страдавшим детским церебральным параличом. Наблюдение за тем, с каким трудом ему давалось общение, пробудило в ней интерес к языку: «Люди говорили, что не понимают его, когда он говорит, но я всегда понимала. Так что, наверное, я была переводчиком. Этот опыт близости к страдающему человеку и осознание того, как тяжело ему дается общение, сделали меня более восприимчивой к языку, чем я могла бы быть в иных обстоятельствах».
Этот интерес привел ее из Огайо в Массачусетс, где в 1949 году она стала студенткой Рэдклиффа. Она изучала все языки, какие только могла, но чего-то всё равно не хватало. Недостающее звено она нашла на курсе «Психология языка», который читал новый профессор Роджер Браун. (Мы мельком встречали Брауна в главе 7 как научного руководителя Элеанор Рош.) Берко была очарована: «Он говорил обо всем, что связано с языком: как мы его усваиваем, обрабатываем, воспроизводим и понимаем. И я просто сказала себе: „Это именно то, чем я должна заниматься“. Я решила, что хочу пойти в аспирантуру изучать лингвистику».
Берко продолжила работать с Брауном в аспирантуре, и сфера ее интересов сместилась к вопросу о том, действительно ли дети усваивают правила языка: «Им просто вдалбливают: „Вот собака, а вот две собаки; вот книга, а вот две книги“? Или в какой-то момент они интериоризируют эти правила? Именно это мы и хотели выяснить». Чтобы ответить на этот вопрос, она создала простую иллюстрированную книжку, которую могла показывать детям, заполнив те самые карточки собственными рисунками. На первой карточке было изображено милое существо, похожее на птицу, с подписью: «This is a wug» («Это ваг»). Под ним красовался рисунок с двумя такими же существами, за которым следовало: «Now there is another one. There are two of them. There are two___» («Теперь появился еще один. Их двое. Здесь два___»). Ребенку предлагалось заполнить пропуск.
Разумеется, дети никогда раньше не слышали слова «wug». Цель Берко состояла в том, чтобы проверить, усвоили ли они правило образования множественного числа в английском языке — добавление окончания «-s» для получения «wugs». Это правило работает не для каждого существительного (достаточно вспомнить «mice» [мыши] и «geese» [гуси]), но лингвисты называют его «регулярной» (то есть подчиняющейся правилу) формой множественного числа: если существительные следуют правилу, они следуют именно ему. Существительные во множественном числе, которые правилу не подчиняются, называют «нерегулярными». Иллюстрированная книжка Берко проверяла, переносят ли дети регулярную форму на новые слова не только во множественном числе, но и в других грамматических связях, включая прошедшее время: «This is a man who knows how to spow. He is spowing. He did the same thing yesterday. What did he do yesterday? Yesterday he___» («Это человек, который умеет споуить. Он споуит. Вчера он делал то же самое. Что он делал вчера? Вчера он___»). Поскольку регулярная форма прошедшего времени образуется добавлением «-ed», предполагалось, что он «spowed» (споуил).
Берко отнесла свою книжку с картинками в местный детский сад и начальную школу, расспрашивая детей от четырех до семи лет о «вагах» и «споуинге». Результаты оказались поразительными: 76 процентов дошкольников сочли, что перед ними два «вага», а к первому классу эта доля выросла до 97 процентов. И хотя лишь 36 процентов дошкольников решили, что человек «споуил» (в первом классе эта доля выросла до 59 процентов), большинство детей с готовностью соглашались, что вчера кто-то «глингал» или «рикал». Они явно были готовы распространить регулярную форму прошедшего времени на новые слова. Ее результаты легли в основу ее диссертации. Когда она представила свою работу на конференции, это был настоящий хит: редактор престижного журнала Word «просто выхватил у меня статью и сказал: „Я это публикую“, и она была напечатана практически дословно, за вычетом первой главы, ровно так, как я ее написала».
Исследование Берко показало, что дети регуляризуют новые слова, как бы применяя лингвистическое правило. Следующее наблюдение заключалось в том, что они сверхрегуляризуют их, используя то же самое правило там, где оно неприменимо. Если взять знаменитый пример Берко, ребенок мог сказать: «My teacher holded the baby rabbits and we patted them» (использовав правильное окончание *-ed* для неправильного глагола *hold*). Подобная сверхрегуляризация — это не просто забавная манера речи, это еще и окно в то, как дети усваивают язык.
Выяснение того, как именно дети приходят к сверхрегуляризации, потребовало технологического прорыва. Сьюзан Эрвин работала преподавателем в Гарвардской педагогической школе, когда Берко училась в аспирантуре. Эрвин только что защитила докторскую диссертацию в Мичиганском университете и входила в группу по изучению детской речи вместе с Берко и Брауном. Идеи Хомского о лингвистических правилах пользовались в Гарварде большим влиянием, и когда в 1958 году Эрвин получила должность преподавателя в Калифорнийском университете в Беркли, она решила изучить, как дети усваивают эти правила. Она применила новаторский подход: работая вместе с лингвистом Уиком Миллером, она записывала речь дошкольников у них дома. Подробные записи речи одних и тех же детей в течение многих месяцев выявили нечто удивительное: использование ими множественного числа и прошедшего времени, по-видимому, проходило через три стадии. Сначала они употребляли правильные нерегулярные формы. Затем они начинали сверхрегуляризовать их. Наконец, они возвращались к правильным формам. Ребенок начинал со слова «held», затем переходил на «holded», а потом снова возвращался к «held».
Результаты Эрвин помогли воссоздать картину того, как дети усваивают язык. Сначала они имитируют слова и фразы, которые слышат вокруг себя, — так, они говорят «held», потому что так сказал кто-то другой. Затем они понимают, что здесь действует абстрактное правило, и начинают применять его повсеместно — «holded». Спустя какое-то время они обнаруживают, что из правила есть исключения, и заучивают их — возвращаясь к «held». С точки зрения Хомского, нерегулярные случаи даже не обязательно являются исключениями, а представляют собой лишь проявления других правил. Неправильные глаголы — это не просто аномалии: их можно объединить в классы, которые ведут себя схожим образом. Например, глаголы «drink» и «sing» оба являются неправильными, но прошедшее время образуют одинаково, превращаясь в «drank» и «sang».
Румельхарту и Макклелланду, которые только начинали открывать, что нейросети можно использовать для объяснения вещей, ранее описывавшихся исключительно с помощью правил, прошедшее время казалось идеальным испытательным полигоном для их идей. Работая над интерактивной моделью активации при чтении, они заметили, что модель ведет себя по-разному в зависимости от того, соответствовала ли интерпретируемая последовательность букв правилам английского языка. По их словам, «поведение модели подчинялось закономерностям, хотя она и не содержала никаких явных правил». Это навело их на мысль о том, что их подход может предложить иное объяснение того, как дети усваивают прошедшее время.
Чтобы исследовать этот вопрос, Румельхарт и Макклелланд создали очень простую модель. Она представляла каждый звук в слове в виде набора лингвистических признаков — грубо говоря, того, как воздух движется во рту для создания этого звука, — а также признаков предшествующего и последующего звуков. На вход сети подавалась форма слова в настоящем времени («hold»), а на выходе ожидалась форма прошедшего времени («held»). Затем они использовали однослойный перцептрон с правилом обучения перцептрона, чтобы выявить связь между этими двумя формами. Они разделили глаголы на три группы в зависимости от частоты их употребления в речи — высокочастотные, среднечастотные и низкочастотные — и предположили, «что ребенок сначала усваивает настоящее и прошедшее время наиболее частотных глаголов; позже обучение происходит на гораздо большем множестве глаголов, включающем гораздо большую долю регулярных форм». Чтобы отразить этот процесс, они сначала обучили свою нейросеть на высокочастотных глаголах, затем добавили среднечастотные и, наконец, протестировали ее работу на низкочастотных.
Эта простая модель оказалась удивительно успешной. Она воспроизвела паттерн, характерный для детей: доля правильного использования неправильных глаголов сначала росла, затем снижалась, а затем снова увеличивалась. Она также продемонстрировала особенности реакций, которые отражали другие описанные в литературе феномены детского усвоения прошедшего времени — например, способность выявлять сходство внутри классов неправильных глаголов. На основе этих результатов Румельхарт и Макклелланд сделали далеко идущий вывод:
Мы полагаем, что предложили отчетливую альтернативу мнению, будто дети в каком-либо явном смысле усваивают правила образования прошедшего времени в английском языке. Мы показали, что правдоподобное объяснение усвоения прошедшего времени может быть дано без обращения к понятию «правила» как чего-то большего, нежели просто описание языка. Мы показали, что для данного случая проблемы индукции не существует. Ребенку не нужно ни выяснять, в чем заключаются правила, ни даже знать о самом существовании правил.
По правилам и символам как основе человеческого языка были сделаны первые выстрелы.
Эти выстрелы не остались без ответа. В 1985 году Макклелланд выступил с докладом об этой работе; на его выступлении присутствовал Стивен Пинкер, который пригласил его прочитать лекцию в рамках серии семинаров в Центре когнитивных наук MIT. Формат предполагал, что докладчик представляет свою работу, после чего следуют комментарии. Одним из комментаторов должен был стать сам Пинкер, а вторым он пригласил Алана Принса. Оба были убежденными сторонниками подхода, основанного на правилах и символах. Пинкер вырос в Монреале и учился в Университете Макгилла, где изучал психологию, сформировавшуюся под влиянием идей Дональда Хебба, и философию, которую преподавал друг Ноама Хомского. Затем он поступил в аспирантуру Гарварда, где его научным руководителем был Роджер Браун; там он занимался вопросами как зрения, так и языка, а также параллельно записался на курс Хомского в MIT и курс по лингвистике и вычислениям, который вела Джоан Брезнан. Последний привел его к постдокторантуре в MIT, где он работал над теорией усвоения языка, а затем — к исследовательской карьере, которая все больше концентрировалась на языке и в итоге привела его обратно в MIT уже в качестве профессора. Принс тоже учился в Макгилле, на несколько лет раньше Пинкера, но специализировался на лингвистике. Он получил докторскую степень в MIT и со временем сосредоточился на фонологии и морфологии — звуковой структуре языка и том, как эти звуки соединяются в слова. Когда Пинкер пригласил его прокомментировать доклад Макклелланда в MIT, Принс только что перешел в Брандейский университет в пригороде Бостона.
Макклелланд фактически попал в засаду. Даже Пинкер позже признавал, что это событие «было не совсем справедливым по отношению к Макклелланду, который оказался зажат в тиски двумя соперниками, да еще и на их поле». Вот как вспоминал об этом сам Макклелланд:
«Я говорил минут двадцать, а потом сел, и после этого два докладчика один за другим выступали по целому часу каждый. И первый начал очень дружелюбно — это был Стив: „О, это все так замечательно. Они пытаются соотнести модель с реальными данными. Разве это не прелестно?“ […] Но затем он принимается говорить: „Что ж, здесь есть некоторые действительно фундаментальные проблемы, которые эта модель никогда не сможет решить“. Спустя какое-то время я начал немного ерзать на стуле, но в конце концов Стив закончил; он вел себя уважительно на протяжении всего выступления и просто изложил свои аргументы. А потом поднялся второй парень и набросился на работу с точки зрения фонолога — это был Алан Принс. Он указал на множество деталей в том, как мы решили представить звуки речи, и объяснил, почему эти способы в принципе не могут быть полностью верными для адекватного отражения фонологии слов. Затем он посмотрел на данные о работе модели и заметил, что после обучения, когда ее протестировали на новых, ранее не встречавшихся примерах, она показала лишь около 80% правильных ответов. И он заявил: „Это неприемлемо. Нам нужны модели, которые отражают языковую компетенцию, прежде чем мы вообще начнем думать о деталях обучения и обработки информации“. В какой-то момент он даже стукнул кулаком по столу, а затем вскинул его вверх и провозгласил: „Я настаиваю на том, чтобы эта модель сначала продемонстрировала способность идеально образовывать формы прошедшего времени, прежде чем мы вообще начнем говорить обо всем остальном!“ И я подумал: ничего себе, очевидно, я исхожу из совершенно иных позиций».
Для Макклелланда само по себе то, что модель вообще работала — что она смогла достичь примерно 80-процентной точности исключительно за счет обучения на опыте, — уже было захватывающим достижением. Но каким бы изнурительным ни было это обсуждение, оно заставило его задуматься о том, что он наткнулся на нечто важное: «В самый тяжелый момент я поймал себя на мысли: ух ты, почему их это так сильно задевает, раз они так яростно нападают? И я подумал: ладно, что ж, возможно, это действительно важно, и, возможно, время покажет, насколько все это себя оправдает».
Пинкер и Принс изложили свою критику модели Румельхарта и Макклелланда в длинной статье. Чтобы вы могли составить представление о ее характере, приведем список их претензий дословно:
Предлагаемое Румельхартом и Макклелландом объяснение этапов регуляризации детьми морфемы прошедшего времени доказуемо ошибочно.
Их объяснение одного из ярких типов детских речевых ошибок также неверно.
Другие их мнимые успехи в объяснении феноменов развития либо не имеют никакого отношения к используемой в модели архитектуре параллельной распределенной обработки и могут быть легко воспроизведены символьными моделями, либо содержат серьезные искажающие факторы и, следовательно, не могут служить надежным подтверждением модели.
Модель неспособна представлять определенные типы слов.
Она неспособна объяснить паттерны психологического сходства между словами.
Она с легкостью моделирует множество типов правил, которые не встречаются ни в одном человеческом языке.
Ей не удается отразить ключевые закономерности звуковых паттернов английского языка.
Она делает неверные предсказания относительно деривационной морфологии, словосложения и новых слов.
Она не справляется с элементарной проблемой омофонии.
Она допускает ошибки при образовании форм прошедшего времени для значительного процента слов, на которых тестируется.
Для некоторых слов она вообще не может сгенерировать форму прошедшего времени.
Она делает неверные предсказания о реальности различия между регулярными правилами и исключениями как у детей, так и в языках.
Из этих многочисленных замечаний, пожалуй, два наиболее существенны. Во-первых, стадии регуляризации (сначала «held», затем «holded» и наконец снова «held»), похоже, были артефактом того, как именно обучалась модель. Поскольку обучение начиналось с высокочастотных глаголов, у модели была возможность сосредоточиться на неправильных формах, так как многие высокочастотные глаголы — неправильные. Когда же были введены глаголы средней частотности, доля правильных глаголов в обучающей выборке существенно выросла, что привело к падению точности, связанному со сверхрегуляризацией неправильных глаголов. Затем, по мере дальнейшего обучения, эти неправильные глаголы удалось восстановить. Во-вторых, модель так до конца и не освоила прошедшее время. Хотя она правильно определяла большинство глаголов, она также совершала поразительные ошибки. Например, она могла утверждать, что прошедшее время от «mail» — это «membled», а от «tour» — «toureder». Подобные ошибки, казалось, сводили на нет заявления Румельхарта и Макклелланда о том, что прошедшему времени можно обучиться без использования явных правил.
Прошедшее время оставалось полем ожесточенной битвы на протяжении следующих двадцати лет. За это время о нем было написано более сотни статей и предложены десятки новых моделей. В этих моделях использовались более сложные типы нейронных сетей — оригинальная модель Румельхарта и Макклелланда даже не использовала обратное распространение ошибки! — и ставилась цель дать ответ на конкретные возражения Пинкера и Принса. И хотя сами Пинкер и Принс так и не изменили своего мнения, оба они впоследствии переняли элементы коннекционистских объяснений языка в собственных работах. Пинкер в конечном счете предположил, что правильные глаголы подчиняются выученному правилу, однако обобщения относительно неправильных глаголов могут основываться на признаках, подобных тем, что выделили Румельхарт и Макклелланд. Принс же совместно с Полом Смоленским, который входил в группу исследователей коннекционизма вместе с Румельхартом и Макклелландом в Калифорнийском университете в Сан-Диего (UCSD), разработал новый подход к фонологии, сочетавший символьные идеи с более градуальными вычислениями.
Однако некоторые из величайших прорывов в использовании нейросетей для репрезентации языка были связаны не с более глубоким погружением в прошлое, а скорее с попытками предсказать будущее.
Что дальше
Какой бы успешной ни была модель усвоения прошедшего времени Румельхарта и Макклелланда, она не слишком подходила для описания других аспектов освоения языка. Она формулировала проблему как изучение отображения одной формы слова в другую — что логично, когда вы думаете о связи между временами глаголов, но мало помогает объяснить, как дети учатся связывать слова в предложения или интерпретировать их значения. Следующий важный шаг на пути к решению этой проблемы будет сделан благодаря работе Джеффа Элмана.
В то время как Сьюзан Эрвин с помощью магнитофонов отслеживала, как дети учатся говорить, Элман осваивал технологию совсем другого рода. Он был разочарованным в учебе второкурсником Гарварда — приезжим из Южной Калифорнии, который никак не мог найти себя; он изучал историю, пока ему не надоело зубрить даты, после чего он стал присматриваться к отделению общественных отношений (Department of Social Relations). Вместо того чтобы штудировать учебники, он листал университетскую газету, когда его внимание привлекло странное объявление:
Требуется гарвардская/MIT-овская тетрадь по Fine Arts № 13 (121 стр.) и 40-страничный ответ K.K. & C. R. плюс 2800; батарея; m.f. El presidente no esta aqui asora, que lastima. Б. Дэвид, а/я 11595, Сент-Луис, Миссури 63105.
Элман прослушал курс «Изобразительное искусство 13» (Fine Arts 13), и у него остались конспекты. Поддавшись импульсу, он отправил Б. Дэвиду ответ: «У меня ваша тетрадь. Давайте поговорим».
Три дня спустя он получил открытку: «Если у вас действительно есть нужные мне сведения, вы сможете ответить на следующие вопросы». На ней была отрывная часть для ответов: «Продолжите последовательность 6 0 4 2 3 1 1 2 1. Что значит M.F.? С каким телефонным оборудованием в прошлом году баловались студенты MIT?»
Это было куда интереснее учебы. Элман задумался над числовой последовательностью. Она заканчивалась на 1 2 1… может, дальше идет 2? К тому же это было похоже на номер телефона, и он решил набрать его. Трубку сняла женщина и произнесла: «Клинер клин инворд» (Cleaner clean inward). Загадок становилось всё больше. Элман отыскал телефонный код 604 в справочнике и выяснил, что он относится к Западной Канаде — Ванкуверу, Скуомишу и… Клина-Клин (Kleena Kleene). Но что означало «inward»? Выяснилось, что один из его соседей по комнате встречался с телефонисткой. Элман поговорил с ней: «Она сказала, мол, входящий оператор (inward) — это тип телефонистки, но вы не должны иметь возможности звонить им напрямую. Это операторы, которые завершают вызовы. Если на одном конце возникает проблема, вы звоните своему местному оператору, а тот связывается с другим».
Дозвониться до входящего оператора с обычного телефона должно было быть невозможно — это был системный сбой. И Элман сумел воспользоваться этим сбоем, чтобы совершать бесплатные звонки: он просто говорил оператору, что звонит с испытательного пульта и просит соединить его с другим номером. Девушка его соседа по комнате помогла разгадать и другую загадку: аббревиатура M.F. означала multifrequency (многочастотный набор) — тональную систему, которую операторы использовали для установления соединений.
А что насчет студентов MIT? Элман применил навыки, которые ему следовало бы использовать на занятиях по истории, и раскопал старую газетную статью о студентах Гарварда и MIT, которых поймали на бесплатных телефонных звонках. Свои записи они вели в 121-страничной тетради по курсу «Изобразительное искусство 13», и их обязали написать 40-страничный отчет о содеянном — и то, и другое было конфисковано телефонной компанией.
Картина начинала проясняться. Элман отправил ответную открытку и получил в ответ письмо с предупреждением держаться подальше (в самый разгар холодной войны письмо было написано задом наперед кириллицей). Не растерявшись, Элман в ответ отправил свой номер телефона. Наконец ему позвонил загадочный Б. Дэвид. Тот понимал, что у Элмана нет тетради, но был впечатлен тем, как искусно тот притворялся. Из этого разговора Элман узнал, что Б. Дэвид состоял в подпольном сообществе взломщиков телефонных систем. Следующие три месяца он провел за сборкой собственного устройства для генерации многочастотных тонов, чтением статей в Bell System Technical Journal и составлением карты телефонной сети в поисках новых сбоев. Все это прекратилось лишь тогда, когда в его комнате в общежитии появились сотрудники службы безопасности AT&T и агенты ФБР.
После этого энергия Элмана, которую он тратил на что угодно, кроме учебы, перенаправилась на участие в демонстрациях против войны во Вьетнаме, включая захват зданий и аресты за протесты. На последнем курсе он взломал компьютерную систему Гарварда и попался. Его спросили, чем он планирует заниматься после выпуска: «Я ответил: "Не знаю". А они говорят: "Хотите у нас работать?" И какое-то время я там проработал».
Затем Элман устроился преподавать историю на испанском языке для недавно прибывших в США иммигрантов. Общение с детьми-билингвами пробудило в нем интерес к языку. Влекомый этим интересом, он купил две книги: «Слова и вещи» Роджера Брауна и «Синтаксические структуры» Ноама Хомского. Книга Брауна показалась ему ясной и доступной, а в книге Хомского он вообще ничего не понял. Поэтому он решил, что ему нужно изучать лингвистику: «Если я могу просто купить книгу в магазине и всё понять, зачем мне тогда аспирантура в этой области?»
Несмотря на то, что он никогда не прослушал ни одного курса по лингвистике, Элман поступил в аспирантуру Техасского университета в Остине. Он обнаружил, что научная работа гораздо больше похожа на взлом телефонной сети, чем он ожидал: «Учеба в аспирантуре помогла мне понять, что исследования — это разгадывание тайн, решение задач, совершение открытий. Это было безумно увлекательно». Этот азарт подтолкнул его к научной карьере, и в 1977 году он стал профессором Калифорнийского университета в Сан-Диего.
Научные интересы Элмана сосредоточились на восприятии речи — области лингвистики, где прогресс двигали скорее конкретные данные, нежели очередные теоретические заявления Хомского. Он начал общаться с Макклелландом и Румельхартом и влился в группу, занимавшуюся коннекционистским моделированием. Особый интерес у него вызывала интерактивная модель активации при чтении, и вместе с Макклелландом он разработал аналогичную модель восприятия речи, в которой признаки активировали фонемы, а те, в свою очередь, активировали слова.
Однако применение этого подхода к речи выявило ключевое различие между письменным и устным языком: время. Письменное слово воспринимается практически целиком и сразу, тогда как устное разворачивается постепенно — по одному звуку или знаку за раз. В своей модели восприятия речи Элман и Макклелланд учли это, позволив активации элементов сохраняться во времени, оставляя след от каждого звука. Но Элман никак не мог придумать, как сделать нечто подобное для предложений. Пару лет он жил с ощущением, будто бьется головой об стену.
В конце концов Элман обратился за советом к Румельхарту. Румельхарт дал ему два совета. Первый: «Если не знаешь, как сделать то, что хочешь, делай то, что умеешь. Будь при деле, не шатайся по улицам, держись подальше от неприятностей, делай хоть что-нибудь». И второй: «А еще продолжай биться головой об стену и просто не сдавайся».
Так он и сделал. И результатом стал новый способ применения нейросетей к языку.
Главная проблема заключалась в том, что обучение нейросети с помощью алгоритма, основанного на ошибках, такого как обратное распространение ошибки, требовало четкого определения того, каким должен быть целевой выходной сигнал сети. В модели прошедшего времени Румельхарта и Макклелланда целевым выходом была правильная форма прошедшего времени. Но каким он должен быть для языка в целом?
Элман понял, что одним из способов решить эту проблему было заставить нейросеть предсказывать следующее слово. Какое слово должно идти следующим с учетом всех предшествующих? Как он рассказывал мне: «Это казалось мне своего рода лакмусовой бумажкой. Если у вас есть временной ряд и некий неизвестный источник, который его генерирует и который вы пытаетесь разгадать, то одним из способов проверить, разгадали ли вы его, будет ваша способность продолжать генерировать ряд вперед и строить прогнозы. И если вы ошиблись, эти прогнозы окажутся неверными, что и станет источником ошибки».
Но одного этого было бы мало. Если бы он создал нейросеть, где на входе подается текущее слово, а на выходе получается следующее, он просто воспроизвел бы вариант простой ассоциативной модели, против которой выступал Хомский (о чем говорилось в главе 4). Даже если бы сеть делала предсказание на основе двух или трех последних слов, она все равно подверглась бы той же критике. Ей каким-то образом нужно было учитывать информацию обо всех предшествующих словах, которые она уже увидела.
Решение, которое нашел Элман, представляло собой новый тип архитектуры нейросетей, известный как простая рекуррентная сеть. Идея — под стать названию — проста: создать сеть, где на входе подается текущее слово, а на выходе получается следующее, но при этом копировать активацию скрытых элементов. При предсказании последующего слова передать эту скопированную активацию обратно на скрытые элементы в качестве еще одного входного сигнала. А затем снова скопировать активацию скрытых элементов, чтобы использовать ее точно так же для следующего слова. Это позволяло скрытым элементам отслеживать информацию о предыдущих словах, передавая ее дальше для использования в будущих предсказаниях (см. рис. 10.1).
Это небольшое изменение сыграло огромную роль. Элман обнаружил, что простую рекуррентную сеть можно обучить предсказывать следующее слово в крошечном созданном им искусственном языке, который воспроизводил отдельные черты английского. Язык Элмана состоял из классов существительных и глаголов и нескольких простых правил их объединения в предложения. Например, один из типов предложений основывался на структуре «СУЩ-ЧЕЛ ГЛАГ-ЕСТЬ СУЩ-ЕДА», где СУЩ-ЧЕЛ соответствовало словам, обозначающим людей, вроде «woman» (женщина), ГЛАГ-ЕСТЬ — глаголу «eat» (есть), а СУЩ-ЕДА — словам, обозначающим пищу, вроде «cookie» (печенье). Соединив всё это вместе, вы получали «woman eat cookie», что было грамматически правильным предложением в языке Элмана. У него было пятнадцать подобных структур для шести различных типов существительных и шести различных типов глаголов.
Рисунок 10.1. Простая рекуррентная сеть того типа, который использовал Элман. Значения активации скрытых элементов копируются в набор «контекстных элементов», а затем при обработке следующего слова подаются обратно в качестве дополнительных входных сигналов.
Элман сгенерировал десять тысяч предложений на своем крошечном языке и соединил их в сплошную цепочку без каких-либо разделителей: «woman smash plate cat move man break car…» Каждое слово было представлено активацией одного входного узла. Он поручил своей простой рекуррентной сети предсказать, какое слово будет следующим, активировав соответствующий выходной узел. И… у неё получилось. Модель смогла научиться предсказывать слова и даже распознавать границы между предложениями.
Элман хотел понять, как ей это удалось, поэтому он изучил активацию скрытых элементов, возникавшую при подаче каждого слова на вход сети. Он обнаружил, что хотя сеть никогда не знакомили с понятиями существительного или глагола, равно как и с тем, что животные и люди — это разные категории, её внутренние представления воспроизводили эти лингвистические различия. Существительные группировались в одной части пространства активации скрытых элементов, а глаголы — в другой. В той части пространства, где располагались существительные, существительные, обозначающие людей, находились в одном месте, а существительные, обозначающие животных, — в другом. Одной лишь попытки предсказать, какое слово будет следующим, оказалось достаточно, чтобы сеть научилась различать различные лингвистические категории.
Телефонные системы могут показаться бесконечно далекими от мозга, но для Элмана между ними существовали глубокие параллели: «Телефонная система в то время, безусловно, во многом походила на человеческий мозг. Она просто росла. Человеческий мозг эволюционировал не для того, чтобы решать дифференциальные уравнения в частных производных. Он не был спроектирован оптимальным образом». Его работа показала, как подобные представления могут формироваться внутри мозга аналогичным путем: мозгу не требовалось врожденных механизмов для усвоения правил; достаточно было просто учиться на основе создаваемых ими статистических закономерностей, чтобы распознавать ключевые различия. И если взлом телефонной системы в свое время принес ему лишь неприятности, то «взлом» мозга привел Элмана к важнейшим открытиям в понимании природы языка. А предложенные им идеи — о том, что мы можем обучать нейросети, пытаясь предсказать следующее слово, и что мы можем понять значение слов, представляя их в виде точек в пространстве, — станут еще более мощными по мере того, как для создания таких систем будет появляться все больше данных.
Слова в пространстве
Простые рекуррентные сети Элмана обучались на крошечном наборе предложений, созданном на основе крошечного языка. Заставить их работать с языком столь сложным, как английский, было невыполнимой задачей при тех вычислительных ресурсах, которые имелись в конце 1980-х годов. Однако всего несколько лет спустя другие исследователи нашли способ извлекать представления значений слов из десятков тысяч документов на реальном английском языке, а не из десятков тысяч предложений на игрушечном языке.
Сьюзан Дюмей выросла в Льюистоне, штат Мэн, и стала первой в своей семье, кто поступил в колледж. Собственно, ей нужно было просто пройтись по улице до Бейтс-колледжа. Факультета компьютерных наук там не было, но Дюмей все же удалось начать работать с компьютерами: будучи ассистентом преподавателя на занятиях по статистике, она научилась решать задачи, создавая визуализации распределений и данных. Это изменило её взгляд на мир: «Я просто увидела безграничные возможности для моделирования явлений способами, которые дополняли аналитические возможности».
На её дальнейший путь повлияло ещё одно важное событие: она прослушала курс по математической психологии, который показал, что те же идеи из математики и информатики могут быть использованы для понимания работы человеческого разума. «Тогда я поняла, что меня гораздо меньше интересуют математика, компьютеры и технологии сами по себе, и гораздо больше — то, что они позволяют делать: в данном случае — понимать людей, то, как они взаимодействуют с миром, как принимают решения, как учатся и так далее».
Этот интерес привёл её в аспирантуру по математической психологии в Индианском университете, где она изучала, как практика может превратить задачу, требующую сознательных усилий, в задачу, выполняемую автоматически. Но больше всего ей нравилось строить математические модели этого процесса обучения. Желая и дальше развивать это сочетание психологии и математики, она устроилась на работу в Bell Labs — в одну из первых исследовательских групп, занимавшихся человеко-компьютерным взаимодействием.
Этой исследовательской группой руководил Том Ландауэр, который в 1960 году получил докторскую степень на факультете общественных отношений в Гарварде, а до прихода в Bell Labs в 1969 году преподавал в Дартмуте, Стэнфорде и Принстоне. Там Дюмей и другие исследователи перешли от размышлений о том, как люди извлекают информацию из собственной памяти, к размышлениям о том, как они извлекают информацию из других источников. И сразу же столкнулись с проблемой.
Они назвали это проблемой лексического несовпадения: «Существует определенное рассогласование импедансов между тем, как описывают вещи люди, создающие информацию, и тем, как люди, ищущие информацию, пытаются их найти». А именно, они могут не использовать одни и те же слова — в одном документе речь может идти о «докторах», а в другом — о «врачах». Если вы пытаетесь использовать компьютерную систему для поиска по совпадению слов, это быстро становится проблемой. «Красота естественного языка — в его гибкости, изобретательности и разнообразии. Но это также и проблема, когда вы пытаетесь общаться с существовавшими тогда крайне хрупкими и буквалистскими системами, требовавшими точного совпадения правильно написанных слов».
Дюмей боролась с этой проблемой, пытаясь разгадать психологию того, как люди обозначают вещи. Прорыв произошел не из психологии, а из математики. Ключ к разгадке лежал в понимании того, что когда люди используют два разных слова для обозначения одного и того же, эти слова обычно сопутствуют одному и тому же набору других слов. Хотя «доктор» и «врач» могут не встречаться в одном и том же документе, поскольку являются неформальным и формальным обозначениями одного и того же понятия, и «доктор», и «врач» будут появляться в документах, где есть слова «медсестра», «пациент» и «больница». Если представить слова через «компанию», в которой они обычно вращаются, внезапно оказывается, что «доктор» и «врач» очень похожи друг на друга.
Дюмей и её коллеги разработали метод решения этой проблемы. Первым шагом было создание матрицы — по сути, гигантской таблицы, фиксирующей связь между словами и документами. Каждая строка матрицы соответствовала слову, а каждый столбец — документу. Значение на пересечении строки слова и столбца документа указывало, как часто это слово встречается в данном документе. Затем они сформулировали задачу прогнозирования: по заданному слову предсказать, как часто оно будет встречаться в каждом документе. Эту задачу можно было решить с помощью простой нейронной сети, связывающей входные элементы, соответствующие различным словам, со скрытым слоем с небольшим количеством измерений, а затем отображающей этот скрытый слой на выходной слой, указывающий частоты для каждого документа. Обучение такой нейронной сети на больших объемах текста могло бы стать серьезной проблемой, но предположение, что функции активации в нейросети были линейными, позволило использовать метод линейной алгебры для быстрого вычисления соответствующих весов.
Этот подход решил проблему лексического несовпадения. Каждое слово отображалось в представление в скрытом слое — точку в пространстве, заданную вектором значений в различных измерениях, что напоминало описанную в главе 1 схему Лейбница по присвоению чисел словам. Слова со схожими паттернами использования в разных документах проецировались в точки, расположенные близко друг к другу. Таким образом, вместо поиска по конкретным словам запрос пользователя теперь можно было преобразовать в вектор и сравнить с векторами, представляющими различные документы. Но это не просто привело к созданию более эффективных практических инструментов поиска документов: это также предложило новый способ осмысления того, как человеческий разум извлекает информацию.
Ноам Хомский предложил одно из решений проблемы Платона — о том, как мы узнаем так много, располагая столь малым опытом: врожденное знание. В 1997 году Ландауэр и Дюмей утверждали, что их подход, который они назвали латентно-семантическим анализом, может предложить другое решение: мы можем восполнять пробелы в нашем опыте, выстраивая эффективные представления событий в окружающей среде. Даже если слова «врач» и «доктор» никогда не встречаются в одном документе, сводя оба эти слова к точке в пространстве относительно малой размерности, мы улавливаем их корреляцию с другими словами и распознаем их сходство.
Ландауэр и Дюмей подкрепили этот довод, показав, что латентно-семантический анализ способен улавливать семантические ассоциации, которые люди видят между словами. В качестве одного из примеров использовался тест по английскому языку как иностранному (TOEFL) — стандартизированный тест, который сдают иностранные студенты при поступлении в вузы США. Тест включает раздел на синонимы, где тестируемому нужно выбрать наиболее подходящий вариант из четырех предложенных. Например, нужно определить, к какому из слов ближе всего по значению слово «significant» (значительный): (а) «trivial» (тривиальный), (b) «minor» (незначительный), (c) «substantial» (существенный) или (d) «irrelevant» (неуместный). Если каждое слово представить в виде точки в пространстве, эту задачу можно решить, выбрав слово, координаты которого ближе всего к координатам слова «significant». Ландауэр и Дюмей показали, что модель, использующая 300-мерное семантическое пространство, смогла правильно ответить на 64,4 процента вопросов из архивных тестов TOEFL — результат, практически полностью совпавший со средним показателем большой группы иностранных студентов.
Что крайне важно, эффективность латентно-семантического анализа зависела от количества измерений, использовавшихся для представления слов. Модель обучалась на 30 473 статьях энциклопедии, поэтому максимально возможное число измерений составляло 30 473 — по сути, представляя каждое слово через частоту его появления в этих статьях. Однако использование такого представления приводило к гораздо более низким результатам. Если просто смотреть на документы, было трудно понять, что «врач» и «доктор» связаны. По мере уменьшения числа измерений модель была вынуждена сжимать информацию о частотности за счет поиска закономерностей в данных, и слова «врач» и «доктор» становились всё более похожими. Но существовала «золотая середина»: при количестве измерений менее 300 эффективность снова начинала падать, поскольку дальнейшее сжатие представления приводило к потере важной информации о различиях между словами.
В последующие десятилетия влияние идеи представления слов в виде точек в пространстве только росло. В современном машинном обучении эти представления называют эмбеддингами слов, поскольку слова в буквальном смысле встраиваются в пространственное представление. Более быстрые компьютеры и остроумные алгоритмы позволили получать эмбеддинги слов из всё более масштабных наборов данных. Например, один популярный подход, разработанный исследователями из Google — word2vec — создавал эмбеддинги слов на основе скрытого слоя нейросети, которая предсказывала слово по соседним словам в тексте. Эта модель была достаточно простой и быстрой, чтобы её можно было обучить на наборе данных объемом более миллиарда слов.
Представления слов, полученные с помощью word2vec, обнаружили удивительное свойство: их можно было использовать для решения простых аналогий. Например, аналогию «Мужчина относится к королю, как женщина к... чему?» (кратко записываемую как мужчина:король::женщина:?) можно было решить, взяв разность положений слов «мужчина» и «король» в пространстве и прибавив её к слову «женщина», что позволяло получить положение слова «королева». Эту пространственную модель аналогий еще в 1973 году предложили Дэвид Румельхарт и Адель Абрахамсон, использовав психологические пространства, полученные методом многомерного шкалирования. Поразительно, но word2vec удавалось воссоздавать пространства, пригодные для рассуждения по аналогии, всего лишь на основе предсказания совместной встречаемости слов в большой базе текстовых данных. Подобные достижения восхищают даже саму Дюмей, которая в свое время помогла «отправить слова в пространство»: «Сейчас невероятно захватывающее время благодаря гораздо большим объемам данных, богатству репрезентативных возможностей некоторых современных моделей, а также скорости, масштабу и общественному значению того, что сегодня создается».
Но прежде чем делать вывод, что проблема представления значений слов решена, стоит вспомнить, что пространственные представления накладывают некоторые важные ограничения. Подобно тому, как в главе 6 мы видели, как Амос Тверски выявил несоответствие человеческих суждений о сходстве метрическим аксиомам, мы можем обнаружить аналогичные проблемы и в области языка. Например, семантические ассоциации людей асимметричны: если попросить человека назвать первое пришедшее в голову слово в ответ на услышанное, то «бочонок» с большей вероятностью вызовет ассоциацию «пиво», чем «пиво» — «бочонок». Эти ассоциации также нарушают неравенство треугольника: слово «астероид» тесно связано с «поясом», а «пояс» — с «пряжкой», но «астероид» и «пряжка» кажутся никак не связанными. Отразить такие отношения в пространственном представлении бывает непросто: каким-то образом положения слов «астероид» и «пряжка» должны быть близки к слову «пояс», но при этом далеки друг от друга.
Те же проблемы характерны и для пространственных аналогий. Работая в моей лаборатории, Дон Чен и Джош Петерсон смогли обнаружить аналогии, которые асимметричны, и те, что нарушают неравенство треугольника. Примером асимметрии служит то, что аналогия парикмахер:расческа::питчер:бейсбольный мяч считается довольно хорошей, тогда как питчер:бейсбольный мяч::парикмахер:расческа — нет. Что касается неравенства треугольника, аналогия медсестра:пациент::мать:младенец считается хорошей, как и мать:младенец::лягушка:головастик, но медсестра:пациент::лягушка:головастик — нет. Подобно оригинальным примерам Тверски, эти случаи часто обыгрывают различные значения слов или разные типы отношений, которые могут связывать пары слов. Простое представление слов в виде точек в пространстве, а отношений между ними — в виде разности между этими точками, не позволяет уловить подобные тонкости.
Языковые модели становятся большими
Переход от латентно-семантического анализа (обучавшегося на миллионах слов) к word2vec (обучавшемуся на миллиардах слов) стал лишь началом стремительного роста наборов данных для обучения нейросетевых моделей языка и размеров самих этих моделей. Доступность больших объемов данных позволила создавать системы, способные на всё более впечатляющие достижения.
Одной из первых демонстраций этого стал машинный перевод. Возможность автоматически переводить с одного языка на другой веками оставалась мечтой, и методы её реализации эволюционировали параллельно с представлениями о том, как моделировать язык. В 1954 году компания IBM продемонстрировала компьютерную систему машинного перевода, в которой текст на русском языке набивался на перфокарту и переводился на английский. Она обладала словарем примерно в 250 слов и использовала свод правил для перевода предложений. По мере того как коннекционистские языковые модели становились мощнее, эти правила уступили место нейронным сетям. Когда я преподавал в Беркли, мне посчастливилось входить в диссертационные советы нескольких студентов, специализировавшихся на компьютерной лингвистике. В Беркли они разрабатывали сложные методы, основанные на правилах и символах, используя различные виды формальных грамматик. Затем они устраивались на работу в Google и переходили к решению тех же задач с помощью нейросетей — шаг, ставший возможным благодаря колоссальным объемам языковых данных и доступных вычислительных мощностей.
Впечатляющим подтверждением эффективности крупномасштабных нейросетей стало то, что они позволили рассматривать машинный перевод как еще одну задачу предсказания. К этой идее независимо друг от друга пришли сразу несколько исследовательских групп, включая команду Google под руководством Ильи Суцкевера (который был частью команды, перешедшей в Google после триумфа AlexNet). Рекуррентной нейросети подавали на вход предложение на английском языке и обучали предсказывать слова, которые должны появиться в переводе этого предложения на французский. Обученная на двенадцати миллионах пар предложений, система смогла превзойти традиционные подходы к машинному переводу. Сегодня нейросети лежат в основе систем машинного перевода Google. Для Джея Макклелланда это стало доказательством правоты позиции, которую он отстаивал в MIT много лет назад. «Сегодня я смотрю на Google Переводчик, и в нем вообще нет явной системы правил. [...] И я говорю себе: да, именно к этому мы и стремились».
Сквозной машинный перевод стал возможен отчасти благодаря разработке более совершенных архитектур нейросетей, лучше улавливающих тонкости языка. Одна из проблем простых рекуррентных сетей Элмана заключалась в том, что весь скрытый слой обновляется при каждой обработке входных данных, из-за чего системе бывает трудно долго удерживать в памяти отдельный фрагмент информации. Эту проблему решило создание Зеппом Хохрайтером и Юргеном Шмидхубером в 1995 году так называемых сетей долгой краткосрочной памяти. Эти модели включают подсети, которые определяют, должен ли фрагмент информации попасть в скрытый слой, нужно ли сохранять информацию в скрытом слое и следует ли использовать информацию из скрытого слоя для обработки текущих входных данных.
Более сложные рекуррентные нейронные сети способны осваивать более сложные языки. Сети долгой краткосрочной памяти могли выявлять закономерности, охватывающие более длинные последовательности слов. Дополнение рекуррентных нейронных сетей другими видами памяти также позволило им осваивать языки более высоких уровней в иерархии Хомского. Работая с Полом Родригесом и Джанет Уайлс, Элман показал, что простые рекуррентные сети могут обучаться простым контекстно-свободным языкам, таким как «яблочно-банановый» язык из главы 4. По сути, сеть выстраивала репрезентацию, в которой каждое появление слова «яблоко» сдвигало активации скрытых элементов в определенном направлении, а каждое появление слова «банан» возвращало эти активации обратно к исходной точке. Таким образом, сеть могла освоить контекстно-свободный язык, если существовал способ представить этот язык в пространственном выражении. Однако в целом простым рекуррентным сетям легко дается усвоение лишь регулярных языков. Добавление управляемой сетью памяти — что делает её более похожей на машину Тьюринга, способную читать и записывать данные на ленту, — позволяет рекуррентным нейросетям без труда осваивать контекстно-свободные и даже некоторые контекстно-зависимые языки.
В последнее время исследования в области языковых моделей сосредоточились на архитектуре нейросетей под названием трансформер. Созданные исследователями из Google в 2017 году, трансформеры используют совершенно иной подход к моделированию языка. Вместо того чтобы итеративно обновлять репрезентацию последовательности по мере предъявления каждого слова, они рассматривают все слова одновременно. Используя эмбеддинги этих слов, они обучаются тому, на какие слова следует обращать внимание для решения задачи прогнозирования. В 2018 году команда из OpenAI — Алек Радфорд, мой принстонский коллега Картик Нарасимхан, Тим Салиманс и Илья Суцкевер (который ушел из Google, став одним из основателей OpenAI) — показала, что обучение трансформера предсказанию следующего слова в последовательности дает качественные репрезентации скрытых элементов для решения других языковых задач. Полученный в результате генеративный предобученный трансформер (GPT) стал первым в целой серии. Выпущенный в 2019 году GPT-2 продемонстрировал еще более впечатляющую способность генерировать фрагменты текста, обладающие внутренней связностью.
GPT-2 обучался на интернет-текстах — в общей сложности около шести миллиардов слов. Изучая его работу, исследователи из OpenAI поняли, что существует устойчивая зависимость между объемом данных, на которых обучался трансформер, и тем, насколько хорошо он предсказывает следующее слово. Эти законы масштабирования указывали на то, что качество работы модели можно непрерывно улучшать, делая её крупнее и используя больше данных. Это привело к созданию GPT-3, обученного примерно на четырехстах миллиардах слов. Настройка этой модели для лучшего реагирования на запросы пользователей привела к созданию ChatGPT — интерактивного языкового ИИ-агента, выпущенного в ноябре 2022 года.
ChatGPT стал поразительным прорывом в области ИИ, продемонстрировав всю мощь больших языковых моделей. Чат-боты на основе продукционных систем, с которыми мы встречались в главе 3, опирались на правила, составленные людьми для реагирования на различные входные сигналы. ChatGPT обучался этим ответам на собственном опыте. Его возможности расширились с выходом GPT-4 в марте 2023 года. Следуя традиции латентно-семантического анализа, исследователи из OpenAI оценили его успехи с помощью стандартизированных тестов: он попал в 90-й процентиль на Едином экзамене на статус адвоката (Uniform Bar Exam), используемом для оценки будущих юристов, и в 99-й процентиль на вербальном тесте для поступающих в магистратуру и аспирантуру. Поразительно, но GPT-4 способен объединять малоизвестные факты для создания подлинно оригинальных результатов. Например, по предложению Джин Берко (ныне Джин Берко Глисон, которой уже за девяносто), я попросил GPT-4 сочинить хокку о кишке — деликатесе из фаршированных кишок. Результат:
Пряной начинкой
кишка бережно хранит —
теплое объятье.
Можно придираться к отдельным её решениям, но задачу модель явно поняла. И она создала то, чего раньше никто никогда не писал — по крайней мере, если верить Google: по запросу «kishkas gently hold» нет ни одного результата поиска (наш собственный аналог «бесцветных зеленых идей»).
Итак, что же поведение этих систем ИИ может рассказать нам о том, как устроен человеческий разум?
Пожалуй, самым примечательным здесь является то, что они служат ярким подтверждением гипотезы Элмана: предсказания следующего слова достаточно для усвоения большей части структуры языка. Более того, предсказание того, что последует дальше, оказывается отличным способом прийти к пониманию не только языка, но и окружающего мира в целом. Например, чтобы спрогнозировать, что Элизабет скажет Фицуильяму, необходимо иметь представление о человеческой природе, их характерах и социальных нравах своего времени.
Выдающиеся возможности больших языковых моделей также иллюстрируют ту роль, которую язык может играть в формировании человекоподобного интеллекта. В частности, они доказывают, что одного лишь обучения использованию языка достаточно для демонстрации разумного поведения в удивительно широком спектре ситуаций. Однако это не означает, что этого фактора достаточно для охвата всех аспектов интеллекта. К примеру, модели, обученные предсказывать следующее слово в последовательности, справляются относительно плохо с теми задачами, которые Аллен Ньюэлл и Герберт Саймон считали центральными для интеллекта — задачами, требующими планирования и поиска. Один из способов преодолеть эти ограничения — создавать агентов, сочетающих в себе те стратегии поиска, которые выявили Ньюэлл и Саймон, с репрезентациями, формируемыми большими языковыми моделями.
Современные большие языковые модели также наглядно демонстрируют некоторые ограничения искусственных нейронных сетей. Помните, Марвина Минского в свое время оттолкнула работа над нейросетями именно потому, что масштаб, необходимый для их эффективного функционирования, казался ему непреодолимым препятствием: «потребуются тысячи или миллионы нейронов, чтобы заставить это работать, а я не мог позволить себе построить такую машину». Во многом современные ИИ-компании просто решили, что могут позволить себе построить такую машину, невзирая на колоссальные затраты: по оценкам, GPT-4 содержит более триллиона весов, а её обучение обошлось в десятки миллионов долларов.
Несмотря на столь колоссальные инвестиции, полученные в итоге модели по-прежнему уязвимы для тех же критических замечаний, которые Стивен Пинкер и Алан Принс в своё время выдвигали против Румельхарта и Макклелланда. Чтобы достичь сопоставимых с человеком результатов, им требуются поистине сверхчеловеческие объёмы обучающих данных: объём данных для обучения GPT-3 эквивалентен непрерывному прослушиванию чьей-то речи в течение пяти тысяч лет — это примерно в тысячу раз дольше, чем требуется человеческому ребёнку, чтобы хорошо овладеть языком. И даже после столь масштабного обучения они, как правило, плохо обобщают информацию за пределами своей обучающей выборки. В недавней версии «ваг-теста», проведённого для ChatGPT, модель правильно применила регулярное правило образования прошедшего времени лишь в 60 процентах случаев. Какими бы впечатляющими ни были большие языковые модели, Пинкер по-прежнему считает, что правила и символы имеют здесь преимущество: «Обработка на основе правил способна справиться с любым количеством граничных случаев — примеров, не входивших в обучающий набор, с которыми люди зачастую справляются без труда, но на которых нейросети имеют тенденцию спотыкаться». Или, как метко выразилась Джин Берко Глисон: «Если вам нужно хокку о кишках, они, пожалуй, хороши, но если вам нужны факты — на это лучше не рассчитывать».
Нейросетевые модели языка расширили наши горизонты в понимании того, чему можно научиться на основе данных и какой вклад язык вносит в интеллект. Но они по-прежнему оставляют нас перед лицом ряда важных вопросов: почему нейросети способны преодолеть логическую проблему усвоения языка? И почему им требуется настолько больше данных, чем людям?
Поиск ответов на эти вопросы потребует иного подхода к осмыслению разума.