К книге
Законы мышления: В поисках математической теории разумаЯзык как распределение вероятностей.
47%
Язык как распределение вероятностей.
16

Ознакомившись с основами теории вероятностей, мы наконец готовы вернуться к этой теме и по-новому взглянуть на язык. Язык послужил одной из лучших демонстраций силы правил и символов: разработанные Ноамом Хомским символьные грамматики использовались для описания структуры различных языков. Он также стал важным полигоном для испытания нейронных сетей, которые показали, как язык можно усвоить без необходимости явно представлять эти самые символьные грамматики. Но вопреки успеху нейросетей у нас остались вопросы: как нейронные сети улавливают столь значительную часть структуры языка, если Хомский утверждал, что для статистических подходов это невозможно? Как нейросети преодолевают логическую проблему усвоения языка, определяя, что другие, никогда не встречавшиеся им предложения не должны быть частью языка? Как человеческие дети умудряются выучить язык по гораздо меньшим объемам данных, чем требуются нейросетям? И как мы можем помочь нейросетям лучше справляться с этой задачей обучения?

Ответы на эти вопросы важны не только для понимания языка; они дадут нам ценные подсказки о том, как согласуются друг с другом три различных подхода, которые мы рассмотрели в этой книге: правила и символы, нейронные сети и теория вероятностей. Поиск путей объединения этих подходов в конечном итоге даст нам более полное представление о Законах Мышления.

P

(Бесцветные зеленые идеи)

В своем докладе 11 сентября 1956 года Хомский выдвинул аргумент против идеи о том, что грамматическую правильность предложения можно оценить по его вероятности: предложение «Бесцветные зеленые идеи яростно спят» распознается как грамматически верное, тогда как «Яростно спят идеи зеленые бесцветные» — нет, несмотря на то, что никакие два слова ни в том, ни в другом предложении, скорее всего, никогда раньше не стояли рядом.

Этот аргумент стал проблемой для присутствовавших в аудитории теоретиков информации, которые вычисляли вероятность предложений ровно тем способом, несостоятельность которого показал Хомский, — оценивая, как часто каждое слово в предложении встречается после предыдущего слова. Теперь, когда мы вооружились математическим аппаратом теории вероятностей, мы можем выразить это точнее. Теоретики информации использовали модель на основе условных вероятностей, вычисляя P(бесцветные), затем P(зеленые|бесцветные), затем P(идеи|зеленые) и так далее.

Эта модель языка называется марковской моделью в честь русского математика Андрея Маркова, который первым проанализировал ее свойства. Хотя изначально Марков интересовался этой моделью с чисто математической точки зрения, позже он применил ее для анализа языка, проведя кропотливый анализ вероятностей, с которыми буквы следовали друг за другом в последовательности из двадцати тысяч букв из романа в стихах Александра Пушкина «Евгений Онегин». Как уже говорилось в главе 5, теоретики информации последовали его примеру: Клод Шеннон составил таблицы условных вероятностей букв и слов в английском языке.

Марковская модель — пожалуй, простейшая вероятностная модель языка. Стоит нам обратиться к более сложным моделям, как аргумент Хомского рассыпается.

Один из способов усложнить марковскую модель — перестать думать о словах и вместо этого рассмотреть лежащие в их основе синтаксические классы (см. рис. 14.1). Грамматики Хомского предполагали, что каждое слово может быть связано с одним или несколькими синтаксическими классами — символами, используемыми для определения грамматики. Так, «бесцветные» и «зеленые» — это прилагательные, «идеи» — существительное, «спят» — глагол, а «яростно» — наречие. Вместо вычисления условной вероятности слов мы могли бы вычислять условную вероятность их синтаксических классов: P(Прилагательное), P(Прилагательное|Прилагательное), P(Существительное|Прилагательное) и так далее.

Рисунок 14.1. Вероятностные модели языка, представленные как байесовские сети. Вверху показана марковская модель, против которой выступал Хомский: здесь каждое слово генерируется на основе предыдущего слова. Внизу представлена скрытая марковская модель, в которой (недостижимый для непосредственного наблюдения) синтаксический класс каждого слова генерируется на основе предыдущего слова, а затем само слово генерируется на основе этого класса.

Эта чуть более сложная модель называется скрытой марковской моделью, поскольку мы никогда не можем непосредственно наблюдать эти синтаксические классы. Скрытая марковская модель генерирует предложение путем выбора класса для первого слова, выбора первого слова из распределения слов, связанных с этим классом, выбора следующего класса с учетом первого класса, выбора следующего слова с учетом этого класса и повторения данного процесса до тех пор, пока предложение не будет завершено.

Этого перехода от марковской модели слов к марковской модели синтаксических классов оказывается достаточно, чтобы опровергнуть аргумент Хомского. Для скрытой марковской модели не имеет значения, что два слова никогда раньше не стояли рядом. Если синтаксические классы, связанные с этими словами, уже встречались рядом, вероятность предложения не будет слишком низкой. Фраза «Бесцветные зеленые идеи яростно спят» содержит вполне обычную для английского предложения последовательность синтаксических классов — как упоминалось в главе 4, та же последовательность используется в других предложениях, например, «Лохматые коричневые собаки весело бегают». Выражение же «Яростно спят идеи зеленые бесцветные» соответствует гораздо менее распространенной последовательности синтаксических классов. Соответственно, скрытая марковская модель, обученная на газетных текстах, присваивает предложению «Бесцветные зеленые идеи яростно спят» вероятность, которая более чем в двести тысяч раз превышает вероятность фразы «Яростно спят идеи зеленые бесцветные». Таким образом, вероятностная модель способна определить, что одно предложение грамматически корректно, а другое — нет.

Использование «скрытой» информации — это также причина, по которой большие языковые модели успешно обучаются прогнозированию языка. Фактически, Джефф Хинтон назвал промежуточные слои нейронных сетей «скрытыми элементами», поскольку его вдохновила скрытая марковская модель. Вместо того чтобы присваивать словам один дискретный синтаксический класс, большие языковые модели представляют информацию, содержащуюся во всех предыдущих словах, в виде точки в пространстве — эмбеддинга. Этот эмбеддинг позволяет моделям делать прогнозы, выходящие за рамки простых связей между отдельными словами, что дает им возможность принять вызов Хомского.

Скрытые марковские модели также связаны еще одним образом с обсуждавшимися нами моделями языка. Они представляют собой вероятностную версию конечноавтоматной грамматики — того самого вида грамматики, который мы превратили в настольную игру в главе 4. Скрытые марковские модели просто добавляют в игру кости. Каждая позиция на поле соответствует одному из скрытых классов в скрытой марковской модели, а выбор следующего шага определяется условными вероятностями. В простом примере, показанном на рисунке 4.2, мы могли бы подбросить монетку, дойдя до выбора между «dog» и «dogs», генерируя предложения «the dog runs» или «the dogs run» с равной вероятностью. Добавление возможности того, что собаки могут быть лохматыми, как на рисунке 4.3, дает нам еще один вариант — вместо подбрасывания монетки мы можем бросить игральную кость, чтобы решить, будем ли мы генерировать «hairy», «dog» или «dogs». Результатом становится распределение вероятностей на бесконечном множестве предложений.

Идея добавления вероятностей в модель правил и символов — мощный способ определения сложных распределений вероятностей. В частности, мы можем проделать то же самое с контекстно-свободной грамматикой. Вместо того чтобы выбирать, какое правило применить для перезаписи символа, мы принимаем это решение случайным образом. Например, рассмотрим нашу яблочно-банановую грамматику: Предложение → apple Предложение banana, Предложение → apple banana. Если мы начнем с символа Предложение, а затем подбросим монетку, чтобы решить, какое правило применить, мы в итоге определим распределение вероятностей для всех предложений с некоторым количеством яблок, за которыми следует такое же количество бананов: «apple banana» появляется с вероятностью

1 2 , «apple apple banana banana» с вероятностью 1 4 , «apple apple apple banana banana banana» с вероятностью 1 8 , и так далее. Это наш третий взгляд на язык. Это не формальная система и не задача прогнозирования, а нечто, содержащее элементы и того и другого: распределение вероятностей. Каждому предложению может быть приписана вероятность, и эти вероятности могут использоваться для оценки того, является ли предложение грамматически правильным или нет. Теорию вероятностей можно сочетать с различными видами представлений — включая формальные системы, — чтобы превратить их в распределения вероятностей. Эта способность связывать структурированные представления со статистикой особенно важна, когда мы переходим к вопросу о том, как происходит усвоение языка.

Вероятностное решение логической проблемы

Одним из ключевых аргументов в пользу того, что язык невозможно усвоить без жестких ограничений, была логическая проблема усвоения языка: обучающийся, который наблюдает только предложения определенного языка, не сможет логически исключить ни один язык, подмножеством которого является истинный язык. В таком случае обучающийся рискует счесть некоторые предложения грамматически правильными, хотя на самом деле это не так.

Теория вероятностей предлагает естественный ответ на этот аргумент. Если язык — это распределение вероятностей, то обучающийся может становиться все более уверенным в правильной гипотезе по мере того, как он наблюдает больше примеров из этого распределения. Он может никогда не быть уверен абсолютно — логическая проблема все еще сохраняет силу, — но вероятность того, что он ошибается, становится исчезающе малой.

Этот взгляд на усвоение языка привел к первым положительным результатам в вопросе о возможности его усвоения. В 1967 году Джером Фельдман, защитивший докторскую диссертацию в Университете Карнеги — Меллона, где он работал в том числе с Алленом Ньюэллом и Гербертом Саймоном, только начал работать профессором в Стэнфорде. Он занимался исследованиями в области формальных компьютерных языков и ассоциативной памяти и начал проявлять интерес к усвоению языка. Свои идеи он изложил в меморандуме под названием «Первые мысли о грамматическом выводе» (First Thoughts on Grammatical Inference). На первой странице было примечание: «Это черновик, его не следует распространять, копировать или верить ему без разрешения автора». После того как меморандум был опубликован, Джим Хорнинг, аспирант, изучавший языки программирования, подошел к Фельдману и сказал: «Я хочу получить разрешение поверить».

В дальнейшем Фельдман стал научным руководителем докторской диссертации Хорнинга. (Несколько лет спустя он также руководил научной работой Марти Тененбаума, отца Джоша Тененбаума.) В своей диссертации Хорнинг показал, что вероятностные языки, столь же сложные, как и генерируемые вероятностной контекстно-свободной грамматикой, могут быть усвоены на основе простых случайно сгенерированных примеров предложений этого языка с помощью байесовского вывода.

Аргумент Хорнинга можно проиллюстрировать простым примером. Представьте, что у меня есть две игральные кости — обычная шестигранная с цифрами от 1 до 6 и необычная двенадцатигранная с цифрами от 1 до 12, которую я стащил из комплекта для Dungeons and Dragons моей дочери. (Оказывается, настольные ролевые игры — это семейное.) Я собираюсь случайно выбрать одну кость и бросить ее, сообщив вам результат. Первый бросок... это 5. Какую кость я выбрал?

Мы можем применить правило Байеса к этой задаче. Есть две гипотезы: шестигранная кость или двенадцатигранная кость. Если предположить, что вероятность выбора любой из костей одинакова, то априорные вероятности этих гипотез равны. Таким образом, действительно важно лишь то, какова относительная вероятность данных — этой пятерки — при обеих гипотезах. Для шестигранной кости вероятность выпадения каждого числа от 1 до 6 составляет

1 6 . Для двенадцатигранной кости каждое число от 1 до 12 выпадает с вероятностью 1 12 . Таким образом, то, что выпала пятерка, увеличивает вероятность того, что была выбрана шестигранная кость, по сравнению с двенадцатигранной в 1 6 / 1 12 =2 раза. Ваша уверенность в том, что я выбрал шестигранную кость, должна вырасти в два раза. Теперь я бросаю кость снова: 1. И еще раз: 3. Каждый результат удваивает шансы в пользу шестигранной кости.

Предположим, я бросаю кость еще семь раз, всего десять бросков: 5, 1, 3, 6, 4, 6, 5, 2, 3, 6. Все эти результаты совместимы с шестигранной костью. Шанс того, что я выбрал шестигранную кость, очень велик: вы десять раз получали двукратное подтверждение в пользу шестигранной кости, а 210 = 1024, так что ваша уверенность в том, что я выбрал шестигранную кость, должна возрасти в тысячу раз. Это не является логической достоверностью, но полученные данные весьма убедительны.

Рисунок 14.2: Еще раз о подмножествах. Истинный язык изображен в виде темно-серого круга, текущая гипотеза обучающегося — в виде светло-серого круга, а примеры предложений на этом языке — в виде черных точек. (а) Логическая проблема усвоения языка: когда истинный язык является подмножеством гипотезы обучающегося, обучающийся не может столкнуться с предложениями, которые противоречили бы его текущей гипотезе, и, следовательно, не может окончательно обнаружить, что его гипотеза неверна. (b) Если примеры предложений выбираются из распределения вероятностей, соответствующего правильной гипотезе, то по мере увеличения числа наблюдаемых предложений-примеров вероятность того, что текущая гипотеза верна, снижается. (c) При еще большем количестве примеров доказательства в пользу правильной гипотезы становятся неопровержимыми.

Это отступление с бросанием костей отражает проблему, с которой сталкивается изучающий язык, если мы мыслим язык как распределение вероятностей на множестве предложений. Числа от 1 до 6 являются подмножеством чисел от 1 до 12. Даже если вы не можете исключить возможность того, что выбранная мной кость была двенадцатигранной, по мере получения новых данных это становится исчезающе маловероятным. Изучающий язык находится в точно таком же положении: он никогда не может быть уверен, что грамматические конструкции, которых он никогда не встречал, не являются частью языка, но чем больше примеров этого языка он наблюдает, тем более невероятным совпадением было бы то, что эти конструкции ему так и не встретились (наглядную иллюстрацию см. на рисунке 14.2).

Результат Хорнинга нанес первый математически строгий удар по утверждению Хомского о сильном врожденном знании, показав, что существуют вполне правдоподобные условия, при которых язык может быть усвоен. Более поздние работы предоставили еще более веские доказательства возможности изучения языка. Диссертационная работа Джоша Тененбаума, посвященная обобщению, продемонстрировала, каким образом этот механизм случайной выборки отдает предпочтение меньшим гипотезам (включая те, которые являются подмножествами других), и как механизм, подобный показанному на рисунке 14.2, может быть использован для объяснения того, как дети учат слова; эту идею он впоследствии проверил совместно со специалистом по психологии развития Фэй Сюй. Ник Чейтер в совместной работе со специалистом по компьютерным наукам Паулем Витаньи доказал, что предпочтения простоты достаточно, чтобы сделать определенные типы языков изучаемыми при наличии достаточного количества данных. Будучи аспирантом, Эндрю Перфорс, ныне работающий в Мельбурнском университете, опирался на эти результаты в совместном проекте с Тененбаумом и Терри Регье, лингвистом и компьютерным специалистом из Беркли, чтобы показать, что байесовские модели с предпочтением простоты способны усваивать конкретные лингвистические структуры, которые Хомский и другие исследователи выделяли как представляющие особую сложность для изучения языка.

Эти результаты также помогают объяснить, почему современные большие языковые модели, такие как GPT-4, столь успешно справляются с изучением человеческих языков: фокусируясь на предсказании следующего слова, они неявно трактуют язык как распределение вероятностей. При наличии достаточного количества примеров из этого языка они способны прийти к правильному распределению. Однако современные большие языковые модели все еще уступают человеку в изучении языка в одном важном аспекте: им требуется гораздо больше данных, чем когда-либо мог бы получить человеческий ребенок. Это мы также можем понять через призму байесовского вывода.

Изучение языка на основе меньшего количества данных

Чтобы понять, как дети усваивают язык на основе гораздо меньшего объема данных, чем нейронные сети, полезно вернуться к правилу Байеса. Вот версия правила Байеса, в которой гипотезы соответствуют различным кандидатным формам языка:

P(язык ∣данные )= P(данные ∣язык ) P(данные ) ×P(язык )

Такая запись показывает, что существуют два способа выучить язык по меньшим объемам данных: либо данные могут быть более информативными для этого конкретного языка (то есть отношение P(данные|язык)/P(данные) выше), либо обучающийся может иметь предвзятость в пользу языков такой формы (то есть априорная вероятность P(язык) выше). В данном случае, вероятно, работают оба фактора.

Большие языковые модели обучаются на колоссальных объемах текста. Человеческие дети учатся на гораздо меньшем объеме языкового материала в окружении, где они взаимодействуют с другими людьми и окружены вещами, которые этот язык призван описывать. Взрослые, заботящиеся о детях, адаптируют свою речь при общении с ними, создавая поддерживающий каркас для обучения; другие дети предоставляют упрощенную форму языка для усвоения, а сами обучающиеся могут выбирать, какие вопросы задавать и как взаимодействовать с окружающим миром. Таким образом, данные, с которыми сталкиваются обучающиеся люди, несомненно, богаче тех, что поступают на вход большой языковой модели.

Но вряд ли дело только в этом — не забывайте, что большие языковые модели обучаются на объемах данных, в тысячи раз превышающих те, что получает человеческий ребенок. И эти дети также более предрасположены к изучению таких вещей, как человеческие языки, чем современные нейросети. Это не означает, что дети обладают сильным врожденным знанием языка, о котором заявлял Хомский, но это означает, что человеческое обучение в некотором существенном отношении отличается от обучения современных нейросетей.

Один из способов осмыслить это заключается в том, что данные, которые мы предоставляем нашим большим языковым моделям, фактически компенсируют два процесса, влияющих на человеческое знание языка: разумеется, само обучение, но также и эволюцию. Мозг человека начинает работу в таком состоянии, когда получаемых им данных вполне достаточно, чтобы в процессе обучения прийти к полному знанию языка. Искусственные нейронные сети стартуют из гораздо более отдаленной точки, поэтому все эти дополнительные данные нужны им лишь для того, чтобы приблизиться к подобию стартового состояния человека. Оптимизация весов нейросети на основе этих данных заменяет собой эволюционный процесс, в результате которого сформировался человеческий мозг, восприимчивый к языку.

Что же скрывается внутри человеческого мозга? Один из способов охарактеризовать это — через априорное распределение языков. В недавней статье Юань Янга и Стивена Пиантадоси впервые было показано, что можно создать систему, способную изучать формальные языки — вроде нашего языка «яблоко-банан» — по очень небольшому числу примеров, не имея при этом жесткого априорного распределения, настроенного под конкретный язык. Их система основывалась на байесовском выводе и использовала вероятностную контекстно-свободную грамматику для определения априорного распределения гипотез, соответствующих различным формальным языкам. Система справлялась с изучением новых языков довольно хорошо, имея всего лишь десяток примеров грамматически верных последовательностей из этих языков. Стандартным нейросетям для достижения такого же уровня эффективности требовались сотни примеров.

Этот результат вовсе не означает, что нейросети не могут обладать схожими индуктивными смещениями или что для обучения по малому числу данных обязательно выполнять явный байесовский вывод на символьных языках. В нашей недавней совместной работе с Томом Маккоем — компьютерным лингвистом, создателем кроссвордов и ныне профессором Йельского университета — мы показали, что нечто похожее на априорное распределение Янга и Пиантадоси может быть воплощено в нейросети. Для этого мы смоделировали разделение между обучением и эволюцией, которое сформировало человеческий разум. Использовав метод под названием метаобучения, мы оптимизировали начальные веса рекуррентной нейросети так, чтобы она могла быстро осваивать формальные языки, выбранные из распределения, аналогичного априорному распределению языков, которое предполагали Янг и Пиантадоси. Результатом этого симуляционного эволюционного процесса стала нейросеть со стартовым состоянием, которое улавливало информацию из априорного распределения, закодированную в определенном наборе весов. Эта нейросеть смогла обучаться на ограниченных данных ничуть не хуже байесовской модели Янга и Пиантадоси, несмотря на то, что не использовала ни символьных представлений, ни байесовского вывода — только веса и обратное распространение ошибки. Полученная модель также могла более эффективно обучаться на небольших объемах английского текста, по-видимому, усвоив идею о том, что языки должны использовать рекурсию.

Подобные демонстрации показывают, что создание искусственных нейросетей с индуктивными смещениями, аналогичными человеческим, вполне возможно. Даже сложные, структурированные индуктивные смещения — например, заданные грамматиками программ — можно воспроизвести, подобрав подходящие веса для нейросети. Изучая свойства полученных сетей, мы можем нащупать подсказки относительно того, что именно нам следует встроить в наши модели, чтобы сделать их более похожими на обучающихся языку людей.

Нейросети как вероятностные модели

Один из уроков, которые можно извлечь из этой главы, заключается в том, что мы можем начать понимать некоторые способности больших языковых моделей, если будем размышлять о них в вероятностных категориях. Хотя в основе этих моделей лежат нейросети, их обучение предсказанию следующего слова в последовательности означает, что они воспринимают язык как распределение вероятностей.

Мы также можем рассматривать процесс обучения нейросетей с точки зрения байесовского вывода: конфигурация весов представляет собой гипотезу, а нейросети обладают неявным априорным распределением, отдающим предпочтение гипотезам, близким к их начальным весам. Каждый шаг обратного распространения ошибки отдаляет их от этой инициализации, но при ограниченных данных или ограниченном объеме обучения они будут смещены в сторону своих начальных условий. Исследование различных архитектур нейросетей — таких как сети долгой краткосрочной памяти или трансформеры — позволяет нам находить модели с разной выразительной способностью и различными индуктивными смещениями. Однако создание нейросетей, обучающихся более похожим на человека образом, потребует целенаправленной настройки этих индуктивных смещений под человеческие, воспроизводя эволюционный процесс, приведший к появлению нашего мозга.

Наличие такого вероятностного взгляда на большие языковые модели особенно важно по мере того, как они становятся все более значимой частью систем ИИ, с которыми мы взаимодействуем в повседневной жизни, поскольку он раскрывает некоторые из их ограничений. Выход GPT-4 вызвал огромный энтузиазм у части сообщества разработчиков ИИ, а одна исследовательская группа в Microsoft даже заявила, что модель демонстрирует «искры» общего искусственного интеллекта. Но поскольку эти системы используются для решения все более широкого круга задач, стоит помнить, что по своей сути это системы, обученные предсказывать язык, и порой хорошо справляться с предсказанием языка — вовсе не то же самое, что успешно функционировать в качестве общего искусственного интеллекта.

Работая с Томом Маккоем и командой аспирантов из Принстона, мы показали, что, насколько бы GPT-4 ни демонстрировала «искры», она также обнажает «тлеющие угольки» той самой задачи предсказания, на которой обучалась. Например, если вы попросите GPT-4 сосчитать количество букв в последовательности, она с большей вероятностью выдаст правильный ответ, если этих букв тридцать, а не двадцать девять. Почему? Потому что число 30 встречается в текстах в интернете гораздо чаще, чем число 29. На GPT-4 влияет ее априорное распределение по числам — сформировавшееся благодаря опыту предсказания следующего слова в интернет-текстах, — даже когда она решает задачу, где это априорное распределение вообще не имеет значения. Такое же поведение наблюдается и во множестве других задач, которые мы предлагали решить GPT-4 и другим большим языковым моделям, от применения простых шифров до составления акронимов.

Таким образом, спустя сотни лет после кончины преподобного Томаса Байеса, мышление в вероятностных категориях по-прежнему помогает понимать разумные системы. Даже когда эти разумные системы — уже не люди, а машины, построенные на гигантских искусственных нейросетях, обученных на колоссальных объемах данных. Именно этого и следовало ожидать от одного из элементов Законов Мышления.

Предыдущая главаГлава 16 из 34Следующая глава