К книге
Законы мышления: В поисках математической теории разума13 Универсальные законы познания.
44%
13 Универсальные законы познания.
15

Теория вероятностей может многое предложить когнитивной науке. Это лучший из имеющихся у нас кандидатов на роль теории индукции — инструмента, который мы можем использовать, чтобы объяснить как то, почему люди способны учиться на малом количестве данных, так и то, почему современным машинам для этого требуются огромные массивы информации. Она также открывает возможность объединить две великие идеи: структурированные представления подхода на основе правил и символов и способности к статистическому обучению, присущие нейронным сетям. Поскольку формулу Байеса можно применить к любому типу гипотез — от логических формул до весов связей, — она позволяет нам исследовать последствия различных предположений о том, как представлен мир и какие индуктивные смещения направляют процесс обучения.

Но прежде чем когнитивисты смогли исследовать этот потенциал, нам требовалось преодолеть убеждение в том, что теория вероятностей несовместима с человеческим разумом. Даниэль Канеман и Амос Тверски привели убедительные примеры того, как человеческие рассуждения отклоняются от теории вероятностей в целом и от формулы Байеса в частности. Чтобы объяснения человеческого познания, основанные на теории вероятностей, воспринимались всерьез, эти отклонения необходимо было объяснить.

Для этого требовалось по-новому подойти к использованию теории вероятностей для понимания мышления. Оказалось, что ключ к успеху состоял в том, чтобы перестать концентрироваться на человеческом разуме и вместо этого задаться вопросом о принципах интеллекта, которые могли бы применяться к любому разуму в любой точке Вселенной.

Первый универсальный закон психологии

В 1687 году Исаак Ньютон опубликовал свой всемирный закон тяготения в «Математических началах». Закон утверждал, что сила гравитации, которую мы ощущаем на Земле, применима и к любому объекту во Вселенной — что любые два тела притягиваются друг к другу с силой, пропорциональной их массам и обратно пропорциональной квадрату расстояния между ними. Используя этот закон, Ньютон смог вывести законы движения небесных тел, видимых с Земли, предложив простой объединяющий принцип для объяснения астрономических наблюдений.

Ровно триста лет спустя Роджер Шепард сформулировал первый универсальный закон психологии: универсальный закон обобщения. Как и закон Ньютона, закон Шепарда должен был действовать в любой точке Вселенной. Начав с абстрактной проблемы, с которой неизбежно сталкивается любой разумный организм, и затем выведя её решение, Шепард выявил принцип, который должен быть применим не только к людям и не только к животным, но и к разуму любого рода.

Как и Ньютон, Шепард интересовался взаимосвязью между парами объектов. Но вместо гравитации в центре его внимания находилось обобщение. Если известно, что один объект обладает определенным свойством — скажем, он съедобен, — какова вероятность того, что другой объект обладает тем же свойством? С подобным вопросом сталкивается любой разумный организм, решает ли он, стоит ли рисковать и есть конкретный гриб, или оценивает, может ли конкретная планета быть обитаемой.

Подобно Ньютону, Шепард выразил свой универсальный закон в виде функции расстояния между этими объектами, хотя сосредоточился на психологическом пространстве (описанном в главе 6), а не на физическом. Универсальный закон обобщения Шепарда гласит, что вероятность переноса свойства с одного объекта на другой убывает как экспоненциальная функция расстояния между этими двумя объектами в психологическом пространстве.

Как Шепард вывел этот универсальный закон? С помощью теории вероятностей. В частности, он представил эту задачу как задачу байесовского вывода. Шепард изобразил каждый объект в виде точки в психологическом пространстве. Затем он предположил, что множество объектов, обладающих некоторым свойством — скажем, множество съедобных грибов, — представляет собой область в этом пространстве. Когда вы узнаёте, что один из объектов обладает этим свойством (например, выясняете, что данный гриб съедобен), вам становится известно, что он принадлежит к этой области. Тогда вопрос сводится к тому, чтобы определить, принадлежит ли другой объект к той же самой области.

Это именно та задача, которую можно решить с помощью формулы Байеса. В данном случае каждая гипотеза представляет собой область пространства, которая может соответствовать этому свойству. Наблюдение того, что один объект принадлежит к некоторой области, дает данные, которые можно использовать для обновления уверенности в этих гипотезах. Чтобы вычислить вероятность того, что другой объект принадлежит к этой же области, нам просто нужно сложить вероятности областей, содержащих этот объект, точно так же, как мы делали при рассмотрении возможных миров в главе 12. Наблюдение Шепарда заключалось в том, что не так уж важно, какие предположения вы делаете об априорных вероятностях гипотетических областей — вероятность того, что второй объект принадлежит к той же области, будет снижаться примерно как экспоненциальная функция расстояния.

Шепард показал, что его универсальный закон, по-видимому, выполняется по меньшей мере для земных существ — вероятности обобщения у людей, крыс и голубей снижались как экспоненциальная функция расстояния в психологическом пространстве (см. рисунок 13.1). Статья с описанием этих результатов была опубликована в журнале Science и заканчивалась смелым заявлением о возможности открытия новых универсальных законов психологии: «Несомненно, психологическая наука отстала от физической как минимум на 300 лет. Несомненно и то, что предсказание поведения живых существ никогда не сможет достичь той точности, с которой предсказывается движение небесных тел. И все же психология, возможно, не ограничена по своей природе простым описанием поведения конкретных земных видов. Возможно, за многообразием поведения людей и животных, как и за различными движениями планет и звезд, мы сможем разглядеть действие универсальных законов».

Рисунок 13.1. Универсальный закон обобщения Шепарда: степень обобщения от одного объекта к другому убывает как экспоненциальная функция расстояния в психологическом пространстве. Это справедливо для самых разных стимулов и организмов — от людей, оценивающих сигналы азбуки Морзе, до голубей, различающих цвета.

Одно из преимуществ публикации статьи в журнале Science заключается в том, что ее читает широкая аудитория людей, в целом интересующихся — собственно, наукой. Одним из читателей статьи Шепарда был великий писатель-фантаст Айзек Азимов. Сама статья далась ему нелегко — Азимов писал: «хотя я и предпринял героическую попытку прочесть ее, математика оказалась для меня слишком сложной, и даже нематематические разделы оставили лишь довольно смутное и туманное понимание». Однако сама мысль о том, что универсальные психологические законы могут быть открыты с помощью подобного математического анализа, произвела на него сильное впечатление. Ранее Азимов написал книгу «Основание», в которой описывалось далекое будущее, где исследователь по имени Гэри Селдон разрабатывает математический метод предсказания человеческого поведения, называемый им психоисторией. Статья Шепарда заставила Азимова вспомнить о Селдоне: «У меня такое чувство, что Гэри Селдон понял бы ее без труда. Кроме того, меня вдруг охватило беспокойство: вдруг психоистория будет создана уже в следующем веке? Я перенес ее создание на 20 000 лет в будущее. Не окажется ли это очередным случаем, когда мое научно-фантастическое воображение оказалось смехотворно скромным?»

Обобщение обобщения

Айзек Азимов был не единственным, на кого статья Шепарда произвела впечатление. Она вдохновила целое поколение когнитивистов — включая меня.

Я вырос в Перте, в Западной Австралии — прекрасном городе, который находится очень далеко от остального мира. В нашей семье всегда были компьютеры, так как мой отец был инженером-электриком, который впоследствии стал системным аналитиком, а затем консультантом по управлению. В детстве я самостоятельно научился программировать на компьютере, чей крошечный экран мог отображать одновременно лишь четыре строки текста, а результаты моих трудов сохранялись на кассету. Моя мама работала психотерапевтом-соцработником, поэтому я также проводил много времени, слушая и размышляя о том, как устроен человеческий разум. Как и Кардано, к изучению теории вероятностей меня подтолкнул подсчет шансов в картах и костях, хотя в моем случае это были коллекционные карточные игры и настольные ролевые игры, а не азартные игры на деньги. (Поскольку здесь вырисовывается довольно специфическая картина моего детства, полагаю, мне стоит также упомянуть, что я проводил много времени на пляже и увлекался фехтованием, хотя последнее отчасти объяснялось тем, что я был плох во всех традиционных австралийских видах спорта.)

В старших классах я простудился, выздоровел и вернулся в школу, но затем снова подхватил простуду и не возвращался туда два года. У меня был синдром поствирусной усталости — состояние, которое сегодня гораздо лучше знакомо людям в эпоху затяжного ковида. В тот период в свои лучшие дни я играл в текстовые ролевые онлайн-игры. В одной из таких игр, если ты продвигался достаточно далеко, ты становился «волшебником» и мог изменять саму игру, дописывая код. Так я освоил объектно-ориентированное программирование на C и работу с операционной системой UNIX — два навыка, весьма необычных для четырнадцатилетнего подростка. Годы жизни с недиагностированной болезнью отчасти пробудили во мне интерес к областям, полным неразгаданных тайн, и подтолкнули к изучению психологии (и других «логий»), когда я поступил в университет.

Будучи студентом Университета Западной Австралии, я ближе познакомился со статистикой и открыл для себя нейросети. Проведя лето за самостоятельным чтением книг по PDP, я нашел в кампусе профессора, который занимался исследованиями в этой области, — Майка Калиша, учившегося в Калифорнийском университете в Сан-Диего в период расцвета коннекционизма. Я подкараулил его в 9:00 утра в первый же день занятий и убедил взять меня ассистентом в его лабораторию. Мои интересы к теории вероятностей и человеческому познанию пересеклись, когда на занятиях Калиша по сходству и категоризации я узнал об универсальном законе обобщения Шепарда. С тех пор я вовсю использовал свои навыки программирования для реализации и оценки математических моделей, сочетавших идеи нейросетей с шепардовским описанием обобщения. В своей дипломной работе я показал, что характер ошибок при устном умножении можно объяснить с точки зрения экспоненциального обобщения в психологическом пространстве задач на умножение — случай, когда проблему из области «правил и символов» можно описать с помощью модели «признаков и пространств». Я точно знал, что хочу изучать в аспирантуре, и подал документы в Стэнфорд, чтобы работать с Роджером Шепардом и Дэвидом Румельхартом.

На другом конце света Джош Тененбаум рос неподалеку от Стэнфорда, где его отец защитил докторскую диссертацию по компьютерным наукам, а также руководил исследовательскими лабораториями ИИ и технологическими компаниями. Его мать была педагогическим психологом и занималась оценкой школьных программ. Тененбаум сохранил интерес как к ИИ, так и к обучению — хотя в Йеле он специализировался на физике, лето между вторым и третьим курсами он провел, работая в лаборатории Роджера Шепарда в Стэнфорде. Его целью на то лето было понять, как согласовать универсальный закон обобщения Шепарда с моделями нейронных сетей. Это лето задало ему новую траекторию: он поступил в аспирантуру факультета наук о мозге и когнитивных наук в MIT, где написал диссертацию, расширяющую закон Шепарда путем анализа того, как должны меняться обобщения людей по мере того, как они обнаруживают, что все больше и больше объектов обладают определенным свойством. Формулирование этой проблемы в терминах байесовского вывода ясно показало, что наблюдение большего количества примеров, согласующихся с определенной гипотезой, должно увеличивать апостериорную вероятность этой гипотезы, объясняя, как люди могут быстро усваивать новые слова и понятия.

В тот год, когда я подавал документы в аспирантуру Стэнфорда, и Роджер Шепард, и Дэвид Румельхарт как раз недавно вышли на пенсию. Однако факультет психологии только-только нанял нового профессора: Джоша Тененбаума. (Как выяснилось, Роджер Шепард, который обычно держался в стороне от внутрифакультетской политики, оставил письмо с горячей поддержкой Тененбаума в почтовых ящиках всех своих коллег-преподавателей.) По неведомым мне причинам Тененбаум просмотрел стопку заявлений абитуриентов и выбрал анкету паренька из Западной Австралии, несмотря на то, что изрядная часть моего эссе, где я должен был описывать свои научные интересы, была посвящена восторгу по поводу стэнфордских залов для фехтования. Рано утром мне позвонила Барбара Тверски и сообщила, что меня приняли, и я отправился в Калифорнию работать с Тененбаумом.

Одним из первых наших совместных проектов стало еще одно расширение шепардовского анализа обобщения. В соответствии со своим взглядом на сходство, Шепард сосредоточился на обобщении в психологических пространствах. Мы показали, что эта теория служит мостом между шепардовским пониманием сходства и теорией на основе признаков, предложенной Тверски. В исходной формулировке Шепарда гипотезы о том, какие именно объекты обладают определенным свойством, соответствуют областям в пространстве. Если же эти гипотезы основываются на признаках объектов, то теория Тверски вытекает из тех же самых байесовских вычислений, которые привели к универсальному закону Шепарда. (Что весьма символично, я работал над этим проектом в крошечной комнатке, находившейся прямо посреди короткого коридора, разделявшего кабинеты, которые ранее занимали Роджер Шепард и Амос Тверски.)

Возможность примирить пространства и признаки как основы для обобщения иллюстрирует силу байесовского вывода. Правило Байеса лишь указывает, как обновлять свои убеждения, но не говорит, какими именно они должны быть. Рассматриваемые нами гипотезы могут быть областями в пространстве или весами нейронной сети, но с тем же успехом они могут основываться на признаках объектов или логических правилах. Таким образом, байесовский вывод дает нам ценный инструмент для исследования того, какие выводы можно сделать на основе данных, независимо от наших предположений о репрезентациях, используемых обучающимся. Более того, это настолько ценный инструмент, что вскоре стало очевидно: его применение может выходить далеко за рамки понимания сходства и обобщения.

Как вернуть теории вероятностей былое уважение

Для ученого отдых порой означает возможность наконец-то обдумать какую-то захватывающую новую идею. Сидя на пляже в южной части Тихого океана в 1983 году, Джон Андерсон с упоением погрузился в книгу, взятую с собой в отпуск: «Зрение» Дэвида Марра. Андерсон был профессором психологии и компьютерных наук в Университете Карнеги — Меллона, где получил известность благодаря развитию символьного подхода, отстаиваемого Ньюэллом и Саймоном, в целостную модель человеческого познания. Чтение на пляже в тот день увело его в новом направлении — он попытался понять абстрактные вычислительные задачи, лежащие в основе тех аспектов человеческой памяти, усвоения категорий, выявления причинно-следственных связей и решения задач, которые он стремился зафиксировать с помощью своего символьного подхода.

В течение следующих нескольких лет Андерсон понял, что каждая из этих задач содержит элементы индуктивного вывода, а их идеальные решения лежат в плоскости теории вероятностей. Как и Шепард, он открыл для себя важную роль, которую правило Байеса может играть в понимании человеческого познания, используя его для объяснения того, как наш мозг определяет, какая информация, скорее всего, окажется полезной в будущем, принадлежит ли объект к той или иной категории, какие причинно-следственные связи мы можем вывести из наблюдаемых данных и как подступаться к решению новых задач. Эти объяснения во многом отвечали стремлению Марра объяснить, почему наш разум работает определенным образом, а не просто как он это делает. Андерсон назвал свой новый подход рациональным анализом, подчеркивая лежащее в его основе допущение: рациональные решения абстрактных вычислительных задач могут пролить свет на человеческое поведение.

В сочетании с работой Шепарда над универсальным законом обобщения результаты Андерсона указывали на то, что весьма значительную часть человеческого познания можно описать с помощью моделей, основанных на байесовском выводе. На первый взгляд, это открытие противоречит выводам Канемана и Тверски о том, что люди плохо справляются с вероятностными рассуждениями. На самом же деле и Андерсон, и Шепард были готовы заявить нечто еще более радикальное: мы вправе ожидать, что люди — и другие разумные организмы — будут вести себя подобно оптимальным байесовским агентам и в других ситуациях. Шепард прямо писал об этом в своей более поздней работе: «Я полагаю, что по мере того, как в ходе эволюции организмы развивают все более мощные способности к репрезентации внешнего мира, принципы, управляющие их когнитивными репрезентациями — и, следовательно, их поведением, — будут все ближе соответствовать тому, что было бы оптимальным в этом мире».

Как же примирить эти две точки зрения? Ключ кроется в том, что в то время как Канеман и Тверски исследовали явные вероятностные рассуждения людей, Шепард сосредоточился на том, как байесовский вывод может неявным образом использоваться для определения оптимального решения проблемы, с которой люди сталкиваются в своей среде обитания. По словам Шепарда: «Абстрактные задачи с бумагой и карандашом, обычно используемые в только что упомянутых экспериментах, имеют мало общего с конкретными, чувственно воспринимаемыми реальными трудностями, с которыми сталкивались наши предки в плейстоцене. Вряд ли существовало сильное давление отбора в пользу когнитивных навыков, необходимых для быстрого и точного решения таких абстрактных задач с бумагой и карандашом».

Подтверждение этой идеи пришло из нового анализа другого вида иррациональности. Одной из причин, почему психологи начали охладевать к логике — помимо её неспособности отражать неопределенность и индукцию, — было то, что люди, похоже, не так уж хорошо справлялись с логическими рассуждениями. Питер Уэйсон, психолог из Университетского колледжа Лондона, в 1960 году обнаружил особенно убедительный пример этого и развил его дальше, когда Джордж Миллер пригласил его посетить Центр когнитивных исследований в Гарварде в 1963 году. Уэйсон показывал людям четыре карты и говорил, что на одной стороне каждой карты написана буква, а на другой — число. Карты раскладывали на столе так, что была видна только одна сторона каждой карты — например, на четырех картах могли быть изображены буква D, число 3, буква B и число 7 соответственно. Затем он просил людей выбрать карты, которые необходимо проверить, чтобы определить, истинно ли простое логическое правило: «Если на одной стороне карты написана буква D, то на другой стороне — число 3». Прежде чем перевернуть страницу, подумайте, какие карты выбрали бы для проверки вы сами.

С точки зрения логики это правило имеет вид P → Q, где P означает наличие буквы D на одной стороне, а Q — числа 3 на другой. Чтобы проверить, выполняется ли оно, нам нужно обратиться к соответствующей таблице истинности:

Единственный мир, в котором это правило ложно, — это тот, где P истинно, а Q ложно, то есть когда у карты на одной стороне написана буква D, а на другой нет тройки. Это означает, что мы должны проверить карту с буквой D, чтобы убедиться, что на ее обратной стороне действительно тройка. Но это также означает, что мы должны проверить карту с семеркой, чтобы убедиться, что на ее обратной стороне нет буквы D.

Люди обычно этого не делают. Вместо этого они проверяют карту с буквой D и карту с тройкой. Уэйсон — как и многие другие психологи впоследствии — счел это провалом логического мышления, и этот пример стал приводиться в качестве доказательства человеческой иррациональности. Однако подход, предложенный Шепардом, указывает на иную возможность: быть может, люди на самом деле отлично справляются с решением совсем другой задачи.

В 1994 году Майк Оуксфорд и Ник Чейтер опубликовали статью, в которой утверждали, что дело обстоит именно так. Оуксфорд и Чейтер подружились еще в аспирантуре Эдинбургского университета и вдохновлялись идеей рационального анализа Андерсона. Они вернулись к задаче Уэйсона с выбором карт, задавшись вопросом: нельзя ли понять выбор людей с точки зрения рационального статистического вывода? Этот ракурс — рассмотрение задачи в категориях вероятностей, а не логики — подсказал новую возможность: люди делают свой выбор на основе того, насколько сильно каждая карта изменит вероятность истинности правила. Объяснение Оуксфорда и Чейтера опиралось на простое допущение: свойства, выделяемые правилами, встречаются редко. Если для карт нетипично иметь букву D на одной стороне или тройку на другой, то проверка карты с тройкой может быть более информативной, чем проверка карты с семеркой, просто потому, что вероятность обнаружить букву D на обороте любой случайной карты крайне мала. Если рассуждать более интуитивно, представьте, что вы хотите проверить правило: «Если кастрюля падает, раздается звон». Оглядываться каждый раз, когда вы слышите звон, чтобы проверить, не упала ли кастрюля, вполне разумно; но проверять кухню всякий раз, когда вы не слышите звона, чтобы узнать, не лежит ли кастрюля на полу, потребовало бы слишком много усилий при низкой вероятности получить полезный результат. Формулирование задачи на языке логики просто плохо подходит для мира, в котором мы реально живем.

Оуксфорд и Чейтер развили этот результат, создав совершенно новую теорию человеческого дедуктивного мышления на основе байесовского вывода. Принятый ими подход — рассмотрение человеческого познания как формирующегося под влиянием вычислительных задач, с которыми люди сталкиваются в своей среде обитания, а не как универсального инструмента для решения произвольных задач — также предлагает новый взгляд на результаты Канемана и Тверски. Причина, по которой люди так плохо справляются с задачами на вероятностные рассуждения, может заключаться в том, что на самом деле они не решают и ту задачу, которую перед ними ставили экспериментаторы. Вместо этого они решают задачу, которая гораздо лучше подходит под те типы проблем, для решения которых эволюционировал человеческий разум. Движимые этими результатами, мы с Тенебаумом решили заново оценить теорию вероятностей как инструмент для понимания человеческого разума.

Первым примером из работы Канемана и Тверски, который я привел в главе 12, был тот факт, что люди считают последовательность рождений Д М Д М М Д более вероятной, чем М Д М М М М. Это очевидное заблуждение: как мы видели в главе 12, вероятность наблюдения любой из этих последовательностей рождений при условии, что рождение мальчиков и девочек равновероятно, одинакова. Рассматривая каждую последовательность рождений как наши наблюдаемые данные, мы можем записать эту вероятность как P(данные|случайно). Но один из способов понять интуицию людей — допустить, что они решают другую задачу: возможно, они пытаются определить, действительно ли эти события были порождены случайным процессом. Это означает, что они оценивают P(случайно|данные) — вероятность гипотезы о том, что рождения происходили случайным образом, при заданной наблюдаемой последовательности рождений. В этом случае правило Байеса говорит нам, что они должны быть чувствительны к тому, насколько данная последовательность свидетельствует в пользу её случайного происхождения, что выражается соотношением P(данные|случайно) / P(данные). Если высока вероятность того, что эту последовательность рождений мог породить какой-то другой процесс, то P(данные) возрастает, а свидетельство в пользу случайного процесса ослабевает.

Представьте, что врачи пытаются выяснить, не влияет ли на рождаемость в некоторых небольших городах какое-то химическое вещество в воде. О каком городе им следовало бы беспокоиться больше: о том, где последние шесть рождений распределились как Д М Д М М Д, или о том, где родились М Д М М М М? Очевидно, о втором. Последовательность М Д М М М М более вероятна, чем Д М Д М М Д, если действует какой-то неслучайный процесс — например, если на показатели рождаемости влияет химическое вещество. Как следствие, последовательность М Д М М М М дает меньше оснований считать, что она возникла в результате случайного процесса, чем Д М Д М М Д. Хотя P(данные|случайно) для этих последовательностей одинакова, P(случайно|данные) выше для Д М Д М М Д, чем для М Д М М М М, и именно к этому чувствительны люди. На самом деле мы с Тенебаумом показали, что суждения людей о случайности бинарных последовательностей отлично описываются простой моделью, которая предполагает, что они оценивают, насколько сильно данная последовательность свидетельствует в пользу её случайного происхождения.

Ключевой шаг здесь состоит в предположении, что люди неявно решают задачу выявления скрытого причинно-следственного процесса, а не вычисляют в явном виде вероятность конкретного исхода (чего как раз и требовали от них экспериментаторы). Существует множество причин, по которым мы склонны распознавать причинно-следственные процессы: это помогает нам понимать окружающую среду и, в частности, замечать в ней закономерности, которые мы могли бы использовать. Два других примера, которые я обсуждал в главе 12, — определение того, является ли Джек юристом или инженером, а Линда — кассиром в банке или кассиром-феминисткой, — могут быть объяснены аналогичным образом. В каждом случае люди вместо оценки вероятности реагируют на то, насколько описание подтверждает ту или иной гипотезу. Описание Джека дает веские основания полагать, что он инженер, а описание Линды дает еще более сильные основания считать ее кассиром-феминисткой, нежели просто кассиром. И вновь мы с Тенебаумом показали, что эту меру подтверждения гипотезы можно выразить на языке байесовского вывода.

Главный вывод отсюда заключается вовсе не в том, что люди правильно применяют теорию вероятностей, отвечая на эти вопросы. Очевидно, что это не так: они не дают правильных ответов на вопросы, которые задавали им Канеман и Тверски. Суть скорее в том, что мы можем использовать теорию вероятностей, чтобы понять поведение людей. В частности, складывается впечатление, что люди весьма успешно справляются со специфической задачей: улавливают свидетельства, важные для оценки причин происходящих событий. Ошибка же возникает потому, что этот инстинкт заставляет их отвечать совсем не на тот вопрос, который им задают.

Взгляд на человеческое поведение под таким углом — с размышлениями об абстрактных вычислительных задачах, которые может решать человеческий разум, и об их идеальных решениях — позволяет использовать теорию вероятностей для понимания причин человеческих поступков. Для индуктивных задач байесовский вывод предлагает идеальное решение. Единственная трудность заключается в том, чтобы построить вероятностные модели, достаточно богатые для отражения человеческих представлений о мире.

Графы и порождающие процессы

Джуда Перл читал статью, написанную Дэвидом Румельхартом, когда ему пришла в голову идея.

Перл уже однажды менял тему исследований, перейдя от изучения электрических компонентов, использовавшихся для создания компьютеров, к разработке новых алгоритмов, помогающих этим компьютерам решать более сложные задачи. Чтение статьи Румельхарта должно было увести его в совершенно ином направлении. Но Перл без колебаний решился на этот шаг. Он вырос в недавно образованном государстве Израиль, где люди постоянно создавали себя и мир вокруг заново. Его дедушка сменил профессию торговца на ремесло молочника, его средней школы не существовало еще за год до того, как он начал в ней учиться, а все учителя были университетскими профессорами, бежавшими из Европы. Окончив Технион, он отправился в США в аспирантуру, умудрившись в 1965 году одновременно получить степень магистра физики в Ратгерском университете и докторскую степень (PhD) в Бруклинском политехническом институте. Он работал в компании, занимавшейся созданием компьютерной памяти, а затем вошел в преподавательский состав Калифорнийского университета в Лос-Анджелесе. Там он начал исследовать эвристические стратегии для систем искусственного интеллекта — подход, вдохновленный работами Аллена Ньюэлла и Герберта Саймона в области решения задач и поиска.

Статья, которую читал Перл, описывала идеи Румельхарта о когнитивных процессах, участвующих в восприятии слов, возникшие еще до того, как он начал обсуждать нейронные сети с Джеем Макклелландом. С его последующей совместной работой с Макклелландом ее объединяла идея взаимодействия между элементами — штрихами, буквами и словами. Однако в ней предлагалось совершенно иное представление о том, как описывать это взаимодействие. По словам Румельхарта: «Мера, которую я предложу, по сути, представляет собой байесовскую [так в оригинале] вероятность того, что гипотеза верна при имеющихся данных».

Это был еще один из тех моментов, когда блестящий ум бьется над идеей, но не может до конца заставить ее работать, подобно Лейбницу с его логикой. Румельхарт видел, что чтение можно описать как байесовский вывод, где штрихи выступают в роли данных, а слова — в роли гипотез. Он пытался понять, как рассчитать соответствующие вероятности по мере того, как поток свидетельств перетекает от штрихов к буквам, затем к словам и далее. Он нарисовал схему, показывающую связи между этими элементами (см. рис. 13.2), и начал набрасывать теорию, но она никак не складывалась в единое целое.

Перл увидел этот рисунок и сразу же вдохновился идеей разрешения неопределенности посредством передачи сообщений между узлами графа. «Читая статью Румельхарта, я убедился, что любой искусственный интеллект должен строиться по образу и подобию того, что мы знаем о человеческом разуме, а машинные рассуждения в условиях неопределенности должны опираться на аналогичную архитектуру передачи сообщений. Но что представляют собой эти сообщения?»

Перлу предстояло стать Булем для Румельхарта, выступившего в роли Лейбница.

Спустя несколько месяцев он нашел решение: сообщениями должны быть условные вероятности. Он изложил эту идею в статье под названием «Преподобный Байес о машинах логического вывода: распределенный иерархический подход» (Reverend Bayes on Inference Engines: A Distributed Hierarchical Approach), публикация которой в 1982 году представила миру байесовские сети.

Рисунок 13.2. Рисунок из статьи Румельхарта, вдохновивший Джуду Перла. Примечание: слово «Sematic» является опечаткой и должно писаться как «Semantic».

Наблюдение Перла было простым: описать структуру, которую задумал Румельхарт, можно было, разбив процесс порождения слова на последовательность шагов. Сначала выбирается слово. Затем пишется каждая буква этого слова. Чтобы сделать это, пишется каждый штрих этих букв. Каждый шаг включает в себя распределение вероятностей: вероятность слова, вероятность буквы при условии этого слова и вероятность штриха при условии этой буквы. Определить распределение вероятностей для слов, букв и штрихов можно было, просто задав условную вероятность каждого шага относительно предыдущего. Эту информацию можно представить в виде графа, подобного показанному на рисунке 13.3, где стрелки описывают этот порождающий процесс: после выбора слова мы следуем по стрелке и пишем первую букву с соответствующей условной вероятностью.

Рисунок 13.3. Байесовская сеть для чтения. Стрелки указывают на порождающий процесс: выбирается слово, затем на основе этого слова выбираются буквы, а затем на основе букв выбираются штрихи.

Такое описание порождающего процесса также значительно упростило выполнение байесовского вывода. Условные вероятности работали в обоих направлениях: при наблюдении набора штрихов информация, которую они несли о наличии той или иной буквы, фиксировалась путем отправки соответствующих условных вероятностей обратно вверх по стрелкам. Каждая буква могла собрать эту информацию и передать ее дальше вверх по стрелкам, чтобы определить, какое слово перед нами. Порождение шло по графу сверху вниз, а вывод — снизу вверх.

Это открытие существенно облегчило работу с распределениями вероятностей. До Перла для определения распределения вероятностей на множестве переменных требовалось расписать все возможные значения, которые могли принимать эти переменные, и присвоить вероятность каждому исходу — точно так же, как мы делали в предыдущей главе с вероятностями различных возможных миров. Это было нежизнеспособно: как и в случае с логическими таблицами истинности, число возможных значений росло экспоненциально с ростом числа переменных. Перл нашел способ определять сложные распределения вероятностей, разбивая их на более простые шаги, каждый из которых достаточно было описать условной вероятностью. Это также упростило выполнение байесовского вывода: условные вероятности могли просто передаваться по полученным графам, избавляя от мучительного пересчета распределения вероятностей по всем возможным исходам после каждого нового наблюдения.

Прорыв Перла прежде всего повлиял на сообщество специалистов по искусственному интеллекту. В 1980-х годах исследователи ИИ использовали продукционные системы, подобные описанным в главе 4. Но у продукционных систем была серьезная проблема: в них было трудно разделить порождение и вывод. Правило вроде «Если прошлой ночью работал разбрызгиватель, то трава мокрая» кажется разумным, но точно так же выглядит и правило «Если трава мокрая, то прошлой ночью работал разбрызгиватель». Первое правило описывает порождающий процесс (разбрызгиватель включается, отчего трава становится мокрой), а второе — логический вывод (мы видим мокрую траву и делаем вывод, что работал разбрызгиватель). Это приводило к самым разным проблемам. Например, трава могла намокнуть и из-за того, что ночью шел дождь. Значит, правило вывода должно было звучать примерно так: «Если трава мокрая и ночью не было дождя, то работал разбрызгиватель». Однако учитывать все возможные исключения было крайне тяжело. Теория вероятностей предлагала верное решение, но пользоваться ею на практике было невозможно, пока Перл не предложил байесовские сети. Эта идея распространилась и на сообщество специалистов по машинному обучению — спад интереса к нейронным сетям в конце 1990-х и начале 2000-х годов стал результатом этого влияния, когда байесовские методы буквально захватили машинное обучение.

Байесовские сети также послужили ключевым инструментом для возрождения теории вероятностей в когнитивистике. Они облегчили построение выразительных вероятностных моделей и сделали теорию вероятностей более интуитивно понятной. Когнитивисты теперь могли создавать модели, отражающие всю сложность задач, с которыми сталкивается человеческий разум, и проверять, действительно ли выводы людей согласуются с этими моделями. В одном из примечательных приложений этих идей Джей Макклелланд ответил на вопрос, поставленный некогда Дэвидом Румельхартом, показав, как модель интерактивной активации можно интерпретировать с байесовских позиций.

Пожалуй, самым важным было то, что подход Перла подчеркнул значимость мышления в терминах порождающих процессов. Когда люди наблюдают какие-то данные, они пытаются реконструировать процесс, в результате которого эти данные могли быть получены. Взаимодействуя с окружающим миром, мы опираемся на его богатую модель, выстроенную у нас в голове — модель, которая задает порождающие процессы для различных событий и позволяет нам их интерпретировать.

Размышления в терминах порождающих процессов дают и еще кое-что, помогающее нам в поисках законов мышления: они предлагают новый взгляд на взаимосвязь между правилами и символами, с одной стороны, и нейронными сетями — с другой.

Структура и статистика

Правила и символы отличаются от нейронных сетей в двух важных измерениях: в способе представления идей и в механизме обучения. В подходе с правилами и символами упор делается на дискретные представления, которые можно комбинировать между собой для создания новых мыслей, планов и предложений, при этом постулируются врожденные ограничения на обучение. Нейронные сети используют непрерывные представления, поддерживающие нечеткие и градуальные понятия, что позволяет извлекать эти представления из данных. Но существует и другая возможность: мы можем использовать правила и символы для описания того, чему именно обучается человеческий разум, и в то же время объяснить, как именно происходит это обучение.

Теория вероятностей — через байесовский вывод — предлагает способ исследовать эту возможность. Определяя порождающие процессы на основе правил и символов и приписывая вероятности гипотезам вроде логических формул или даже компьютерных программ, мы можем объединить структурированные представления со статистическим обучением. Это дает нам способ описать то, что люди узнают о мире, используя богатый язык, поддерживающий продуктивность, иерархичность и композициональность — свойства человеческого знания, которые подчеркивает подход на основе правил и символов.

Силу этого подхода можно проиллюстрировать на примере, который мы рассматривали на протяжении всей книги: на категориях. Логика дала нам элегантный способ описания категорий с помощью правил, определяющих, какие объекты принадлежат к категории, а какие нет. Нейронные сети поддержали более размытые границы категорий и сделали возможным их усвоение на основе опыта. Размышления о том, как описать категории в терминах порождающих процессов, показывают, как мы можем связать байесовский вывод и с логикой, и с нейронными сетями, а также как объединение структуры и статистики позволяет нам рассматривать более богатые формы, которые могут принимать категории.

Как уже обсуждалось в предыдущей главе, категоризацию легко представить в виде задачи байесовского вывода. В данном случае наблюдаемые нами данные — это признаки объекта, а наши гипотезы касаются различных категорий, к которым он может принадлежать. Например, встретив лохматое существо, мы можем задуматься, кошка это или собака. Правило Байеса говорит нам, что ответить на этот вопрос можно путем вычисления апостериорной вероятности различных категорий на основе признаков, которыми обладает существо:

P(кошка ∣ признаки )= P(признаки ∣кошка )×P(кошка ) P(признаки )

Решающим фактором при вычислении этой апостериорной вероятности является P(признаки|кошка), указывающая на то, насколько вероятно, что животное будет обладать этими признаками, если оно является кошкой. С байесовской точки зрения категория характеризуется распределением вероятностей по признакам. Определение этого распределения вероятностей через различные порождающие процессы приводит к разным способам осмысления категорий.

Эта перспектива объединяет в себе предыдущие подходы к категоризации, которые мы рассматривали, и позволяет выйти за их рамки. Например, простой способ определить распределение вероятностей по признакам для категории — предположить, что каждый признак порождается независимо от остальных, то есть вероятность обладания одним признаком не зависит от того, есть ли у вас другие признаки. У кошек может быть длинная или короткая шерсть, длинный или короткий нос, и эти параметры никак особо между собой не связаны. Байесовская сеть, соответствующая этому предположению, показана на рисунке 13.4.

Оказывается, в этом случае простая нейронная сеть, такая как перцептрон, действительно может реализовывать правило Байеса. Когда Марвин Минский только начал изучать свойства перцептронов, он понял, что байесовское решение задачи определения того, к какой из двух категорий принадлежит объект, дает линейную границу классификации, когда признаки этих объектов независимы внутри каждой из категорий. В результате легко создать однослойную нейронную сеть, реализующую это байесовское решение, как показано на рисунке 13.4. Интуитивно говоря, веса от признаков к категориям передают условные вероятности, необходимые для вывода, на выходной уровень.

Рисунок 13.4. Байесовская сеть слева показывает ситуацию, когда признаки объекта генерируются независимо на основе категории. В этом случае простой перцептрон, показанный справа, может вычислять правило Байеса, выводя категорию из признаков. Веса перцептрона просто отражают, насколько сильным свидетельством в пользу категории является каждый признак.

Предположение о том, что люди представляют категории с помощью прототипов, также приводит к линейной границе между категориями и, следовательно, тоже может получить байесовскую интерпретацию. Подобные соответствия между моделями не должны удивлять: поскольку правило Байеса определяет идеальное решение индуктивных задач, другие хорошие способы решения этих задач часто оказываются эквивалентными байесовскому выводу при определенных допущениях.

Но размышления о порождающих процессах также позволяют нам исследовать и другие способы описания категорий. Например, мы можем предположить, что кошек действительно можно описать логической формулой, но допустить некоторую изменчивость в ее применении: кошки, как правило, представляют собой мелких пушистых домашних хищников, однако с некоторой малой вероятностью они могут не обладать каким-то из этих признаков. Этот подход возрождает идею, предложенную Брунером, Гудноу и Остином, — о том, что усвоение категорий сводится к оценке различных логических гипотез, — но расширяет ее с помощью вероятностей, чтобы учесть размытые границы реальных категорий. Используя этот подход, мы можем объяснить, как люди усваивают правила, описывающие категории, допуская при этом нечеткость как в выводах, так и в самих правилах.

Байесовский подход также позволяет нам рассматривать более глубокие виды информации, которую мы включаем в свои знания о категориях. Например, мы можем описать причинно-следственные связи между признаками объектов, влияющие на то, как они используются при категоризации. Птицы умеют летать, потому что у них есть крылья. Если вы видите вдали летящее животное, знание о том, что оно умеет летать, служит подсказкой, что это может быть птица. Но если вы видите животное на земле и замечаете, что у него есть крылья, знание о том, умеет ли оно летать, уже не так информативно. Подобные причинно-следственные связи порождают зависимости между признаками, которые можно зафиксировать с помощью байесовских сетей (см. рисунок 13.5).

Рисунок 13.5. Байесовская сеть, отражающая тот факт, что полет зависит от наличия крыльев, поэтому новость о том, что животное умеет летать, не несет информации о том, является ли оно птицей, если вы уже знаете, что у него есть крылья.

В более общем смысле мы можем связать категории с любым генеративным процессом, который порождает распределение вероятностей по объектам. Например, категория деревьев охватывает огромное разнообразие объектов — от крошечных саженцев до высочайших секвой. Мы могли бы попытаться определить это распределение через изменчивость высоты и ширины, но гораздо естественнее признать, что деревья растут. То, как растут деревья, предсказуемо — они становятся выше и шире, обзаводясь ветвями и листьями; это генеративный процесс, который мы можем описать. Мы можем представить, что совершаем случайное число шагов, и на каждом шаге к дереву добавляются новые ветви и листья. Таким образом, мы можем определить распределения вероятностей, отражающие глубокие, абстрактные знания о том, что такое деревья, и использовать эту информацию для их распознавания.

Конечно, здесь возникает новый вопрос: как люди определяют, какой именно генеративный процесс хорошо описывает ту или иную категорию? Эту проблему тоже можно решить с помощью байесовского вывода. Чарльз Кемп, тоже австралиец, ныне работающий в Мельбурнском университете, решил эту задачу во время учебы в аспирантуре, работая совместно с Джошем Тененбаумом. Кемп и Тененбаум показали, что различные гипотезы о структуре распределения можно описать с помощью генеративных моделей того типа, который ввел Перл, а правило Байеса можно использовать для вывода верной структуры. Их подход позволял выявить, что судей Верховного суда США лучше всего представить в виде точек на прямой, отражающей их политические взгляды, цвета, различающиеся по оттенку, — в двумерном пространстве, а свойства животных лучше всего описываются таксономическим деревом.

Рассмотрение категорий с точки зрения распределений вероятностей — и лежащих в их основе структурированных генеративных процессов — дает нам более полный способ понять мышление. Категории — это не просто прототипы или линейные правила классификации. Это эффективные стратегии аппроксимации байесовского вывода для простейших видов категорий — тех, которые можно описать, используя только независимые признаки. Но в целом, когда мы пытаемся понять, как интерпретировать то, чего мы никогда раньше не видели, мы используем гипотезы, которые включают в себя логические правила, учитывают причинно-следственные связи и опираются на информацию о том, как вещи меняются со временем. Байесовский подход позволяет нам зафиксировать эти знания в форме сложных генеративных процессов. В более широком смысле он позволяет нам описывать модели, которые человеческий разум строит для окружающего мира. И не только человеческий — но и разум мыслящих организмов в любой точке Вселенной.

Предыдущая главаГлава 15 из 34Следующая глава