К книге
Законы мышления: В поисках математической теории разума12 Вероятность — это новая логика.
41%
12 Вероятность — это новая логика.
14

Логика и нейронные сети — это две нити, тянущиеся сквозь время, каждая из которых соответствует своему подходу к осмыслению разума. Теория вероятностей — третья нить, тесно переплетенная с обеими первыми. Многие мыслители, с которыми мы познакомились в предыдущих главах, проявляли интерес к вероятности, пытались ли они понять разум через правила и символы или же через сети, пространства и признаки. Лейбниц, Буль, Тьюринг, Минский, Тверски, Румельхарт, Хинтон и Макклелланд — все они бились над вероятностью и использовали ее в своих поисках Законов Мышления. На самом деле, хотя книга Буля «Исследование законов мышления» известна своим вкладом в логику, вся ее вторая половина была посвящена вероятности.

Но что есть вероятность?

Не слишком заботясь о том, что именно это означает, мы часто говорим о вероятностях тех или иных событий, имея в виду нечто вроде их склонности происходить. Вероятности можно приписать исходам подбрасывания монеты или броска игральных костей. Но их также можно присвоить прогнозам дождя, шансам получить работу при подаче резюме или просто событиям, в которых мы не уверены. Мы обновляем эти вероятности по мере получения новой информации — стоит нам взглянуть в окно или получить обнадеживающее электронное письмо. Выяснение правил, по которым должно работать подобное вероятностное мышление, было задачей не менее сложной, чем определение правил логики. А превращение вероятностей в практический инструмент изучения разума оказалось еще более трудной задачей, которая не была решена вплоть до конца XX века.

Понимание того, как работает вероятность, поможет нам связать воедино различные идеи, с которыми мы сталкивались до сих пор, и ответит на многие из оставшихся вопросов. Вероятностное рассуждение расширяет логику; его можно использовать, чтобы понять, почему нейронные сети ведут себя именно так, как они ведут себя. Оно открывает путь к объединению сильных сторон этих двух подходов и дает возможность подумать о том, как найти между ними компромисс. Этот путь приведет нас к новому способу понимания сходства, категорий и языка, а также подскажет, как анализировать разум на всех трех уровнях Марра.

Но сначала нам нужно четко уяснить, что означает вероятность.

Два вида вероятности

Теория вероятностей родилась из броска игральных костей. Джироламо Кардано, родившийся в Павии (Италия) в 1501 году, прожил необычайно яркую жизнь. Он был математиком, врачом, астрологом, влиятельным автором... и заядлым игроком. В автобиографии он признавался, что предавался азартным играм на протяжении нескольких десятилетий «и не просто каждый год, но — говорю об этом со стыдом — каждый день, теряя при этом разум, средства и время». Но очевидно, что Кардано обретал способность мыслить вновь, стоило ему отойти от игрового стола: его как математика завораживали игральные кости. Существовал ли способ рассчитать вероятности различных исходов, чтобы руководствоваться ими при игре? Кардано прилежно высчитывал подходящие ставки для различных исходов при игре с несколькими костями.

Первым шагом в решении Кардано было определение вероятности того, что кости дадут определенный результат. Кардано вывел простое правило для расчета этой вероятности: подсчитать количество способов получения благоприятного исхода и разделить его на общее число возможных исходов. Именно так нас часто учат вычислять вероятности в школе. Вероятность каждого исхода в итоге оказывается числом от 0 до 1, причем сумма вероятностей всех исходов равна 1.

Труд Кардано о вероятностях был опубликован лишь в 1663 году, почти через сто лет после его смерти. Тем временем другие ученые уже приняли вызов по созданию математической теории вероятностей. И снова их вдохновила задача, связанная с азартными играми...

Блез Паскаль был математическим вундеркиндом, по-видимому, вопреки усилиям своего отца. Его сестра, Жильберта, писала в биографии Паскаля, что их отец беспокоился, как бы занятия математикой не заставили сына пренебречь другими важными предметами, и не подпускал его к этой науке. Паскаль, не пав духом, в возрасте двенадцати лет самостоятельно открыл основные геометрические законы. Этого оказалось достаточно, чтобы отец смягчился. К шестнадцати годам Блез доказал новую теорему о конических сечениях, а к восемнадцати изобрел новый тип механического калькулятора (предшественника того, что позже изобрел Лейбниц).

Не теряя интереса к математике, Паскаль начал открывать для себя светскую жизнь и отправился в путешествие в компании Антуана Гомбо, шевалье де Мере. Шевалье интересовался и математикой, и азартными играми, и в 1654 году предложил Паскалю задачу о том, как разделить банк между двумя игроками, если игра была прервана до ее завершения. Например, если цель состояла в том, чтобы подбрасывать монету до тех пор, пока кто-то не наберет в общей сложности шесть орлов, и у одного игрока уже выпало пять орлов, а у другого только один, кажется очевидным, что тот, кто лидирует, должен получить большую долю банка.

Это была непростая задача — над ней математики, включая Кардано, размышляли более ста лет. Паскаль вел по этому вопросу переписку с Пьером де Ферма, который сегодня наиболее известен благодаря своей Великой теореме. В ходе этой переписки они решили задачу, попутно заложив основы современной теории вероятностей.

Однако Паскаль знаменит и другим применением теории вероятностей. Позднее, в том же 1654 году, он пережил глубокое религиозное озарение — уверовав, что предстал перед Богом, — и отрекся от математики. Тем не менее, размышления о религии вновь привели его к теории вероятностей. В своем пресловутом рассуждении, опубликованном в «Мыслях» в 1670 году, он представил выбор — верить или не верить в Бога — в виде пари. Если Бог существует, то выигрыш потенциально бесконечен — в виде вечной загробной жизни. Если же Его нет, мы ничего не приобретаем. Вера в Его существование имеет лишь конечную цену — цену одной благочестивой жизни. А значит, верить рационально — до тех пор, пока вероятность существования Бога хоть немного превышает нуль.

В рассуждении Паскаля неявно присутствует мысль о том, что существованию Бога можно приписать определенную вероятность. Преподобный Джон Уилкинс — создатель «Реального характера», о котором говорилось в главе 1, — прибегнул к аналогичному призыву к вероятности в своем доказательстве бытия Бога, основанном на упорядоченности Вселенной. Поскольку разумно устроенная Вселенная не могла бы существовать без всемогущего Творца, Уилкинс утверждал, что существование Бога — наиболее вероятное объяснение: «Во всех обычных жизненных делах люди привыкли руководствоваться следующим правилом: склоняться к тому, что наиболее вероятно и правдоподобно, когда они не могут достичь ясной и несомненной уверенности». Давид Юм также обращался к вероятности в контексте религиозной веры. Как и следовало ожидать, он использовал ее в гораздо более скептическом ключе — чтобы подвергнуть сомнению любые выводы, которые можно сделать из рассказов о чудесах. Юм писал: «Когда кто-либо говорит мне, что видел, как мертвый воскрес, я тотчас же спрашиваю себя, что более вероятно: то, что этот человек обманывает или обманут, или же то, что событие, о котором он рассказывает, действительно произошло? [...] Если ложность его свидетельства была бы еще более чудесной, нежели событие, о котором он рассказывает, тогда — и не раньше — он может претендовать на мою веру или мое мнение».

Паскаль, Уилкинс и Юм использовали вероятность не для того, чтобы рассуждать о шансах выпадения того или иного числа на игральных костях, а как способ описания степени уверенности — убежденности, связанной с тем или иным выводом. Этот нюанс может показаться незначительным, но на самом деле это радикальный шаг. Он открывает возможность того, что конкретная математическая система — та самая, что используется для описания результатов бросания костей, — способна отразить один из аспектов человеческого мышления. В частности, отсюда следует, что теория вероятностей может описывать, как люди рассуждают в условиях неопределенности. Это делает ее естественным дополнением к логике, которая указывает нам, как приходить к однозначно достоверным выводам.

Эта связь между вероятностью и логикой не укрылась от проницательного ума Лейбница. Благодаря своим математическим работам по комбинаторике он хорошо умел вычислять, сколькими способами могут быть достигнуты различные исходы, и уже в возрасте девятнадцати лет писал о присвоении дробных степеней уверенности судебным делам. Более того, существует мнение, что Лейбниц рассматривал вероятность как «новый вид логики» и видел в ней компонент той системы логического вывода, которую пытался разработать во время работы над всеобщей характеристикой.

Как и в случае с логикой, Лейбниц так и не разработал математическую теорию, которую можно было бы использовать для описания вероятностных рассуждений. Эта проблема была решена в XVIII веке британским священником и французским математиком — преподобным Томасом Байесом и маркизом Пьером-Симоном Лапласом. Байес размышлял о том, как человек, наблюдающий за лотереей, должен корректировать свои предположения о вероятности выигрыша на основе количества уже зафиксированных побед и поражений. Заметки, сделанные Байесом по этому поводу, после его смерти отредактировал его друг сэр Роберт Прайс, который и представил их Королевскому обществу в 1763 году. Лаплас независимо подошел к той же проблеме десять лет спустя, решил ее и внес множество других вкладов в развитие теории вероятностей. Сегодня мы называем этот тип рассуждений в условиях неопределенности байесовским выводом. (Чтобы вам не было обидно за Лапласа, стоит упомянуть, что его решение исходной задачи Байеса известно как закон Лапласа, да и вообще его именем названо множество других вещей, включая преобразование Лапласа, лапласиан, уравнение Лапласа, ряд Лапласа и даже демона Лапласа.)

При использовании для характеристики степени уверенности вероятность представляет собой точно такой же математический объект, какой применяется для описания азартных игр: число от 0 до 1, причем сумма вероятностей всех возможных исходов равна 1. Однако в контексте убеждений это число указывает на степень правдоподобности, которую человек приписывает одному из возможных миров как истинному. Сумма вероятностей равна 1, потому что у нас есть всего одна единица уверенности, которую мы распределяем между этими возможными мирами: если какая-то возможность получает вероятность 1, то она становится достоверной. Мы можем рассуждать с помощью вероятностей, пересчитывая шансы, приписываемые каждому возможному миру, по мере получения новой информации. Что крайне важно, такой подход дает нам способ решения индуктивных задач.

Чтобы рассмотреть простой пример, вернемся к выводу, сделанному месье Дюпеном в главе 5:

Если бы преступником был орангутан, то он мог бы взобраться к окну

Преступник взобрался к окну

Преступником был орангутан

Впервые обсуждая это умозаключение, я отмечал, что в нем используется аргумент, который в логике считается ошибочным — подтверждение консеквента. В общем виде это выглядит так:

P → Q Q P

Но кажется, что иногда — как, возможно, в случае с Дюпеном — подобный довод разумен. Теория вероятностей объясняет почему.

Вот снова таблица истинности для P, Q и P → Q, где числа обозначают различные возможные миры:

Если вы помните, причина, по которой этот аргумент логически некорректен, заключается в том, что если и P → Q, и Q истинны, то P может быть как истинным, так и ложным (мы можем находиться в мире 1 или в мире 3). Поэтому мы не можем с уверенностью знать, что P истинно.

Чтобы использовать в этих условиях вероятностные рассуждения, мы введем новый инструмент: сопоставим каждому возможному миру — каждой строке таблицы — определенную вероятность (числа от 0 до 1, сумма которых по всем возможным мирам равна 1). Вот пример:

В этом примере мир, в котором и P, и Q ложны, с наибольшей вероятностью является истинным (мир 4, с вероятностью 0,8), но также существуют возможные миры, в которых оба утверждения истинны (мир 1, вероятность 0,15) или P ложно, а Q истинно (мир 3, вероятность 0,05). Я уже учел тот факт, что нам известно, что P → Q истинно, присвоив вероятность 0 тому миру, где оно ложно.

Эти вероятности можно использовать для ответа на вопросы о мире, в котором мы находимся. Например, если мы хотим узнать вероятность того, что P истинно, мы можем сложить вероятности, приписанные тем мирам, в которых P истинно (номера 1 и 2). В данном случае эта вероятность равна 0,15 + 0 = 0,15. Аналогично, вероятность того, что Q истинно, составляет 0,15 + 0,05 = 0,2.

Теперь, если мы обнаружим, что Q на самом деле истинно, это сузит круг миров, в которых мы можем находиться. В частности, это исключает мир, где и P, и Q ложны (мир 4). Нам нужно обновить наши убеждения с учетом этой информации, присвоив миру 4 вероятность 0. Но теперь сумма наших вероятностей больше не равна 1. Чтобы исправить это, мы разделим вероятности оставшихся миров на их сумму, в данном случае на 0,2. Таким образом, мир 1 получает вероятность 0,15/0,2 = 0,75, а мир 2 получает вероятность 0,05/0,2 = 0,25. Наши обновленные вероятности выглядят следующим образом:

И теперь мы снова можем вычислить вероятность того, что P истинно, сложив вероятности первых двух миров: 0,75 + 0 = 0,75. Тот факт, что Q оказалось истинным, существенно повысил вероятность того, что P истинно, увеличив ее с 0,15 до целых 0,75.

Довольно этих P и Q, давайте вернемся к орангутанам. Этот анализ — в рамках которого мы присваиваем вероятности возможным мирам, а затем обновляем эти вероятности по мере получения данных — кажется отличным способом обосновать вывод Дюпена. Тот факт, что преступник взобрался к окну, не делает логически неопровержимым то, что им был орангутан. Но он повышает эту вероятность. Такое умозаключение имеет смысл!

Но чтобы все это заработало, нам сначала пришлось присвоить вероятности возможным мирам. Что произойдет, если мы изменим эти вероятности? Вот еще один набор вероятностей, который мы могли бы выбрать:

Если вы пройдете ту же последовательность шагов, то сможете убедиться, что вероятность P здесь также равна 0,15, но после того, как вы обнаружите, что Q истинно, и обновите вероятности, вероятность P составит... около 0,158 (на самом деле она равна 0,15/0,95 = 3/19). При таком распределении вероятностей по возможным мирам наблюдение Q мало что нам сообщает. Таким образом, сила нашего индуктивного умозаключения напрямую зависит от того, как именно распределены вероятности. Числа, которые я выбрал в первом примере, довольно хорошо соответствуют предположениям Дюпена: весьма маловероятно, что преступником окажется орангутан (что P истинно), но если бы им был он, то он гарантированно смог бы взобраться к окну (поэтому Q должно быть истинным). Преступник-человек гораздо более вероятен, но вряд ли он сможет добраться до окна. Во втором наборе вероятностей то, что преступником является орангутан, по-прежнему маловероятно, но человек в роли преступника почти всегда мог бы добраться до окна. В этой ситуации наблюдение того факта, что преступник умел хорошо лазать, становится гораздо менее информативным.

Эти примеры отчасти объясняют, почему сформулировать теорию индукции гораздо сложнее, чем теорию дедукции. Чтобы делать выводы с полной уверенностью, нам важно лишь то, какие миры возможны. Когда же мы имеем дело с неопределенностью, нам необходимо знать вероятности, приписанные каждому возможному миру. Эти вероятности теснейшим образом связаны с семантикой ситуации — с тем, чему на самом деле соответствуют такие утверждения, как P и Q. Способности орангутанов и пригодность громоотводов для лазания — это важнейшие детали, когда мы пытаемся оценить, насколько вероятен тот или иной гипотетический мир. Как следствие этой чувствительности к частностям, мы не можем просто записать схему рассуждения, которая будет работать для любого индуктивного вывода исключительно на основе его синтаксиса. Нам нужно достаточно информации, чтобы оценить соответствующие вероятности.

Прежде чем двигаться дальше, я хочу показать еще одну связь между вероятностью и логикой. До сих пор мы концентрировались на рассуждении, которое логически некорректно, поскольку не дает стопроцентной уверенности. В таком контексте теория вероятностей позволяет понять, как нам следует обновлять свои недостоверные убеждения. Но что произойдет, если мы применим тот же подход к анализу аргумента, который является логически корректным?

Давайте возьмем тот же набор возможных миров и те же вероятности, что и в моем первом примере:

Теперь давайте посмотрим, что произойдет, если мы обновим наши убеждения, обнаружив, что P истинно, как в классическом корректном логическом рассуждении — modus ponens:

P → Q Q P

Наблюдение P означает, что только те миры, в которых P истинно, могут иметь ненулевую вероятность, поэтому мирам 3 и 4 присваивается вероятность 0. Фактически, ненулевую вероятность имеет только один мир: мир 1. Поскольку сумма вероятностей по всем возможным мирам должна быть равна 1, этот мир теперь имеет вероятность 1. Чтобы вычислить вероятность того, что Q истинно, мы складываем вероятности всех миров, в которых Q истинно. И вновь перед нами всего один мир, и у этого мира вероятность равна 1, так что вероятность того, что Q истинно, тоже равна 1. Таким образом, мы можем сделать вывод, что Q истинно с абсолютной уверенностью.

И это не просто совпадение — совершенно не важно, как именно мы распределяем вероятности по возможным мирам, главное, чтобы мир 1 имел ненулевую вероятность (то есть чтобы мы заранее не знали о ¬P), а мир 2 имел нулевую вероятность (поскольку мы знаем, что утверждение P → Q истинно). Наблюдение P в итоге всегда будет давать вероятность 1 для Q. То же самое верно для любого корректного логического аргумента: если аргумент удовлетворяет правилам логики, он удовлетворяет и теории вероятностей. Так что в некотором важном смысле теория вероятностей действительно является новой логикой. Теория вероятностей расширяет логику, соглашаясь с ней во всех однозначных случаях и подсказывая, как мыслить в ситуациях неопределенности.

Как я покажу далее в этой главе, теория вероятностей к тому же довольно контринтуитивна. Прежде чем читать дальше, я бы рекомендовал убедиться, что вы хорошо поняли все, о чем шла речь в этом разделе. Я собираюсь представить несколько инструментов, облегчающих рассуждения о вероятностях, но важно освоиться с самой идеей сопоставления чисел возможным мирам и тем, как эти числа обновляются по мере получения новой информации. Если вы просто разберете эти примеры с карандашом и бумагой в руках, это поможет вам развить интуитивное понимание того, как работать с неопределенностью.

Понимание индукции

Томас Байес не просто предположил, что вероятности можно использовать для выражения и обновления степени уверенности. Он доказал теорему, которая дает нам простое правило для описания этого процесса. Правило Байеса позволяет глубже понять индуктивный вывод и начать отвечать на вопросы о том, почему для одних выводов (и одних алгоритмов обучения) требуется больше данных, чем для других.

В истории статистики Байес — фигура довольно туманная: при жизни он не стремился к публичности, поэтому в его биографии присутствует вполне уместная неопределенность. Например, историк статистики Стивен Стиглер оценивает вероятность того, что Байес родился в 1701 году, в 0,8. Достоверно известно одно: он был сыном пастора-нонконформиста (то есть христианина, не разделявшего догматы англиканской церкви). Из-за такого происхождения Байес не имел права учиться в английских университетах, таких как Оксфорд и Кембридж, и вместо этого отправился в Эдинбургский университет изучать математику и богословие. Прослужив какое-то время помощником в лондонской часовне своего отца, он возглавил собственный приход в Танбридж-Уэллсе, где и провел остаток жизни.

Помимо своей основной работы священником, Байес продолжал заниматься математикой. В 1736 году он опубликовал работу, защищающую ньютоновское исчисление от критики ирландского философа Джорджа Беркли, что, по всей видимости, и послужило толчком к его избранию членом Королевского общества в 1742 году. При жизни он не публиковал трудов по теории вероятностей, но в своем завещании назначил Ричарда Прайса своим душеприказчиком по литературным делам. Когда в 1761 году Байес умер, Прайс нашел рукопись об обновлении степени уверенности, тщательно ее отредактировал, написал подробное введение и представил Королевскому обществу.

Почему склонный к математике священник заинтересовался теорией вероятностей? Как и многое в его жизни, мотивы Байеса остаются неизвестными. Однако есть некоторые зацепки, объясняющие, почему Прайс счел эти идеи столь важными, что, в свою очередь, может пролить свет на то, что привело к этой теме самого Байеса. Во-первых, хотя статья, представленная Прайсом, в итоге была опубликована под названием «Опыт решения задачи в доктрине шансов», ее первоначальное название звучало как «Метод вычисления точной вероятности всех выводов, основанных на индукции». Во-вторых, в своих последующих богословских трудах Прайс использовал разработанные Байесом вероятностные аргументы, пытаясь опровергнуть скептический аргумент Юма против чудес (в частности, указывая на то, что показания нескольких независимых свидетелей потенциально могут служить веским доказательством). Эти подсказки намекают (индуктивно!), что сам Байес, возможно, стремился дать математическое обоснование индукции в качестве ответа Юму.

В своей работе Байес предложил как общее правило для обновления вероятностей на основе новых свидетельств, так и конкретное применение этого правила к задаче оценки шансов на выигрыш в лотерею. В центре нашего внимания здесь будет именно общее правило. (Если вам интересно, мы с Брайаном Кристианом обсуждаем частное применение этого правила в главе 6 книги Алгоритмы для жизни.) Чтобы представить правило Байеса, я вернусь к умозаключению Дюпена и сформулирую его так, чтобы его связь с логикой была менее очевидной, но само умозаключение легче обобщалось на другие виды индуктивных выводов.

Умозаключение Дюпена можно переосмыслить в терминах гипотез, которые он рассматривал (что преступником был орангутан или человек), и данных, на которые он опирался (что преступник взобрался по громоотводу). Используя этот язык гипотез и данных, мы можем переписать нашу таблицу вероятностей следующим образом:

Все, что я сделал здесь, — заменил истинностные значения P и Q более ясными утверждениями о соответствующих гипотезах и данных.

Определение того, каковы наши гипотезы, помогает яснее понять цель этого индуктивного вывода: обновить степень нашей уверенности в этих гипотезах на основе имеющихся данных. Мы можем вычислить вероятность конкретной гипотезы — например, того, что преступником был орангутан, — сложив вероятности соответствующих возможных миров, как и прежде. Я буду записывать эти вероятности с помощью P(), так что P(орангутан) — это вероятность того, что преступником является орангутан, которая равна 0,15 + 0 = 0,15. Она называется априорной вероятностью, поскольку это вероятность гипотезы до того, как мы увидим какие-либо данные.

Но на самом деле мы хотим знать, какова должна быть степень нашей уверенности в каждой гипотезе после того, как мы увидим данные, — это значение известно как апостериорная вероятность. Если наши данные заключаются в том, что преступник взобрался по громоотводу, мы можем записать эту вероятность как P(орангутан|взобрался), где символ | посередине следует читать как «при условии». Таким образом, это вероятность того, что преступником был орангутан, при условии, что он взобрался по громоотводу. Такой вид вероятности называется условной вероятностью, так как это вероятность наступления события при определенных условиях.

Процедура, которую мы использовали для обновления вероятностей в предыдущем разделе, подсказывает нам, как рассчитать эту условную вероятность: мы берем вероятность возможного мира, в котором истинны и гипотеза, и данные, и делим ее на сумму вероятностей всех возможных миров, в которых истинны данные. Эта сумма соответствует вероятности данных. В данном случае мы будем делить P(орангутан, взобрался) = 0,15 на P(взобрался) = 0,15 + 0,05 = 0,2.

Если мы запишем это в виде формулы, она будет выглядеть так:

P(орангутан ∣ взобрался ) =  P(орангутан , взобрался ) P(взобрался )

Вы можете убедиться, что подстановка соответствующих чисел в формулу дает P(орангутан|взобрался) = 0,15/0,2 = 0,75, точно так же, как и в предыдущем разделе. Таким образом, наблюдение того, что преступник взобрался по громоотводу, переносит нас от априорной вероятности 0,15 того, что это орангутан, к апостериорной вероятности 0,75.

Мы можем сделать еще один шаг в выражении связи между априорной и апостериорной вероятностями. Вероятность возможного мира P(орангутан, взобрался) может быть записана как произведение двух частей: вероятности того, что преступником был орангутан, P(орангутан), и вероятности того, что преступник мог взобраться по громоотводу при условии, что он был орангутаном, P(взобрался|орангутан). Чтобы рассчитать эту вторую условную вероятность, мы просто используем ту же формулу, но меняем местами исходы, используемые в вероятностях:

P(взобрался ∣орангутан )= P(орангутан, взобрался ) P(орангутан )

В данном конкретном случае орангутан всегда успешно взбирается по громоотводу, поэтому P(взобрался|орангутан) = 1. Однако человек в роли преступника справился бы хуже: P(взобрался|человек) = 0,05/0,85 = 1/17. Именно эта разница — то, что P(взобрался|орангутан) намного больше, чем P(взобрался|человек), — позволяет наблюдению за тем, как преступник взобрался по громоотводу, столь сильно сместить апостериорную вероятность в сторону того, что преступником был орангутан.

Если переписать P(орангутан, взобрался) таким образом, наша формула обновления уверенности примет следующий вид:

P(орангутан ∣взобрался )= P(взобрался ∣орангутан )×P(орангутан ) P(взобрался )

Это показывает, что апостериорная вероятность гипотезы равна произведению априорной вероятности на вероятность данных при условии этой гипотезы, деленному на вероятность данных. Записав это для обобщенных гипотезы и данных вместо орангутанов и громоотводов, мы получим:

P(гипотеза ∣данные )= P(данные ∣гипотеза )×P(гипотеза ) P(данные )

Эта формула обновления степени уверенности — для вычисления апостериорных вероятностей — и есть правило Байеса. Член P(данные|гипотеза), обозначающий вероятность увидеть эти данные, если бы гипотеза была верна, называется правдоподобием.

Правило Байеса дает точно такие же результаты, как и процедура обновления уверенности, которую мы рассмотрели в предыдущем разделе, однако выражение этой процедуры в терминах гипотез и данных и связывание априорной и апостериорной вероятностей с помощью простой формулы дает нам еще более эффективный инструмент для понимания индуктивного вывода. Теперь мы можем вернуться к индуктивным задачам, с которыми мы столкнулись в главе 5, — усвоению языка, формированию категорий, интерпретации изображений и распознаванию речи — и представить их как задачи байесовского вывода.

В усвоении языка — в частности, синтаксиса — гипотезами выступают различные грамматики, а данными — высказывания на этом языке. Априорная вероятность гипотезы отражает индуктивные предвзятости обучающегося: грамматику с более высокой априорной вероятностью будет легче усвоить, и для этого потребуется меньше свидетельств из данных. Таким образом, сильные врожденные ограничения того типа, что рассматривал Хомский, можно выразить через априорные вероятности, приписывающие высокую вероятность относительно небольшому числу возможных грамматик. Однако способность справляться с неопределенностью — а значит, отсутствие ограничений логической проблемой усвоения языка — открывает путь для других возможностей, к чему мы вскоре вернемся в главе 14.

Формирование категорий легко выразить на языке байесовского вывода: гипотезы соответствуют возможным категориям, а данные — наблюдаемым примерам. По мере поступления каждого нового примера обучающийся может обновлять апостериорную вероятность этих гипотез. Здесь априорное распределение выражает ожидания обучающегося относительно формы категорий, и, опять же, усвоение гипотез с более низкой априорной вероятностью потребует более убедительных данных — гипотезы вида «Белый ˅ Квадрат» будут иметь более низкую априорную вероятность, чем «Черный ˄ Круг».

При зрительном восприятии наша цель состоит в том, чтобы сделать вывод о трехмерной структуре окружающего нас мира на основе паттернов света, попадающих на нашу сетчатку. В этом случае наши априорные вероятности приписываются различным конфигурациям мира, данными являются эти паттерны света, а правдоподобие P(данные|гипотеза) отражает, насколько вероятно, что мы увидим именно этот паттерн света, если бы мир действительно имел определенную конфигурацию. Двусмысленные изображения — подобные тому, что показано на рисунке 5.1, — находят идеальный баланс между априорной вероятностью и правдоподобием, так что в итоге мы получаем несколько гипотез со схожими апостериорными вероятностями.

Наконец, при восприятии речи наши гипотезы касаются слов, которые мы слышим, а данными служат звуки, достигающие нашей барабанной перепонки. В этом случае априорная вероятность слова должна отражать то, насколько часто оно встречается в нашем языке. Из этого следует, что ошибки более вероятны для менее распространенных слов. Это вполне подтверждается нашими примерами: люди, вероятно, чаще сталкиваются со словосочетанием «поцелуй этого парня» (kiss this guy), чем «поцелуй небо» (kiss the sky), фразой «в контейнерах» (in containers) чаще, чем «артисты» (entertainers), и словом «Старбакс» (Starbucks) чаще, чем «обреченные» (star-crossed).

Но формула Байеса полезна не только для осмысления этих индуктивных задач. Она также может помочь нам ответить на вопрос, почему одни индуктивные выводы требуют больше данных, чем другие.

Почему достаточно одного случая

Формула Байеса гласит, что на нашу степень уверенности в гипотезе должны влиять всего две вещи: наша априорная уверенность в этой гипотезе и свидетельства, предоставляемые наблюдаемыми данными. По сути, мы можем переписать формулу Байеса, чтобы сделать это еще более очевидным:

P(гипотеза ∣ данные) = P(данные ∣ гипотеза) P(данные) × P(гипотеза)

Все, что я сделал, — это вынес априорную вероятность P(гипотеза) за пределы дроби, чтобы показать, что апостериорная вероятность — это просто априорная вероятность, умноженная на то, насколько вероятны наблюдаемые данные при условии истинности гипотезы, по сравнению с тем, насколько вероятны эти данные в целом. Это отношение отражает свидетельство, которое данные предоставляют в пользу гипотезы.

Понимание того, что эти два фактора — априорная вероятность и свидетельство, предоставляемое данными, — это всё, что должно определять индуктивный вывод, дает нам инструмент для понимания того, почему одни индуктивные выводы требуют меньше данных, чем другие. Если вернуться к одному из примеров Нельсона Гудмена из главы 5, наблюдение за тем, что кусок меди проводит электричество, может заставить нас поверить, что медь в целом проводит электричество, но наблюдение за тем, что кто-то в комнате является третьим сыном, не приведет нас к выводу, что каждый в этой комнате — третий сын. Оба этих наблюдения высоковероятны при условии истинности соответствующей гипотезы, поэтому P(данные|гипотеза) велико: если медь проводит электричество, то вероятность того, что данный кусок меди проводит электричество, равна 1; если каждый в комнате является третьим сыном, то вероятность того, что этот конкретный человек — третий сын, равна 1. Обнаружение вещей, проводящих электричество, может быть более редким событием, чем встреча с третьими сыновьями, поэтому, возможно, P(данные) для случая с медью немного ниже, но отношение P(данные|гипотеза) к P(данные) должно быть высоким для обоих наблюдений, и, таким образом, они оба предоставляют свидетельства в пользу соответствующих гипотез. Ключевое различие заключается в априорных вероятностях этих двух гипотез: мы приписываем гораздо более высокую априорную вероятность тому, что какой-то вид металла проводит электричество, нежели тому, что комната полна третьих сыновей. Если априорная вероятность достаточно высока, одного-единственного наблюдения оказывается достаточно, чтобы поднять апостериорную вероятность до уровня, на котором мы признаем гипотезу правдоподобной.

Хороший способ показать, что разница кроется именно в априорной вероятности, — это рассмотреть, что происходит по мере накопления доказательств. Не то чтобы нас в принципе невозможно было убедить в том, что все в комнате — третьи сыновья: первый встреченный нами третий сын не вызывает удивления, второй кажется любопытным совпадением, третий — подозрительным, а к четвертому или пятому мы вполне можем поверить, что присутствуем на Ежегодном собрании Общества третьих сыновей. Происходит следующее: каждое новое наблюдение согласуется с этой гипотезой, но становится все менее вероятным в рамках альтернативных гипотез, поэтому отношение P(данные|гипотеза) к P(данные) становится все больше и больше. В конце концов этого оказывается достаточно, чтобы перевесить низкую априорную вероятность данной гипотезы.

Это объяснение на языке априорных вероятностей согласуется с решением загадки, предложенным самим Гудменом. Гудмен утверждал, что индукция опирается на сверхгипотезы, которые сообщают нам о том, какие типы гипотез являются правдоподобными целями для индуктивного обобщения. Он не формализовал эту идею, но если выразить ее в терминах байесовского вывода, то сверхгипотезы — это знания, которые повышают априорную вероятность одних гипотез по сравнению с другими.

Таким образом, формула Байеса дает нам инструмент для ответа на вопрос, поставленный Джоном Стюартом Миллем: почему в некоторых случаях одного-единственного примера достаточно для полной индукции? Потому что этот пример представляет собой данные, которые служат сильным свидетельством в пользу этой гипотезы, а сама гипотеза обладает достаточно высокой априорной вероятностью, чтобы в итоге и апостериорная вероятность оказалась высокой. Это закладывает основу для исследовательской программы по изучению индуктивного вывода у человека: картирования априорных вероятностей, отражающих индуктивные предвзятости, которые направляют человеческое мышление.

Формула Байеса также дает нам инструмент для ответа на наш вопрос о нейронных сетях: почему им требуется так много данных для обучения? Каждую конфигурацию весов нейросети можно рассматривать как отдельную гипотезу об отображении входов в выходы. Сила нейросетей отчасти заключается в том, что они способны рассматривать огромное количество таких гипотез — одну и ту же нейросеть можно использовать для изучения отображений, соответствующих самым разным задачам, будь то задачи в области языка, зрения или в других сферах. Однако за эту гибкость приходится платить. При столь большом количестве альтернативных гипотез априорная вероятность, приписываемая каждой из них, будет низкой, поскольку сумма этих вероятностей должна быть равна 1. Как следствие, для того чтобы убедиться в истинности какой-то конкретной гипотезы, потребуется огромное количество данных.

Это важное наблюдение: способность обучаться множеству вещей дается ценой необходимости в большем объеме данных для освоения каждой из них. Подобно тому как в физике существует закон сохранения импульса, формула Байеса предполагает закон сохранения обучения: наличие всего лишь одной единицы априорной вероятности, которую необходимо распределить по всем гипотезам, доступным для рассмотрения обучающимся, означает, что те, кто рассматривает меньшее количество гипотез, в среднем будут приписывать более высокую априорную вероятность любой конкретной гипотезе.

Важно отметить, что то, как мы используем здесь формулу Байеса — как для искусственных нейросетей, так и для людей, — находится именно на вычислительном уровне Марра. Я не утверждаю, что нейросети или люди действительно просчитывают формулу Байеса каждый раз, когда чему-то учатся. Но поскольку она описывает идеальный способ решения индуктивных задач, мы можем использовать формулу Байеса для понимания различных типов систем, которым приходится эти задачи решать. Подобно тому как птицам вовсе не нужно решать уравнения Навье — Стокса всякий раз, когда они машут крыльями, чтобы аэродинамика помогала нам понять птичий полет, нейронным сетям — естественным или искусственным — не требуется явным образом осуществлять байесовский вывод, чтобы он оставался полезным инструментом для понимания индуктивного вывода.

Пессимизм в отношении теории вероятностей

Хотя когнитивная революция и продемонстрировала силу систем правил и символов, она также побудила психологов исследовать теорию вероятностей в качестве объяснения человеческого мышления. Уорд Эдвардс, чьи статьи о принятии решений вдохновили Амоса Тверски на поступление в аспирантуру, проводил эксперименты по вероятностному мышлению людей. В них казалось, что люди корректировали свои убеждения таким образом, который в целом соответствовал формуле Байеса. Последующие эксперименты подтвердили этот вывод, а в одной влиятельной статье, опубликованной в 1960-х годах, люди и вовсе объявлялись хорошими интуитивными статистиками, пусть и обновляющими свои убеждения несколько медленнее, чем хотелось бы самому Байесу, — «консервативными байесовцами».

Но когда в 1969 году Тверски представил эту работу на семинаре своего коллеги Даниэля Канемана в Еврейском университете, это положило начало сотрудничеству, которое в значительной степени подорвет представление о том, что теорию вероятностей можно использовать для понимания человеческого разума.

Канеман родился в Тель-Авиве, но первые годы жизни провел в Париже. Его семья бежала после оккупации Парижа во время Второй мировой войны, и в ходе этого бегства его отец скончался. После войны Канеман с матерью переехали в Иерусалим, где у них оставались родственники. Затем он изучал психологию и математику в Еврейском университете в Иерусалиме, после чего служил в израильской армии, где недолго командовал взводом, пока его не перевели в армейское психологическое подразделение. Там он разработал тест, который использовался для определения способностей новобранцев. Он получил стипендию от Еврейского университета для поездки за границу для получения докторской степени и выбрал Беркли. Канеман защитил диссертацию в 1961 году под руководством Сьюзан Эрвин (с которой мы встречались в главе 10). Затем он вернулся в Израиль, чтобы преподавать в Еврейском университете, но с 1965 по 1967 год имел возможность провести длительное время в Мичиганском и Гарвардском университетах, общаясь с Джеромом Брунером и Джорджем Миллером в Центре когнитивных исследований. Когда он пригласил Тверски выступить на своем семинаре, он и представить себе не мог, что это даст старт новой исследовательской программе для них обоих.

Канеман относился с глубоким скептицизмом к тому, что люди совершают нечто похожее на байесовский вывод. Вместе с Тверски они принялись развенчивать идею о том, что люди могут рассуждать в соответствии с теорией вероятностей. Как и в случае с критикой пространственных представлений со стороны Тверски, эта работа была сосредоточена на выявлении принципов теории вероятностей и последующем конструировании хитроумных примеров, показывающих, как люди нарушают эти принципы. Результатом этой исследовательской программы, растянувшейся на два десятилетия, стали десятки статей, а также Нобелевская премия и бестселлер «Думай медленно… решай быстро», поэтому я остановлюсь лишь на некоторых наиболее ярких примерах.

Одним из первых вопросов, над которыми работали Канеман и Тверски, были интуитивные представления людей о случайности. Рассмотрим следующий вопрос:

В некоем городе опросили все семьи с шестью детьми. В семидесяти двух семьях точный порядок рождения девочек и мальчиков оказался следующим: Д М Д М М Д.

Как по-вашему, в каком количестве из опрошенных семей точный порядок рождения детей был именно М Д М М М М?

Как вы думаете?

Когда Канеман и Тверски задали этот вопрос студентам, семьдесят пять из девяноста двух сочли вторую последовательность рождения менее вероятной. Но на самом деле, если вероятность рождения мальчика и девочки одинакова, обе последовательности равновероятны. Интуитивные представления людей о случайности почему-то завели их не туда.

В одной из последующих статей Канеман и Тверски открыто бросили вызов байесовскому выводу. Они предлагали участникам эксперимента прочитать описания людей, а затем определить, кем те, скорее всего, работают — юристами или инженерами. Вот пример такого описания:

Джеку сорок пять лет. Он женат, у него четверо детей. В целом он консервативен, осторожен и честолюбив. Он не проявляет никакого интереса к политическим и общественным вопросам, а большую часть свободного времени посвящает своим многочисленным хобби, среди которых столярные работы по дому, парусный спорт и математические головоломки.

Трюк заключался в том, что половине участников, читавших эти описания, сказали, будто они были выбраны из группы, состоящей из тридцати инженеров и семидесяти юристов, а другой половине — что они были взяты из группы в семьдесят инженеров и тридцать юристов.

С точки зрения формулы Байеса, описание — это данные, а гипотезы — это профессии юриста или инженера. Информация о том, сколько юристов и инженеров находится в выборке, должна использоваться для определения априорной вероятности. Даже при наличии сильных доказательств в пользу того, что человек может быть юристом или инженером, эти априорные вероятности должны сдвигать суждения людей в ту или иную сторону. Канеман и Тверски обнаружили, что люди были гораздо менее чувствительны к этим априорным вероятностям, чем следовало бы: их суждения, по всей видимости, основывались главным образом на самих описаниях.

И наконец, в одном из самых известных примеров нарушения теории вероятностей Канеман и Тверски показали, что люди выносят суждения, противоречащие базовой идее о том, что вероятности распределяются по различным возможным мирам. Рассмотрим следующее описание:

Линде тридцать один год, она не замужем, прямолинейна и очень умна. В университете изучала философию. Будучи студенткой, она была глубоко обеспокоена вопросами дискриминации и социальной справедливости, а также участвовала в антиядерных демонстрациях.

Пожалуйста, отметьте наиболее вероятный вариант:

□ Линда — кассир в банке.

□ Линда — кассир в банке и активная участница феминистского движения.

Вы можете подумать над своим ответом.

Когда этот вопрос задали группе студентов, 85 процентов из них сочли более вероятным, что Линда — кассир в банке и активная участница феминистского движения. Но это нарушает базовый принцип теории вероятностей. Если «кассир в банке» и «феминистка» — это наши высказывания, то возможные миры будут выглядеть следующим образом:

Вероятность того, что Линда одновременно является кассиром в банке и феминисткой, — это вероятность мира 1. Вероятность того, что она кассир в банке, равна сумме вероятностей миров 1 и 2, и, следовательно, может быть только больше или равна вероятности мира 1. Не существует способа приписать вероятности возможным мирам так, чтобы это согласовывалось с интуицией людей.

Эти результаты кажутся сокрушительными для идеи о том, что мы можем использовать теорию вероятностей для объяснения индуктивных умозаключений людей. Как выразились Канеман и Тверски: «Человек, по-видимому, не является консервативным байесовцем — он вообще не байесовец».

Подобно тому как работа Минского и Пейперта охладила энтузиазм по отношению к перцептронам, исследования Канемана и Тверски снизили интерес к использованию теории вероятностей для понимания человеческого познания. Потребовалось больше десяти лет, прежде чем психологи смогли привести убедительные аргументы в пользу байесовской вероятности как компонента Законов Мышления.

Предыдущая главаГлава 14 из 34Следующая глава