Стоит ли нам ожидать, что рациональность окажется `на каком-то уровне` простой? Должны ли мы искать и надеяться на `глубинную` красоту в искусстве формирования убеждений и выбора?
Позвольте мне начать обсуждение этого вопроса с жалобы покойного великого Мастера байесианства Э. Т. Джейнса:`1`
«Два медика-исследователя независимо друг от друга применяют одно и то же лечение в разных больницах. Ни один из них не опустился бы до фальсификации данных, но один заранее решил, что из-за ограниченности ресурсов остановится после лечения n = 100 пациентов, независимо от того, сколько выздоровлений будет зафиксировано к этому моменту. Другой поставил на кон свою репутацию ради доказательства эффективности лечения и решил, что не остановится, пока не получит данные, указывающие на показатель выздоровления явно выше 60%, сколько бы пациентов для этого ни потребовалось. Но фактически оба остановились, получив абсолютно одинаковые данные: n = 100 [пациентов], r = 70 [выздоровлений]. Должны ли мы в таком случае сделать разные выводы из их экспериментов?» [Предположительно, две контрольные группы также показали одинаковые результаты.]
`Cyan` отсылает нас к `главе 37` `великолепного учебника по статистике` Маккея, который можно бесплатно найти в сети, за более подробным разбором этой проблемы.`2`
Согласно старомодной статистической процедуре — которую, я полагаю, преподают и по сей день — эти два исследователя провели разные эксперименты с разными условиями остановки. Эти два эксперимента `могли` закончиться с разными данными, а следовательно, представляют собой разные проверки гипотезы, требующие разного статистического анализа. Вполне возможно, что первый эксперимент окажется «статистически значимым», а второй — нет.
Смущает вас это или нет, но это многое говорит о вашем отношении к теории вероятностей и, собственно, к самой рациональности.
Небайесовские статистики могут пожать плечами и сказать: «Ну, понимаете, не у всех статистических инструментов одинаковые сильные и слабые стороны — молоток не похож на отвёртку, — и если вы применяете разные статистические инструменты, вы можете получить разные результаты. Это как использовать одни и те же данные для вычисления линейной регрессии или для обучения регуляризованной нейросети. Нужно подбирать правильный инструмент для каждого случая. Жизнь вообще штука сложная...»
И вот что ответят байесианцы: «Это `вы` простите? Доказательная сила фиксированного экспериментального метода, давшего определённые данные, зависит от личных мыслей исследователя? И у вас хватает наглости обвинять `нас` в «излишней субъективности»?»
Если Природа устроена одним образом, то вероятность получить те данные, которые мы увидели, будет одной. Если Природа устроена иначе, вероятность получить такие данные будет другой. Но вероятность того, что определённое состояние Природы породит наблюдаемые нами данные, никак не связана с личными намерениями исследователя. Таким образом, какими бы ни были наши гипотезы о Природе, отношение правдоподобия в обоих экспериментах одинаково, доказательная сила одинакова, и апостериорная вероятность должна быть одинаковой. Чтобы эти два метода старой школы привели к разным ответам, по крайней мере один из них должен отбрасывать важную информацию — или просто выполнять неверный расчёт.
Древняя война между байесианцами и проклятыми частотниками тянется уже десятилетиями, и я не собираюсь пересказывать эту стародавнюю историю в данном эссе.
Но один из центральных конфликтов заключается в том, что байесианцы ждут от теории вероятностей... какое бы слово подобрать? «Стройности»? «Чистоты»? «Самосогласованности»?
Как говорит Джейнс, теоремы байесовской теории вероятностей — это именно `теоремы` в согласованной системе доказательств. Независимо от того, какие выводы и в каком порядке вы используете, результаты байесовской теории вероятностей всегда должны быть согласованными — каждая теорема совместима с любой другой теоремой.
Если вы хотите узнать сумму 10 + 10, вы можете представить её как (2 × 5) + (7 + 3) или как (2 × (4 + 6)), либо использовать любые другие `допустимые` приёмы, но результат всегда должен быть одним и тем же, в данном случае — 20. Если одним способом получается 20, а другим — 19, то вы можете сделать вывод, что по крайней мере в одном из случаев вы сделали нечто недопустимое. (В арифметике недопустимая операция — это обычно деление на ноль; в теории вероятностей это обычно бесконечность, которую не рассматривали как предел конечного процесса).
Если вы получили результат 19 = 20, хорошенько поищите ошибку, которую только что совершили, потому что маловероятно, что вы обратили в пепел саму арифметику. Если кому-либо когда-либо удастся вывести `настоящее` противоречие из байесовской теории вероятностей — скажем, две разные доказательные силы для одного и того же экспериментального метода, давшего одинаковые результаты, — тогда всё это здание обратится в прах. Вместе с теорией множеств, потому что я почти уверен, что в ZF можно построить модель теории вероятностей.
Математика! Вот то слово, которое я искал. Байесианцы ожидают, что теория вероятностей будет `математикой.` Именно поэтому мы интересуемся теоремой Кокса и её многочисленными расширениями, показывающими, что любое представление неопределённости, подчиняющееся определённым ограничениям, должно сводиться к теории вероятностей. Непротиворечивая математика — это здорово, но единственно возможная математика — ещё лучше.
И всё же... `должна ли` рациональность быть математикой? Вовсе не предрешено, что теория вероятностей должна быть красивой. Реальный мир запутан — так не нужны ли столь же запутанные рассуждения, чтобы с ним справляться? Возможно, небайесовские статистики с их огромной коллекцией ad hoc методов и ad hoc обоснований строго более компетентны, поскольку у них строго больший набор инструментов. Приятно, когда задачи чистые и аккуратные, но обычно это не так, и с этим приходится мириться.
В конце концов, общеизвестно, что байесовские методы нельзя использовать для решения многих задач, поскольку байесовские вычисления вычислительно нереализуемы.
Так почему бы не позволить расцветать множеству цветов? Почему бы не иметь в своём ящике больше одного инструмента?
Поиск законов — это не то же самое, что поиск особенно изящных и красивых инструментов. Второй закон термодинамики — это не какой-то особенно изящный и красивый холодильник.
Цикл Карно — это идеальный двигатель, собственно говоря, тот самый идеальный двигатель. Ни один двигатель, работающий от двух тепловых резервуаров, не может быть более эффективным, чем двигатель Карно. Как следствие, все термодинамически обратимые двигатели, работающие между одними и теми же тепловыми резервуарами, одинаково эффективны.
Но, разумеется, вы не можете использовать двигатель Карно, чтобы привести в движение настоящий автомобиль. Двигатель настоящего автомобиля похож на двигатель Карно примерно так же, как автомобильные шины — на идеальные катящиеся цилиндры.
Отсюда очевидно, что двигатель Карно — бесполезный инструмент для создания реального автомобиля. Второй закон термодинамики здесь, разумеется, неприменим. В реальном мире слишком сложно создать двигатель, который бы ему подчинялся. Просто забудьте о термодинамике — используйте то, что работает.
Именно такая путаница, на мой взгляд, царит в умах тех, кто всё ещё цепляется за старые догмы.
Нет, вы не всегда можете выполнить точный байесовский расчёт для конкретной задачи. Иногда приходится искать приближение — и даже очень часто. Но это не значит, что теория вероятностей перестала работать — точно так же, как ваша неспособность рассчитать аэродинамику «Боинга-747» на уровне отдельных атомов не означает, что самолёт состоит не из атомов. Какое бы приближение вы ни использовали, оно работает ровно в той степени, в какой приближается к идеальному байесовскому расчёту, и даёт сбой ровно в той степени, в какой от него отклоняется.
Доказательства согласованности и уникальности байесианства — палка о двух концах. Точно так же, как любой расчёт, подчиняющийся аксиомам согласованности Кокса (или любой из их многочисленных переформулировок и обобщений), должен проецироваться на вероятности, так и любой небайесовский метод неизбежно провалит один из тестов на согласованность. А это, в свою очередь, делает вас уязвимыми для таких наказаний, как «голландская книга» (принятие комбинаций ставок, ведущих к гарантированному проигрышу, или отклонение комбинаций ставок, ведущих к гарантированному выигрышу).
Возможно, вы не сможете вычислить оптимальный ответ. Но какое бы приближение вы ни использовали, и его успехи, и его неудачи будут объяснимы с точки зрения байесовской теории вероятностей. Вы можете не знать этого объяснения, но это не значит, что его не существует.
Итак, вы хотите использовать линейную регрессию вместо байесовского обновления? Но посмотрите на глубинную структуру линейной регрессии, и вы увидите, что она соответствует выбору наилучшей точечной оценки при гауссовской функции правдоподобия и равномерном априорном распределении параметров.
Хотите использовать регуляризованную линейную регрессию, потому что на практике она работает лучше? Что ж, это (как скажет байесианец) соответствует наличию гауссовского априорного распределения весов.
Иногда вы не можете использовать байесовские методы буквально — на самом деле, довольно часто. Но когда вы можете применить точный байесовский расчёт, учитывающий каждую крупицу доступных знаний, дело сделано. Вы никогда не найдёте статистического метода, который дал бы лучший ответ. Вы можете найти дешёвое приближение, которое отлично работает почти всегда, и оно действительно потребует меньше ресурсов, но оно не будет более точным. Разве только если этот другой метод использует знания — скажем, замаскированные под априорную информацию, — которые вы не включили в байесовский расчёт. Но если вы внесёте эту априорную информацию в байесовский расчёт, он снова покажет такой же или лучший результат.
Когда вы используете ad hoc статистический инструмент старой школы с таким же ad hoc обоснованием (хотя часто весьма интересным), вы никогда не знаете, не придумает ли завтра кто-нибудь ещё более хитрый инструмент. Но когда вы можете напрямую использовать расчёт, отражающий байесовский закон, вы у цели — это всё равно что умудриться поставить тепловой двигатель Карно в свой автомобиль. Это, как говорится, «байес-оптимально».
Мне кажется, что сторонники «ящика с инструментами» смотрят на последовательность кубов {1, 8, 27, 64, 125, ...}, указывают на первые разности {7, 19, 37, 61, ...} и говорят: «Смотрите, жизнь не всегда так проста — нужно приспосабливаться к обстоятельствам». А байесианцы указывают на третьи разности — лежащий в основе стабильный уровень {6, 6, 6, 6, 6, ...}. И критики возражают: «О чём вы вообще говорите? Тут 7, 19, 37, а не 6, 6, 6. Вы слишком упрощаете эту сложную проблему, вы слишком привязаны к простоте».
На поверхностном уровне всё не обязательно просто. Чтобы обнаружить стабильность, нужно погрузиться глубже.
Мыслите законами, а не инструментами. Необходимость вычислять приближения к закону не меняет сам закон. Самолёты всё ещё состоят из атомов, для них в природе нет специальных исключений, облегчающих аэродинамические расчёты. Приближение существует на карте, а не на территории. Вы можете знать второй закон термодинамики и при этом работать инженером, создающим несовершенный автомобильный двигатель. Второй закон не перестаёт действовать; ваше знание этого закона и циклов Карно помогает вам подобраться как можно ближе к идеальной эффективности.
Мы очарованы байесовскими методами вовсе не потому, что они красивы. Красота — это побочный эффект. Байесовские теоремы элегантны, согласованы, оптимальны и доказуемо уникальны именно потому, что они являются законами.
*
1. Эдвин Т. Джейнс, «Теория вероятностей как логика», в Maximum Entropy and Bayesian Methods, под ред. Пола Ф. Фужера (Springer Netherlands, 1990).
2. Дэвид Дж. К. Маккей, Information Theory, Inference, and Learning Algorithms (New York: Cambridge University Press, 2003).