Когда я был еще маленьким мальчиком, мой отец, физик с докторской степенью, строго предупредил меня, чтобы я не совался в дела физиков; он говорил, что пытаться понять физику без формального математического аппарата — дело безнадежное. И точка. Никаких лазеек. Но в научно-популярных книгах Фейнмана я прочел, что если ты действительно понимаешь физику, то должен быть в состоянии объяснить ее неспециалисту. Я поверил Фейнману, а не отцу, потому что Фейнман получил Нобелевскую премию, а мой отец — нет.
Лишь позже — собственно, когда я читал «Фейнмановские лекции» — я понял, что отец открыл мне простую и чистую правду. Нет математики — нет физики.
По призванию я байесианец, а не физик. И хотя меня воспитывали в убеждении, что в дела физиков соваться не стоит, меня вынудило к этому периодическое грубое злоупотребление тремя понятиями: «простой», «фальсифицируемый» и «проверяемый».
Предыдущее вступление нужно для того, чтобы вы не рассмеялись и не сказали: «Конечно же, я знаю, что значат эти слова!» Здесь есть математика. То, что последует далее, будет изложением идей из эссе «Вера в подразумеваемое невидимое» в их применении к квантовой физике.
Начнем с замечания, которое и вывело меня на этот путь; я встречал его в нескольких версиях, и в вольном пересказе оно звучит так:
Многомировая интерпретация квантовой механики постулирует существование огромного множества других миров, существующих параллельно с нашим. Бритва Оккама гласит, что мы не должны множить сущности без необходимости.
Справедливости ради стоит отметить, что те, кто так утверждает, обычно признают:
Но это не общепринятое применение Бритвы Оккама; некоторые говорят, что Бритва Оккама должна применяться к законам, управляющим моделью, а не к числу объектов внутри нее.
Так что это здорово, что мы все признаем противоположные аргументы и выслушиваем обе стороны —
Но предположим, что вам нужно вычислить простоту теории.
Оригинальная формулировка Уильяма Оккама гласила:
Lex parsimoniae: Entia non sunt multiplicanda praeter necessitatem.
«Закон экономии: сущности не следует множить без необходимости».
Но это качественное соображение. Недостаточно сказать, кажется ли одна теория проще или сложнее другой — нужно присвоить число; и это число должно иметь смысл, его нельзя просто выдумать. Преодоление этого разрыва подобно переходу от способности определять на глаз, какие вещи движутся «быстро», а какие «медленно», к измерению и вычислению скоростей.
Предположим, вы попытаетесь сказать: «Посчитайте слова — вот насколько сложна теория».
Роберт Хайнлайн однажды заявил (надеюсь, в шутку), что «самое простое объяснение» — всегда такое: «Женщина в конце улицы — ведьма; это она сделала». Одиннадцать слов — мало какая статья по физике побьет этот рекорд.
Столкнувшись с этой проблемой, можно пойти двумя путями.
Во-первых, можно спросить: «Женщина в конце улицы — кто?» То, что в языке есть одно слово для обозначения какого-то понятия, еще не значит, что само это понятие простое. Представьте, что вы разговариваете с инопланетянами, которые ничего не знают ни о ведьмах, ни о женщинах, ни об улицах. Сколько времени уйдет у вас на то, чтобы объяснить им вашу теорию? А еще лучше: представьте, что вам нужно написать компьютерную программу, которая воплощает вашу гипотезу и выдает то, что вы называете предсказаниями вашей гипотезы, — какого размера должна быть эта программа? Допустим, ваша задача — предсказать временной ряд измеренных положений камня, катящегося с холма. Если вы напишете подпрограмму, моделирующую ведьм, это вряд ли поможет точнее определить, куда покатится камень, — лишняя подпрограмма лишь раздует ваш код. С другой стороны, вы можете обнаружить, что ваш код обязательно должен содержать подпрограмму для возведения чисел в квадрат.
Во-вторых, можно спросить: «Женщина в конце улицы — ведьма; она сделала что?» Представьте, что вы хотите описать некое событие настолько точно, насколько это возможно при имеющихся у вас данных, — опять же, допустим, временной ряд расстояний для катящегося с холма камня. Вы можете начать свое объяснение со слов «Женщина в конце улицы — ведьма», но ваш друг спросит: «И что же она сделала?», а вы ответите: «Она сделала так, что камень укатился на один метр за первую секунду, на девять метров за третью секунду...» Добавление фразы «Женщина в конце улицы — ведьма» в начало вашего сообщения никак не помогает сжать остальную часть описания. В итоге вы просто отправляете более длинное сообщение, чем нужно, — логичнее было бы просто отбросить вступление про «ведьму». С другой стороны, если вы потратите немного времени на рассказ о Галилее, вы сможете значительно сжать следующие пять тысяч подробных временных рядов для катящихся с холмов камней.
Если вы пойдете первым путем, то придете к тому, что называется колмогоровской сложностью и соломоновской индукцией. Если пойдете вторым путем — придете к принципу минимальной длины описания.
Ага, значит, я могу выбирать определение простоты на свой вкус?
Нет, на самом деле эквивалентность этих двух формализмов в их наиболее развитых формах была доказана.
И теперь, надо полагать, вы собираетесь сказать мне, что оба формализма сходятся на том, что «Оккам велит считать законы, а не объекты».
Более-менее так. В принципе минимальной длины описания, пока вы можете дать другу точный рецепт, которому тот может мысленно следовать для получения временного ряда катящегося камня, нас не волнует, сколько умственных усилий потребуется для выполнения этого рецепта. В соломоновской индукции мы считаем биты в программном коде, а не биты оперативной памяти, используемые программой во время работы. «Сущности» здесь — это строки кода, а не моделируемые объекты. И, как уже было сказано, в конечном счете эти два формализма эквивалентны.
Но прежде чем я перейду к более подробному разбору формальной простоты, позвольте мне отвлечься и рассмотреть возражение:
И что с того? Почему я не могу просто изобрести свой собственный формализм, который работает иначе? С какой стати мне вообще обращать внимание на то, как вы там у себя в области решили вести дела? Есть ли у вас какие-нибудь экспериментальные доказательства того, что я должен поступать именно так?
Да, вообще-то есть, хотите верьте, хотите нет. Но позвольте мне начать с самого начала.
Правило конъюнкции в теории вероятностей гласит:
P(X,Y) ≤ P(X).
Для любых утверждений X и Y вероятность того, что «истинно X и истинно Y», меньше или равна вероятности того, что «истинно X (вне зависимости от того, истинно ли Y)». (Если это утверждение кажется вам не слишком глубокомысленным, уверяю вас: легко найти случаи, когда люди, оценивающие вероятности, нарушают это правило.)
Обычно вы не можете применить правило конъюнкции P(X,Y) ≤ P(X) напрямую к конфликту между взаимоисключающими гипотезами. Правило конъюнкции применяется напрямую только к тем случаям, когда левая часть строго влечет за собой правую часть. Кроме того, конъюнкция — это всего лишь неравенство; она не дает нам тех количественных расчетов, которые нам нужны.
Но правило конъюнкции дает нам правило монотонного убывания вероятности: по мере того как вы добавляете к истории всё больше деталей, каждая из которых потенциально может быть истинной или ложной, вероятность истории монотонно снижается. Представьте вероятность как сохраняющуюся величину: её запас ограничен. По мере роста числа деталей в истории количество возможных историй растет экспоненциально, но сумма их вероятностей никогда не может превысить 1. Для каждой истории «X и Y» существует история «X и ¬Y». Когда вы просто рассказываете историю «X», вы можете просуммировать по возможностям Y и ¬Y.
Если вы добавите к X десять деталей, каждая из которых потенциально может быть истинной или ложной, то вашей истории придется конкурировать за драгоценную вероятность с 210 - 1 другими столь же детализированными историями. Если же, с другой стороны, достаточно просто сказать X, вы можете просуммировать свою вероятность по 210 историям:
((X и Y и Z и . . .) или (X и ¬Y и Z и . . .) или . . .).
«Сущности», подсчитываемые бритвой Оккама, должны по отдельности дорого обходиться с точки зрения вероятности; именно поэтому мы предпочитаем теории, содержащие меньше таких сущностей.
Представьте лотерею, в которой продается до миллиона билетов, где каждый из возможных билетов продается только один раз, и к моменту розыгрыша проданы абсолютно все билеты. Ваш друг купил один билет за 1 доллар — что кажется вам плохим вложением, ведь выигрыш составляет всего 500 000 долларов. Но друг говорит: «Да, но рассмотри альтернативные гипотезы: „Завтра кто-то выиграет в лотерею“ и „Завтра я выиграю в лотерею“. Очевидно, что вторая гипотеза проще по бритве Оккама; в ней упоминаются лишь один человек и один билет, тогда как первая гипотеза сложнее: она упоминает миллион человек и миллион билетов!»
Говорить, что бритва Оккама считает только законы, а не объекты, не совсем верно: против теории говорят те сущности, которые она вынуждена упоминать явно, поскольку это те самые сущности, которые нельзя просуммировать. Предположим, вы с другом ломаете голову над удивительным бильярдным ударом: вам известно начальное состояние стола и то, какие шары забиты, но не то, как именно был сделан удар. Вы предлагаете теорию, включающую десять конкретных столкновений между десятью конкретными шарами; ваш друг возражает теорией, включающей пять конкретных столкновений между пятью конкретными шарами. Против ваших теорий говорят не только законы, которые, как вы утверждаете, управляют бильярдными шарами, но и любые конкретные шары, которые должны были находиться в каком-то определенном состоянии, чтобы предсказание вашей модели оказалось верным.
Если вы измерили температуру в гостиной и она составила 22° Цельсия, бессмысленно заявлять: «Твой термометр, скорее всего, ошибается; гораздо более вероятно, что в комнате 20° C. Ведь если рассмотреть все частицы в комнате, то при температуре 22° C количество состояний, которые они могут занимать, экспоненциально больше — а значит, любое конкретное состояние становится еще менее вероятным». Но в каком бы именно из состояний при 22° C ни находилась ваша комната, вы всё равно можете сделать то же самое предсказание (для подавляющего большинства таких состояний), что термометр в итоге покажет 22° C, а значит, вы не чувствительны к точным начальным условиям. Вам не нужно указывать точное положение всех молекул воздуха в комнате, так что это не играет против вероятности вашего объяснения.
С другой стороны — возвращаясь к примеру с лотереей, — предположим, ваш друг выиграл десять лотерей подряд. В этот момент вам стоит заподозрить, что всё подстроено. Гипотеза «Мой друг выигрывает в лотерею каждый раз» сложнее гипотезы «Кто-то выигрывает в лотерею каждый раз». Однако первая гипотеза предсказывает данные гораздо точнее.
В формализме минимальной длины описания фраза «Есть один человек, который каждый раз выигрывает в лотерею» в самом начале вашего сообщения сжимает описание того, кто выиграл следующие десять лотерей; чтобы закончить сообщение, вам достаточно просто сказать: «И этот человек — Фред Смит». Сравните это с: «Первую лотерею выиграл Фред Смит, вторую лотерею выиграл Фред Смит, третью лотерею...»
В формализме соломоновской индукции априорная вероятность гипотезы «Мой друг выигрывает в лотерею каждый раз» мала, поскольку программе, описывающей лотерею, теперь требуется явный код, выделяющий вашего друга; однако, поскольку эта программа способна выдать более узкое распределение вероятностей для потенциальных победителей лотереи, чем гипотеза «Кто-то выигрывает в лотерею каждый раз», она может — по правилу Байеса — преодолеть свою априорную маловероятность и победить в качестве гипотезы.
Любая формальная теория Бритвы Оккама должна количественно определять не только «сущности» и «простоту», но и саму «необходимость».
Минимальная длина описания определяет необходимость как «то, что сжимает сообщение».
Соломоновская индукция присваивает априорную вероятность каждой возможной компьютерной программе, при этом сумма всего распределения по всем возможным компьютерным программам не превышает 1. Этого можно достичь, используя двоичный код, в котором ни одна корректная компьютерная программа не является префиксом другой корректной компьютерной программы («беспрефиксный код») — например, за счёт использования стоп-кода. Тогда априорная вероятность любой программы P равна просто 2-L(P), где L(P) — длина P в битах.
Сама программа P может принимать на вход строку битов (возможно, нулевой длины) и выдавать условную вероятность того, что следующий бит будет равен 1; это делает P распределением вероятностей на множестве всех двоичных последовательностей. Данная версия соломоновской индукции для любой строки даёт нам смесь апостериорных вероятностей, в которой доминируют кратчайшие программы, наиболее точно предсказывающие эту строку. Суммирование по этой смеси даёт нам предсказание для следующего бита.
Суть в том, что для обоснования более сложных гипотез требуется больше байесовских свидетельств — больше успешных предсказаний или более точные предсказания. Но это вполне реально; бремя априорной маловероятности не бесконечно. Если вы подбросите монету четыре раза, и каждый раз будет выпадать орёл, вы не сделаете сразу вывод, что у этой монеты всегда выпадает только орёл. Но если орёл выпадет двадцать раз подряд, вам стоит отнестись к этому крайне серьёзно. А как насчёт гипотезы о том, что монета подстроена так, чтобы выдавать ОРРОРР... в виде повторяющегося цикла? Это звучит куда более странно, но после сотни бросков только глупец станет это отрицать.
Обычная химия утверждает, что в одном грамме газообразного водорода содержится шестьсот миллиардов триллионов атомов водорода. Это поразительное утверждение, но набралось достаточно свидетельств, чтобы убедить физиков вообще и вас в частности в его истинности.
А теперь спросите себя, сколько свидетельств потребовалось бы, чтобы убедить вас в истинности теории, содержащей шестьсот миллиардов триллионов отдельно сформулированных физических законов.
Почему же априорная вероятность программы в соломоновском формализме не включает в себя оценку того, сколько оперативной памяти она использует или каково её общее время работы?
Простой ответ таков: «Потому что пространственные и временные ресурсы, используемые программой, не являются взаимоисключающими возможностями». Это не спецификация программы, которая в каждом конкретном месте может содержать только 1 или 0.
Но ещё более простой ответ звучит так: «Потому что, если судить по истории науки, эта эвристика не работает».
Бритву Оккама приводили в качестве возражения против гипотезы о том, что туманности на самом деле являются далекими галактиками — казалось, это колоссально увеличивает количество сущностей во Вселенной. Все эти звёзды!
Снова и снова в истории человечества Вселенная становилась всё больше. Вариант Бритвы Оккама, который в каждом подобном случае помечал бы более обширную Вселенную как менее вероятную, показал бы себя гораздо хуже с точки зрения исторического опыта человечества.
Это часть тех самых «экспериментальных свидетельств», на которые я намекал ранее. Хотя теории простоты можно обосновать соображениями математического толка, желательно также, чтобы они действительно работали на практике. (Другая часть «экспериментальных свидетельств» исходит от статистиков, специалистов по компьютерным наукам и исследователей искусственного интеллекта, которые проверяют, какие именно определения «простоты» позволяют создавать компьютерные программы, эмпирически успешно предсказывающие будущие данные на основе прошлых. Вероятно, парадигма минимальной длины описания оказалась здесь наиболее продуктивной, поскольку она предлагает очень гибкий способ размышления о реальных проблемах.)
Представьте себе космический корабль, запуск которого вы наблюдаете с огромной помпой; он ускоряется, удаляясь от вас, и вскоре летит со скоростью 0,9c. Если расширение Вселенной продолжится — как считает современная космология, — наступит момент, когда, согласно вашей модели реальности, вы не сможете взаимодействовать с этим кораблем даже в принципе: он пересечёт космологический горизонт относительно вас, и испускаемые им фотоны уже не смогут обогнать расширение Вселенной.
Должны ли вы верить, что космический корабль буквально, физически исчезает из Вселенной в тот момент, когда пересекает космологический горизонт относительно вас?
Если вы считаете, что Бритва Оккама подсчитывает количество объектов в модели, то да, должны. Как только корабль пересекает ваш космологический горизонт, модель, в которой он мгновенно исчезает, и модель, в которой он продолжает лететь дальше, дают неразличимые предсказания; ни одна из них не имеет байесовского доказательного преимущества перед другой. Однако одна модель содержит гораздо меньше «сущностей»: ей не нужно говорить обо всех кварках, электронах и полях, из которых состоит корабль. Следовательно, проще предположить, что корабль исчезает.
С другой стороны, вы можете сказать: «В ходе многочисленных экспериментов я вывел определённые законы, управляющие наблюдаемыми частицами. Космический корабль состоит из таких частиц. Применяя эти законы, я делаю вывод, что корабль должен продолжать движение после пересечения космологического горизонта с тем же импульсом и той же энергией, что и прежде, иначе нарушатся законы сохранения, которые, насколько я мог судить, соблюдаются во всех поддающихся проверке случаях. Чтобы предположить, будто корабль исчезает, мне пришлось бы добавить новый закон: „Вещи исчезают, как только пересекают мой космологический горизонт“».
Декогерентная (она же многомировая) версия квантовой механики утверждает, что измерения подчиняются тем же квантовомеханическим правилам, что и все остальные физические процессы. Применяя эти правила к макроскопическим объектам точно так же, как к микроскопическим, мы получаем наблюдателей в состоянии суперпозиции. Здесь возникает множество вопросов, например: «Но почему тогда все бинарные квантовые измерения не кажутся имеющими вероятность 50/50, раз разные версии нас видят оба исхода?»
Однако возражение, будто декогеренция нарушает Бритву Оккама за счёт умножения объектов в модели, попросту неверно.
Декогеренция не требует, чтобы волновая функция принимала какое-то сложное точное начальное состояние. Многомировая интерпретация не задаёт все свои миры вручную, а генерирует их с помощью компактных законов квантовой механики. Компьютерная программа, напрямую симулирующая квантовую механику для получения экспериментальных прогнозов, потребовала бы огромного объёма оперативной памяти — но симуляция волновой функции экспоненциально затратна в любой версии квантовой механики! Декогеренция — просто в ещё большей степени. Многие физические открытия в истории человечества, от звёзд до галактик, от атомов до квантовой механики, колоссально увеличили кажущуюся вычислительную нагрузку того, что мы считаем Вселенной.
Многомировая интерпретация не становится сложнее от того, что в ней целый зиллион миров, так же как и атомная гипотеза не усложняется из-за зиллиона атомов. Для каждого, кто понимает Бритву Оккама количественно, слово «сложный» означает совершенно не это.
Как и в историческом случае с галактиками, возможно, люди приняли свой шок от мысли о столь огромной вселенной за штраф к вероятности и сослались в оправдание на Бритву Оккама. Но даже если для декогеренции и существуют штрафы к вероятности, огромность предполагаемой вселенной сама по себе определённо не является их источником!
Представление о том, что декогерентные миры — это дополнительные сущности, штрафуемые Бритвой Оккама, попросту ошибочно. Оно не «в какой-то мере верно». Это не аргумент, пусть и слабый, но всё же имеющий право на существование. Это не заслуживающая защиты позиция, которую можно было бы укрепить дальнейшими доводами. Оно совершенно несостоятельно с точки зрения теории вероятностей. Его не исправить. Это плохая математика. 2 + 2 = 3.
*