Сценарий 1: Барри — известный геолог. Чарльз — четырнадцатилетний правонарушитель с длинным списком арестов и периодическими психотическими эпизодами. Барри безапелляционно заявляет Артуру некое контринтуитивное утверждение о горных породах, и Артур оценивает его вероятность в 90%. Затем Чарльз делает столь же контринтуитивное и безапелляционное заявление о горных породах, и Артур оценивает его вероятность в 10%. Очевидно, что Артур принимает во внимание авторитет говорящего, решая, верить ли его утверждениям.
Сценарий 2: Дэвид делает контринтуитивное заявление о физике и дает Артуру подробное объяснение аргументов, включая ссылки. Эрни делает столь же контринтуитивное заявление, но приводит неубедительный аргумент, требующий нескольких допущений на веру. И Дэвид, и Эрни утверждают, что это лучшее объяснение, которое они в принципе могут дать (кому бы то ни было, а не только Артуру). Артур присваивает утверждению Дэвида вероятность 90%, выслушав его объяснение, но присваивает лишь 10%-ную вероятность утверждению Эрни.
Может показаться, что эти два сценария примерно симметричны: оба предполагают учет полезных свидетельств — будь то сильный авторитет против слабого или сильный аргумент против слабого.
Но теперь предположим, что Артур просит Барри и Чарльза представить полные технические обоснования со ссылками; и что Барри и Чарльз представляют одинаково хорошие обоснования, а Артур проверяет ссылки, и они подтверждаются. Затем Артур спрашивает Дэвида и Эрни об их квалификации, и оказывается, что у Дэвида и Эрни примерно одинаковая квалификация — может быть, они оба клоуны, а может, оба физики.
Если предположить, что Артур обладает достаточными знаниями, чтобы понять все технические аргументы (иначе они для него — просто впечатляющий шум), то кажется, что Артур должен видеть у Дэвида огромное преимущество в правдоподобности перед Эрни, в то время как преимущество Барри перед Чарльзом будет в лучшем случае незначительным.
В самом деле, если технические аргументы достаточно хороши, преимущество Барри перед Чарльзом, возможно, даже не стоит учитывать. Хороший технический аргумент — это тот, который устраняет необходимость полагаться на личный авторитет говорящего.
Точно так же, если мы действительно верим Эрни, что приведенный им аргумент — это лучший аргумент, который он мог предоставить, и что он включает в себя все логические шаги, которые проделал Эрни, и все подтверждения, которые он принял во внимание (включая ссылки на любые авторитеты, к которым сам Эрни мог прислушиваться), тогда мы можем практически проигнорировать любую информацию о квалификации Эрни. Эрни может быть физиком или клоуном, это не должно иметь значения. (Опять же, это предполагает, что у нас достаточно технических способностей, чтобы разобраться в аргументе. В противном случае Эрни просто произносит мистические слоги, и то, «верим» ли мы этим слогам, в значительной степени зависит от его авторитета.)
Таким образом, между аргументом и авторитетом, похоже, существует асимметрия. Если нам известен авторитет, нам всё ещё интересно услышать аргументы; но если мы полностью знаем аргументы, из авторитета нам уже почти нечего почерпнуть.
Очевидно (говорит новичок), авторитет и аргумент — это принципиально разные виды свидетельств, и эту разницу невозможно объяснить с помощью скучно-чистых методов байесовской теории вероятностей. Ведь хотя сила свидетельств — 90% против 10% — в обоих случаях одинакова, при объединении они ведут себя по-разному. Как мы это объясним?
Вот половина технической демонстрации того, как представить эту разницу в теории вероятностей. (Остальное вы можете принять под мой личный авторитет или посмотреть в источниках).
Если P(H|E1) = 90% и P(H|E2) = 9%, какова вероятность P(H|E1,E2)? Если, узнав, что E1 истинно, мы присваиваем H вероятность 90%, а узнав, что истинно E2, — вероятность 9%, то какую вероятность нам следует присвоить H, если мы узнаем, что истинны оба события E1 и E2? Исходя из предоставленной информации, это просто невозможно вычислить средствами теории вероятностей. Нет, недостающая информация — это не априорная вероятность H. События E1 и E2 могут не быть независимыми друг от друга.
Предположим, что H означает «Мой тротуар скользкий», E1 — «Мой разбрызгиватель работает», а E2 — «Сейчас ночь». Тротуар становится скользким через минуту после включения разбрызгивателя и остается таким, пока он не выключится, а сам разбрызгиватель работает десять минут. Таким образом, если мы знаем, что разбрызгиватель включен, вероятность того, что тротуар скользкий, равна 90%. Разбрызгиватель работает в течение 10% ночного времени, поэтому если мы знаем, что сейчас ночь, вероятность того, что тротуар скользкий, составляет 9%. Если же мы знаем, что сейчас ночь и разбрызгиватель включен — то есть знаем оба факта, — вероятность того, что тротуар скользкий, составляет 90%.
Мы можем представить это в виде графической модели следующим образом:
То, ночь сейчас или нет, служит причиной включения или выключения Разбрызгивателя, а то, включен ли Разбрызгиватель, служит причиной того, будет ли тротуар Скользким или Нескользким.
Направление стрелок имеет значение. Представим, что у нас было бы так:
Это означало бы, что если бы я не знал ничего о разбрызгивателе, вероятности Ночи и Скользкости были бы независимы друг от друга. Например, предположим, что я бросаю Кость Один и Кость Два и складываю выпавшие числа, чтобы получить Сумму:
Если вы не назовете мне сумму двух чисел, но сообщите, что на первой кости выпало 6, это пока ничего не скажет мне о результате на второй кости. Но если вы теперь также скажете, что сумма равна 7, я буду знать, что на второй кости выпала 1.
Выяснение того, когда различные элементы информации зависимы или независимы друг от друга при тех или иных фоновых знаниях, на самом деле оказывается весьма технической темой. Книги, которые стоит прочесть, — это работа Джуды Перла «Вероятностные рассуждения в интеллектуальных системах: сети правдоподобного вывода»1 и «Причинность: модели, рассуждения и выводы».2 (Если у вас есть время прочесть только одну книгу, прочтите первую.)
Если вы умеете читать причинно-следственные графы, то вы посмотрите на граф бросков костей и сразу увидите:
P(Кость 1, Кость 2) = P(Кость 1) × P(Кость 2)
P(Кость 1, Кость 2|Сумма) ≠ P(Кость 1|Сумма) × P(Кость 2|Сумма)
Если вы посмотрите на правильную диаграмму с тротуаром, то увидите такие факты, как:
P(Скользкий|Ночь) ≠ P(Скользкий)
P(Скользкий|Разбрызгиватель) ≠ P(Скользкий)
P(Скользкий|Ночь, Разбрызгиватель) = P(Скользкий|Разбрызгиватель).
То есть вероятность того, что тротуар Скользкий при наличии информации о Разбрызгивателе и о Ночи, совпадает с вероятностью, которую мы бы приписали, знай мы только о Разбрызгивателе. Знание о Разбрызгивателе делает знание о Ночи несущественным для выводов о Скользкости.
Это явление называется экранированием, а критерий, позволяющий считывать подобную условную независимость с каузальных графов, известен как D-разделение.
Для случая аргументов и авторитета причинно-следственная диаграмма выглядит следующим образом:
Если нечто истинно, то в его пользу, как правило, находятся аргументы, и поэтому эксперты наблюдают эти свидетельства и меняют свое мнение. (В теории!)
Если мы видим, что эксперт во что-то верит, мы делаем обратный вывод о существовании неких абстрактных свидетельств (даже если не знаем в точности, каковы они), а из существования этих абстрактных свидетельств мы заключаем об истинности утверждения.
Но если нам известно значение узла «Аргумент», это D-разделяет узел «Истина» и узел «Вера эксперта», блокируя все пути между ними в соответствии с определенными техническими критериями «блокирования путей», которые в данном случае кажутся довольно очевидными. Таким образом, даже не сверяясь с точным распределением вероятностей, мы можем считать по графу, что:
P(истина|аргумент, эксперт) = P(истина|аргумент).
Это не противоречит обычной теории вероятностей. Это просто более компактный способ выражения определенных вероятностных фактов. Те же равенства и неравенства можно было бы считать непосредственно из обычного распределения вероятностей — но «на глазок» заметить их было бы труднее. Авторитету и аргументу не требуются два разных вида вероятности — так же, как разбрызгиватели не сделаны из какой-то онтологически иной материи, нежели солнечный свет.
На практике вы никогда не сможете полностью перестать полагаться на авторитет. Признанные авторитеты с большей вероятностью знают о существующих контраргументах, которые следует принять во внимание; менее авторитетные специалисты знают об этом с меньшей вероятностью, что делает их аргументы менее надежными. Этот фактор невозможно устранить просто за счет ознакомления со свидетельствами, которые они действительно учли.
Кроме того, аргументы крайне сложно свести к чистой математике; в противном же случае оценка силы логического шага может опираться на интуицию, которую невозможно воспроизвести без тех же тридцати лет опыта.
Есть неустранимая правомерность в том, чтобы приписывать чуть более высокую вероятность словам Э. Т. Джейнса о байесовской вероятности, нежели аналогичному утверждению Элиезера Юдковского. Пятьдесят лет дополнительного опыта не должны иметь буквально нулевой вес.
Но этот перевес авторитета имеет силу лишь ceteris paribus, и его легко могут перевесить более сильные аргументы. Я обнаружил небольшую ошибку в одной из книг Джейнса — потому что алгебра бьет авторитет.
*
1. Перл, Probabilistic Reasoning in Intelligent Systems.
2. Джуда Перл, Causality: Models, Reasoning, and Inference, 2nd ed. (New York: Cambridge University Press, 2009).