Ваши друзья и коллеги постоянно говорят о чем-то под названием «теорема Байеса», или «правило Байеса», или о каком-то там байесовском мышлении. Причем говорят с большим энтузиазмом. Вы гуглите, находите веб-страницу о теореме Байеса и...
И видите формулу. И всё. Одну-единственную формулу. Страница, которую вы нашли, дает ей определение, но не объясняет, что это вообще такое, чем она полезна и почему ваши друзья так ею восторгаются. Выглядит как какая-то случайная статистическая штуковина.
Почему же математическое понятие вызывает такой странный восторг у тех, кто его изучает? Что это за так называемая «байесовская революция», которая сейчас охватывает науку и претендует на то, чтобы включить в себя даже сам экспериментальный метод в качестве частного случая? В чем секрет, который знают адепты Байеса? Что за свет они узрели?
Скоро вы узнаете. Скоро вы станете одним из нас.
Хотя в интернете и можно найти несколько объяснений теоремы Байеса, мой опыт знакомства людей с байесовским мышлением показывает, что эти объяснения слишком абстрактны. Байесовское мышление крайне контринтуитивно. Люди не применяют его интуитивно, им очень трудно научиться ему даже с преподавателем, и они быстро забывают байесовские методы, как только обучение заканчивается. Это в равной степени относится как к новичкам, так и к высококлассным профессионалам в своих областях. Судя по всему, байесовское мышление — одна из тех вещей (вроде квантовой механики или задачи выбора Уэйсона), которые человеку трудно постичь с помощью встроенных ментальных способностей.
По крайней мере, так утверждают. Здесь вы найдете попытку дать интуитивное объяснение байесовского мышления — предельно мягкое введение, задействующее все доступные человеку способы восприятия чисел: от естественных частот до пространственной визуализации. Моя цель — показать не абстрактные правила манипулирования числами, а то, что эти числа значат и почему правила именно таковы (и никакими другими быть не могут). Дочитав этот текст до конца, вы будете видеть байесовские задачи во сне.
И давайте начнем.
Вот текстовая задача о ситуации, с которой часто сталкиваются врачи:
У 1% женщин в возрасте сорока лет, проходящих плановое обследование, есть рак груди. У 80% женщин с раком груди маммография дает положительный результат. У 9,6% женщин без рака груди маммография также дает положительный результат. У женщины из этой возрастной группы при плановом обследовании маммография оказалась положительной. Какова вероятность того, что у нее действительно рак груди?
Как вам кажется, каков ответ? Если вы раньше не сталкивались с подобными задачами, пожалуйста, уделите минутку и подумайте над собственным ответом, прежде чем читать дальше.
А теперь представьте, что большинство врачей дают на эту задачу один и тот же неправильный ответ — обычно правильно отвечают лишь около 15% врачей. («Серьезно? 15%? Это реальная цифра или городская легенда из интернет-опросов?» Это реальная цифра. См. Касселлс, Шенбергер и Грабойс, 1978;1 Эдди, 1982;2 Гигерензер и Хоффраге, 1995;3 а также множество других исследований. Этот удивительный результат легко воспроизвести, поэтому его неоднократно перепроверяли.)
В вышеприведенной задаче большинство врачей оценивают вероятность в диапазоне от 70% до 80%, что в корне неверно.
Вот альтернативный вариант задачи, с которым врачи справляются несколько лучше:
У 10 из 1000 женщин в возрасте сорока лет, проходящих плановое обследование, есть рак груди. У 800 из 1000 женщин с раком груди маммография дает положительный результат. У 96 из 1000 женщин без рака груди маммография также дает положительный результат. Если 1000 женщин из этой возрастной группы пройдут плановое обследование, то какую долю от женщин с положительной маммографией составят те, у кого действительно есть рак груди?
И наконец, вот задача, с которой врачи справляются лучше всего — 46% (почти половина) дают правильный ответ:
У 100 из 10 000 женщин в возрасте сорока лет, проходящих плановое обследование, есть рак груди. У 80 из каждых 100 женщин с раком груди маммография дает положительный результат. У 950 из 9900 женщин без рака груди маммография также дает положительный результат. Если 10 000 женщин из этой возрастной группы пройдут плановое обследование, то какую долю от женщин с положительной маммографией составят те, у кого действительно есть рак груди?
Правильный ответ — 7,8%, и получается он следующим образом: из 10 000 женщин у 100 есть рак груди; у 80 из этих 100 маммография положительная. Из тех же 10 000 женщин у 9900 рака груди нет, и у 950 из этих 9900 маммография также окажется положительной. Таким образом, общее число женщин с положительной маммографией составляет 950 + 80, то есть 1030. Из этих 1030 женщин с положительной маммографией рак будет у 80. В виде доли это записывается как 80/1030, что равняется 0,07767, или 7,8%.
Иными словами, до проведения маммографии 10 000 женщин можно разделить на две группы:
Группа 1: 100 женщин с раком груди.
Группа 2: 9900 женщин без рака груди.
Сумма этих двух групп дает в итоге 10 000 пациенток, что подтверждает: в расчетах никто не потерялся. После прохождения маммографии женщин можно разделить на четыре группы:
Группа А: 80 женщин с раком груди и положительной маммографией.
Группа B: 20 женщин с раком груди и отрицательной маммографией.
Группа C: 950 женщин без рака груди и с положительной маммографией.
Группа D: 8950 женщин без рака груди и с отрицательной маммографией.
Сумма групп A и B, то есть групп с раком груди, соответствует группе 1; а сумма групп C и D, групп без рака груди, соответствует группе 2. Если провести маммографию 10 000 пациенток, то из 1030 женщин с положительным результатом рак обнаружится у восьмидесяти. Это правильный ответ — именно его должен дать врач пациентке с положительной маммограммой, если она спросит о вероятности того, что у неё рак груди. Если такой вопрос зададут тринадцать пациенток, то рак обнаружится примерно у одной из них.
Самая распространенная ошибка — проигнорировать исходную долю женщин с раком груди и долю женщин без рака груди, получивших ложноположительный результат, и сосредоточиться исключительно на доле женщин с раком груди, получивших положительный результат. Например, подавляющее большинство врачей в этих исследованиях, судя по всему, считали: если примерно у 80% женщин с раком груди маммография дает положительный результат, то и вероятность того, что у женщины с положительной маммограммой действительно рак, тоже должна составлять около 80%.
Чтобы найти окончательный ответ, всегда требуются все три элемента информации: процент женщин с раком груди, процент женщин без рака груди, получающих ложноположительные результаты, и процент женщин с раком груди, получающих (правильные) положительные результаты.
Исходная доля пациенток с раком груди называется априорной вероятностью. Шанс того, что пациентка с раком груди получит положительный результат маммографии, и шанс того, что пациентка без рака груди получит положительный результат, известны как две условные вероятности. В совокупности эта исходная информация известна как априорные вероятности. Окончательный ответ — оценочная вероятность того, что у пациентки рак груди, при условии, что мы знаем о её положительном результате маммографии, — называется пересмотренной вероятностью или апостериорной вероятностью. Из того, что мы сейчас увидели, следует, что апостериорная вероятность частично зависит от априорной вероятности.
Чтобы убедиться, что окончательный ответ всегда зависит от исходной доли женщин с раком груди, представьте альтернативную вселенную, где рак груди есть только у одной женщины из миллиона. Даже если в этом мире маммография выявляет рак груди в 8 из 10 случаев, а ложноположительный результат у здоровой женщины выдает всего в 1 случае из 10, на каждый реальный случай обнаруженного рака всё равно будет приходиться сто тысяч ложноположительных результатов. Исходная вероятность того, что у женщины рак, настолько ничтожна, что положительный результат маммографии хоть и увеличивает расчетную вероятность, но не делает её достоверной или даже просто «заметной»; вероятность вырастает лишь с 1:1 000 000 до 1:100 000.
Это демонстрирует, что результат маммографии не заменяет имевшуюся ранее информацию о шансах пациентки на заболевание; маммография лишь сдвигает расчетную вероятность в направлении полученного результата. Положительный результат сдвигает исходную вероятность вверх, отрицательный — вниз. Например, в исходной задаче, где рак есть у 1% женщин, 80% женщин с раком получают положительный результат, а 9,6% женщин без рака также получают положительный результат, положительный результат маммографии сдвигает исходный 1-процентный шанс вверх, до 7,8%.
Большинство людей, впервые сталкиваясь с подобными задачами, совершают мысленную операцию замены исходной 1-процентной вероятности на 80-процентную вероятность того, что женщина с раком получит положительный результат. На первый взгляд это может показаться логичным, но так это просто не работает. «Вероятность того, что у женщины с положительной маммограммой есть рак груди» — совсем не то же самое, что «вероятность того, что женщина с раком груди получит положительную маммограмму»; они отличаются друг от друга так же сильно, как яблоки и сыр.
В. Зачем байесовец перешел дорогу?
О. Чтобы ответить на этот вопрос, вам нужно больше информации.
Представьте, что в бочке лежит много маленьких пластиковых яиц. Одни покрашены в красный цвет, другие — в синий. 40% яиц в бочке содержат жемчужины, а 60% — пустые. 30% яиц с жемчужинами покрашены в синий цвет, и 10% пустых яиц тоже покрашены в синий цвет. Какова вероятность того, что в синем яйце окажется жемчужина? В этом примере арифметика достаточно проста, чтобы вы могли сосчитать всё в уме, и я рекомендую вам попробовать это сделать.
Более компактная формулировка этой задачи:
P(жемчужина) = 40%
P(синее|жемчужина) = 30%
P(синее|¬жемчужина) = 10%
P(жемчужина|синее) = ?
Символ «¬» служит сокращением для отрицания «не», так что «¬жемчужина» читается как «не жемчужина».
Запись P(синее|жемчужина) — это сокращение для выражения «вероятность синего при условии жемчужины» или «вероятность того, что яйцо синее, при условии, что в нем лежит жемчужина». Элемент справа — это то, что вы уже знаете, или посылка, а элемент слева — это следствие или вывод. Если P(синее|жемчужина) = 30% и уже знаем, что в некоем яйце лежит жемчужина, мы можем сделать вывод, что вероятность синей окраски этого яйца равна 30%. Таким образом, искомый факт — «шанс того, что в синем яйце лежит жемчужина», или «вероятность того, что в яйце лежит жемчужина, если мы знаем, что оно синее», — записывается как P(жемчужина|синее).
40% яиц содержат жемчужины, а 60% яиц пустые. 30% яиц с жемчужинами синие, следовательно, всего 12% всех яиц содержат жемчужины и при этом синие. 10% пустых яиц синие, следовательно, всего 6% всех яиц — пустые и синие. В общей сложности 18% всех яиц синие, и из них 12% всех яиц — синие и содержат жемчужины, так что шанс найти жемчужину в синем яйце составляет 12/18, или 2/3, то есть около 67%.
Как и прежде, необходимость всех трех фрагментов информации можно увидеть, если рассмотреть крайние случаи. В (большой) бочке, где лишь одно яйцо из тысячи содержит жемчужину, знание того, что яйцо окрашено в синий цвет, сдвигает вероятность с 0,1% до 0,3% (вместо сдвига с 40% до 67%). Аналогично, если 999 из 1000 яиц содержат жемчужины, знание того, что яйцо синее, сдвигает вероятность с 99,9% до 99,966%; при этом вероятность того, что яйцо не содержит жемчужины, падает с 1/1000 примерно до 1/3000.
В задаче о жемчужинах и яйцах большинство респондентов, не знакомых с байесовским рассуждением, скорее всего, ответят, что вероятность того, что в синем яйце лежит жемчужина, равна 30% или, возможно, 20% (30-процентная вероятность истинно положительного результата минус 10-процентная вероятность ложноположительного). Даже если в тот момент такая мысленная операция кажется хорошей идеей, она совершенно бессмысленна в контексте заданного вопроса. Это похоже на эксперимент, в котором второклассника спрашивают: «Если в автобус сели восемнадцать человек, а потом сели еще семь, то сколько лет водителю?» Многие второклассники ответят: «Двадцать пять». Они понимают, когда их побуждают выполнить определенную мысленную процедуру, но еще не вполне связали эту процедуру с реальностью. Точно так же, когда нужно найти вероятность того, что у женщины с положительным результатом маммографии есть рак груди, совершенно бессмысленно подменять исходную вероятность того, что у женщины рак, вероятностью того, что женщина с раком груди получит положительный результат маммографии. Нельзя также и вычитать вероятность ложноположительного результата из вероятности истинно положительного. Эти операции настолько же не имеют отношения к делу, как и сложение количества людей в автобусе для нахождения возраста водителя.
Исследование Гигеренцера и Хоффраге в 1995 году показало, что некоторые способы формулировки текстовых задач гораздо лучше наводят на правильное байесовское мышление.4 Наименее наводящая на верный путь формулировка использовала вероятности. Чуть более наводящая на верный путь формулировка использовала частоты вместо вероятностей: задача оставалась прежней, но вместо утверждения, что рак груди есть у 1% женщин, говорилось, что рак груди есть у 1 из 100 женщин, что 80 из 100 женщин с раком груди получат положительный результат маммографии, и так далее. Почему большая доля испытуемых рассуждала по-байесовски в этой задаче? Вероятно, потому, что фраза «1 из 100 женщин» побуждает конкретно представить себе X женщин с раком, что ведет к представлению X женщин с раком и положительным результатом маммографии и так далее.
Самым эффективным из найденных на данный момент способов подачи информации оказался метод так называемых естественных частот — когда говорится, что 40 из 100 яиц содержат жемчужины, 12 из 40 яиц с жемчужинами окрашены в синий цвет, а 6 из 60 пустых яиц окрашены в синий цвет. Подача информации в естественных частотах — это способ, при котором сведения об априорной вероятности уже заложены в формулировку условных вероятностей. Если бы вы узнавали об условных вероятностях для яиц путем естественного эксперимента, то в процессе разбивания сотни яиц вы бы открыли около 40 яиц с жемчужинами (из которых 12 оказались бы синими) и 60 пустых яиц (из которых синими оказались бы около 6). В ходе изучения условных вероятностей вы бы сталкивались с примерами синих яиц, содержащих жемчужины, примерно в два раза чаще, чем с примерами синих пустых яиц.
К сожалению, хотя естественные частоты — это шаг в правильном направлении, одного этого, скорее всего, будет мало. Когда задачи формулируются в естественных частотах, доля людей, использующих байесовское мышление, вырастает примерно до половины. Огромный прогресс, но все же недостаточный, когда речь идет о настоящих врачах и настоящих пациентах.
В. Как мне найти априорные вероятности для задачи?
О. Многие часто используемые априорные вероятности приведены в Справочнике по химии и физике.
В. Откуда априорные вероятности берутся изначально?
О. Никогда не задавайте этот вопрос.
В. Ага. Тогда откуда ученые берут свои априорные вероятности?
О. Априорные вероятности для научных задач устанавливаются ежегодным голосованием AAAS. В последние годы голосование стало неспокойным и спорным, сопровождаясь всеобщей враждебностью, фракционной поляризацией и даже несколькими самыми настоящими убийствами. Возможно, это ширма для внутренних раздоров в Совете Байеса, а возможно, у спорящих просто слишком много свободного времени. Никто не знает наверняка.
В. Понятно. А откуда все остальные берут свои априорные вероятности?
О. Они скачивают свои априорные вероятности из Kazaa.
В. А если нужных мне априорных вероятностей нет в Kazaa?
О. В одном из переулков Чайнатауна в Сан-Франциско есть маленькая, заваленная хламом лавка древностей. Не спрашивайте про бронзовую крысу.
На самом деле априорные вероятности бывают истинными или ложными точно так же, как и конечный ответ, — они отражают реальность, и судить о них можно путем сравнения с реальностью. Например, если вы думаете, что рак груди есть у 920 из 10 000 женщин в выборке, а реальное число составляет 100 из 10 000, то ваши априорные вероятности неверны. В нашей конкретной задаче априорные вероятности могли быть установлены на основе трех исследований: исследования историй болезни женщин с раком груди (чтобы выяснить, у скольких из них маммография дала положительный результат), исследования женщин без рака груди (чтобы узнать, у скольких из них тест дает положительный результат) и эпидемиологического исследования распространенности рака груди в конкретной демографической группе.
Вероятность P(A,B) — это то же самое, что P(B,A), но P(A|B) — совсем не то же самое, что P(B|A), а P(A,B) полностью отличается от P(A|B). Путать некоторые из этих величин или вообще все сразу — очень распространенная ошибка.
Чтобы поближе познакомиться со всеми связями между ними, мы сыграем в игру «следи за степенями свободы». Например, две величины — P(рак) и P(¬рак) — имеют на двоих одну степень свободы из-за общего закона P(A) + P(¬A) = 1. Если вы знаете, что P(¬рак) = 0,99, то можете получить P(рак) = 1 - P(¬рак) = 0,01.
Величины P(положительный|рак) и P(¬положительный|рак) также имеют на двоих всего одну степень свободы; у женщины с раком груди маммография либо дает положительный результат, либо нет. С другой стороны, P(положительный|рак) и P(положительный|¬рак) имеют две степени свободы. У вас может быть маммографический тест, который дает положительный результат для 80% больных раком и 9,6% здоровых пациенток, или который дает положительный результат для 70% больных раком и 2% здоровых пациенток, или даже медицинский тест, дающий «положительный» результат для 30% больных раком и 92% здоровых пациенток. Две эти величины — результат маммографии для больных раком и результат маммографии для здоровых пациенток — математически независимы; ни одну из них нельзя никак получить из другой, и поэтому на двоих они имеют две степени свободы.
А как насчет P(положительный, рак), P(положительный|рак) и P(рак)? Здесь перед нами три величины; сколько у них степеней свободы? В данном случае должно выполняться следующее уравнение:
P(положительный, рак) = P(положительный|рак) × P(рак).
Это равенство сокращает число степеней свободы на одну. Если мы знаем долю пациенток с раком и вероятность того, что у больной раком пациентки маммография окажется положительной, то путем умножения мы можем вычислить долю пациенток с раком груди и положительным результатом маммографии.
Точно так же, если мы знаем количество пациенток с раком груди и положительным результатом маммографии, а также количество пациенток с раком груди, мы можем оценить вероятность того, что у женщины с раком груди маммография будет положительной, с помощью деления: P(положительный|рак) = P(положительный, рак) / P(рак). На самом деле именно так подобные медицинские диагностические тесты и калибруются: вы проводите исследование 8520 женщин с раком груди и видите, что среди них 6816 (или около того) имеют рак груди и положительный результат маммографии, а затем делите 6816 на 8520 и узнаете, что у 80% женщин с раком груди маммография была положительной. (Кстати, если вы случайно разделите 8520 на 6816 вместо обратного действия, ваши вычисления начнут вытворять странные вещи — например, утверждать, что у 125% женщин с раком груди и положительной маммографией есть рак груди. По моему опыту, это распространенная ошибка при выполнении байесовских вычислений.) И наконец, если вы знаете P(положительный, рак) и P(положительный|рак), вы можете вычислить, сколько больных раком изначально должно было быть. На три эти величины приходится две степени свободы; если мы знаем любые две, мы можем вычислить третью.
А как насчет P(положительный), P(положительный, рак) и P(положительный, ¬рак)? И снова среди этих трех переменных есть только две степени свободы. Уравнение, занимающее лишнюю степень свободы, выглядит так:
P(положительный) = P(положительный, рак) + P(положительный, ¬рак).
Именно так изначально и вычисляется P(положительный): мы определяем количество женщин с раком груди, у которых маммография дала положительный результат, и количество женщин без рака груди, у которых маммография дала положительный результат, а затем складываем их, чтобы получить общее число женщин с положительным результатом маммографии. Было бы очень странно взять и провести целое исследование, чтобы определить число женщин с положительным результатом маммографии — только это одно число и ничего больше, — но теоретически вы могли бы это сделать. И если бы вы затем провели еще одно исследование и выяснили количество тех женщин, у которых была положительная маммография и рак груди, вы бы также узнали число женщин с положительной маммографией и без рака груди — ведь у женщины с положительной маммографией рак груди либо есть, либо его нет. В общем случае P(A,B) + P(A,¬B) = P(A). Симметрично, P(A,B) + P(¬A,B) = P(B).
А как насчет P(положительный, рак), P(положительный, ¬рак), P(¬положительный, рак) и P(¬положительный, ¬рак)? Сначала у вас может возникнуть соблазн подумать, будто для этих четырех величин есть только две степени свободы — что вы можете, например, получить P(положительный, ¬рак), умножив P(положительный) × P(¬рак), и, следовательно, все четыре величины можно найти, зная только две: P(положительный) и P(рак). Это не так! P(положительный, ¬рак) = P(положительный) × P(¬рак) только в том случае, если эти две вероятности статистически независимы — то есть если вероятность того, что у женщины рак груди, никак не влияет на то, будет ли у нее положительный результат маммографии. Это равносильно требованию равенства двух условных вероятностей друг другу — требованию, которое устранило бы одну степень свободы. Если вы вспомните, что эти четыре величины представляют собой группы A, B, C и D, вы сможете мысленно перебрать эти четыре группы и понять, что в теории вы можете поместить в них любое количество людей. Если вы начнете с группы из 80 женщин с раком груди и положительной маммографией, нет причин, по которым вы не могли бы добавить еще одну группу из 500 женщин с раком груди и отрицательной маммографией, а затем группу из 3 женщин без рака груди и с отрицательной маммографией и так далее. Так что теперь кажется, будто у четырех величин есть четыре степени свободы. И так бы оно и было, за исключением того, что, выражая их в виде вероятностей, нам нужно нормировать их как доли от полной группы, что накладывает ограничение: P(положительный, рак) + P(положительный, ¬рак) + P(¬положительный, рак) + P(¬положительный, ¬рак) = 1. Это уравнение забирает одну степень свободы, оставляя три степени свободы среди четырех величин. Если вы зададите доли женщин в группах A, B и D, то сможете вычислить долю женщин в группе C.
Имея четыре группы A, B, C и D, очень просто вычислить всё остальное:
P(рак) = (A + B) / (A + B + C + D)
P(¬положительный|рак) = B / (A + B),
и так далее. Поскольку множество {A,B,C,D} содержит три степени свободы, из этого следует, что весь набор вероятностей, связывающих заболеваемость раком с результатами тестов, содержит всего три степени свободы. Помните, что в наших задачах нам всегда требовалось три элемента информации — априорная вероятность и две условные вероятности, — которые на самом деле и имеют между собой три степени свободы. Вообще говоря, для байесовских задач любые три величины, имеющие между собой три степени свободы, логически должны полностью определять всю задачу.
Вероятность того, что тест даст истинно положительный результат, деленная на вероятность того, что тест даст ложноположительный результат, называется отношением правдоподобия этого теста. Отношение правдоподобия для положительного результата показывает, насколько сильно положительный результат сдвинет априорную вероятность. Означает ли это, что отношение правдоподобия медицинского теста исчерпывающе описывает его полезность?
Нет, не означает! Отношение правдоподобия действительно отражает всё, что нужно знать о значении положительного результата медицинского теста, однако значение отрицательного результата теста остается неопределенным, как и то, насколько часто этот тест приносит пользу. Например, маммография с долей верных результатов в 80% для пациенток с раком груди и долей ложноположительных результатов в 9,6% для здоровых пациенток имеет такое же отношение правдоподобия, как и тест с долей верных результатов в 8% и долей ложноположительных результатов в 0,96%. Хотя у этих двух тестов одинаковое отношение правдоподобия, первый тест во всех отношениях полезнее: он чаще выявляет болезнь, а его отрицательный результат служит более весомым свидетельством здоровья.
Предположим, вы проводите последовательно два теста на рак груди — скажем, стандартную маммографию и ещё какой-то другой тест, который независим от маммографии. Поскольку мне неизвестно о существовании такого независимого от маммографии теста, для этой задачи я его выдумаю и назову «тестом деления Тэмса — Брейлора», который проверяет, не делятся ли какие-либо клетки быстрее остальных. Предположим, что тест Тэмса — Брейлора дает истинно положительный результат для 90% пациенток с раком груди и ложноположительный — для 5% пациенток без рака. Допустим, априорная распространенность рака груди составляет 1%. Если пациентка получает положительный результат и на маммографии, и на тесте Тэмса — Брейлора, то какова скорректированная вероятность того, что у нее рак груди?
Один из способов решить эту задачу — взять скорректированную вероятность для положительного результата маммографии, которую мы уже рассчитали как 7,8%, и подставить её в тест Тэмса — Брейлора в качестве новой априорной вероятности. Если мы так поступим, то увидим, что результат составит 60%.
Предположим, что априорная распространенность рака груди в некоторой демографической группе составляет 1%. Предположим, у нас как у врачей есть в арсенале три независимых теста на рак груди. Наш первый тест, тест А (маммография), имеет отношение правдоподобия 80% / 9,6% = 8,33. Второй тест, тест B, имеет отношение правдоподобия 18,0 (например, при 90% против 5%); и третий тест, тест C, имеет отношение правдоподобия 3,5 (что может получаться из 70% против 20% или из 35% против 10%; это не имеет значения). Предположим, пациентка получает положительный результат по всем трем тестам. Какова вероятность того, что у нее рак груди?
Вот забавный трюк, облегчающий расчеты. Если априорная распространенность рака груди в этой группе составляет 1%, это значит, что у 1 из 100 женщин есть рак груди, а у 99 из 100 — нет. Поэтому если мы запишем вероятность в 1% через отношение шансов, то шансы будут равны 1:99.
А отношения правдоподобия для трех тестов A, B и C будут следующими:
8,33:1 = 25:3
18,0:1 = 18:1
3,5:1 = 7,5:2.
Шансы для женщин с раком груди, получивших положительный результат по всем трем тестам, против женщин без рака груди, также получивших положительный результат по всем трем тестам, составят:
1 × 25 × 18 × 7 : 99 × 3 × 1 × 2 = 3150 : 594.
Чтобы перевести шансы обратно в вероятность, мы просто пишем:
3150 / (3150 + 594) = 84%.
Это работает всегда, независимо от того, как именно записаны отношения шансов; то есть 8,33:1 — это абсолютно то же самое, что и 25:3 или 75:9. Не имеет значения, в каком порядке проводятся тесты или в каком порядке рассчитываются результаты. Доказательство предлагается читателю в качестве упражнения.
Э. Т. Джейнс в книге «Теория вероятностей с приложениями в науке и технике» предлагает измерять степень уверенности и силу свидетельств в децибелах.5
В децибелах?
Децибелы используются для измерения экспоненциальных различий в интенсивности. Например, если звук автомобильного гудка несет в 10 000 раз больше энергии (на квадратный метр в секунду), чем звук будильника, то автомобильный гудок будет на 40 децибел громче. Пение птицы может нести в 1000 раз меньше энергии, чем звонок будильника, и, следовательно, быть на 30 децибел тише. Чтобы получить количество децибел, нужно взять десятичный логарифм и умножить его на 10:
децибелы = 10log10(интенсивность)
или
интенсивность = 10децибел/10.
Предположим, мы начинаем с априорной вероятности 1% того, что у женщины рак груди, что соответствует отношению шансов 1:99. А затем мы проводим три теста с отношениями правдоподобия 25:3, 18:1 и 7:2. Вы могли бы перемножить эти числа... или же вы можете просто сложить их логарифмы:
10log10(1/99) ≈ -20
10log10(25/3) ≈ 9
10log10(18/1) ≈ 13
10log10(7/2) ≈ 5.
Изначально то, что у женщины рак груди, довольно маловероятно — уровень нашей уверенности находится на отметке -20 децибел. Затем приходят результаты трех тестов, добавляющие 9, 13 и 5 децибел свидетельств. Это повышает уровень уверенности в общей сложности на 27 децибел, а значит, априорная уверенность в -20 децибел превращается в апостериорную уверенность в 7 децибел. В итоге шансы меняются с 1:99 на 5:1, а вероятность возрастает с 1% примерно до 83%.
Вы чините штуковины. Когда штуковина перестает работать, в 30% случаев причиной оказывается засорившийся шланг. Если шланг штуковины засорился, существует 45-процентная вероятность, что если в нее ткнуть, она заискрит. Если шланг не засорился, шанс того, что штуковина заискрит, если в нее ткнуть, составляет всего 5%. Клиент приносит вам неисправную штуковину. Вы тыкаете в нее и обнаруживаете, что она искрит. Какова вероятность того, что у заискрившей штуковины засорен шланг?
Какую последовательность арифметических операций вы выполнили, чтобы решить эту задачу?
(45% × 30%) / (45% × 30% + 5% × 70%)
Аналогично, чтобы найти шанс того, что женщина с положительным результатом маммографии больна раком груди, мы вычислили:
что представляет собой
то есть
P(positive,cancer) / P(positive)
то есть
P(cancer|positive).
Полностью обобщенная форма этого вычисления известна как теорема Байеса или правило Байеса.
Когда существует некоторое явление A, которое мы хотим исследовать, и наблюдение X, являющееся свидетельством в пользу A (например, в предыдущем примере A — это рак груди, а X — положительный результат маммографии), теорема Байеса говорит нам, как мы должны обновлять нашу вероятность A с учетом нового свидетельства X.
На данном этапе теорема Байеса может показаться совершенно очевидной или даже тавтологичной, а вовсе не волнующей и новой. Если так, то это введение полностью достигло своей цели.
Теорема Байеса описывает, что именно делает нечто «свидетельством» и насколько весомо это свидетельство. Статистические модели оценивают путем сравнения с байесовским методом, поскольку в статистике байесовский метод — это предел возможностей. Он определяет максимальную пользу, которую можно извлечь из конкретного свидетельства, точно так же как термодинамика определяет максимальную работу, которую можно получить за счет разности температур. Вот почему от когнитивистов так часто можно услышать о байесовских субъектах. В когнитивистике «байесовский субъект» — это технически точное кодовое выражение, под которым мы подразумеваем рациональный разум.
Рассматривая теорему Байеса, можно также вывести ряд общих эвристик человеческого мышления.
Например, во многих дискуссиях о теореме Байеса можно услышать от когнитивных психологов, что люди недостаточно учитывают априорную частоту. Это означает следующее: когда люди сталкиваются с задачей, где некое свидетельство X указывает на возможную истинность условия A, они склонны судить о вероятности A исключительно по тому, насколько хорошо свидетельство X согласуется с A, не принимая во внимание априорную частоту появления A. Если вы, к примеру, считаете, что в случае с маммографией шанс женщины заболеть раком груди находится в диапазоне 70–80%, то подобный ход мысли нечувствителен к заданной в условии априорной частоте; он игнорирует тот факт, болеет ли изначально раком груди 1% женщин или 10%. «Уделяйте больше внимания априорной частоте!» — это одна из многих вещей, о которых людям нужно помнить, чтобы частично компенсировать наши врожденные недостатки.
Схожая ошибка — уделять слишком много внимания величине P(X|A) и недостаточно внимания P(X|¬A) при определении того, насколько весомым свидетельством в пользу A является X. Степень, в которой результат X служит свидетельством в пользу A, зависит не только от силы утверждения «мы ожидали бы увидеть результат X, если бы A было истинным», но и от силы утверждения «мы не ожидали бы увидеть результат X, если бы A не было истинным». Например, если идет дождь, то отсюда с высокой степенью уверенности следует, что трава мокрая — P(wetgrass|rain) ≈ 1, — однако тот факт, что трава мокрая, еще не обязательно означает, что только что прошел дождь: возможно, включили разбрызгиватель или вы видите утреннюю росу. Поскольку P(wetgrass|¬rain) существенно больше нуля, P(rain|wetgrass) существенно меньше единицы. С другой стороны, если бы трава никогда не бывала мокрой в отсутствие дождя, то знание о том, что трава мокрая, всегда указывало бы на дождь (P(rain|wetgrass) ≈ 1), даже если P(wetgrass|rain) = 50%, то есть даже если трава намокала бы только в половине случаев, когда идет дождь. Свидетельство — это всегда результат разности между двумя условными вероятностями. Сильное свидетельство — это не следствие очень высокой вероятности того, что A приводит к X, а следствие очень низкой вероятности того, что не-A могло привести к X.
Байесовская революция в науке подпитывается не только тем, что всё больше когнитивистов внезапно замечают байесовскую структуру в психических феноменах; не только тем, что ученые во всех областях учатся оценивать свои статистические методы путем сравнения с байесовским методом; но также и мыслью о том, что сама наука — это частный случай теоремы Байеса, а экспериментальное свидетельство — это байесовское свидетельство. Сторонники байесовской революции утверждают: когда вы проводите эксперимент и получаете данные, которые «подтверждают» или «опровергают» вашу теорию, это подтверждение и опровержение подчиняются байесовским правилам. Например, вам нужно учитывать не только то, предсказывает ли ваша теория данное явление, но и то, предсказывают ли его другие возможные объяснения.
Ранее самой популярной философией науки был, пожалуй, фальсификационизм Карла Поппера — старая философия, которую сейчас свергает байесовская революция. Идея Карла Поппера о том, что теории можно окончательно опровергнуть (фальсифицировать), но никогда нельзя окончательно подтвердить, — это еще один частный случай байесовских правил: если P(X|A) ≈ 1 — то есть если теория дает определенное предсказание, — то наблюдение ¬X крайне убедительно опровергает A. С другой стороны, если P(X|A) ≈ 1 и мы наблюдаем X, это не подтверждает теорию окончательно; может существовать какое-то другое условие B, такое что P(X|B) ≈ 1, и в этом случае наблюдение X не дает преимуществ теории A перед B. Чтобы наблюдение X окончательно подтверждало A, нам нужно было бы знать не то, что P(X|A) ≈ 1, а то, что P(X|¬A) ≈ 0. Но этого мы знать не можем, поскольку не способны перебрать все возможные альтернативные объяснения. Например, когда общая теория относительности Эйнштейна низвергла невероятно хорошо подтвержденную ньютоновскую теорию тяготения, оказалось, что все предсказания Ньютона были лишь частным случаем предсказаний Эйнштейна.
Философию Поппера можно даже формализовать математически. Отношение правдоподобия для X, то есть величина P(X|A)/P(X|¬A), определяет, насколько сильно наблюдение X сдвигает вероятность A; именно отношение правдоподобия показывает, насколько сильно свидетельство X. Что ж, в рамках своей теории A вы можете предсказать X с вероятностью 1, если хотите; но вы не можете контролировать знаменатель отношения правдоподобия, P(X|¬A), — всегда будут существовать какие-то альтернативные теории, которые тоже предсказывают X. И хотя мы выбираем простейшую теорию, соответствующую имеющимся свидетельствам, однажды вы можете столкнуться с фактами, которые предсказываются альтернативной теорией, но не вашей. Именно этот скрытый подвох и сокрушил ньютоновскую теорию тяготения. Так что существует предел того, сколько пользы можно извлечь из успешных предсказаний; есть предел тому, насколько высоко может подняться отношение правдоподобия для подтверждающего свидетельства.
С другой стороны, если вы сталкиваетесь с неким свидетельством Y, которое ваша теория определенно не предсказывает, это становится колоссально сильным свидетельством против вашей теории. Если P(Y|A) бесконечно мала, то и отношение правдоподобия тоже будет бесконечно малым. Например, если P(Y|A) составляет 0,0001%, а P(Y|¬A) — 1%, то отношение правдоподобия P(Y|A)/P(Y|¬A) будет равно 1:10 000. Это -40 децибел свидетельства! Или же, если перевернуть отношение правдоподобия, при крайне малой величине P(Y|A) значение P(Y|¬A)/P(Y|A) будет очень большим, а значит, наблюдение Y дает огромное преимущество ¬A перед A. Опровержение гораздо сильнее подтверждения. Это следствие высказанной ранее мысли о том, что очень сильное свидетельство — это не результат очень высокой вероятности того, что A приводит к X, а результат очень низкой вероятности того, что к X могло привести не-A. Именно это точное байесовское правило лежит в основе эвристической ценности попперовского фальсификационизма.
Точно так же утверждение Поппера о том, что идея должна быть фальсифицируемой, можно истолковать как проявление байесовского закона сохранения вероятности: если результат X служит положительным свидетельством в пользу теории, то результат ¬X должен в какой-то мере её опровергать. Если же вы попытаетесь истолковать и X, и ¬X как «подтверждающие» теорию, байесовские правила скажут, что это невозможно! Чтобы повысить вероятность теории, вы обязаны подвергнуть её испытаниям, которые потенциально способны эту вероятность снизить; это не просто правило для выявления потенциальных обманщиков в социальном процессе науки, а прямое следствие байесовской теории вероятностей. С другой стороны, идея Поппера о том, что существует только опровержение, а подтверждения вообще не существует, оказывается неверной. Теорема Байеса показывает, что опровержение — это очень сильное свидетельство по сравнению с подтверждением, но оно всё же носит вероятностный характер; оно не подчиняется каким-то принципиально иным правилам, нежели подтверждение, как утверждал Поппер.
Таким образом, мы видим, что многие феномены когнитивных наук, а также используемые учеными статистические методы и сам научный метод оказываются частными случаями теоремы Байеса. Отсюда и байесовская революция.
Теперь, когда мы представили теорему Байеса в явном виде, мы можем напрямую обсудить её составляющие.
Начнем с P(A|X). Если вы когда-нибудь запутаетесь, что в теореме Байеса означает A, а что — X, начните с P(A|X) в левой части уравнения: её интерпретировать проще всего. В выражении P(A|X) переменная A — это то, о чем мы хотим узнать. X — это то, как именно мы это наблюдаем; X — свидетельство, которое мы используем для выводов об A. Помните, что в любом выражении вида P(Q|P) нас интересует вероятность Q при условии P, то есть степень, в которой P влечет за собой Q. Более разумным обозначением (которое внедрять уже слишком поздно) было бы P(Q ← P).
Выражение P(Q|P) тесно связано с P(Q,P), но они не идентичны. Выраженное в виде вероятности или доли, P(Q,P) — это доля объектов, обладающих одновременно свойством Q и свойством P, среди вообще всех объектов; например, доля «женщин с раком груди и положительным результатом маммографии» во всей группе женщин. Если общее число женщин составляет 10 000, и у 80 из них есть рак груди и положительный результат маммографии, то P(Q,P) равно 80/10 000 = 0,8%. Можно сказать, что абсолютная величина (80) нормируется до вероятности относительно всей группы женщин. Или, для большей наглядности, предположим, что в общей выборке из 89 031 женщины группа женщин с раком груди и положительным результатом маммографии составляет 641 человек. Шестьсот сорок один — это абсолютная величина. Если вы случайно выберете женщину из всей выборки, то вероятность того, что вы выберете женщину с раком груди и положительным результатом маммографии, будет равна P(Q,P), то есть (в данном примере) 0,72%.
С другой стороны, P(Q|P) — это доля объектов, обладающих свойствами Q и P, среди всех объектов, обладающих свойством P; например, доля женщин с раком груди и положительным результатом маммографии в группе всех женщин с положительными результатами маммографии. Если в выборке есть 641 женщина с раком груди и положительным результатом маммографии, 7915 женщин с положительным результатом маммографии и всего 89 031 женщина, то P(Q,P) — это вероятность выбрать одну из тех 641 женщин при случайном выборе из всей группы в 89 031 человека, тогда как P(Q|P) — это вероятность выбрать одну из тех 641 женщин при случайном выборе из меньшей группы в 7915 человек.
В некотором смысле P(Q|P) на самом деле означает P(Q,P|P), но постоянное указание дополнительного P было бы избыточным. Вы уже знаете, что объект обладает свойством P, поэтому свойство, которое вы исследуете, — это Q, даже несмотря на то, что вы оцениваете размер группы (Q,P) внутри группы P, а не размер группы Q внутри группы P (что было бы бессмыслицей). Именно это и означает считать свойство в правой части данным: вы знаете, что работаете исключительно внутри группы объектов, обладающих свойством P. Когда вы сужаете фокус внимания, чтобы видеть только эту меньшую группу, многие другие вероятности меняются. Если вы принимаете P как данное, то P(Q,P) становится равным просто P(Q) — по крайней мере, относительно группы P. Старая вероятность P(Q) — частота «объектов со свойством Q во всей выборке» — пересматривается и превращается в новую частоту: «доля объектов со свойством Q в подвыборке объектов, обладающих свойством P». Если P дано, если P — весь наш мир, то поиск (Q,P) — это то же самое, что и поиск просто Q.
Если вы ограничите свое внимание исключительно популяцией яиц, окрашенных в синий цвет, то внезапно «вероятность того, что яйцо содержит жемчужину», станет другой величиной; для синих яиц эта доля отличается от доли для всех яиц в целом. Данное — свойство, которое сужает наше внимание, — всегда находится с правой стороны от черты в выражении P(Q|P); P становится нашим миром, всем тем, что мы видим, а по другую сторону от «дано» вероятность P всегда равна 1 — именно это и означает принимать P как данное. Таким образом, P(Q|P) означает: «Если вероятность P равна 1, какова вероятность Q?» или «Если мы ограничим свое внимание только теми объектами или событиями, для которых P истинно, какова вероятность Q?» Утверждение Q, находящееся с другой стороны от условия, не является достоверным — его вероятность может быть и 10%, и 90%, и любым другим числом. Поэтому когда вы используете теорему Байеса и записываете левую часть уравнения как P(A|X) — то, как следует обновлять вероятность A после наблюдения X, — новую вероятность A при условии, что нам известно X, степень, в которой X влечет A, — вы понимаете, что X всегда является наблюдением или свидетельством, а A — исследуемым свойством, тем, о чем вы хотите узнать.
Правая часть теоремы Байеса выводится из левой части с помощью следующих шагов:
Как только вывод завершен, все условные вероятности в правой части уравнения принимают вид P(X|A) или P(X|¬A), в то время как условная вероятность в левой части равна P(A|X). Симметрия возникает из-за того, что элементарные причинно-следственные связи обычно представляют собой следствия, ведущие от фактов к наблюдениям (например, от рака груди к положительному результату маммографии). Элементарные шаги в рассуждениях обычно представляют собой следствия, ведущие от наблюдений к фактам (например, от положительного результата маммографии к раку груди). Левая часть теоремы Байеса — это элементарный выводной шаг от наблюдения положительного результата маммографии к выводу о повышенной вероятности рака груди. Логическое следствие записывается справа налево, поэтому в левой части уравнения мы пишем P(рак|положительный). Правая часть теоремы Байеса описывает элементарные причинно-следственные шаги — например, от рака груди к положительному результату маммографии, — и поэтому условные вероятности в правой части теоремы Байеса принимают вид P(положительный|рак) или P(положительный|¬рак).
И это — теорема Байеса. Рациональный вывод на левом конце, физическая причинность — на правом; уравнение, в котором разум находится с одной стороны, а реальность — с другой. Помните, как научный метод оказался частным случаем теоремы Байеса? Если выразиться поэтично, можно сказать, что теорема Байеса вплетает мышление в физическую вселенную.
Что ж, мы закончили.
Преподобный Байес говорит:
Теперь вы посвящены в Байесовский заговор.
*
1. Уорд Кассчеллс, Арно Шёнбергер и Томас Грабойс, «Interpretation by Physicians of Clinical Laboratory Results», New England Journal of Medicine 299 (1978): 999–1001.
2. Дэвид М. Эдди, «Probabilistic Reasoning in Clinical Medicine: Problems and Opportunities», в Judgement Under Uncertainty: Heuristics and Biases, под ред. Даниэля Канемана, Пола Словика и Амоса Тверски (Cambridge University Press, 1982).
3. Герд Гигерензер и Ульрих Хоффраге, «How to Improve Bayesian Reasoning without Instruction: Frequency Formats», Psychological Review 102 (1995): 684–704.
4. Там же.
5. Эдвин Т. Джейнс, «Probability Theory, with Applications in Science and Engineering», неопубликованная рукопись (1974).