К книге
Рациональность: от ИИ до зомби175. Взаимная информация и плотность в пространстве вещей.
53%
175. Взаимная информация и плотность в пространстве вещей.
186

Предположим, у вас есть система X, которая может находиться в любом из 8 состояний, причем все они равновероятны (исходя из вашего текущего уровня знаний), и система Y, которая может находиться в любом из 4 состояний, также равновероятных.

Энтропия X, согласно определению из предыдущего эссе, составляет 3 бита; нам понадобится задать 3 вопроса с ответами «да/нет», чтобы узнать точное состояние X. Энтропия Y составляет 2 бита; чтобы узнать точное состояние Y, нам нужно задать 2 вопроса «да/нет». Это может показаться очевидным, поскольку 23 = 8 и 22 = 4, то есть 3 вопроса позволяют различить 8 возможностей, а 2 вопроса — 4 возможности; но помните, что если бы возможности не были равновероятными, мы могли бы использовать более хитрый код, чтобы выяснить состояние Y, скажем, в среднем за 1,75 вопроса. В данном случае, однако, вероятностная масса системы X равномерно распределена по всем ее возможным состояниям, и то же самое касается Y, так что мы не можем использовать никакие хитрые коды.

Какова энтропия объединенной системы (X,Y)?

Возможно, вам захочется ответить: «Требуется 3 вопроса, чтобы узнать X, и затем 2 вопроса, чтобы узнать Y, так что всего требуется 5 вопросов, чтобы узнать состояние X и Y».

Но что, если эти две переменные запутаны, так что знание состояния Y сообщает нам что-то о состоянии X?

В частности, предположим, что X и Y либо оба нечетные, либо оба четные.

Теперь, если мы получаем 3-битное сообщение (задаем 3 вопроса) и узнаем, что X находится в состоянии X5, мы понимаем, что Y находится в состоянии Y1 или Y3, но не в состоянии Y2 или Y4. Таким образом, один дополнительный вопрос «Находится ли Y в состоянии Y3?», на который получен ответ «Нет», сообщает нам полное состояние (X,Y): X = X5, Y = Y1. И мы выяснили это в общей сложности за 4 вопроса.

И наоборот, если с помощью двух вопросов мы узнаем, что Y находится в состоянии Y4, нам потребуется всего два дополнительных вопроса, чтобы выяснить, находится ли X в состоянии X2, X4, X6 или X8. И снова — четыре вопроса, чтобы узнать состояние совместной системы.

Взаимная информация двух переменных определяется как разность между суммой энтропий отдельных систем и энтропией их совместной системы: I(X;Y) = H(X) + H(Y) - H(X,Y).

В данном случае между двумя системами есть один бит взаимной информации: знание X сообщает нам один бит информации о Y (сокращает пространство возможностей с 4 до 2, то есть уменьшает объем в два раза), а знание Y сообщает один бит информации об X (сокращает пространство возможностей с 8 до 4).

А что происходит, когда вероятностная масса распределена неравномерно? В предыдущем эссе, например, мы обсуждали случай, когда четыре состояния Y имели вероятности 1/2, 1/4, 1/8, 1/8. Давайте примем это за наше распределение вероятностей для Y, рассматриваемого независимо — если бы мы наблюдали Y, не видя ничего другого, именно это мы и ожидали бы увидеть. И предположим, что переменная Z имеет два состояния, Z1 и Z2, с вероятностями 3/8 и 5/8 соответственно.

Тогда взаимная информация между Y и Z равна нулю в том и только в том случае, если совместное распределение Y и Z выглядит следующим образом:

Z1Y1 : 3/16

Z1Y2 : 3/32

Z1Y3 : 3/64

Z1Y4 : 3/64

Z2Y1 : 5/16

Z2Y2 : 5/32

Z2Y3 : 5/64

Z2Y4 : 5/64.

Это распределение подчиняется закону

P(Y,Z) = P(Y)P(Z).

Например, P(Z1Y2) = P(Z1)P(Y2) = 3∕8 × 1∕4 = 3∕32.

И обратите внимание, что мы можем восстановить маргинальные (независимые) вероятности Y и Z, просто глядя на совместное распределение:

P(Y1) = общая вероятность всех способов, которыми может реализоваться Y1

= P (Z1Y1) + P(Z2Y1)

= 3/16 + 5/16

= 1/2.

Таким образом, просто изучив совместное распределение, мы можем определить, являются ли маргинальные переменные Y и Z независимыми; то есть раскладывается ли совместное распределение на произведение маргинальных распределений; выполняется ли для всех Y и Z равенство P(Y,Z) = P(Y)P(Z).

Последнее существенно, поскольку, согласно правилу Байеса,

P(ZjYi) = P(Yi)P(Zj)

P(ZjYi)/P(Zj) = P(Yi)

P(Yi|Zj) = P(Yi).

Простыми словами: «После того как вы узнали Zj, ваши убеждения относительно Yi остаются точно такими же, как и прежде».

Таким образом, когда распределение факторизуется — когда P(Y,Z) = P(Y)P(Z) — это эквивалентно утверждению: «Получение информации о Y никогда ничего не сообщает нам о Z, и наоборот».

Из чего вы можете — и совершенно верно — предположить, что между Y и Z нет взаимной информации. Там, где нет взаимной информации, нет и байесовского свидетельства, и наоборот.

Предположим, что в приведенном выше распределении (Y,Z) мы рассматриваем каждую возможную комбинацию Y и Z как отдельное событие — так что распределение (Y,Z) содержит в общей сложности 8 исходов с указанными вероятностями — а затем вычисляем энтропию распределения (Y,Z) точно так же, как мы вычисляли бы энтропию любого распределения:

P(Z1Y1)log2(P(Z1Y1)) + P(Z1Y2)log2(P(Z1Y2)) + P(Z1Y3)log2(P(Z1Y3)) + . . . + P (Z2Y4)log2(P(Z2Y4))

=(3/16)log2(3/16) + (3/32)log2(3/32) + (3/64)log2(3/64) + . . . + (5/64)log2(5/64).

В итоге вы получите ту же сумму, что и при отдельном расчете энтропии Y плюс энтропии Z. Взаимная информация между двумя переменными отсутствует, поэтому наша неопределенность относительно совместной системы ничуть не меньше, чем наша неопределенность относительно этих двух систем, рассматриваемых по отдельности. (Я не привожу здесь расчеты, но вы можете проделать их сами; также я не привожу доказательство того, что это верно в общем случае, но при желании вы можете поискать в Google по запросам «энтропия Шеннона» и «взаимная информация».)

Что если совместное распределение не факторизуется? Например:

Z1Y1 : 12/64

Z1Y2 : 8/64

Z1Y3 : 1/64

Z1Y4 : 3/64

Z2Y1 : 20/64

Z2Y2 : 8/64

Z2Y3 : 7/64

Z2Y4 : 5/64.

Если вы сложите совместные вероятности, чтобы получить маргинальные вероятности, то обнаружите, что P(Y1) = 1/2, P(Z1) = 3/8 и так далее — маргинальные вероятности остались прежними.

Но совместные вероятности не всегда равны произведению маргинальных вероятностей. Например, вероятность P(Z1Y2) равна 8/64, в то время как P(Z1)P(Y2) была бы равна 3/8 × 1/4 = 6/64. То есть вероятность встретить Z1Y2 вместе выше, чем можно было бы ожидать, исходя из вероятностей встретить Z1 или Y2 по отдельности.

Что в свою очередь означает:

P(Z1Y2) > P(Z1)P(Y2)

P(Z1Y2)/P(Y2) > P(Z1)

P(Z1|Y2) > P(Z1).

Поскольку вероятность P(Z1Y2) «необычайно высока» — то есть выше, чем по умолчанию следовало бы из маргинальных вероятностей, — отсюда следует, что наблюдение Y2 является свидетельством, повышающим вероятность Z1. И, в силу симметрии, наблюдение Z1 должно свидетельствовать в пользу Y2.

Поскольку существуют хотя бы некоторые значения Y, которые говорят нам о Z (и наоборот), между этими двумя переменными должна существовать взаимная информация; и поэтому вы обнаружите — я уверен в этом, хотя на самом деле не проверял, — что вычисление энтропии (Y,Z) дает меньшую общую неопределенность, чем сумма независимых энтропий Y и Z. То есть H(Y,Z) = H(Y) + H(Z) - I(Y;Z), где все величины обязательно положительны.

(Здесь я позволю себе отвлечься и заметить, что симметрия выражения для взаимной информации показывает, что Y должен говорить нам о Z в среднем столько же, сколько Z говорит нам о Y. Я оставляю читателю в качестве упражнения примирить это со всем, чему его учили на уроках логики: о том, как если все вороны черные, то разрешение рассуждать как Ворон(x) ⇒ Черный(x) не означает, что вам разрешено рассуждать как Черный(x) ⇒ Ворон(x). Какими же разными кажутся симметричные вероятностные потоки байесианства и резкие рывки логики — хотя последняя является лишь вырожденным случаем первых.)

«Но, — спросите вы, — какое отношение все это имеет к правильному использованию слов?»

В эссе «Пустые ярлыки», а затем в «Замените символ сутью» мы рассматривали прием замены слова его определением на следующем примере:

Все [смертные, ¬перья, двуногие] смертны.

Сократ — [смертный, ¬перья, двуногий].

Следовательно, Сократ смертен.

Зачем тогда вообще нужно слово «человек»? Почему бы просто не сказать: «Сократ — смертное двуногое без перьев»?

Потому что полезно иметь более короткие слова для вещей, с которыми вы часто сталкиваетесь. Если ваш код для описания отдельных свойств уже эффективен, то в специальном слове для их конъюнкции — вроде «человек» вместо «смертное двуногое без перьев» — не будет никакого преимущества, если только существа, которые одновременно смертны и лишены перьев и двуноги, не встречаются чаще, чем можно было бы ожидать, исходя из маргинальных вероятностей.

В эффективных кодах длина слова соответствует вероятности — поэтому код для Z1Y2 будет такой же длины, как код для Z1 плюс код для Y2, если только не P(Z1Y2) > P(Z1)P(Y2); в таком случае код для целого слова может быть короче, чем коды его частей.

А это, в свою очередь, в точности соответствует случаю, когда мы можем сделать вывод о некоторых свойствах объекта, наблюдая другие его свойства. Вероятность того, что двуногие существа без перьев также окажутся смертными, должна быть выше, чем по умолчанию.

Конечно, слово «человек» на самом деле описывает гораздо, гораздо больше свойств: когда вы видите человекоподобное существо, которое разговаривает и носит одежду, вы можете сделать вывод о массе биохимических, анатомических и когнитивных фактов о нем. Если бы мы заменили слово «человек» описанием всего, что мы знаем о людях, нам пришлось бы тратить на разговоры непомерно много времени. Но это верно только потому, что говорящее двуногое без перьев с гораздо большей вероятностью, чем по умолчанию, может быть отравлено болиголовом, иметь плоские ногти или страдать от излишней самоуверенности.

Использование отдельного слова для вещи вместо перечисления всех ее свойств оказывается более компактным кодом именно в тех случаях, когда мы можем вывести одни свойства из других. (За исключением, возможно, самых примитивных слов вроде «красный», которые мы используем для передачи полностью несжатого описания нашего чувственного опыта. Но к тому времени, когда вы сталкиваетесь с жуком или даже с камнем, вы уже имеете дело со сложными наборами свойств, находящимися далеко за пределами этого примитивного уровня.)

Таким образом, иметь слово «виггин» для обозначения зеленоглазых черноволосых людей полезнее, чем просто говорить «зеленоглазый черноволосый человек», именно тогда, когда:

У зеленоглазых людей вероятность оказаться черноволосыми выше средней (и наоборот), что означает, что мы можем с некоторой вероятностью вывести наличие зеленых глаз по черным волосам, и наоборот; или

Виггины обладают другими общими свойствами, которые можно вывести с вероятностью выше, чем по умолчанию. В этом случае нам приходится отдельно наблюдать зеленые глаза и черные волосы; но затем, независимо обнаружив оба этих свойства, мы можем вероятностным образом вывести другие свойства (например, любовь к кетчупу).

Можно даже рассматривать акт определения слова как обещание, что это действительно так. Когда вы говорите кому-то: «Я определяю слово „виггин“ как человека с зелеными глазами и черными волосами», вы, в силу грайсовской импликатуры, тем самым утверждаете, что слово «виггин» как-то поможет вам делать выводы или сократить ваши сообщения.

Если вероятность встретить зеленые глаза и черные волосы вместе не выше, чем по умолчанию, и никакое другое свойство не сопутствует им с вероятностью выше, чем по умолчанию, тогда слово «виггин» — это ложь: оно заявляет, что этих людей стоит выделять в отдельную группу, хотя это не так.

В этом случае слово «виггин» не помогает описывать реальность более компактно — оно не возникло бы при попытке отправить максимально короткое сообщение, — оно не играет никакой роли в простейшем объяснении. Точно так же слово «виггин» ничем не поможет вам при байесовском выводе. Даже если вы не назовете это слово ложью, это, несомненно, ошибка.

И способ разделять реальность по её сочленениям состоит в том, чтобы проводить границы вокруг скоплений необычайно высокой плотности вероятности в Пространстве Вещей.

*

Предыдущая главаГлава 186 из 354Следующая глава