В главах 4, 5 и 6, обсуждая обучение с подкреплением, формирование вознаграждения и внутреннюю мотивацию – особенно в контексте игр Atari и го, – мы косвенно исходили из предположения о существовании так называемой эргодичности. Это значит, что невозможно совершить необратимую, смертельную ошибку, а любое негативное последствие можно исправить, начав сначала. Поэтому нет проблемы в том, чтобы учиться, допуская сотни тысяч случайных – и порой фатальных – ошибок. Однако такая эргодичность существует лишь в безопасных «игрушечных» мирах вроде Atari.
Помню, в начале 2000‐х годов я видел рекламный ролик автомобиля. В нем показан программист эпохи доткомов – представитель поколения Х, который днем создает экстремальную гоночную игру с кинематографическими замедленными сценами катастроф, а вечером аккуратно едет домой на своем седане, думая прежде всего о безопасности. «Потому что в реальной жизни, – говорит он, глядя в камеру, – нет кнопки перезагрузки».
Ян Лейке из DeepMind формулирует эту мысль иначе. Он подчеркивает, что между ним самим и искусственными агентами, которых он изучает, есть принципиальное различие. Точнее, существует огромная разница между их мирами и его собственным: «Реальный мир не обладает эргодичностью, – отметил исследователь. – Если я выпрыгну из окна, это будет не та ошибка, на которой я смогу чему‐то научиться» [809].
Различные подходы к обучению с подкреплением опираются на разные допущения. Некоторые предполагают, что мир состоит из конечного числа дискретных состояний. Другие – что агент всегда точно знает, в каком состоянии находится. Многие исходят из того, что вознаграждения всегда выражаются скалярными величинами, не меняются и их получение всегда предсказуемо. Немало подходов основаны на предположении, что окружающая среда стабильна. Часть считает, что агент не может безвозвратно изменить среду, а среда – агента.
В реальном мире многие действия изменяют ваши цели. Например, лекарства, влияющие на сознание или настроение (рецептурные и нет), способны изменять цели – хотя бы временно. То же самое бывает, когда переезжаешь в другую страну, встречаешь важного человека или даже слышишь определенную песню.
Большинство методов обучения с подкреплением игнорируют такую возможность. Лишь немногие исследования допускают, что агент может пытаться «рационально» защититься от подобных изменений [810]. При этом люди сознательно ищут опыт, который меняет их, – даже если не могут предсказать, как именно они изменятся [811]. (Один из очевидных примеров – родительство.)
Традиционное обучение с подкреплением обычно предполагает, что агент – единственный в своей среде. Даже в играх с нулевой суммой (например, в шахматах или го) система скорее «играет против фигур», чем против соперника. При этом почти не учитывается, что оппонент может адаптироваться к ее стратегии.
В одной из недавних бесед с двумя исследователями в области обучения с подкреплением мы обсуждали, что будет, если большинство таких алгоритмов столкнутся с дилеммой заключенного [812]. В ней двое соучастников преступления должны решить, сотрудничать ли им (сохранять молчание) или отказаться от сотрудничества (дать показания друг на друга). Стратегия сотрудничества дает наилучший результат, но лишь при условии, что ее выбирают оба. При этом традиционные агенты обучения с подкреплением не способны осознать, что в среде есть другой агент, чье поведение определяется его собственной волей. Отказ от сотрудничества всегда выглядит более простым решением с максимальной краткосрочной выгодой. Сотрудничество же требует определенной синхронизации, а ее не смогу достичь два агента, не осознающие своей взаимозависимости [813].
Жан Пиаже, рассуждая о развитии детского разума, отмечал: «Шаг за шагом, по мере установления связей его интеллектуальных инструментов, он открывает себя как активный объект, находящийся среди других активных объектов во внешней по отношению к нему вселенной» [814].
Люди осознают, что, по словам учителя «осознанности» Джона Кабата-Зинна [815], «куда бы ты ни шел, ты уже там». В отличие от них агенты обучения с подкреплением обычно не воспринимают себя как часть моделируемого ими мира. Большинство систем машинного обучения предполагают, что они сами по себе не влияют на мир – поэтому им не нужно моделировать или понимать себя. Однако чем мощнее, функциональнее и масштабнее становятся такие агенты, тем меньше оснований для этого допущения. Например, Абрам Демски и Скотт Гаррабрант из Института исследований машинного интеллекта выдвинули идею о необходимости «вложенной агентности» – переосмысления того глубоко укоренившегося разделения себя и мира, которое стало в отрасли чем‐то само собой разумеющимся [816].