К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 2 Агенты. 6. Любопытство. Скука и зависимость
65%
Часть 2 Агенты. 6. Любопытство. Скука и зависимость
54

Внутренняя мотивации в обучении с подкреплением – это не только источник эффективного поведения агентов. В ней можно разглядеть искру человеческого желания познавать мир, исследовать и узнавать, что будет дальше. Но здесь отражаются и человеческие слабости – скука и привыкание.

Я спросил Дипака Патака, имеет ли смысл говорить о скуке в контексте искусственного интеллекта. Может ли агент заскучать?

«Безусловно», – ответил он.

На первом уровне Super Mario Bros. есть пропасть, которую агент почти никогда не может преодолеть. Для этого нужно удерживать кнопку прыжка 15 кадров подряд, а научиться длинной последовательности точных действий гораздо сложнее, чем коротким и гибким маневрам [523]. В результате агент добирается до края ямы и просто… разворачивается.

«Он физически не может перепрыгнуть, – объяснял Патак, – так что для него это тупик конца мира». Но игра устроена так, что обойти препятствие невозможно. Агент застревает и учится ничего не делать.

Патаку доводилось наблюдать и более общие случай апатии. После долгой игры в Super Mario Bros. его агент «просто начал останавливаться в начале… Поскольку нигде не было наград, а ошибки предсказания случались все реже, он научился бездействовать и никуда не идти». Агент просто слонялся на старте, не имея мотивации что‐либо делать.

В этом есть какой‐то злой рок. Человек, которому надоела игра, может бросить ее – и обычно так и делает. Мы можем сменить игру или выключить компьютер и заняться чем‐то другим. Агент же (и это кажется жестоким) заперт внутри игры, хотя у него больше нет стимула в нее играть.

С момента появления видеоигр существует и область знаний, изучающая, почему в них весело играть и что делает одну игру увлекательнее другой. Разумеется, тут задействованы как экономические, так и психологические факторы [524].

Мне кажется, что обучение с подкреплением дало нам практический критерий для оценки не только сложности игры (сколько времени потребуется агенту, чтобы стать профессионалом), но и ее интересности (как долго агент играет, не теряя мотивации, и не предпочтет ли он ей другую игру). Вполне возможно, что в следующие десятилетия целевой аудиторией компьютерных игр станут внутренне мотивированные агенты искусственного интеллекта.

Когнитивист Дуглас Хофштадтер в своей книге «Гёдель, Эшер, Бах: эта бесконечная гирлянда» [525], вышедшей в 1979 году и получившей Пулитцеровскую премию, предсказывал будущее игрового программирования, связывая умение играть с мотивацией и интеллектом:

Вопрос: Будут ли созданы шахматные программы, способные обыграть кого угодно?

Возможный ответ: Нет. Могут быть созданы программы, способные обыграть кого угодно, но это будут не просто шахматные программы. Это будут программы с общим интеллектом, и, как и у людей, у них будет характер. «Хотите сыграть партию в шахматы?» – «Нет, шахматы мне надоели. Давайте лучше поговорим о поэзии…»

Сегодня эта цитата выглядит до смешного устаревшей. Постфактум легко рассуждать, зная, что менее чем через 20 лет шахматный компьютер IBM Deep Blue победит чемпиона мира Гарри Каспаровым [526]. Deep Blue была исключительно шахматной программой: она специализировалась только на шахматах. У нее не было никакого общего интеллекта, и она не стремилась обсуждать литературу.

Но, возможно, в этом высказывании есть и глубокая истина. Современные передовые системы обучения с подкреплением действительно универсальны – по крайней мере, в мире игр. Deep Blue такой не была. А вот DQN может с одинаковым успехом играть в десятки игр Atari. AlphaZero одинаково искусна и в шахматах, сёги и го.

Более того, общему искусственному интеллекту (ОИИ), способному обучаться в постоянно меняющемся реальном мире, вероятно, действительно потребуется архитектура, построенная на внутренней мотивации. А такая архитектура неизбежно заставит его заскучать, если он будет заниматься одним и тем же слишком долго.

Противоположность скуки – зависимость. Не отстраненность, а темная сторона увлеченности, патологическое повторение или упорство. И здесь обучение с подкреплением демонстрирует модели поведения, пугающе напоминающие человеческие.

Исследователи внутренней мотивации говорят о так называемой «проблеме шумного телевизора». Что, если в среде есть неистощимый источник случайности или новизны? Не окажется ли внутренне мотивированный агент бессилен перед ним?

Представьте, что где‐то в мире есть источник непредсказуемого визуального «шума». В классическом примере это телевизор с помехами («белыми шумом»), но его роль могут сыграть языки пламени, падающие листья или бегущая вода. Каждая новая конфигурация света и тени становится бесконечным калейдоскопом для любопытного наблюдателя. Теоретически агент, столкнувшийся с таким явлением, должен мгновенно замереть на месте.

Большинство простых игр Atari 1970–80‐х годов не содержат таких источников визуальной случайности, поэтому с «проблемой шумного телевизора» на правктике долго сталкивались. Патак, Бурда и Эдвардс решили воплотить этот мысленный эксперимент в жизнь. Они создали простую игру с трехмерным лабиринтом, где агенту нужно было найти выход. Но в одной из версий на стене висел телевизор, и агент мог переключать каналы. Что же произошло?

Как только агент добрался до телевизора, исследование лабиринта прекратилось. Агент встал перед экраном и начал щелкать пультом. Щелк – летящий самолет. Щелк – милые щенки. Щелк – человек за компьютером. Щелк – машины на улице. Агент купался в волнах новизны и неожиданности. С места он больше не сдвинулся.

Визуальная информация – не единственный опасный источник случайности; им может стать даже простое подбрасывание монетки. Эта мысль пришла в голову исследователю DeepMind Лоран Орсо почти на десять лет раньше. Он начинал в команде безопасности, а теперь занимался фундаментальными исследованиями. Задолго до появления агентов, «залипающих» в телевизор, Орсо размышлял о гораздо более мощном разуме, впадающем в транс из-за монетки.

Он представил гипотетического агента, которого назвал «ищущим знания». Целью этого агента был «сбор максимального количества информации о неизвестном мире» [527]. Агент Орсо опирался на теоретическую модель AIXI, обладающую бесконечной вычислительной мощностью. Такой всемогущий интеллект не может существовать в реальности, но служит идеальной точкой отсчета: если бы вы могли думать вечно перед каждым действием, что бы вы выбрали? Удивительно, но даже такой сверхразумный агент, ищущий знания, деградировал при виде монетки. «Он предпочитал наблюдать за подбрасыванием монеты, а не исследовать более информативные части среды, – отмечал Орсо. – Причина в том, что подобные агенты ошибочно принимают случайные результаты за сложную информацию» [528].

Когда Б. Ф. Скиннер не обучал голубей, он интересовался природой азартных игр. Казино всегда выигрывает, а вся психология, начиная с Торндайка, строится на идее, что живые существа повторяют действия, приносящие пользу, и избегают вредных. С этой точки зрения пристрастие к азартным играм невозможно. Однако оно существует, и это ставит бихевиористов в тупик. «Такое ощущение, что игроки нарушают закон эффекта, – писал Скиннер, – потому что продолжают играть даже тогда, когда их чистый выигрыш становится отрицательным. Приходится признать, что они играют по какой‐то другой причине» [529]. Кажется, теперь у нас есть отличный кандидат на роль этой причины.

Азартные игры, возможно, подменяют внешнюю награду (которой нет, ведь казино выигрывает) внутренней. Случайные события всегда немного удивляют, даже если мы прекрасно понимаем их вероятность (как при честном броске монеты).

В главе 4 мы говорили о роли дофамина в кодировании ошибок прогнозирования ошибок – случаев, когда результат оказывается лучше или хуже ожидаемого. Однако есть случаи, не вписывающихся в эту схему. На рубеже веков появилось все больше доказательств того, что новые и неожиданные события вызывают выброс дофамина независимо от того, связано ли с ними какое‐либо «вознаграждение» [530].

Как раз в то время, когда компьютерные ученые открыли ценность новизны и неожиданности как формы вознаграждения, нейробиологи обнаружили подобный механизм в нашем мозге.

Вместе с тем становится понятнее, как эти полезные механизмы могут выйти из-под контроля. Агенты обучения с подкреплением способны почувствовать непреодолимую тягу к переключению каналов или игровым автоматом, и то же самое может произойти и с нами. Поскольку результат в таких ситуациях никогда в точности не совпадает с ожиданиями, там всегда присутствует элемент неожиданности, создающий иллюзию возможности чему‐то «научить». Мы не привыкли думать о зависимости как об избытке мотивации и любопытства, но, по сути, именно так этот механизм и работает.

Предыдущая главаГлава 54 из 83Следующая глава