К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 2 Агенты. 6. Любопытство
58%
Часть 2 Агенты. 6. Любопытство
48

Для того, чтобы нетренированный детский мозг стал интеллектуальным, потребуются и дисциплина, и находчивость. Пока что мы думали только о дисциплине.

Весной 2008 года аспирант Марк Беллемаре и информатик Майкл Боулинг из университета Альберты прогуливались по пляжу Барбадоса. У Боулинга была идея.

Исследования обучения с подкреплением тогда проводил один ученый, который с нуля делал свою уникальную игру, а потом вручную настраивал для нее удачную систему [463]. Боулинг же размышлял о создании единой среды, которую каждый мог бы использовать, – целой библиотеки игр. Причем не каких‐нибудь рандомных, а настоящих – классических видеоигр 1970‐х и 1980‐х, в которые играли на Atari 2600?

«Я посчитал эту идею глупее некуда [464], – вспоминал Беллемаре. – Но спустя три изменил свое мнение». Более того, идея настолько ему понравилась, что стала темой диссертации, а Боулинг – научным руководителем.

Цель проекта могла показаться несколько безумной. И не только из-за колоссального объема работы по созданию «бестиария» видеоигр, который ученые назвали Аркадной обучающей средой (Arcade Learning Environment, ALE), но и из-за череды сложнейших задач, которые она поставила перед всей отраслью [465]. Идея исследователей заключалась в том, чтобы создать единую самообучающуюся систему, способную играть не в одну, а сразу во все шестьдесят игр. Отрасль была к этому совершенно не готова.

Главная проблема состояла в том, что игровые среды, создаваемые прежде по индивидуальным заказам, обычно описывали агенту мир в упрощенных, отфильтрованных терминах, предоставляя ему уже готовые полезные данные. Например, в задаче с балансирующей тележкой система получала бы на вход точные координаты тележки, ее скорость, угол наклона шеста и так далее. В двумерном мире с деревьями и хищниками системе сразу сообщили бы ее местоположение, уровень здоровья, где находится еда и есть ли поблизости враги. Эти единицы информации называются «ключевыми характеристиками».

ALE же, напротив, предлагала нечто более сложное и менее пригодное для немедленного использования – набор пикселей на экране. И все. Каждая игра отличалась от другой не только правилами, но и тем, как именно пиксели передавали полезную информацию. При запуске обучаемой системы в новую игру ей приходилось разбираться во всем с нуля: «эти пиксели мигают, когда я получаю очки», «те появляются перед моей смертью», «а эти в центре сдвигаются влево, когда я жму клавишу „влево“ – о, может быть, это я и есть!». Исследователям пришлось бы либо искать универсальные способы извлечения полезных паттернов из происходящего на экране (подходящие для всех шестидесяти игр), чтобы система могла отслеживать свое состояние, либо разрабатывать алгоритм, способный находить смысл во всем на лету. Так возникла проблема «выделения признаков».

Беллемаре начал экспериментировать, подключая различные алгоритмы извлечения признаков к стандартным системам обучения с подкреплением и запуская их в игры. Результаты были далеко не впечатляющими. Тем не менее, к его удивлению, опубликовать их оказалось несложно – хотя бы потому, что рецензенты были потрясены объемом проделанной работы по воссозданию среды игр Atari. «Самое забавное, – рассказывал Беллемаре, – порой рецензенты так мне и говорили: „Ты сделал нечто потрясающее с Atari. Я просто не могу отклонить твою статью“. Система была настолько масштабной, что качество результатов уже не имело значения. Люди говорили: „Ух ты, ты и вправду это сделал!“»

Фактически Беллемаре с коллегами воздвигли гору, и теперь предстояло найти способ на нее взобраться.

Получив докторскую степень в 2013 году, Беллемаре переехал из Эдмонтона в Лондон, чтобы работать в компании DeepMind [466]. Там команда под руководством Владимира Мниха увлеченно работала над идеей использовать нейросети глубокого обучения (похожие на AlexNet, блестяще выступившую на конкурсе ImageNet годом ранее) в задачах обучения с подкреплением. Если глубокие нейросети могут анализировать десятки тысяч необработанных пикселей и понимать, что перед ними – рогалик, банджо или бабочка, возможно, они справятся и с выделением признаков, необходимых для осмысления происходящего на экране Atari.

Беллемаре вспоминает слова кого‐то из группы: «У нас есть сверточные нейросети. Они прекрасно показали себя в классификации изображений. Что, если заменить ваш несколько топорный механизм извлечения признаков такой нейронной сетью?»

Беллемаре принял эту мысль не сразу. «Честно говоря, я долго не верил… Идея перцептивного обучения с подкреплением выглядела очень, очень странно. И, знаете, я относился со здоровой долей скептицизма к возможностям нейронных сетей».

Но вскоре ему пришлось изменить свое мнение.

Просто добавив глубокое обучение к классическому алгоритму обучения с подкреплением и протестировав его на семи играх Atari, Мних сумел побить рекорды предыдущих алгоритмов в шести из них. Более того, в трех играх программа показала результат, сопоставимый с уровнем человека. Чтобы зафиксировать успех, исследователи выступили с докладом на семинаре в конце 2013 года [467]. «Это стало своего рода доказательством того, что сверточные нейронные сети действительно на такое способны», – говорил Беллемаре.

«По сути, – продолжал он, – внедрение глубокого обучения сделало то, чего исследователи в области обучения с подкреплением не могли достичь долгие годы: оно позволило создавать признаки на лету. Теперь это стало возможным для любой игры, неважно какой. А потом все это… – Беллемаре сделал небольшую паузу, – обрело невероятную популярность».

Предыдущая главаГлава 48 из 83Следующая глава