К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 2 Агенты. 4. Подкрепление. Гипотеза о вознаграждении
41%
Часть 2 Агенты. 4. Подкрепление. Гипотеза о вознаграждении
34

Барто и Саттон взяли идею Гарри Клопфа об организме, стремящемся к максимуму, и придали ей конкретную математическую форму. Представьте, что вы можете получить определенное вознаграждение. Оно доступно, если вы выполните конкретные действия и достигнете конкретного состояния. Ваша работа – получить максимальное вознаграждение, то есть самое большое количество очков, какое сможете набрать.

Представьте, что при этом вы в лабиринте – тогда вы можете двигаться на север, запад, юг или восток, а вознаграждение получаете, когда доберетесь до выхода (за вычетом небольшого штрафа за превышение времени). Или на шахматной доске – тогда вы двигаете фигуры и получаете по одному очку, когда ставите сопернику мат (и половину очка за ничью). Или на фондовом рынке – тогда вы покупаете и продаете, а ваше вознаграждение измеряется долларовой стоимостью вашего портфеля акций. Для усложнения этих сценариев нет никаких границ до тех пор, пока вознаграждения остаются скалярными, то есть сопоставимыми, измеримыми, в единой валюте. Это может быть даже национальная экономика, где придется принимать законодательные акты и заниматься дипломатией, а вознаграждением будет рост ВВП в течение продолжительного времени.

Структура обучения с подкреплением показала себя настолько общеприменимой, что привела к идее, которую назвали «гипотезой о вознаграждении»: «Все, что мы подразумеваем под целями и стремлениями, можно описать как максимизацию ожидаемого накопленного скалярного вознаграждения» [325].

«Это почти что философское понятие, – говорит Ричард Саттон. – Но вы на это покупаетесь» [326].

Разумеется, не каждый принимает эту идею с такой готовностью. В спорте, в настольных и компьютерных играх, в финансах в самом деле может существовать такое скалярное число, единая валюта (буквально или в переносном смысле) для измерения результатов, но можно ли этот подход применить к такой сложной и многообразной вещи, как жизнь человека или даже животного? Мы часто вынуждены принимать решения, результаты которых напоминают, образно говоря, яблоки и апельсины. Задержимся ли мы на работе, улучшив отношения с начальником, но подвергнув испытанию терпение нашей второй половины? Предпочтем ли жизнь, полную достижений, жизнь, полную приключений, жизнь, полную связей с другими людьми, или путь духовного роста? Например, философ из Оксфордского университета Рут Чанг несколько десятков лет утверждала, что ничто так не характеризует человеческую природу, как несоизмеримость имеющихся у нас мотивов и целей. Мы просто не можем сделать жизненно важный выбор, взвесив возможные альтернативы и приняв решение о том, что будет лучше. Иначе в мире не было бы места морали – только чистый разум. Не было бы возможности придавать вещам смысл и развивать личность [327].

Сам Саттон допускал, что гипотеза о вознаграждении, «возможно, в конце концов окажется неверной, но она так проста, что нам придется ее опровергнуть, прежде чем задумываться о чем‐то более сложном».

Даже если предварительно принять концепцию максимизации вознаграждения и соразмерность скалярных наград, мы обнаружим, что довести гетеростаз до максимума сложнее, чем кажется. Проблема обучения с подкреплением сопряжена и с философскими, и с математическими трудностями.

Первая проблема состоит в том, что наши решения связаны друг с другом. Здесь обучение с подкреплением немного отличается (и это отличие имеет значение!) и от неконтролируемого обучения (основанного на векторной презентации слов, о которой мы говорили в главе 1), и от контролируемого (используется везде: от конкурса ImageNet до распознавания лиц и предсказания риска рецидивизма). При установке параметров последних каждое решение принимается само по себе. Вашей системе показывают изображение – скажем, гриба лисички обыкновенной – и просят отнести его к определенной категории. Система может дать правильный ответ, может ошибиться, в случае ошибки ее параметры могут быть настроены, но в любом случае вы просто вытягиваете наугад еще одну фотографию из коллекции и продолжаете показ. Данные, поступающие на вход, – это то, что статистики называют «н. о. р.», – независимые и одинаково распределенные. Не существует никакой причинно-следственной связи между тем, что мы видим, что делаем и что увидим потом.

При обучении с подкреплением – в лабиринте, шахматной партии, да и в самой жизни – мы не можем принимать решения в вакууме. Каждое решение порождает контекст, в котором принимается следующее решение, и этот контекст может постоянно изменяться. Если мы передвинем шахматные фигуры определенным образом, то значительно ограничим типы позиций, с которыми можем столкнуться, и типы стратегий, которые могут оказаться полезными для дальнейшей игры. В существующем мире – виртуальном или реальном – движению неизбежно присуще одно свойство: любое действие, которое мы предпринимаем – свернуть на север, заглянуть в лицо любимому, провести зиму во Флориде, – определяет будущие входные данные, на время или навсегда. Если мы жертвуем ферзем, этой фигуры у нас не будет до конца игры. Если мы прыгаем с крыши, возможно, мы больше никогда не сможем прыгать. Если мы плохо с кем‐то поступили, мы можем потом всю жизнь переживать, как этот человек теперь поведет себя с нами, и можем никогда не узнать, как бы он повел себя, если бы мы были добрее.

Вторая проблема обучения с подкреплением по сравнению с контролируемым и неконтролируемым обучением в том, что награды и наказания, которые мы получаем от окружающей среды, по причине скалярности очень сжаты. Языковой модели, обучающейся находить отсутствующее слово, после каждой попытки сообщают, какой вариант был правильным. Классификатор изображений, пытающийся определить нужную категорию, немедленно получает верную подпись для картинки. Затем программа явным образом настраивается в сторону правильного ответа. Напротив, при обучении с подкреплением попытки изо всех сил увеличить счет в какой‐либо обстановке приводят к тому, что система узнает итоговый счет, но она, выиграв или проиграв, может никогда не узнать, какие «правильные» или «лучшие» действия следовало предпринять. Когда взрывается ракета, или рушится мост, или падает стопка тарелок, которую вы пытались донести до мойки, или пущенный вами мяч летит мимо ворот, результат абсолютно понятен всему миру. Однако никто не скажет, как именно вы должны были поступить.

Как заключает Эндрю Барто, обучение с подкреплением больше похоже не на обучение с учителем, а на обучение с критиком [328]. Критик может быть сколь угодно умным, но он куда меньше склонен помогать. Учитель будет заглядывать в вашу работу через плечо, мгновенно исправлять сделанные ошибки и говорить или показывать, как следовало поступить. Критик ждет, когда вы закончите свою работу, а потом выкрикивает: «Фу!» с заднего ряда аудитории, не давая никаких намеков на то, что именно ему не понравилось или что конкретно он предпочел бы видеть. Критик может не дать вам никакого намека или конструктивной обратной связи; у него самого может не остаться ничего, кроме некой степени, как говорил Торндайк, «удовлетворения или раздражения».

В-третьих, обратная связь оказывается не только скудной и неконструктивной, она еще и откладывается. Мы, к примеру, можем сделать безнадежный промах на пятом ходу игры, а последствия скажутся лишь сто ходов спустя. На ум приходит фраза, сказанная тем, кто испытывает горечь проигрыша или поражения, – разочарованным родителем, обанкротившимся бизнесменом, пойманным воришкой: «Где же я ошибся?» В обучении с подкреплением это называется задачей назначения коэффициентов доверия, исследователи пытаются решить ее с середины прошлого века. Например, Марвин Минский из Массачусетского технологического института писал в своей знаменитой статье 1961 года «Шаг к искусственному интеллекту»: «Когда кто‐то играет в сложную игру, такую как шашки или шахматы, или занимается написанием компьютерной программы, у него есть определенный критерий успеха: проигрыш или выигрыш. Но в процессе каждый конечный успех (или провал) связан с большим количеством внутренних решений. Если в итоге все получилось, как мы можем расставить коэффициенты доверия среди множества решений?» [329]

Минский развивает мысль, подчеркивая главный вопрос: «Предположим, что при выполнении сложного задания, такого как победа в шахматной партии, принимается миллион решений. Можем мы приписать каждому из этих решений… одну миллионную долю коэффициента доверия за выполненное задание?»

После автомобильной аварии, случившейся спустя несколько дней путешествия через всю страну, мы не прослеживаем все свои действия до того момента, как вставили ключ в зажигание, а думаем: «Никогда в жизни больше не сверну налево, выезжая со двора!» Аналогично, если нам поставили мат на 89‐м ходе игры, мы полагаем, что грубую ошибку должны были сделать на 88‐м.

Так как же определить правильные уроки, которые мы можем извлечь как из успеха, так и из поражения? Схема обучения с подкреплением начала открывать целую вереницу фундаментальных проблем обучения и поведения, которые развились в полноценную отрасль и определили курс исследований искусственного интеллекта вплоть до текущего десятилетия. Как и предсказывал Гарри Клопф, мы получили ряд новых вопросов для окружающего нас естественного интеллекта.

Предыдущая главаГлава 34 из 83Следующая глава