К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 2 Агенты. 5. Формирование навыков. Проблема разреженности
49%
Часть 2 Агенты. 5. Формирование навыков. Проблема разреженности
41

Есть способ сделать это лучше… найдите его!

Шотландский философ Александр Бейн в 1855 году первым применил фразу «методом проб и ошибок», описывая обучение людей и животных [402]. (Другое его крылатое выражение «эксперимент вслепую» известно не меньше, но не настолько закрепилось в языке.)

По своей сути обучение с подкреплением – это обучение методом проб и ошибок, а простейший алгоритм, формирующий эти пробы (или поиск на ощупь, если угодно), – это «эпсилон-жадный алгоритм» (можно написать и с греческой буквой ε «ε-жадный»). Букву ε используют математики, чтобы обозначить «малую толику», а «ε-жадный» – это сокращение от «будь жадным всегда, кроме малой толики времени». Субъект, управляемый ε-жадным алгоритмом, почти все время – скажем, в 99 % случаев – предпринимает действия, которые, по его мнению, принесут наибольшее вознаграждение в целом. При этом он основывается на том ограниченном опыте, который получил на данный момент. Но ε времени – например, оставшийся 1 % – он пробует сделать что‐то абсолютно случайным образом. Допустим, в игре на приставке Atari какую‐то часть времени он нажимает рандомные кнопки, чтобы посмотреть, что произойдет.

В обучении по такому исследовательскому поведению могут быть нюансы, но общая идея сохраняется. Пробуйте разное, делайте больше того, что принесет награду, и меньше того, за что могут наказать. Этого можно добиться, попытавшись понять, как работает мир («основанное на модели обучение с подкреплением»), или доводя до совершенства интуицию («безмодельное» обучение). Можно узнать, сколько вознаграждений приносит то или иное состояние или действие («оценочное» обучение), или понять, какие стратегии работают лучше других (обучение, связанное с политикой). Как бы то ни было, все подходы строятся вокруг идеи о том, чтобы сперва прийти к успеху случайно, а потом чаще использовать рабочие методы.

Как выяснилось, некоторые задачи согласуются с этим подходом лучше, чем другие.

В таких играх, как Space Invaders, на вас обрушиваются полчища врагов, и все, что вам остается – это двигаться направо или налево и стрелять. Случайные нажатия на клавиши, возможно, позволят уничтожить несколько врагов, которые принесут некоторое количество очков. Первые очки можно использовать для обучения, что усилит определенные схемы поведения и разработает лучшие стратегии. Например, вы поняли, что выстрелы приносят очки, поэтому стреляете чаще. Такие игры имеют «плотную» систему вознаграждений, поэтому в них достаточно легко научиться играть.

В других играх, скажем, в шахматах, вознаграждение дается гораздо позже, но оно точно есть. Шахматная партия так или иначе заканчивается через несколько десятков ходов, а правила не дадут сделать больше пары сотен ходов. Даже если вы не имеете ни малейшего понятия о стратегии и двигаете фигуры случайным образом, все равно задолго до конца партии поймете, победите ли, проиграете или сыграете вничью.

Существует ряд ситуаций, когда получение какого‐либо вознаграждения сродни чуду. Скиннер, разумеется, обнаружил их в первую очередь, пытаясь вознаградить птицу за то, что она забросила крошечный мяч на миниатюрную дорожку для боулинга. Голубь, который понятия не имел, в какую игру играет, мог провести годы, вырабатывая правильное поведение, если бы, конечно, за это время не умер с голоду.

Все вышесказанное справедливо и для механических «учеников». К примеру, чтобы человекоподобный робот пнул футбольный мяч в ворота, могут потребоваться десятки тысяч движений в десятках шарниров, и все они должны быть идеально скоординированы. Трудно себе представить робота, который двигает десятками своих шарниров случайным образом, чтобы встать прямо, не говоря уж о том, чтобы осмысленно контактировать с мячом и посылать его в ворота.

Исследователи обучения с подкреплением называют это проблемой разреженных вознаграждений, или проблемой разреженности. Если вознаграждение явно выражено в конечной цели или в чем‐то достаточно близком, следует просто ждать, пока случайные нажатия на кнопки или блуждание не приведут к желаемому результату. Математика доказывает, что большинство алгоритмов машинного обучения в конце концов до него доберутся, но это может случиться намного позже взрыва Солнца. Если вы пытаетесь натренировать программу для игры в го так, чтобы она могла победить чемпиона мира, и даете ей одно очко каждый раз, когда чемпион сдается, и ни одного очка в ином случае, результата придется ждать очень долго.

Проблема разреженности имеет последствия для безопасности. Будьте осторожны, если когда‐нибудь в будущем будете разрабатывать сверхумный искусственный интеллект с широким набором возможностей, использующий эпсилон-жадный алгоритм обучения с подкреплением, и решите вознаграждать его одним очком, если он вылечит рак, и не давать ни одного очка в ином случае. Ему потребуется перепробовать множество случайных методов, прежде чем он получит первое вознаграждение. Многие из них могут быть просто отвратительными.

В разговоре с Майклом Литтманом из Брауновского университета, посвятившим всю свою жизнь работе в области обучения с подкреплением, я спросил, был ли его исследовательский интерес к подкреплению полезен ему как родителю. В голову Литтману сразу же пришла проблема разреженности. Он вспомнил, как шутил с женой об использовании разреженных вознаграждений для их сына. «Давай так: пока ты не заговоришь по-китайски, мы не будем тебя кормить! Прекрасная мотивация! Посмотрим, как она работает! – Тут Литтман рассмеялся. – Моя супруга довольно приземленный человек… Она ответила: „Нет, в такие игры мы не играем!“» [403]

Разумеется, Литтман, как и Скиннер, знал, что в эту игру не стоит ввязываться. Проблема разреженности заставила сообщество исследователей обучения с подкреплением совершить экскурс в прошлое, во времена Скиннера, и они достаточно прямолинейно восприняли его советы [404]. В частности, идеи о формировании навыков привели к двум отдельным, хотя и перекликающимся, направлениям мысли: о последовательности режимов и о средствах поощрения, или стимулах.

Предыдущая главаГлава 41 из 83Следующая глава