Обучение с подкреплением, берущее начало в исследованиях об обучении животных начала ХХ века, расцвело в абстрактном математическом мире машинного обучения 1970‐х и 1980‐х годов, чтобы с триумфом вернуться в литературу о поведении животных с практически идеальной моделью, которая привела к общепринятому пониманию роли дофамина в головном мозге [379]. Эта модель, в свою очередь, дала нам более глубокое осознание человеческих мотивации и счастья.
Тем временем уже в 2018 году нейрофизиологические материалы позволили предположить, что сумасшедшая гипотеза Гарри Клопфа о том, что нейроны являются «гедонистами», мотивированными своими собственными законами эффекта Торндайка, не так уж далека от истины [380]. «Думаю, нейронаука приближается к чему‐то, очень напоминающему предположение Клопфа», – говорил Барто с некоторой гордостью за покойного наставника, которому они с Саттоном посвятили свой учебник [381].
Обучение с подкреплением предлагает веское и, возможно, даже универсальное определение интеллекта [382]. Если, как говорит специалист по информатике Джон Маккарти, интеллект – «это вычислительная часть способности достигать целей в окружающем мире» [383], тогда обучение с подкреплением представляет удивительно всеобъемлющий набор инструментов для достижения таких целей. Похоже, что основные принципы интеллекта раз за разом открывались эволюцией, и – опять же – кажется, будто именно они сформируют основание для того, что ожидает в будущем искусственный интеллект XXI века.
В некотором роде более глубокое понимание способности животных и машин достигать целей в мире опрокидывает более сложные философские воззрения. Эта теория никоим образом не говорит о том, что мы оцениваем или что должны оценивать. Дофамин остается такой же загадкой, как и когда о его роли знали намного меньше. Если это скалярная ошибка прогноза, то сложность в том, как этот прогноз «измерить». Если за дверью номер один находится не отпуск на Карибских островах, как мы ожидали, а путешествие в страну северных сияний, уровень дофамина быстро и надежно покажет, приятно или неприятно мы удивлены. Но как в действительности определяется ценность этих альтернатив? [384] Об этом дофамин ничего не говорит.
Тем временем возникает еще один вопрос. Обучение с подкреплением в своей классической форме считает само собой разумеющейся структуру вознаграждений в мире и задается вопросом о том, как добиться такого поведения – «политики», – чтобы максимально увеличить награды. Но во многих случаях за этим прячется куда более интересная и безотлагательная проблема, с которой мы столкнулись на пороге развития ИИ. Мы гораздо более заинтересованы в обратной стороне этого вопроса: зная, какого поведения мы ожидаем от машин, как структурировать вознаграждения в окружающей среде так, чтобы ожидания оправдались? Как мы получим то, чего хотим, если это мы сидим в задней части аудитории на стуле критика, если мы распределяем лакомства или их цифровые эквиваленты?
Это и есть проблема выравнивания в контексте обучения с подкреплением. Хотя за последние пять или десять лет вопрос стал неотложным – как мы увидим, он прочно связан с прошлым самого обучения с подкреплением.