В 2013 году Дилан Хэдфилд-Менелл поступил в Калифорнийский университет в Беркли после получения степени магистра в Массачусетском технологическом институте, где он учился под руководством пионера робототехники и обучения с подкреплением Лесли Кэлблинг. Он предполагал, что тема его будущей докторской диссертации в лаборатории Стюарта Рассела станет логичным продолжением магистерской работы, то есть он займется постановкой задач для роботов и программированием перемещений. Однако в тот год Рассел был в творческом отпуске. Когда весной 2014 года он вернулся, все изменилось.
«У нас было большое собрание, на котором мы обсуждали планы, – вспоминал Хэдфилд-Менелл. – Рассел изложил свое видение будущих исследований. Он прямо не назвал проблему „выравнивания“, но задал вопрос: „Что может пойти не так, если мы добьемся реального успеха в создании ИИ?“ Рассел рассказал, что начинает всерьез задумываться о долгосрочных рисках: чем гибче и мощнее становятся самообучащиеся системы, тем важнее строго контролировать, чему именно они учатся». Во время работы в Париже эти опасения лишь окрепли. Рассел вернулся в Беркли с твердой уверенностью, что этой теме необходимо посвятить как научные исследования, так и общественные дискуссии.
«Идеи для исследований появились практически сразу, – говорил Рассел [676]. – Решением казались системы ИИ, чьи ценности согласованы с человеческими, то есть такие системы, которые разделяют наши цели. И, по сути, еще с конца 1990‐х годов я занимался именно этой проблемой в рамках концепции обратного обучения с подкреплением».
Я отметил, что есть определенная ирония в том, что его новая программа по безопасности ИИ выросла из идеи двадцатилетней давности. Ленивые размышления Рассела по пути в Safeway спустя два десятилетия превратились в план спасения цивилизации от возможной катастрофы. «Это всего лишь совпадение, – пояснил он. – Но, по правде сказать, все это научное направление выросло из целой чреды совпадений, так что все нормально».
На том историческом собрании лаборатории Рассел обозначил несколько конкретных тем, заслуживающих стать основой для докторских диссертаций. Хэдфилд-Менелл продолжил заниматься робототехникой, но в глубине души постоянно возвращался к проблеме согласования ценностей. Поначалу его привлекал чисто интеллектуальный азарт первооткрывателя – возможность погрузиться в неисследованную область и внести в нее весомый вклад. Но со временем пришло иное понимание: «Казалось, что это невероятно важная проблема, на которую совершенно не обращают внимания». Весной 2015 года он решил радикально сменить тему диссертации и направление своей карьеры.
«В то время я даже в душе думал только о выравнивании ценностей, – признался Хэдфилд-Менелл.
Одним из первых их совместных проектов с Расселом стал пересмотр самой структуры обратного обучения с подкреплением. Вместе с Питером Аббелем и специалистом по робототехнике из Беркли Анкой Драган они начали переосмысливать эту концепцию с нуля. И здесь они нащупали две ключевые идеи.
История с обучением вертолета, как и почти все в этой отрасли, строилась на четкой границе между человеком и машиной. Пилот-эксперт просто выполнял трюки, а компьютер в изоляции пытался извлечь из этих демонстраций пользу. Каждый действовал сам по себе, словно в вакууме. Но что, если бы человек с самого начала знал, что у него есть старательный искусственный ученик? Что, если бы они осознанно работали вместе? Как бы это выглядело?
Вторая важная деталь заключалась в том, что в традиционном IRL машина принимает функцию вознаграждения человека как свою собственную. Если пилот показывает фигуру «хаос», компьютерный алгоритм тоже пытается ее выполнить. Иногда это имеет смысл: мы хотим безопасно ездить на работу и рады, когда наш беспилотный автомобиль усваивает этот прозрачный набор целей. Но в других случаях нам нужно что‐то менее прямолинейное. Потянувшись за фруктом, мы не хотим, чтобы домашний робот сам съел банан. Мы, скорее, ожидаем от него поведения полуторогодовалого ребенка: заметив, что мы не можем дотянуться до предмета, он берет его и передает нам [677].
Рассел назвал эту новую парадигму совместным обратным обучением с подкреплением (Cooperative Inverse Reinforcement Learning, CIRL) [678]. В этой модели человек и компьютер работают вместе, чтобы максимизировать общую функцию вознаграждения, суть которой изначально известна только человеку.
«Мы думали: какое простейшее изменение можно внести в существующий математический аппарат, чтобы устранить саму конструкцию, порождающую риски глобальной катастрофы? – объяснял Хэдфилд-Менелл. – Какая математическая задача даст то оптимальное решение, которое нам действительно нужно?» [679]
Для Рассела это было не просто легким изменением формулировок, а своего рода шахом и матом – фундаментальным решением проблемы согласования. По масштабу это было сродни открытию Коперника в основах ИИ. Как пояснял Рассел, на протяжении последнего столетия мы пытались создавать машины, способные достигать своих целей. Это подразумевалось практически во всех работах, а вопросы безопасности сводились к тому, как контролировать эти цели и формулировать задачи так, чтобы в них не было лазеек. Рассел предположил, что, возможно, саму идею следует вывернуть наизнанку. «Что, если вместо того, чтобы позволять машинам преследовать их собственные цели, мы потребуем от них добиваться наших целей? – рассуждал ученый. – Пожалуй, именно к этому нам и следовало стремиться с самого начала» [680].
Появление концепции совместного обучения открыло новые горизонты. Исследователи машинного обучения и робототехники стали все чаще обращаться за идеями к детской психологии, педагогике, психологии развития, проектированию интерфейсов и изучению взаимодействия человека с компьютером. Неожиданно целые отрасли знаний оказались не просто полезными, а жизненно важными [681]. Модель сотрудничества – понимание того, что мы совершаем действия, зная, что за нами наблюдают и пытаются разгадать наши намерения, – заставляет нас совершенно иначе взглянуть на поведение как человека, так и машины.
Работа с этими возможностями продолжается, еще многое предстоит узнать. Но исследователи уже сделали несколько ключевых открытий.
Во-первых, когда мы осознаем, что обучаем кого‐то, мы можем делать это гораздо понятнее и эффективнее, чем если бы вели себя естественно. «Модель CIRL мотивирует человека учить, – пишет группа исследователей из Беркли, – а не просто выжимать максимум из награды» [682]. Мы можем не только давать прямые инструкции, но и действовать более информативно, и последовательно. Зачастую мы делаем это автоматически, даже не задумываясь.
К примеру, доказано, что напевный ритм речи («сюсюканье»), который взрослые используют при общении с маленькими детьми, имеет глубокий педагогический эффект. Дети, с которыми так говорят, быстрее овладевают языком. Осознаем мы это или нет, но именно такова наша эволюционная цель [683].
Подобное происходит не только в языке, но и в движениях. Мы интуитивно выстраиваем свое поведение так, чтобы окружающим было легче его «прочитать». Возьмем простую задачу – передать предмет другому человеку. Мы берем вещь не самым удобным для себя хватом, вытягивает руку далеко вперед и замираем. Другой человек понимает, что мы бы никогда не приняли такую позу, если бы не подавали четкий сигнал: «Я хочу передать это тебе» [684].
Специалисты по информатике быстро взяли на вооружение эти открытия из области педагогики и психологии. Главная идея работает в обе стороны: мы хотим вести себя так, чтобы машины нас понимали, и мы хотим, чтобы машины действовали интуитивно «считываемым» для нас образом.
Один из ведущих специалистом в этой области – робототехник Анка Драган из Беркли, автор термина «понятное движение» [685]. По мере того как роботы взаимодействуют с людьми все теснее, они должны вести себя не просто максимально эффективно или предсказуемо, но и ясно транслировать свои скрытые намерения. Драган приводит в пример ситуацию с двумя бутылками на столе. Если робот потянется к одной из них по одеяльной прямой (самой короткой и эффективной траектории), человеку будет по последнего момента неясно, какую именно бутылку он хочет взять. Но если манипулятор двинется по широкой гиперболе, мы сразу поймем его цель. В этом смысле предсказуемость и понятность (распознаваемость) – противоположности. Предсказуемость означает, что наблюдатель уже знает вашу цель и может угадать маршрут, а понятность означает, что наблюдатель цели не знает, но маршрут помогает ее быстрее угадать.
Помимо понимания важности «педагогического» поведения, появилось и второе важное открытие. Сотрудничество оказывается гораздо эффективнее, когда оно выстроено как непрерывное взаимодействие, а не как две изолированные фазы: «сначала учись, потом делай».
Ян Лейке столкнулся с этим в своей работе по обучению с помощью обратной связи от человека. «Одной из самых интересных деталей в той статье стало то, что в итоге уместилось в обычную сноску, – говорил он. – Это примеры так называемого взлома системы вознаграждений».
Если агент сначала тратит все время на изучение функции вознаграждения, а лишь затем приступаем к оптимизации поведения, это часто заканчивается катастрофой. Агент находит лазейку, использует ее и перестает развиваться. Например, Лейке учил агента играть в Pong, используя только оценки коротких видеоклипов с его игрой, которые давали люди. В одном из экспериментов компьютер научился идеально отслеживать летящий мяч ракеткой, но… пропускал его в самую последнюю секунду. Поскольку у него не было доступа к реальному счету, он понятия не имел, что пропускает самый важный момент игры.
В другом эксперименте система научилась безупречно отбивать мяч и защищать свою половину поля, но даже не пыталась забить гол, просто поддерживая бесконечную перепасовку.
«С точки зрения безопасности это крайне полезный опыт, – говорил Лейке. – Мы хотим понять, как происходят подобные сбои, и придумать защиту от них».
Выяснилось, что когда обратная связь от человека вплеталась в процесс на всем протяжении обучения (а не загружалась только на старте), такие проблемы обычно решались сами собой [686]. Это еще один аргумент в пользу того, что строгую парадигму «смотри и учись» стоит заменить гибкой моделью непрерывного сотрудничества.
Джули Шах из Массачусетского технологического института, изучающая сотрудничество человека и робота в реальном мире, пришла к аналогичному выводу. «Много лет меня интересовало, как можно совместно оптимизировать процесс обучения человека и машины», – рассказывала она. Работа с роботами привела ее к изучению исследований по подготовке человеческих команд. Люди, безусловно, реагируют на поощрения, но в человеческих коллективах редко применяется грубое микроуправление через систему мелких наград за каждое действие. «Если вы обучаете систему через интерактивное назначение вознаграждений, это больше похоже на дрессировку собаки, чем на обучение человека», – объясняла Джули [687]. Простая демонстрация тоже не всегда помогает. «Это отличный способ односторонней передачи навыка, – говорила Шах. – Но он не работает, когда речь идет о координации совместных взаимозависимых действий человека и машины». Демонстрировать парную работу гораздо сложнее.
Выводы из исследований человеческих коллективов однозначны. «Существует серьезная литература, доказывающая, что явное инструктирование и командование вторым человеком – худший способ наладить командную работу. Знаете, когда об этом задумываешься, кажется, что это очевидно… И тем не менее, это худший из возможных методов командного тренинга», – говорила Шах.
«Но есть и другие исследования, – добавляет она. – Представьте команду людей с общей целью. Если каждый понимает цель, но у них разные, несогласованные стратегии ее достижения, а их работа взаимозависима, они покажут гораздо худший результат, чем команда с не самой оптимальной, но единой и согласованной стратегией». Практически в любом коллективе – в бизнесе, армии, спорте или музыке – наличие общей глобальной цели подразумевается само собой. Но этого недостаточно. Нужен общий план.
В командах людей отлично работает так называемое перекрестное обучение. Коллеги на время меняются ролями. Внезапно оказавшись на месте напарника, человек начинает понимать, как изменить свою работу, чтобы она лучше стыковалась с потребностями и процессами других. Перекрестное обучение – это золотой стандарт командного тренинга, который применяется на производстве, в медицине и армии [688].
Шах задалась вопросом: сработает ли это во взаимодействии человека и робота? Можно ли перенести лучший метод подготовки людей прямо в робототехнику? Идея казалась безумной: «Это походило на чисто психологический эксперимент, – вспоминала она. – Мы думали, есть ли в этом смысл. Идея настолько странная, что стоит ее проверить».
Так они и поступили. Исследователи хотели выяснить два момента: способно ли перекрестное обучение конкурировать с традиционными методами машинного обучения, и (что весьма необычно для таких тестов) поможет ли оно самому человеку лучше понять, как обучать робота и работать с ним.
Группа Шах смоделировала реальную производственную задачу: совместную установку и закручивание болтов (только без шуруповерта). Они сравнили традиционные методы – демонстрацию и обратную связь – с перекрестным обучением [689].
«Результаты нас поразили и очень вдохновили, – рассказывала исследовательница. – Перекрестное обучения привело к улучшению объективных показателей командной работы». Люди чувствовали себя увереннее, выполняя задачи параллельно с роботом, а не по очереди; это сократило время простоя и повысило общую производительность [690].
Но еще интереснее оказались субъективные оценки. По сравнению с контрольной группой, которая использовала классическое обучение, люди, прошедшие перекрестные тренировки, заявляли, что больше доверяют роботу и считают, что он подстраивается под их индивидуальный стиль работы.
Как бы невероятно это ни звучало, но лучший метод тренировки человеческих коллективов удалось успешно перенести в робототехнику. Это дает надежду на то, что и будущие открытия из психологии найдут свое применение в ИИ – и наоборот.
«Это было базовое исследование на относительно простой задаче, – говорила Шах. – Но даже здесь мы получили статистически значимые результаты. Это открывает огромные перспективы для изучения методов подготовки людей и их адаптации для смешанных команд человека и робота» [691].