Поразмышляйте о том, что подражание – самая приемлемая часть молитвы и что боги гораздо больше хотели бы, чтобы человеческий род им подражал, а не льстил.
Для все большего числа философов и специалистов по информатике, задумывающихся о далеком будущем, перспектива появления гибких интеллектуальных систем, в которые нам предстоит вложить сложнейшие модели поведения и ценности, вызывает вопросы куда более сложные, чем просто технические.
Здесь есть две основных трудности.
Первая состоит в том, что наши желания очень трудно выразить недвусмысленно даже словами, не говоря уж о цифрах. Как отмечает Ник Бостром из Института будущего человечества: «Кажется невозможным составить полный список всего, что нас волнует» [628]. В таких случаях мы уже видели успех методов подражания – там, где сложно формализовать каждую мелочь, делающую человека хорошим водителем или игроком в го, простая команда «смотри и учись» часто дает впечатляющие результаты. Вполне возможно, что по мере того, как автономные системы будут становиться мощнее и универсальнее, мы сможем использовать этот же подход, чтобы объяснить им не только правила игры или вождения, но и то, что значит жить хорошо – как для отдельного человека, так и для общества.
Вторая, более глубокая проблема заключается в том, что и традиционное обучение с подкреплением (через награды), и обучение с подражанием требуют от человека роли высшего авторитета. Системы, обучающиеся подражанию, могут превзойти своих учителей только в двух случаях: либо если ошибки неидеальных учителей взаимно нейтрализуются на большой дистанции, либо если эксперты, не способные показать идеальное исполнение, могут хотя бы распознать его.
Если заглянуть в будущее, где мощные системы будут действовать в сложных и неоднозначных условиях реального мира, обе эти проблемы становятся критическими.
Некоторые, например, беспокоятся, что люди – не лучший пример для подражания в вопросах морали. «Мы много говорим о том, как заложить в машины человеческие ценности, – отмечал Блез Агуэра-и-Аркас из Google. – Но я не считаю это главной проблемой. Куда важнее, что человеческие ценности в их нынешнем виде недостаточно хороши» [629].
Элиезер Юдковский, сооснователь Института исследований машинного интеллекта, в своей влиятельной работе 2004 году утверждал: чтобы наделить машины способностью не просто копировать наши нормы, а развивать их, мы должны привить им то, что он назвал «когерентной экстраполированной волей». «Поэтически выражаясь, – пишет он, – это наше желание знать больше, думать быстрее и быть теми людьми, которыми мы хотели бы быть» [630].
В областях с четкими критериями успеха – шашках, го или Montezuma’s Revenge – машины могут использовать подражание как старт, а затем, применяя метод проб и ошибок, превзойти учителя. Однако в сфере морали неясно, как развивать успех дальше, ведь здесь нет внешнего объективного мерила [631].
Более того, если мы создадим системы, которые однажды станут умнее нас, они могут предпринимать действия, которые нам будет трудно оценить. Представьте, что ИИ предложит реформу правил клинических исследований. Сможем ли мы – даже после долгих размышлений, не говоря уже о мгновенной обратной связи – понять, соответствует ли эта реформа нашим этическим нормам? Как мы можем продолжать учить систему быть похожей на нас, если ее поведение выходит за рамки нашего понимания?
Немногие размышляют над этими вопросами так глубоко, как Пол Кристиано из OpenA I. «Мне очень интересно, как эти решения будут выглядеть при масштабировании, – говорил он. – Какой у нас план? Каков финал игры? Этим интересуются немногие, а работают над этим еще меньше людей» [632].
Кристиано понял еще в 2012 году: даже в самой сложной ситуации можно найти путь вперед [633]. Мы видели, как AlphaZero использовала быструю интуицию для отбора ходов, а затем проверяла их медленным алгоритмом поиска, чтобы подтвердить или исправить догадки. Результаты этого медленного мышления затем использовались для тренировки и улучшения быстрой интуиции – система училась предсказывать результаты собственных размышлений [634].
Кристиано считает, что эту схему, которую он называет «итеративной дистилляцией и усилением», можно применить для разработки систем, чьи рассуждения превосходят наши, но остаются согласованными с ними.
Представьте, что мы проектируем метро в мегаполисе. В отличие от игр, здесь нельзя прогнать тысячи сценариев за секунду; оценка этого вариант может занять месяцы. И здесь нет объективного счета: хорошая система метро – это та, которую люди считают хорошей.
С помощью обычного подражания мы можем обучить ИИ до определенного уровня компетенции. Затем мы начинаем использовать его как помощника – так главный архитектор работает с младшими сотрудниками. Мы просим одну копию системы оценить время ожидания поездов. Другую – рассчитать бюджет. Третью – сделать доклад о доступности. Мы, как «начальник», принимаем окончательное решение, объединяя («усиливая») работу наших цифровых подчиненных. Эти подчиненные, в свою очередь, учатся («дистиллируют» опыт) на нашем решении и немного улучшают свои навыки планирования. Вместе работа идет быстрее, чем если бы мы делали все сами. Затем мы повторяем процесс, поручая следующий проект этой новой, улучшенной версии команды. Цикл взаимного усиления замыкается.
В конце концов, считает Кристиано, наша «команда» коллективно станет тем самым идеальным градостроителем, которым мы хотели бы быть, – тем, кем мы стали бы, если бы «знали больше, думали быстрее и соответствовали своим представлениям о себе».
Здесь еще много работы. Кристиано хочет найти способы гарантировать, что в процессе усиления и дистилляции суждения системы останутся согласованными с человеческими. Пока это открытый вопрос и надежда, подкрепленная небольшими экспериментами. «Если нам удастся реализовать эту надежду, – пишут Кристиано и его коллеги из OpenAI, – это станет очень важным шагом к безопасному внедрению машинного обучения и решению тревожных вопросов о долгосрочном влиянии ИИ» [635].
Обсуждая его работу, я спросил Кристиано, ставшего лидером в области «согласования» ИИ, считает ли он себя ролевой моделью для тех, кто хочет пойти по его стопам. Его ответ меня удивил.
«Надеюсь, людям не придется идти этим путем», – сказал он [636].
Кристиано пояснил, что, возможно, он один из последних исследователей безопасности ИИ, которому пришлось вести «двойную жизнь»: работать над традиционными проблемами ради академической репутации и параллельно в одиночку искать способы заняться тем, что он считал по-настоящему важным. «Мне пришлось долгое время думать о сложных вещах в одиночестве, – сказал он. – Заниматься наукой проще в обществе».
Это сообщество появилось лишь несколько лет спустя [637]. «Так что будем надеяться, что теперь люди смогут просто вливаться в работу, – говорил Кристиано. – Сейчас уже есть ученые, думающие об этих вещах, и новички могут сразу заняться делом… просто делая то, что [их] волнует».
Возможно, в этом и есть роль первопроходца: последователям вряд ли придется копировать твой путь шаг в шаг, но именно благодаря твоим усилиям им это и не понадобится.