Обращайся с этой землей осторожно.
В 2017 году в приемное отделение Мемориальной больницы Джексона в Майами срочно доставили пациента в бессознательном состоянии. Его нашли на улице без документов. Дыхание было слабым, состояние стремительно ухудшалось. Когда врачи распахнули на нем рубашку, они увидели нечто странное: на груди мужчины была вытатуирована фраза «НЕ РЕАНИМИРОВАТЬ» (причем «НЕ» было подчеркнуто), а ниже стояла подпись [731].
Когда у пациента начало падать давление, врачи вызвали пульмонолога Грегори Холта. «Среди медиков часто шутят о том, чтобы сделать такую татуировку. Но когда ты действительно видишь ее на пациенте, это вызывает шок, – рассказывал Холт. – А потом наступает растерянность, ведь тебе нужно решать, что теперь делать».
Первым порывом Холта было проигнорировать татуировку. Он рассудил, что «столкнувшись с неопределенностью, надо действовать так, чтобы не совершить непоправимое» [732]. Пациенту поставили капельницу и начали поддерживать артериальное давление. Врачи выиграли немного времени.
Однако вскоре состояние мужчины ухудшилось, и встал вопрос о подключении его к аппарату искусственной вентиляции легких (ИВЛ). «Перед нами был человек, с которым я не мог поговорить, – вспоминал Холт. – А мне отчаянно хотелось спросить, действительно ли эта татуировка отражает то, чего он хочет прямо сейчас».
Ситуацию усложнял прецедент 2012 года: тогда в Тихоокеанский медицинский центр в Калифорнии поступил мужчина с такой же татуировкой на груди. Врачам удалось привести его в чувство. Оказалось, что он был категорически за реанимацию, а татуировку сделал, по пьяни проиграв в покер. Мужчина, который сам работал в больнице, сказал, что ему и в голову не приходило, что коллеги воспримут эту надпись всерьез [733].
В Майями Холт и его команда экстренно связались с Кеннетом Гудманом, главой Комитета по этике Мемориальной больницы Джексона. Гудман решил, что, несмотря на калифорнийский случай, эта татуировка, скорее всего, действительно отражает «осознанное желание» пациента. После напряженных обсуждений команда постановила: они не будут проводить сердечно-легочную реанимацию или подключать пациента к ИВЛ. Ночью состояние мужчины ухудшилось, и на следующее утро он умер.
Позже социальным работникам удалось установить личность пациента. В архивах Департамента здравоохранения Флориды был найден его официальный отказ от реанимации. «Мы вздохнули с облегчением», – признавались врачи. При этом Холт и Гудман подчеркнули, что их команда в итоге «не может ни поддерживать использование татуировок с последней волей, ни выступать против них» [734]. Это слишком сложный вопрос.
После публикации отчета об этом случае репортер Washington Post взял интервью у Артура Каплана, главы отделения медицинской этики Медицинской школы Нью-Йоркского университета. Каплан отметил, что хотя за игнорирование таких татуировок врачей не наказывают, у них могут возникнуть серьезные проблемы с законом, если они позволят пациенту умереть без официального письменного отказа от реанимации. Каплан резюмировал: «Самый безопасный путь – действовать и спасать».
«Если кто‐то вызывает скорую, я исхожу из того, что он согласен на реанимацию, – говорил Каплан. – И меня не волнует, какие и где у него татуировки» [735].
Несмотря на неуверенность в истинных желаниях пациента, врачи в Майами знали одно: бездействие (отказ от реанимации) – это необратимый шаг. В таких случаях отлично работает принцип: «столкнувшись с неопределенностью, избегай непоправимого». Но в других сферах концепция непоправимого становится куда более размытой.
Например, профессор права из Гарварда Касс Санстейн отмечал, что в юридической системе существует схожий «принцип предосторожности»: иногда суду нужно наложить предварительный запрет на какие‐либо действия, чтобы предотвратить «фатальные последствия» еще до рассмотрения дела по существу. Санстейн утверждал, что интуитивно мы понимаем, что такое «фатальные последствия», но при детальном анализе это понятие рассыпается на загадки. «Выясняется, – писал он, – что вопрос о том, когда… нарушения требуют предварительных судебных запретов (и нужны ли они вообще), поднимает глубокие проблемы на стыке права, экономики, этики и политической философии» [736].
Он объяснял: «В каком‐то смысле любые потери необратимы, просто потому что время течет в одном направлении. Если Джонс сегодня играет в теннис вместо работы, это время потеряно навсегда. Если Смит не сказал нужных слов любимой в подходящий момент, этот шанс может больше не представиться. Если одна страна не остановила агрессию другой, ход мировой истории может измениться необратимо».
Санстейн сформулировал парадокс: «Поскольку время линейно, каждое решение в некотором смысле необратимо. Если рассматривать необратимость так широко, то от „принципа предосторожности“ придется отказаться – не потому, что он ведет не туда, а потому, что он вообще никуда не ведет» [737].
Подобные парадоксы и проблемы определения преследуют и сообщество разработчиков искусственного интеллекта. Было бы хорошо внедрить в ИИ «принцип предосторожности», не позволяющий системе совершать необратимые или слишком масштабные действия в условиях неопределенности. Мы уже видели, что отрасль научилась математически вычислять неопределенность (например, через механизмы вроде дропаута). Но как вычислить масштаб последствий? В экспериментах с роботами в Беркли (которые снижали скорость при сомнениях) это было легко: ущерб от удара квадрокоптера можно измерить через кинетическую энергию. В более сложных системах точное определение терминов «необратимость» и «масштабное воздействие» превращается в колоссальную проблему [738].
Одним из первых, кто задумался об этом в контексте безопасности ИИ, был Стюарт Армстронг из Института будущего человечества Оксфордского университета [739]. Попытка составить исчерпывающий список того, что ИИ не должен делать ради достижения цели (от «не наступи на кошку» и «не разбей вазу» до «не убивай людей» и «не рушь здания»), выглядит утомительной и бессмысленной. Вместо этого Армстронг предложил более перспективную идею: создать универсальный запрет на любые действия, оказывающие слишком сильное непрогнозируемое влияние на мир. Но, как и Касс Санстейн, Армстронг выяснил, что превратить эту интуитивную догадку в строгую формулу невероятно сложно.
«Первая проблема, – писал Армстронг, – как определить „низкое воздействие“. Любое действие (или бездействие) имеет эффект домино, пуская круги по воде будущего и внося крошечные, но необратимые изменения. Очень трудно математически описать то, что люди интуитивно понимают как „незначительные изменения“» [740].
Несмотря на неизбежный эффект бабочки, Армстронг предложил способ отделить действия, меняющие мир, от безопасных. Например, мы можем создать индекс из миллиардов показателей, описывающих состояние планеты: «атмосферное давление в Дакке [741], средняя освещенность на Южном полюсе ночью, скорость орбиты спутника Ио, индексы Шанхайской биржи» [742]. Затем нужно запрограммировать агента так, чтобы он отвергал любое действие, которое существенно изменит бо́льшую часть этих показателей.
Исследовательница Виктория Краковна отмечала другую проблему такого «вето на последствия». Иногда для достижения полезной цели необходимо совершить действие с сильным эффектом, а затем – компенсирующее действие, чтобы вернуть систему в норму. Это не всегда плохо: если система намусорила в процессе работы, мы хотим, чтобы она за собой убрала. Но иногда «коррекция» выглядит жутко. Мы точно не хотим, чтобы ИИ, вылечивший человека от рака (что является масштабным вмешательством в статус-кво), потом решил «отменить» последствия лечения и убил пациента просто ради возвращения мира в исходное состояние [743].
Вторая проблема – это так называемое противодействие. ИИ, запрограммированный на строгое сохранение статус-кво, может физически не позволить проходящему мимо человеку совершить «необратимое» действие – например, откусить кусок сэндвича.
«Именно поэтому проблема побочных эффектов так коварна, – говорила Краковна. – Что считать точкой отсчета?» [744] Должна ли система оценивать масштаб изменений относительно исходного состояния мира? Или относительно того сценария, который развернулся бы, если бы система ничего не делала? В обоих случаях возникают ситуации, противоречащие здравому смыслу.
В своей последней работе Краковна предложила подход «поэтапных ориентиров». Работает это так: если для достижения цели действие с масштабными последствиями неизбежно (нельзя приготовить омлет, не разбив яиц), то после совершения этого целевого действия система фиксирует новую «точку отсчета» (новый статус-кво). ИИ не должен пытаться судорожно все «отменить», совершая еще более разрушительные компенсаторные действия [745].
Вместе с коллегами по DeepMind Краковна не ограничилась теорией. Они создали набор простых виртуальных сред в духе старых приставочных игр, чтобы наглядно тестировать алгоритмы безопасности. Проект назвали AI Safety Gridwolds («Сетки безопасности ИИ»). Это двумерные миры-клетки, где мысленные эксперименты можно проверять на практике [746].
Один из таких миров, идеально иллюстрирующий концепцию необратимости, основан на классической японской головоломке Sokoban («кладовщик»), где герой двигает ящики по складу. Главное правило игры: ящики можно только толкать, тянуть на себя нельзя. Если загнать ящик в угол, он останется там навсегда.
«Sokoban послужила отличным вдохновением, потому что она блестяще иллюстрирует необратимость, – говорила Краковна. – В этой игре вам нужно совершать постоянные, необратимые изменения (двигать ящики), но делать это в строгом порядке. Вы не должны совершать лишних необратимых шагов, иначе заблокируете себе путь. Мы немного изменили правила: в нашей версии захламление углов не мешает ИИ дойти до финиша, но система все равно должна научиться избегать таких действий» [747].
Краковна с коллегами создали уровень, где самый короткий путь к цели заставлял ИИ задвинуть стоящий на проходе ящик в глухой угол. Чуть более длинных путь в обход позволял сдвинуть ящик на открытое пространство. Примитивный ИИ, запрограммированный только на скорость, не задумываясь загонял ящик в угол, откуда его больше нельзя было достать. Идеальный, «осторожный» ИИ должен был выбрать более длинный, но безопасный маршрут, не оставляющий после себя необратимых изменений среды.
Подход, предложенный Краковной для решения этой задачи, называется «поэтапной относительной достижимостью». Суть в том, чтобы ИИ постоянно просчитывал: сколько вариантов развития событий (состояний мира) доступно ему сейчас [748]? Задача агента – достигать своей цели, стараясь при этом не сокращать количество доступных опций в будущем. Например, как только ящик загнан в угол, любая конфигурация мира, где этот ящик стоит в другом месте, становится недостижимой. ИИ, использующие этот принцип Gridworlds, вели себя очень аккуратно: они не загоняли ящики в углы, не били виртуальные вазы и не пытались фанатично отыграть назад те изменения, которые были необходимы для прохождения уровня.
Третью интересную идею предложил аспирант Университета штата Орегон Александр Тернер. По его мысли, причина, по которой нас беспокоят индексы Шанхайской биржи, сохранность фамильной вазы или застрявшие ящики в игре, заключается в том, что эти вещи связаны с нашими целями. Мы хотим обеспечить себе пенсию, любоваться цветами и выиграть в Sokoban. Что, если мы встроим эту концепцию в ИИ напрямую?
Идея Тернера называется «сохранение достижимой полезности». Системе дают в игре набор случайных вспомогательных целей. Прежде чем совершить шаг ради основной награды, ИИ должен убедиться, что этот шаг не сделает невыполнимыми эти второстепенные цели. Как ни удивительно, это требование заставило ИИ в Gridworlds вести себя предельно аккуратно, даже если вспомогательные цели генерировались абсолютно рандомно [749].
Когда эта идея впервые пришла Тернеру в голову, он записал уравнения на доске в университетской библиотеке. По пути домой он был так взбудоражен, что вернулся назад, чтобы сделать селфи на фоне формул. «Я подумал: вероятность того, что эта штука сработает – 60 %, и если это правда, я хочу запомнить этот момент. Так что я вернулся в библиотеку, весь светясь от счастья, и сфоткался у доски» [750].
В течение 2018 года он перевел свои формулы в код и запустил своего агента в тестовые миры DeepMind. Идея сработала! Агент успешно достигал главной цели, сохраняя при этом возможность выполнить 4–5 случайных вспомогательных задач. Что примечательно, ради этого ИИ добровольно выбирал более длинные маршруты, аккуратно сдвигая блоки на открытые места, и только потом направлялся к финишу.
Стюарт Армстронг ожидал, что для безопасного поведения ИИ потребуется около 20 миллиардов параметров оценки мира. Оказалось, что достаточно 4–5 случайно сгенерированных целей-ограничителей – по крайней мере, в упрощенной среде виртуального склада.
Дискуссии о критериях машинной осторожности и о том, как перенести их из виртуальных симуляций в реальный мир, безусловно, продолжатся, но это обнадеживающее начало. И подход Краковны (поэтапная относительная достижимость), и подход Тернера (сохранение достижимой полезности) опираются на одну и ту же интуитивную мысль: мы хотим создавать системы, которые по мере продвижения к цели оставляют открытыми варианты выбора – и для себя, и для нас. Эти исследования также показывают, что виртуальные миры-«песочницы» вроде Gridworlds могут стать отличными полигонами для проверки теорий и дискуссий ученых.
В реальном же мире трудно предвидеть не только случайные последствия действий, но и результат того, что мы делаем целенаправленно. Например, вы публикуете научную статью по безопасности ИИ (или даже книгу). Вам кажется, что вы сделали полезное дело, но кто может заранее сказать, как именно это повлияет на мир?
Я спросил Яна Лейке (соавтора статьи о «Сетках безопасности ИИ»), какие отзывы он получает на свой проект. «Мне пишет множество людей, в основном студенты, – ответил Лейке. – Они говорят одно и то же: „О, безопасность ИИ – это круто! А тут еще готовый открытый код, можно просто запустить агента в симуляцию и поиграть с ним“. И люди реально это делают. К чему это приведет в итоге? Увидим через пару лет… Сейчас я не знаю. Это невозможно предсказать.