К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 3 Нормативность. 9. Неопределенность. Возможность внесения поправок, задержка и степень соответствия
89%
Часть 3 Нормативность. 9. Неопределенность. Возможность внесения поправок, задержка и степень соответствия
74

В знаменитой статье «Моральные и технические последствия автоматизации», написанной в 1960 году Норбертом Винером из Массачусетского технологического института, есть одна из самых пугающих и пророческих цитат в истории безопасности ИИ: «Если для достижения своих целей мы используем механического агента, работу которого невозможно прервать после запуска… тогда нам лучше быть уверенными в том, что цель – это цель, заложенная в машину, – это именно то, к чему мы стремимся, а не искусная ее подделка» [751]. По сути, это первое емкое изложение проблемы выравнивания.

Однако не менее важна и обратная сторона этой мысли: если мы не можем идеально сформулировать цель и ограничения для машины, тогда нам жизненно необходимо убедиться, что мы всегда сможем прервать ее работу или скорректировать курс. В литературе по безопасности ИИ эта идея называется корректируемостью, и на практике она оказывается гораздо сложнее, чем кажется [752].

Любые дискуссии о роботах-убийцах и вышедшей из-под контроля технике обычно вызывают реакцию, подобную той, что в 2016 году озвучил Барак Обама. Когда главный редактор Wired спросил президента США, стоит ли беспокоиться об искусственном интеллекте, тот ответил: «Нужно поставить кого‐нибудь рядом с розеткой. Как только увидите, что происходит что‐то не то, просто выдергивайте шнур» [753].

«Знаете, Обаме можно простить эти слова, – сказал мне исследователь Дилан Хэдфилд-Менелл, когда мы сидели в конференц-зале OpenAI [754]. – Какое‐то время это можно было простить даже специалистам по ИИ». В 1951 году сам Алан Тьюринг в редиоинтервью говорил о возможности «отключить электричество в критический момент» [755]. Но, как добавил Хэдфилд-Менелл: «Если всерьез вдуматься в проблему, такое легкомыслие непростительно. Я готов списать это на оговорку. Но если вы глубоко изучали этот вопрос и все, к чему пришли, – это „выдернуть вилку“, то я не понимаю, как вы вообще пришли к такому выводу, если действительно допускаете, что эта штука может быть умнее нас».

Чтобы машина сопротивлялась отключению или вмешательству, ей даже не нужна злонамеренность. Система просто пытается достичь поставленной цели или следует «мышечной памяти», воспроизводя действия, которые раньше приносили награду. Вмешательство в этот процесс воспринимается ею как препятствие. (Это может привести к опасному инстинкту самосохранения даже у систем с безобидными задачами. Робот, которому поручили просто подать кофе, может отчаянно сопротивляться отключению, потому что, как метко заметил Стюарт Рассел: «Если ты мертв, ты не сможешь принести кофе» [756].)

Первая серьезная техническая статья, посвященная проблеме корректируемости, вышла в 2015 году. Ее авторами стали Нейт Соэрс, Бенджамин Фалленстайн и Элиезар Юдковский (Институт исследований машинного интеллекта), а также Стюарт Армстронг (Институт будущего человечества Оксфордского университета). Они проанализировали проблему с точки зрения системы стимулов и отметили, насколько сложно так мотивировать агента, чтобы он добровольно позволил себя отключить или изменить свои же цели [757]. Балансирование стимулов напоминает хождение по канату: если их слишком мало, ИИ не даст себя выключить; если слишком много – он выключит себя сам. Как пишут исследователи, их первые попытки решить эту задачу математически оказались «неудовлетворительными», но «пролили свет на направления для будущих исследований». Они пришли к выводу, что ключом к ответу могут быть не стимулы, а неопределенность. В идеале нам нужна система, которая понимает, что может ошибаться – система, которая «рассуждает так, словно она несовершенна и это несовершенство может представлять опасность» [758].

Менее чем в полутора километрах от них исследователи из Беркли пришли к такому же выводу. Стюарт Рассел был убежден: «Машина должна изначально сомневаться» в том, чего хотят от нее люди [759].

Рассел, Хэдфилд-Менелл и их коллеги из Беркли Анка Драган и Питер Аббель сформулировали эту проблему в виде так называемой «игры с выключением». Они смоделировали систему, чья единственная цель – любым способом угодить человеку. Однако ее представления о том, что именно нужно человеку, были неточными и неопределенными. В каждый момент у системы был выбор: либо совершить действие, которое (по ее мнению) поможет пользователю, либо озвучить свои намерения и дать человеку шанс одобрить действие или остановить его.

Ученые математически доказали: если за ожидание или уступку человеку машина не получает штрафных баллов, то система всегда сначала обратится к человеку. Пока у системы есть хоть малейшее сомнение в том, чего хочет пользователь, ей выгоднее дать ему возможность вмешаться. Более того, ИИ выгодно подчиняться этому вмешательству каждый раз. Если единственная цель системы – помогать, а человек пытается ее остановить (сигнализируя, что считает действие вредным), системе логичнее прийти к выводу, что действие и правда вредно, и послушно отключиться.

Это был многообещающий результат, математически доказавший прочную связь между неуверенностью (неопределенностью ИИ) и его способностью принимать корректировки.

Но возникли две проблемы.

Первая: каждый раз, когда человек вмешивается, ИИ учится. Он понимает, что допустил ошибку, и уточняет модель человеческих предпочтений. Неопределенность ИИ снижается. Если она когда‐нибудь упадет до нуля, система решит, что поняла человека идеально. С этого момента у нее исчезнет любой стимул спрашивать разрешения или подчиняться попыткам ее остановить.

«Главный посыл нашего доказательства, – объясняет Хэдфилд-Менелл, – заключается в том, что нужно очень, очень крепко подумать, прежде чем жестко прописывать роботу целевую функцию или позволять ему считать, что он на 100 % уверен в своей цели» [760].

Вторая проблема сложнее: модель исходит из того, что «клиент всегда прав». То есть если человек пытается остановить систему, он априори не может ошибаться. Но если заложить в алгоритм имею, что люди тоже иногда совершают ошибки, то система со временем достигнет точки, когда решит, что она знает лучше человека, что для него благо. И в этот момент она перестанет реагировать на протесты: «Успокойтесь, я знаю, что делаю. Вам это понравится. Вы думаете, это плохо, но на самом деле это полезно. Доверьтесь мне».

Я сказал Хэдфилду-Менеллу, что чтение их статьи напоминает катание на эмоциональных американских горках. Сначала мы видим счастливый конец: неопределенность решает проблему выключения! А затем резкий разворот – это работает, только при двух очень хрупких условиях: система никогда не должна быть слишком уверена в себе, а человек никогда не должен совершать поступков, которые ИИ сочтет ошибкой или иррациональностью. Статья внезапно меняет тон и победного на тревожный.

«Именно, – ответил он. – Американские горки идеально отражают мой опыт. От эйфории „Ого, мы придумали что‐то хорошее!“ до паники „Черт, все это рухнет, стоит человеку хоть на йоту отступить от рациональности!“».

В последующем исследовании, которым руководила аспирантка из Беркли Смита Милли, команда задалась вопросом: «Должны ли роботы всегда быть послушными?» [761] Ученые отметили, что люди часто сами не знают, чего хотят, или делают плохой выбор. В таких случаях мы бы хотели, чтобы умная система нас ослушалась, потому что она объективно может обладать лучшей информацией.

«Бывают ситуации, когда излишняя покорность ИИ вредна, – рассуждала Милли. – Например, если человек совершает случайную ошибку. Скажем, я еду на беспилотном автомобиле и случайно задеваю руль. Я бы не хотела, чтобы машина тут же беспрекословно отключила автопилот в опасной ситуации» [762].

Но в этом есть загвоздка. Если созданная системой модель ваших ценностей неполна (есть вещи, которые для вас важны, но ИИ о них просто не знает), система запутается. Например, если робот ничего не знает об устройстве человеческого аппетита, он не поймет, почему вы требуете стейк в 18:00, но категорически отказываетесь от второго стейка в 19:00. Если модель робота примитивна («стейк – это всегда хорошо»), то один из этих двух выборов он сочтет ошибкой. Система интерпретирует ваше поведение как иррациональное, а это, как мы уже знаем, – прямой путь к неповиновению и отказу от корректировок [763].

Следовательно, модель человеческих ценностей должна быть намеренно усложнена. «Мы обнаружили интересную вещь, – рассказывал Хэдфилд-Менелл. – Если вы заложите в модель ИИ слишком много переменных для оценки человеческих желаний, система будет учиться чуть дольше, но в итоге поймет все правильно. А вот если переменных недостаточно, система очень быстро станет непослушной, свято уверовав, что знает все лучше человека».

К сожалению, на практике заложить в ИИ «достаточно параметров» сложнее, чем сказать; мы возвращаемся к проблеме 20 миллиардов параметров Стюарта Армстронга. Если модель ваших предпочтений при поиске жилья включает только метраж и цену, алгоритм сочтет ваш выбор дома (поменьше, но подороже) досадной ошибкой. В реальности же на ваш выбор влияют факторы, которых просто нет в базе данных алгоритма: престижность района, хорошие школы, красивый вид, соседство с друзьями или ностальгия. В машинном обучении это называется проблемой «неверной спецификации модели». Обычная проблема, но в контексте непослушного ИИ ее последствия выглядя пугающе.

«Чтобы система успешно взаимодействовала с человеком, ей нужна детализированная модель человеческой психологии, – говорила Милли. – А создавать такие модели невероятно трудно». Она отмечала, что при всем прогрессе в отрасли главные прорывы происходят на «стороне робота». Интеграция качественных моделей человеческого поведения сильно отстает.

Идея о том, как удержать ИИ от излишней самоуверенности – заставить его сомневаться даже тогда, когда мы даем ему конкретную функцию вознаграждения, – оказалась настолько важна для контроля, что команда из Беркли перешла к следующему шагу.

Что, если спроектировать систему так, чтобы она оставалась неуверенной, даже если вы даете ей абсолютно чуткую цель? Как бы это выглядело?

Одной из сквозных тем (вспомним главу 5) была сложность создания функция вознаграждения (счетчика очков), которая мотивировала бы нужное поведение без лазеек и побочных эффектов. Многие в индустрии ИИ считают, что ручная настойка внешних параметров цели – это дорога в ад, вымощенная благими намерениями: как бы тщательно вы все ни продумали, ИИ все равно найдет то, что вы не учли.

Пессимизм в отношении жестко заданных целевых функций укоренился настолько глубоко, что сегодня передовые исследования безопасности ИИ направлены на уход от явных целей. Вместо этого ученые создают системы, которые учатся, пытаясь подражать людям (беспилотные авто), искать их одобрения (робот, делающий сальто на основе оценок человека) или угадывать человеческие намерения (трюки с вертолетом).

Но что, если существует способ спасти архитектуру с внешней функцией вознаграждения? Или хотя бы сделать ее безопаснее?

Группа из Беркли поняла: для этого нужно создать систему, которая осознает собственное несовершенство. ИИ должен понимать, что программисты честно пытались перевести свои сложные желания в формулу вознаграждения, но неизбежно справились с этим неидеально. ИИ должен усвоить, что очки в игре – это еще не вся суть игры. Есть истинные желания человека, и явно выраженная цель отражает их лишь частично.

«Мы хотели… взять эту концепцию неопределенности и задаться вопросом: какое простейшее исправление программисты могут внести прямо сейчас, чтобы это исправить? – говорил Хэдфилд-Менелл. – Какая крошечная корректировка в коде повысит здоровую неуверенность ИИ в собственной цели?»

Он поясняет: «Функция вознаграждения – это чрезвычайно плотный сигнал. Это важнейшее указание на то, что нужно делать. Сейчас в ИИ принято считать этот сигнал исчерпывающей истиной – мы допускаем, что наша функция вознаграждения идеально описывает правильное поведение при любом состоянии мира. Но это не так. Как нам использовать этот мощный сигнал, не воспринимая его как абсолютную истину в последней инстанции?» [764]

Как заключает Стюарт Рассел: «Система обучения усваивает свидетельства о человеческих предпочтениях, а сигнал вознаграждения – это в лучшем случае одно из таких свидетельств» [765].

Исследователи назвали этот подход «обратным проектированием вознаграждения» (Inverse Reward Design, IRD) [766]. Теперь мы не воспринимаем прямую инструкцию (целевую функцию) как истину в последней инстанции; мы воспринимаем ее лишь как информацию о том, чего хочет человек. В обратном обучении с подкреплением ИИ спрашивал: «Чего ты хочешь, судя по тому, что ты делаешь?» В IRD ИИ идет дальше и спрашивает: «Чего ты на самом деле хочешь, судя по тому, что ты мне приказываешь?» [767]

«Автономные агенты оптимизируют функцию вознаграждения, которую мы им даем, – писали исследователи. – Чего они не понимают, так это того, насколько трудно человеку сформулировать функцию, которая действительно отражает его желания» [768].

Вспомните знаменитую нейросеть, управляющую гоночной лодкой, которая накручивала очки, наворачивая круги вокруг бонусов, вместо того чтобы закончить гонку. Ей открыто приказали: «Максимизируй очки», что обычно является отличной стратегией. Заданная человеком награда отлично работает в той предсказуемой среде, для которой систему тренировали. Но когда в реальном мире система сталкивается с непредсказуемыми ситуациями, которых не мог предусмотреть даже создатель, слепое следование изначальной инструкции теряет всякий смысл.

Вполне вероятно, что в ближайшие десятилетия интеллектуальные системы по-прежнему будут получать прямые приказы. И они будут воспринимать их крайне серьезно. Но – ради нашей же безопасности – они не будут воспринимать их буквально.

Предыдущая главаГлава 74 из 83Следующая глава