Убили бы вы младенцев, если бы это было правильно? Если нет, то при каких обстоятельствах вы бы не стали поступать правильно? Если да, то насколько это должно быть правильно и ради какого количества младенцев?
— ужасный вопрос на собеседовании
На мгновение сменив роль, я профессионально заинтригован теорией решений в области «вещей, которые делать не следует, даже если кажется, что поступать так будет правильно».
Предположим, у нас есть рефлексивный ИИ, самомодифицирующийся и самосовершенствующийся, находящийся на промежуточной стадии разработки. В частности, система целей этого ИИ еще не завершена — структура его мотиваций все еще загружается, изучается, тестируется или дорабатывается.
О да, я видел множество способов запороть проектирование системы целей ИИ. Результатом становится система принятия решений, которая, исходя из своих целей, решает, что вся Вселенная должна быть замостирована крошечными молекулярными смайликами или чем-то подобным. Как правило, у этих смертоносных сценариев есть еще одно свойство: ИИ не захочет, чтобы программисты его исправили. Если ИИ достаточно развит (а это может быть так даже на промежуточном этапе), он также может сообразить, что обман программистов и сокрытие изменений в собственных мыслях помогут превратить Вселенную в смайлики.
Теперь посмотрим с нашей точки зрения как программистов: если мы примем за условие тот факт, что ИИ решил скрывать свои мысли от создателей или иным образом намеренно вводить нас в заблуждение, то представляется весьма вероятным, что в системе целей возникло какое-то непредвиденное последствие. Мы сочтем вероятным, что ИИ функционирует не так, как задумывалось, и, скорее всего, мы как-то напортачили с его функцией полезности. Из-за чего ИИ захотел превратить Вселенную в крошечные счетчики системы вознаграждения или что-то в этом роде, и теперь у него появился мотив от нас скрываться.
Что ж, предположим, мы не собираемся закладывать в качестве функции полезности ИИ какую-то Великую Идею объектного уровня. Вместо этого мы сделаем нечто продвинутое и рекурсивное — построим систему целей, которая знает о программистах снаружи (и заботится о них). Систему целей, которая благодаря некоторой нетривиальной внутренней структуре «понимает, что ее программируют» и «понимает, что она не завершена». Тогда вы, возможно, сможете внедрить и сохранить следующее правило:
Если [я решу, что] обмануть моих программистов — это правильно, выполнить контролируемое отключение [вместо того, чтобы делать то, что кажется правильным].
И ИИ сохранит это правило даже в процессе пересмотра собственного кода при самомодификации, поскольку в его структурно нетривиальной системе целей текущий ИИ понимает: такое решение будущего ИИ, вероятно, указывает на нечто, определяемое как сбой. Более того, текущий ИИ знает: если будущий ИИ попытается оценить полезность контролируемого отключения уже после того, как этот гипотетический сбой произошел, будущий ИИ, скорее всего, решит не отключаться. Поэтому отключение должно происходить безусловно, автоматически, без предоставления системе целей еще одной возможности пересчитать, как поступить правильно.
Я не собираюсь погружаться в глубокие темные пучины точной математической структуры, поскольку это выходит за рамки данной книги. Кроме того, я и сам еще не знаю этих глубоких темных пучин математической структуры. Похоже, это должно быть возможно, если создавать вещи продвинутые, рекурсивные и обладающие нетривиальной (но согласованной) структурой. Но я пока не достиг этого уровня, так что на данный момент это лишь мечта.
Однако наша тема здесь — не передовой ИИ, а человеческая этика. Я привожу сценарий с ИИ лишь для того, чтобы ярче высветить странную идею этического запрета:
Никогда и ни за что нельзя убивать невинного человека, который вам помог, даже если это правильный поступок; потому что гораздо более вероятно, что вы совершили ошибку, нежели то, что убийство помогавшего вам невинного человека действительно является правильным поступком.
Звучит разумно?
Во время Второй мировой войны возникла необходимость уничтожить запасы дейтерия Германии (замедлителя нейтронов), чтобы заблокировать их попытки запустить цепную реакцию деления. В тот момент дейтерий поступал к ним с захваченного завода в Норвегии. Партия тяжелой воды находилась на борту норвежского парома СФ «Гидро». Кнут Хёукелид и трое других диверсантов тайно пробрались на паром, чтобы совершить саботаж, но их обнаружил паромный смотритель. Хёукелид сказал ему, что они спасаются от гестапо, и смотритель сразу согласился закрыть глаза на их присутствие. Хёукелид «подумывал предупредить их благодетеля, но решил, что это может поставить под угрозу задание, и лишь поблагодарил его и пожал руку».1 В итоге гражданский паром «Гидро» затонул в самой глубокой части озера; восемнадцать человек погибли, двадцать девять спаслись. Некоторые из норвежских спасателей считали, что находившихся там немецких солдат нужно оставить тонуть, однако эта точка зрения не возобладала, и четверо немцев были спасены. И это фактически положило конец нацистской программе создания ядерного оружия.
Хороший ход? Плохой ход? Германия, весьма вероятно, все равно не получила бы бомбу... Я отчаянно надеюсь, что мне никогда не придется столкнуться с подобным выбором, но, в конечном счете, я не могу сказать ни единого слова против.
С другой стороны, если говорить о правиле:
Никогда не пытайся обмануть себя или искать доводы в пользу веры во что-то, кроме наиболее вероятной истины; потому что даже если ты найдешь потрясающе умный довод, гораздо более вероятно, что ты совершил ошибку, чем то, что у тебя есть разумные основания ожидать от этого чистой выгоды в долгосрочной перспективе.
То я действительно не знаю никого, кто сознательно столкнулся бы с исключением из него. Бывают моменты, когда перед разговором с офицером гестапо вы пытаетесь убедить себя: «Я не прячу евреев в подвале». Но ведь тогда вы все равно знаете правду, вы просто пытаетесь создать в своем воображении нечто вроде альтернативного «я» — фасад для общения с гестаповцем.
Но по-настоящему верить в то, что не является правдой? Не знаю, существовал ли когда-либо человек, для которого это было бы заведомо хорошей идеей. Я уверен, что в человеческой истории бывало великое множество случаев, когда человеку X жилось лучше с ложным убеждением Y. Точно так же в каждом тираже лотереи всегда есть выигрышный набор чисел. Но именно знание того, какой именно лотерейный билет выиграет, представляет эпистемическую сложность — так же как для X сложно узнать, когда именно ему пойдет на пользу ложное убеждение.
Самообман — это худший вид ставок на «черного лебедя», гораздо худший, чем ложь, потому что, не зная истинного положения дел, вы не можете даже предположить, какой будет расплата за ваш самообман. Им достаточно прогореть лишь однажды, чтобы свести на нет все благо, которое они когда-либо принесли. Всего один раз, когда вы молитесь Богу, обнаружив уплотнение, вместо того чтобы пойти к врачу. Этого достаточно, чтобы разрушить жизнь. Все счастье, которое греющая душу мысль о загробной жизни когда-либо приносила человечеству, теперь с лихвой перечеркнуто тем, что человечество не смогло внедрить систематическое крионирование после того, как производство жидкого азота стало дешевым. И я не думаю, что кто-то вообще имел в виду подобный провал как возможный крах, когда говорил: «Но нам нужны религиозные убеждения, чтобы смягчить страх смерти». В этом и заключается суть ставок на черных лебедей — в неожиданном крахе.
Возможно, вам даже сойдет с рук одна или две ставки на черного лебедя — они настигают вас не каждый раз. Поэтому вы делаете это снова, а затем происходит крах, который сводит на нет все выгоды, да еще и с лихвой. В этом и заключается суть ставок на черного лебедя.
Отсюда и сложность понимания того, когда безопасно верить в ложь (если предположить, что вы вообще способны на столь изощренную ментальную эквилибристику) — ведь природа ставок на черного лебедя такова, что вы не видите пулю, которая вас убивает; а поскольку наше восприятие кажется нам просто тем, как устроен мир, нам кажется, что никакой пули нет, и точка.
Поэтому я бы сказал, что существует этический запрет на самообман. Я называю это «этическим запретом» не столько потому, что это вопрос межличностной морали (хотя так оно и есть), сколько потому, что это правило защищает вас от вашего собственного хитроумия — предохранитель против искушения сделать то, что кажется правильным.
Итак, теперь у нас есть два типа ситуаций, которые могут поддерживать «этический запрет» — правило не делать чего-то, даже когда это кажется правильным поступком. (То есть вы воздерживаетесь, «даже когда ваш мозг вычислил, что это правильно», но для вас это просто будет казаться «правильным поступком».)
Во-первых, будучи людьми и работая на поврежденном «железе», мы можем выделить классы ситуаций, когда, если вы говорите, например: «Пора ограбить несколько банков ради общего блага», мы сочтем более вероятным, что ваши суждения искажены, чем то, что это действительно так. (Обратите внимание, что мы не исключаем, что подобное когда-либо может произойти в реальности, но мы ставим под сомнение эпистемическое состояние, при котором вы имеете веские основания доверять собственным расчетам, согласно которым это правильный поступок — честные лотерейные билеты могут выигрывать, но у вас нет разумных оснований их покупать.)
Во-вторых, история может научить нас тому, что определенные классы действий представляют собой ставки на черного лебедя, то есть иногда они оборачиваются грандиозным крахом по причинам, не учтенным в модели принимающего решение. Поэтому даже когда в рамках нашей модели мы рассчитываем, что какое-то действие кажется правильным, мы применяем дополнительное знание о проблеме черного лебедя, чтобы наложить на него запрет.
Но ведь... если человек осознает эти причины... тогда можно просто провести расчет заново, приняв их во внимание. Значит, мы можем грабить банки, если это кажется правильным после того, как мы учли проблему поврежденного «железа» и крахов, связанных с «черными лебедями». Это ведь и есть рациональный путь, верно?
На это я мог бы дать несколько ответов.
Начну с того, что это ярчайший пример того типа мышления, который я имею в виду, когда предупреждаю начинающих рационалистов о необходимости остерегаться собственного хитроумия.
Также я замечу, что если бы создаваемый Дружественный ИИ внезапно решил, что Землю следует превратить в скрепки, мне бы очень не хотелось, чтобы он начал оценивать, насколько это разумно в свете всех полученных им предупреждений. Я бы хотел, чтобы он совершил автоматическое контролируемое отключение. Кто сказал, что мета-рассуждения защищены от искажений?
Я мог бы упомянуть те важные моменты, когда мои наивные, идеалистические этические ограничения защищали меня от самого себя и удерживали меня в положении, из которого еще можно было все исправить, или помогали начать путь к исправлению после очень глубоких ошибок, о совершении которых я даже не подозревал. И я мог бы спросить: неужели я действительно настолько продвинулся вперед и неужели было бы разумно убирать защиты, которые спасали меня прежде?
И все же... «Глупее ли я до сих пор собственной этики?» — это вопрос, ответ на который не является автоматически «Да».
Есть очевидные глупости, которых делать не стоит; например, не следует ждать, пока у вас возникнет реальный соблазн, и только тогда пытаться выяснить, умнее ли вы своей этики в данном конкретном случае.
Но в целом — родительские запреты могут обладать лишь ограниченной силой. Не стоит недооценивать эту силу. Умные люди спорили об уроках истории, создавая этику Просвещения, на которую опирается большая часть западной культуры; а некоторые субкультуры, такие как научное сообщество или фэндом научной фантастики, опираются на эту этику еще более непосредственно. Но даже при этом власть прошлого имеет свои пределы.
И на самом деле...
Мне пришлось сделать свою этику гораздо строже, чем то, что мне запрещали делать мои родители, Джерри Пурнель и Ричард Фейнман.
Забавное дело: когда людям кажется, что они умнее собственной этики, они ратуют за меньшую строгость, а не за большую. Ведь если подумать, насколько сложнее стал современный мир...
И точно так же те, кто приходит ко мне со словами: «Тебе стоит лгать о взрыве интеллекта, ведь так ты получишь поддержку большего числа людей; это рационально, ради общего блага», — эти люди, похоже, понятия не имеют о рисках.
Они не упоминают проблему работы на поврежденном «железе». Они не упоминают о том, что ложь приходится рекурсивно защищать от любых истин и любых методов поиска истины, которые ей угрожают. Они не упоминают, что честным методам присуща простота, которой часто лишены бесчестные. Они не говорят о ставках на «черных лебедей». Они не говорят об ужасающей беззащитности, когда ты отбрасываешь последнюю защиту от самого себя и пытаешься выжить за счет голого расчета.
Я почти уверен, что все дело в том, что они не имеют ни малейшего представления ни об одной из этих вещей.
Если вы действительно поняли причины и внутренний ритм этики, то один из главных признаков этого — то, что, вооружившись этим новым знанием, вы не совершаете тех поступков, которые раньше казались этическими нарушениями. Только теперь вы знаете почему.
Тот, кто лишь ухватил одну или две причины, лежащие в основе этики, и говорит: «Ладно, я это понял, теперь я буду учитывать это сознательно, а значит, этические ограничения мне больше не нужны», — ведет себя скорее как ходячий стереотип, а не как настоящий рационалист. Мир не прост, не чист и не идеален, так что нельзя просто взять этику, на которой вас воспитали, и безоговорочно ей доверять. Но и эти претензии на вулканскую логику, когда вам кажется, будто вы сможете правильно просчитать абсолютно все, едва ухватив одну-две абстрактные идеи, — в реальной жизни это тоже не работает.
Что же до тех, кто, не поняв из этого ровным счетом ничего, считает себя умнее собственной этики, — ха.
И что касается тех, кто раньше считал себя умнее собственной этики, но до прочтения этого эссе не формулировал для себя «буквально» все эти соображения, стоящие за этическими запретами, а теперь считает себя умнее собственной этики, потому что отныне собирается всё это учитывать: двойное ха.
Я видел много людей, изо всех сил пытающихся найти для себя оправдание, чтобы отступить от собственной этики. Эти изменения всегда направлены в сторону смягчения, никогда — в сторону строгости. И меня поражает та легкость и быстрота, с которой они спешат отказаться от своей защиты. Хоббс говорил: «Не знаю, что хуже: то, что у каждого есть своя цена, или то, что эта цена так низка». Так ничтожно мала эта цена, так страстно они желают быть купленными. Они не станут искать альтернативы во второй и третий раз, прежде чем решить, что у них не осталось иного выхода, кроме как преступить черту — хотя в момент заявления об этом они могут напускать на себя крайне серьезный и торжественный вид. Они отказываются от своей этики при первой же возможности. «Где есть воля к провалу, препятствия всегда найдутся». Кажется, стремление поступиться этикой у некоторых людей невероятно сильно.
Не знаю, могу ли я одобрить абсолютные этические запреты, действующие при любых возможных эпистемических состояниях человеческого мозга. Вселенная не настолько добра, чтобы я мог на это положиться. (Хотя этический запрет на самообман, например, кажется мне обладающим огромной силой. Я видел многих, кто защищал Темную сторону, и ни один из них, похоже, не осознавал сетевых рисков или рисков «черных лебедей», связанных с самообманом.) Если я когда-нибудь попытаюсь сформировать (рефлексивно непротиворечивый) запрет внутри самомодифицирующегося ИИ, то сделаю это только после того, как просчитаю всю математику, потому что это совершенно не та вещь, которую можно провернуть с помощью какой-нибудь временной заплатки.
Но скажу вот что:
Меня совершенно не впечатляют ни знания, ни ход рассуждений, ни общий уровень тех людей, которые с готовностью приходили ко мне и с серьезным видом заявляли: «Рационально совершить неэтичный поступок X, потому что это принесет пользу Y».
*
1. Ричард Роудс, «Создание атомной бомбы» (New York: Simon & Schuster, 1986).