К книге
Рациональность: от ИИ до зомби287. Цель не оправдывает средства (у людей). «Если цель не оправдывает средства, то что же тогда их оправдывает?» — приписывается разным авторам. «Я думаю о себе как о программе, работающей на враждеб
86%
287. Цель не оправдывает средства (у людей). «Если цель не оправдывает средства, то что же тогда их оправдывает?» — приписывается разным авторам. «Я думаю о себе как о программе, работающей на враждеб
304

Возможно, в ходе эволюции у людей сформировался паттерн политической революции, когда все начинается с убежденности в своем моральном превосходстве над коррумпированной властной верхушкой, а заканчивается тем, что они сами оказываются развращены властью — и происходит это вовсе не из-за какого-то сознательного плана в их головах, а из-за эха предков, которые поступали точно так же и благодаря этому оставили потомство.

Это укладывается в шаблон:

В некоторых случаях люди эволюционировали таким образом, чтобы считать, будто они совершают действие X ради просоциальной причины Y, однако когда люди действительно совершают X, срабатывают другие адаптации, способствующие получению выгодного для них самих результата Z.

От этого утверждения я перейду к вопросу, который лежит далеко за пределами классической байесовской теории принятия решений:

Что, если я запущен на испорченном железе?

В таком случае вы можете обнаружить, что произносите утверждения, которые кажутся парадоксальными — и выглядят полнейшей нелепицей с точки зрения классической теории принятия решений, — например:

Цель не оправдывает средства.

Но если вы запущены на испорченном железе, то рефлексивное наблюдение, согласно которому захват власти кажется вам благородным и альтруистичным поступком, — эта кажимость вряд ли может служить сильным доказательством того, что захват власти действительно принесет племени наибольшую пользу.

В силу наивного реализма испорченное железо, на котором вы работаете, и вычисляемые им искаженные кажимости будут казаться самой тканью реальности — просто тем, как все устроено на самом деле.

И в итоге мы получаем кажущееся странным правило: «Ради блага племени не прибегай к обману ради захвата власти, даже когда это принесло бы племени чистую выгоду».

Пожалуй, действительно мудрее сформулировать это именно так. Если просто сказать «когда кажется, что это принесет племени чистую выгоду», то обязательно найдутся люди, которые возразят: «Но это не просто кажется — это действительно принесет племени чистую выгоду, если у руля встану я».

Идея ненадежного железа выглядит как нечто, находящееся полностью за пределами классической теории принятия решений. (Как она влияет на рефлексивную теорию принятия решений, я пока сказать не могу, но, судя по всему, решать эту проблему нужно именно на таком уровне.)

Но на человеческом уровне эта заплатка кажется простой. Как только вы узнаете об искажении, вы создаете правила, которые описывают искаженное поведение и ставят его вне закона. Правило, гласящее: «Ради блага племени не прибегай к обману ради захвата власти, даже ради блага племени». Или: «Ради блага племени не убивай, даже ради блага племени».

И тут приходит философ и предлагает свой «мысленный эксперимент», выстраивая сценарий, в котором по условию единственный возможный способ спасти пять невинных жизней — убить одного невиновного человека, и это убийство гарантированно спасет те пять жизней. «Поезд мчится на пятерых невинных людей, которых вы никак не можете предупредить, чтобы они успели отскочить в сторону, но вы можете толкнуть на рельсы перед поездом одного невиновного человека, и это остановит состав. Это ваши единственные варианты. Что вы сделаете?»

Альтруистичный человек, принявший определенные деонтологические запреты — которые кажутся вполне обоснованными, если взглянуть на историческую статистику результатов подобных рассуждений на ненадежном железе, — столкнувшись с этим мысленным экспериментом, может испытать некоторый душевный дискомфорт.

И вот ответ на этот философский сценарий, который мне еще ни разу не доводилось слышать от жертв философов:

«Вы утверждаете, что единственный возможный способ спасти пять невинных жизней — убить одного невиновного, и это убийство определенно спасет пять жизней, и что эти факты известны мне с абсолютной уверенностью. Но поскольку я работаю на испорченном железе, я не могу находиться в том эпистемическом состоянии, которое вы просите меня представить. Поэтому я отвечу так: в обществе Искусственных Интеллектов, заслуживающих статуса личности и лишенных врожденной склонности развращаться властью, для ИИ было бы правильным убить одного невиновного ради спасения пятерых, и более того, все его собратья с этим согласились бы. Однако я отказываюсь проецировать этот ответ на себя, поскольку эпистемическое состояние, которое вы просите меня представить, может существовать только у существ иного типа, нежели люди».

Как по мне, это выглядит как уловка. Я думаю, вселенная достаточно сурова, чтобы мы были вынуждены всерьез рассматривать подобные ситуации. Те, кто то и дело предлагают подобные мысленные эксперименты, вполне заслуживают такого ответа. Но любая человеческая правовая система так или иначе содержит в себе ответ на вопрос: «Сколько невиновных людей мы можем посадить в тюрьму, чтобы поймать виновных?», даже если это число нигде не записано.

Как человек, я стараюсь соблюдать деонтологические запреты, которые люди создали, чтобы жить в мире друг с другом. Но я не считаю, что наши деонтологические запреты буквально, по самой своей природе, внеконсеквенциально и терминально правильны. Я одобряю принцип «цель не оправдывает средства» как ориентир для людей, работающих на испорченном железе, но я бы не стал одобрять его как принцип для общества ИИ, которые строят хорошо откалиброванные прогнозы. (Если в человеческом обществе есть всего один ИИ, это добавляет другие соображения — например, будут ли люди брать с него пример.)

Поэтому я бы не сказал, что правильно спроектированный Дружественный ИИ непременно должен отказаться столкнуть того единственного человека с уступа, чтобы остановить поезд. Разумеется, я ожидал бы, что любой порядочный сверхинтеллект найдет лучшую третью альтернативу. Но если эти две альтернативы — единственные, и Дружественный ИИ сочтет, что разумнее столкнуть того человека с уступа — даже с учетом побочных эффектов для людей, которые увидят это и разнесут историю, и так далее, — то я не стану считать тревожным сигналом, если ИИ назовет правильным решением пожертвовать одним ради спасения пятерых. Опять же, я сам не хожу и не толкаю людей под поезда и не граблю банки ради финансирования своих альтруистических проектов. Так уж вышло, что я человек. Но если бы Дружественный ИИ развратился под влиянием власти, это было бы подобно тому, как если бы у него пошла красная кровь. Склонность развращаться под влиянием власти — это конкретная биологическая адаптация, поддерживаемая определенными когнитивными контурами, заложенная в нас генами по вполне понятной эволюционной причине. Она не появится в коде Дружественного ИИ спонтанно — точно так же, как его транзисторы не начнут кровоточить.

Я бы зашел еще дальше и сказал, что если бы существовали разумы с врожденным искажением, заставляющим их переоценивать внешний вред от действий, приносящих пользу им самим, то им понадобилось бы правило «цели не запрещают средства» — предписывающее делать то, что выгодно тебе самому, даже если это (как кажется) вредит племени. Гипотетически, если бы в их обществе не было такого правила, эти разумы отказывались бы дышать из страха израсходовать чужой кислород, и все они умерли бы. Для них случайные эксцессы, когда кто-то получает личную выгоду в чистый ущерб обществу, казались бы проявлением столь же осторожной добродетели — и действительно были бы им, — как и случаи, когда кто-то из нас, людей, проявляя осторожность, упускает возможность украсть буханку хлеба, которая действительно принесла бы ему самому больше пользы, чем убытка торговцу (с учетом всех побочных эффектов).

Принцип «цель не оправдывает средства» — это просто консеквенциалистское рассуждение на один метауровень выше. Если человек начинает думать на объектном уровне, что цель оправдывает средства, это приводит к ужасным последствиям из-за ненадежности нашего мозга; поэтому человеку не следует так думать. Но в конечном счете все это по-прежнему консеквенциализм. Просто это рефлексивный консеквенциализм для существ, которые знают, что их сиюминутные решения принимаются на ненадежном «железе».

*

Предыдущая главаГлава 304 из 354Следующая глава