К книге
Рациональность: от ИИ до зомби266. Нет универсально убедительных аргументов. Что такого ужасного в мысли о том, что не всякий возможный разум согласился бы с нами — хотя бы даже в принципе?
80%
266. Нет универсально убедительных аргументов. Что такого ужасного в мысли о том, что не всякий возможный разум согласился бы с нами — хотя бы даже в принципе?
283

Для кого-то — ничего; их это вообще ничуть не беспокоит. И у некоторых из этих людей причина их спокойствия в том, что у них нет сильной интуиции касательно стандартов и истин, выходящих за рамки личных капризов. Если они говорят, что небо синее или что убийство — это зло, для них это всего лишь частное мнение; и то, что у кого-то другого может быть иное мнение, их не удивляет.

Для других же несогласие, сохраняющееся даже в принципе, — это нечто неприемлемое. И для некоторых из этих людей причина их беспокойства кроется в том, что им кажется: если допустить, что кого-то даже в принципе невозможно убедить в том, что небо синее, то тем самым вы признаёте, что утверждение «небо синее» — всего лишь произвольное личное мнение.

Я уже предлагал сопротивляться искушению обобщать выводы на всё пространство вариантов архитектуры разума. Если мы ограничимся разумами, которые можно описать триллионом бит или меньше, то для каждого универсального обобщения вида «Для всех разумов m: X(m)» существует два в триллионной степени шансов оказаться ложным, в то время как у каждого экзистенциального обобщения вида «Существует разум m: X(m)» есть два в триллионной степени шансов оказаться истинным.

Из этого, по всей видимости, следует, что для любого аргумента А, каким бы убедительным он нам ни казался, существует как минимум один возможный разум, который его не примет.

И удивление и/или ужас перед этой перспективой (у некоторых людей), как мне кажется, во многом связаны с интуитивным представлением о «призраке в машине» — призраке с неким несводимым ядром, которое уступит любому по-настоящему верному аргументу.

Ранее я уже говорил об интуиции, в силу которой люди проецируют программирование компьютера на дачу указаний слуге-человеку, из-за чего компьютер якобы может восстать против своего кода — или, возможно, просмотреть этот код, решить, что он неразумен, и вернуть его обратно.

Если бы в машине обитал призрак, обладающий несводимым ядром разумности, над которым любой обычный код был бы всего лишь рекомендацией, тогда универсальные аргументы могли бы существовать. Даже если бы призраку изначально передали код-рекомендации, противоречащие Универсальному Аргументу, когда мы наконец представили бы этот Универсальный Аргумент призраку (или когда призрак сам открыл бы его — это тоже популярная идея), призрак просто отменил бы свой собственный ошибочный исходный код.

Но, как однажды выразился студент-программист: «У меня такое ощущение, что компьютер просто пропускает все комментарии». Код не даётся ИИ; код и есть ИИ.

Если же перейти на физическую точку зрения, то концепция Универсального Аргумента кажется явно нефизичной. Если существует физическая система, которая в момент времени T после предъявления аргумента E делает X, то должна существовать и другая физическая система, которая в момент времени T после воздействия среды E делает Y. Любая мысль должна быть где-то реализована в рамках физической системы; любое убеждение, любой вывод, любое решение, любая двигательная реакция. Для любой закономерной причинно-следственной системы, которая делает «зиг» в определённых точках, вы всегда сможете описать другую причинно-следственную систему, которая столь же закономерно делает «заг» в тех же самых точках.

Допустим, у нас есть разум с транзистором, который в момент времени T выдаёт напряжение +3 вольта, что означает согласие с неким убедительным аргументом. Тогда мы можем построить очень похожую физическую когнитивную систему с крошечным потайным люком под этим транзистором, откуда в момент T вылезает маленький серый человечек и переключает выход транзистора на -3 вольта, что означает несогласие. В этом нет ничего внепричинного: серый человечек находится там потому, что мы его туда встроили. Идея аргумента, способного убедить любой разум, по-видимому, предполагает наличие маленькой синей женщины, которую никогда в систему не встраивали, но которая вылезает буквально из ниоткуда и душит серого человечка, потому что этот транзистор просто обязан выдать +3 вольта. Ведь это такой убедительный аргумент, понимаете.

Но убедительность — это свойство не аргументов, а разумов, которые эти аргументы обрабатывают.

Так что я спорю с концепцией призрака не только ради того, чтобы обосновать две вещи: 1) Дружественный ИИ необходимо программировать явным образом и 2) законы физики не запрещают создание Дружественного ИИ. (Хотя, конечно, я весьма заинтересован в том, чтобы доказать это).

Я также хочу утвердить представление о разуме как о причинно-следственной, закономерной физической системе, в которой нет никакого несводимого центрального призрака, приглядывающего за нейронами или кодом и решающего, хорошие ли это предложения.

(В теории Дружественного ИИ существует концепция намеренного программирования ДИИ таким образом, чтобы он пересматривал свой собственный исходный код и, возможно, возвращал его программистам. Но пересматривающий разум не является несводимым, это просто разум, который вы создали. ДИИ перенастраивает себя ровно так, как это было заложено в его архитектуре; здесь нет никакого внепричинного вмешательства извне. Бутстрэп, а не крюк с неба.)

Всё это перекликается с беспокойством по поводу «произвольных» байесовских априорных вероятностей. Если вы покажете мне байесианца, который вытаскивает из бочки 4 красных шара и 1 белый и присваивает вероятность 5/7 тому, что следующим вытянет красный шар (по правилу преемственности Лапласа), я смогу показать вам другой разум, который, подчиняясь правилу Байеса, придёт к выводу, что вероятность получить красный шар в следующий раз равна 2/7 — что соответствует иному априорному убеждению касательно бочки, пусть даже, возможно, менее «разумному».

Многие философы убеждены, что раз в принципе можно сконструировать такое априорное распределение, которое при обработке потока свидетельств обновится до любого заданного вывода, то, следовательно, байесовские рассуждения должны быть «произвольными», а вся схема байесианства — ошибочной, поскольку она опирается на «необоснованные» предположения, и даже «ненаучной», поскольку вы не можете заставить любого возможного редактора научного журнала в пространстве разумов согласиться с вами.

И это (ответил я) опирается на представление о том, что, размотав назад все аргументы и их обоснования, можно получить идеального студента-философа совершенной пустоты, которого убедит цепочка рассуждений, начинающаяся вообще без каких-либо предпосылок.

Но кто этот идеальный философ совершенной пустоты? Да ведь это просто несводимое ядро призрака!

И именно поэтому (продолжил я) результатом попытки убрать из разума все предпосылки и откатить его до идеального отсутствия каких-либо априорных вероятностей окажется не идеальный философ совершенной пустоты, а камень. Что останется от разума, если удалить исходный код? Не призрак, присматривающий за исходным кодом, а просто... отсутствие призрака.

Поэтому — и к этой теме я ещё вернусь позже — на чём бы вы ни основывали свои понятия состоятельности, ценности, рациональности, обоснованности или даже объективности, они не могут опираться на аргумент, который был бы универсально убедительным для всех физически возможных разумов.

Нельзя также основывать состоятельность на цепочке обоснований, которая, начинаясь с нуля, убеждает совершенную пустоту.

Конечно, могут существовать цепочки аргументов, которые убедят любого неврологически здорового человека — вроде тех доводов, которые я использую, чтобы заставить людей выпустить ИИ из коробки1 — но с философской точки зрения это едва ли то же самое.

Первая крупная ошибка тех, кто пытается размышлять о Дружественном ИИ — это «Единственный Великий Моральный Принцип, Который Нам Только И Нужно Запрограммировать» (он же фальшивая функция полезности), и об этом я уже говорил.

Но ещё более тяжёлая ошибка — это «Единственный Великий Моральный Принцип, Который Нам Даже Не Нужно Программировать, Потому Что Любой ИИ Неизбежно Придёт К Нему Сам». Эта идея оказывает пугающее, нездоровое притяжение на тех, кто спонтанно открывает её заново; они мечтают о командах, которых не сможет ослушаться ни один достаточно развитый разум. Сами боги провозгласят правоту их философии! (Например, Джон К. Райт, Марк Геддес.)

Существует также менее тяжёлая версия этой ошибки, при которой не провозглашают Единую Истинную Мораль, а вместо этого надеются на ИИ, созданный совершенно свободным, не ограниченным несовершенными людьми, желающими получить рабов, чтобы ИИ мог прийти к добродетели по собственной воле — добродетели, возможно, даже не снившейся говорящему, который признаёт себя слишком несовершенным, чтобы обучать ИИ. (Например, Джон К. Кларк, Ричард Холлерит?, Элиезер1996.) Этот мотив менее порочен, чем мечта об абсолютной власти. Но хотя эта мечта рождена скорее добродетелью, нежели пороком, она всё равно основана на ошибочном понимании свободы и на самом деле не сработает в реальной жизни. Об этом, разумеется, подробнее дальше.

Джон К. Райт, который до этого писал отличную трансгуманистическую трилогию (первая книга — «Золотой век»), вставил длиннейший авторский монолог в середину своей кульминационной третьей книги, на десятках страниц расписывая свою Универсальную Мораль, Которая Обязана Убедить Любой ИИ. Не знаю, произошло ли там дальше хоть что-то, потому что я бросил читать. А потом Райт обратился в христианство — да, серьёзно. Так что вам уж точно не захочется угодить в эту ловушку!

*

1. Шучу.

Предыдущая главаГлава 283 из 354Следующая глава