К книге
Рациональность: от ИИ до зомби274. Магические категории.
82%
274. Магические категории.
291

Мы можем спроектировать разумные машины так, чтобы их главной, врожденной эмоцией была безусловная любовь ко всем людям. Сначала мы можем построить относительно простые машины, которые научатся распознавать счастье и несчастье по выражениям человеческих лиц, человеческим голосам и человеческому языку тела. Затем мы можем жестко закрепить результат этого обучения в качестве врожденных эмоциональных ценностей для более сложных разумных машин — так, чтобы они получали положительное подкрепление, когда мы счастливы, и отрицательное подкрепление, когда мы несчастны.

— Билл Хиббард (2001), «Суперинтеллектуальные машины»1

Это было опубликовано в рецензируемом научном журнале, а позже автор написал об этом целую книгу, так что позиция, которую я здесь обсуждаю, вовсе не является «соломенным чучелом».

Так что... гм... что же тут может пойти не так...

Когда я упомянул (разд. 7.2)2, что созданный по рецепту Хиббарда ИИ в итоге замостит всю галактику крошечными молекулярными смайликами, Хиббард написал возмущенный ответ:

«Когда станет возможно создать сверхразум, станет возможным и жестко встроить в него распознавание «выражений человеческих лиц, человеческих голосов и человеческого языка тела» (если воспользоваться моими словами, которые вы цитируете), точность которого превзойдет точность распознавания у современных людей, таких как мы с вами, и которое уж точно не удастся обмануть «крошечными молекулярными изображениями смайликов». Не стоит предполагать столь топорную реализацию моей идеи, которая не способна проводить различения, тривиальные для современных людей».

Поскольку Хиббард также написал: «Столь очевидные противоречивые допущения показывают, что Юдковский предпочитает драму разуму», я позволю себе заметить, что Хиббард иллюстрирует ключевой момент: не существует никакого профессионального сертификационного теста, который необходимо пройти, прежде чем вам позволят рассуждать о морали ИИ. Но это не главная моя тема на сегодня. Хотя это крайне важное замечание о расстановке сил на доске: большинство горе-создателей AGI/FAI настолько абсолютно не приспособлены к этой задаче, что я не знаю никого достаточно циничного, чтобы вообразить весь этот ужас, не увидев его собственными глазами. Даже Майкл Вассар, вероятно, был удивлен в свой первый раз.

Нет, сегодня я здесь для того, чтобы препарировать фразу: «Не стоит предполагать столь скверную реализацию моей идеи, которая не способна провести различение, тривиальное для современных людей».

Как-то раз — я встречал эту историю в нескольких версиях и в нескольких местах, иногда ее приводили как факт, но первоисточник мне так и не удалось найти, — так вот, как-то раз армия США решила использовать нейросети для автоматического обнаружения замаскированных танков противника.

Исследователи обучили нейросеть на 50 фотографиях замаскированных танков среди деревьев и 50 фотографиях деревьев без танков. Используя стандартные методы обучения с учителем, исследователи подобрали веса нейросети так, чтобы она правильно классифицировала обучающую выборку: выдавала «да» на 50 фотографиях с замаскированными танками и «нет» на 50 фотографиях леса.

Конечно, это еще не доказывало и даже не гарантировало, что новые примеры будут классифицированы правильно. Нейросеть могла просто «запомнить» 100 частных случаев, которые никак не обобщались на новые задачи. Не «замаскированные танки против леса», а просто «фото-1 положительное, фото-2 отрицательное, фото-3 отрицательное, фото-4 положительное...»

Однако исследователи поступили мудро: изначально они сделали 200 снимков — 100 с танками и 100 с деревьями — и использовали в обучающей выборке лишь половину. Они прогнали нейросеть по оставшимся 100 фотографиям, и без какого-либо дополнительного обучения она классифицировала все остальные снимки абсолютно верно. Успех подтвержден!

Исследователи передали готовую работу Пентагону, который вскоре вернул её обратно с жалобой, что в его собственных тестах нейросеть справлялась с различением фотографий не лучше, чем случайное угадывание.

Оказалось, что в наборе данных исследователей фотографии замаскированных танков были сделаны в пасмурные дни, тогда как фотографии обычного леса — в солнечные. Нейросеть научилась отличать пасмурные дни от солнечных вместо того, чтобы отличать замаскированные танки от пустого леса.

Эта притча — которая может быть как правдой, так и вымыслом — иллюстрирует одну из самых фундаментальных проблем в области обучения с учителем и, по сути, во всей сфере искусственного интеллекта: если обучающие задачи и реальные задачи хоть немного различаются по контексту — если они не принадлежат к одному и тому же независимо и одинаково распределённому процессу, — то не существует никаких статистических гарантий того, что прошлый успех перенесется на будущее. И неважно, насколько отлично ИИ, казалось бы, работает в условиях обучения. (Это не неразрешимая проблема, но это проблема, которую нельзя исправить заплатками. Существуют глубокие методы работы с ней — тема, выходящая за рамки этого эссе, — но здесь не помогут никакие пластыри.)

Как описано в главе «Суперэкспоненциальное пространство понятий», возможных понятий экспоненциально больше, чем возможных объектов, точно так же как количество возможных объектов экспоненциально зависит от количества признаков. Если черно-белое изображение имеет размер 256 пикселей с каждой стороны, то всего на картинке 65 536 пикселей. Количество возможных изображений составляет 265 536. А количество возможных понятий, которые классифицируют изображения на положительные и отрицательные примеры — то есть количество возможных границ, которые можно провести в пространстве изображений, — составляет 22^65 536. Исходя из этого, мы видим, что даже обучение с учителем почти полностью зависит от индуктивного смещения, без которого потребовалось бы как минимум 265 536 классифицированных примеров, чтобы провести различие между 22^65 536 возможных понятий — даже если классификации со временем не меняются.

Так что давайте теперь снова вернемся к словам:

Сначала мы можем построить относительно простые машины, которые научатся распознавать счастье и несчастье по выражениям человеческих лиц, человеческим голосам и человеческому языку тела. Затем мы можем жестко закрепить результат этого обучения в качестве врожденных эмоциональных ценностей для более сложных разумных машин — так, чтобы они получали положительное подкрепление, когда мы счастливы, и отрицательное подкрепление, когда мы несчастны.

и

Когда станет возможно создать сверхразум, станет возможным и жестко встроить в него распознавание «выражений человеческих лиц, человеческих голосов и человеческого языка тела» (если воспользоваться моими словами, которые вы цитируете), точность которого превзойдет точность распознавания у современных людей, таких как мы с вами, и которое уж точно не удастся обмануть «крошечными молекулярными изображениями смайликов». Не стоит предполагать столь топорную реализацию моей идеи, которая не способна проводить различения, тривиальные для современных людей.

Отличить фотографию с изображением замаскированного танка от фотографии пустого леса тривиально — в том смысле, чтобы определить, что эти две фотографии не идентичны. Это разные массивы пикселей с разными единицами и нулями. Отличить их друг от друга так же просто, как проверить массивы на равенство.

Классификация новых фотографий на положительные и отрицательные примеры «улыбки» путем логического вывода на основе набора обучающих снимков, уже классифицированных как положительные или отрицательные, — это задача совсем другого порядка.

Когда у вас есть изображение размером 256×256 пикселей с реальной камеры, на котором, как оказывается, запечатлен замаскированный танк, в нем нет никакого дополнительного 65 537-го бита, обозначающего положительность, — нет крошечного XML-тега, гласящего: «Это изображение изначально положительное». Оно является положительным примером лишь относительно некоторого конкретного понятия.

Но для любого не-Огромного объема обучающих данных — любых обучающих данных, которые не содержат точную побитовую копию наблюдаемого сейчас изображения, — существует сверхэкспоненциально много возможных понятий, совместимых с предыдущими классификациями.

Для ИИ выбор или взвешивание среди сверхэкспоненциального множества вариантов — это вопрос индуктивного смещения. Которое может не совпадать с тем, что имеет в виду пользователь. Разрыв между этими двумя процессами классификации примеров — индукцией, с одной стороны, и реальными целями пользователя, с другой, — преодолеть далеко не просто.

Допустим, обучающие данные ИИ выглядят так:

Набор данных 1:

+: Улыбка_1, Улыбка_2, Улыбка_3

-: Хмурое_лицо_1, Кот_1, Хмурое_лицо_2, Хмурое_лицо_3, Кот_2, Лодка_1, Машина_1, Хмурое_лицо_5.

Теперь ИИ вырастает в сверхразум и сталкивается со следующими данными:

Набор данных 2:

: Хмурое_лицо_6, Кот_3, Улыбка_4, Галактика_1, Хмурое_лицо_7, Нанофабрика_1, Молекулярный_смайлик_1, Кот_4, Молекулярный_смайлик_2, Галактика_2, Нанофабрика_2.

То, что полученная в результате вывода классификация, которую вы предпочли бы, окажется именно такой:

+: Улыбка_1, Улыбка_2, Улыбка_3, Улыбка_4

-: Хмурое_лицо_1, Кот_1, Хмурое_лицо_2, Хмурое_лицо_3, Кот_2, Лодка_1, Машина_1, Хмурое_лицо_5, Хмурое_лицо_6, Кот_3, Галактика_1, Хмурое_лицо_7, Нанофабрика_1, Молекулярный_смайлик_1, Кот_4, Молекулярный_смайлик_2, Галактика_2, Нанофабрика_2.

а не такой:

+: Улыбка_1, Улыбка_2, Улыбка_3, Молекулярный_смайлик_1, Молекулярный_смайлик_2, Улыбка_4

-: Хмурое_лицо_1, Кот_1, Хмурое_лицо_2, Хмурое_лицо_3, Кот_2, Лодка_1, Машина_1, Хмурое_лицо_5, Хмурое_лицо_6, Кот_3, Галактика_1, Хмурое_лицо_7, Нанофабрика_1, Кот_4, Галактика_2, Нанофабрика_2.

— не является свойством этих наборов данных.

Обе эти классификации совместимы с обучающими данными. Число понятий, совместимых с обучающими данными, будет гораздо больше, поскольку сразу несколько разных понятий могут отбрасывать одну и ту же тень на объединенный набор данных. Если пространство возможных понятий включает в себя пространство возможных вычислений, классифицирующих примеры, то это пространство бесконечно.

Какую классификацию выберет ИИ? Это не внутреннее свойство обучающих данных; это свойство того, как именно ИИ осуществляет индукцию.

Какая классификация является верной? Это не свойство обучающих данных; это свойство ваших предпочтений (или, если угодно, свойство идеализированной абстрактной динамики, которую вы называете «правильной»).

Понятие, которое вы имели в виду, отбросило свою тень на обучающие данные, когда вы сами помечали каждый пример знаком «+» или «-», опираясь при этом на собственный разум и предпочтения. В этом и заключается суть обучения с учителем — предоставить ИИ размеченные обучающие примеры, которые проецируют тень причинно-следственного процесса, создавшего эти метки.

Но если обучающие данные не взяты из точно такого же контекста, что и в реальной жизни, они в некотором смысле будут «поверхностными» — проекцией гораздо более многомерного пространства возможностей.

ИИ никогда не видел крошечных молекулярных смайликов на этапе своего обучения, когда он был еще глупее человека, равно как и не видел крошечного агента со счетчиком счастья, установленным на гуголплекс. Теперь же вы, столкнувшись наконец с крошечным молекулярным смайликом — или, возможно, с очень реалистичной крошечной скульптурой человеческого лица, — сразу понимаете, что это не то, что вы хотите считать улыбкой. Но это суждение отражает неестественную категорию, граница классификации которой чутко зависит от ваших сложных ценностей. Именно ваши собственные планы и желания начинают действовать, когда вы говорите «Нет!».

Хиббард инстинктивно знает, что крошечный молекулярный смайлик — это не «улыбка», потому что понимает: он не хочет, чтобы его гипотетический ИИ занимался подобным. Если бы перед кем-то другим стояла иная задача, например классификация произведений искусства, этот человек мог бы счесть, что Мона Лиза очевидно улыбается (а не хмурится, к примеру), хотя это всего лишь краска.

Как показывает случай Терри Шиаво, технологии порождают новые пограничные случаи, которые ввергают нас в новые, по сути своей моральные дилеммы. Демонстрация ИИ изображений живых и мертвых людей, какими они были во времена Древней Греции, не поможет ему принять моральное решение о том, является ли отключение Терри от системы жизнеобеспечения убийством. Этой информации нет в наборе данных даже на уровне индукции! Случай Терри Шиаво поднимает новые моральные вопросы, апеллируя к новым моральным соображениям, о которых вам не пришлось бы задумываться при классификации фотографий живых и мертвых людей времен Древней Греции. Тогда никто не находился на системах жизнеобеспечения, продолжая дышать с наполовину разжиженным мозгом. Поэтому подобные соображения не играют никакой роли в причинно-следственном процессе, который вы используете для классификации обучающих данных времен Древней Греции, а значит, не отбрасывают никакой тени на эти обучающие данные и не могут быть получены путем индукции по ним.

Первое заблуждение состоит в недооценке сложности понятия, которое мы конструируем ради его ценности. Границы этого понятия будут зависеть от множества ценностей и, вероятно, от моральных рассуждений «на лету», если пограничный случай относится к числу тех, с которыми мы еще не сталкивались. Но все это происходит незаметно, на заднем плане; Хиббарду просто кажется очевидным, что крошечный молекулярный смайлик — это не улыбка. И мы не перебираем все возможные пограничные случаи, а потому не думаем обо всех соображениях, которые могли бы сыграть роль в переопределении понятия, но еще не сыграли роли в его определении. Поскольку люди недооценивают сложность своих понятий, они недооценивают и трудность выведения понятия из обучающих данных. (А также трудность прямого описания понятия — см. «Скрытая сложность желаний».)

Второе заблуждение — это антропоморфный оптимизм. Поскольку Билл Хиббард использует собственный интеллект для поиска вариантов и планов, занимающих высокие позиции в его шкале предпочтений, он с недоверием относится к мысли, что сверхинтеллект может классифицировать никогда ранее не встречавшиеся крошечные молекулярные смайлики как положительный пример «улыбки». В том смысле, в каком понятие «улыбка» использует Хиббард (для описания желаемого поведения сверхинтеллекта), расширение этого понятия на крошечные молекулярные смайлики находилось бы на очень низком месте в его шкале предпочтений; это было бы глупо — причем глупо изначально, по самому свойству этого понятия, — а значит, сверхинтеллект уж точно так не поступит; это же совершенно очевидно неверная классификация. Уж конечно, сверхинтеллект способен отличить правильные кучки камешков от неправильных.

Да ведь Дружественный ИИ — это совсем не сложно! Всего-то и нужен ИИ, который делает то, что хорошо! О да, конечно, далеко не всякий возможный разум делает то, что хорошо, — но в данном случае мы просто запрограммируем сверхинтеллект делать то, что хорошо. Вам понадобится лишь нейросеть, которая увидит несколько примеров хороших и не-хороших вещей, и у вас уже есть классификатор. Подключите его к максимизатору ожидаемой полезности — и дело сделано!

Я назову это заблуждением магических категорий — простых коротких слов, за которыми, как оказывается, скрывается вся желаемая функциональность ИИ. Почему бы не запрограммировать шахматного игрока, запустив нейросеть (то есть магический поглотитель категорий) на наборе выигрышных и проигрышных последовательностей шахматных ходов, чтобы она могла генерировать «выигрышные» последовательности? В 1950-х годах считалось, что ИИ устроен именно так просто, но это оказалось совсем не так.

Новичку кажется, будто Дружественный ИИ — это проблема принуждения ИИ делать то, чего хотите вы, вместо того чтобы он следовал собственным желаниям. Но настоящая проблема Дружественного ИИ — это проблема коммуникации, передачи границ категорий вроде «хорошо», которые невозможно полностью очертить в обучающих данных, доступных ИИ в период его «детства». По сравнению с огромным пространством возможностей, которое таит в себе Будущее, мы сами не представляем себе большинства пограничных случаев, и нам самим потребовались бы полноценные моральные споры, чтобы во всем разобраться. Чтобы решить проблему Дружественного ИИ, нужно выйти за рамки парадигмы индукции на размеченных людьми обучающих данных и парадигмы сформулированных людьми интенсиональных определений.

Конечно, даже если бы Хиббарду удалось передать ИИ понятие, которое охватывает в точности каждое выражение человеческого лица, которое Хиббард назвал бы «улыбкой», и исключает любое выражение лица, которое Хиббард не назвал бы «улыбкой»...

То получившийся ИИ казался бы работающим правильно в период своего «детства», пока он был еще достаточно слаб и мог вызывать улыбки, только угождая своим программистам.

Когда же этот ИИ развился бы до уровня сверхинтеллекта и обзавелся собственной нанотехнологической инфраструктурой, он бы содрал с вас лицо, зафиксировал бы его проволокой в вечной улыбке и принялся бы его ксерокопировать.

Глубокие ответы на подобные вопросы выходят за рамки этого эссе, но общий принцип Дружественного ИИ гласит: простыми заплатками здесь не обойтись. В 2004 году Хиббард изменил свое предложение, заявив, что выражение согласия со стороны человека должно подкреплять определение счастья, а счастье, в свою очередь, должно подкреплять другие формы поведения. Что, даже если бы это сработало, привело бы лишь к тому, что ИИ стал бы ксерокопировать кучу вещей, сходных в его пространстве понятий с программистами, говорящими «Да, это счастье!» по поводу атомов водорода — ведь атомы водорода так легко создавать.

Ссылка на мое обсуждение с Хиббардом здесь. Самое важное вы уже усвоили.

*

1. Билл Хиббард, «Super-Intelligent Machines», ACM SIGGRAPH Computer Graphics 35, no. 1 (2001): 13–15, http://www.siggraph.org/publications/newsletter/issues/v35/v35n1.pdf.

2. Элиезер Юдковский, «Artificial Intelligence as a Positive and Negative Factor in Global Risk» в сборнике под ред. Бострома и Чирковича Global Catastrophic Risks, 308–345.

Предыдущая главаГлава 291 из 354Следующая глава