Роб Бензингер
Вы — разум, и это ставит вас в довольно странное положение.
Быть разумом дано очень немногим вещам. Вы — та странная крупица материи во Вселенной, которая способна делать прогнозы и строить планы, взвешивать и пересматривать убеждения, страдать, мечтать, замечать божьих коровок или испытывать внезапное желание съесть манго. Вы даже можете сформировать в собственном разуме картину всего своего разума целиком. Вы можете рассуждать о собственном процессе рассуждения и работать над тем, чтобы привести его работу в большее соответствие с вашими целями.
Вы — разум, реализованный в человеческом мозге. И оказывается, что человеческий мозг, при всей его изумительной гибкости, — вещь закономерная, состоящая из шаблонов и рутины. Ваш разум может всю жизнь следовать привычной рутине, ни разу этого не заметив. И эта рутина может иметь огромные последствия.
Когда ментальный шаблон приносит вам пользу, мы называем это «рациональностью».
Вы существуете именно в таком виде — биологически предрасположенными к проявлению определенных видов рациональности и определенных видов иррациональности — благодаря вашим предкам. Вы, как и вся жизнь на Земле, происходите от древних самовоспроизводящихся молекул. Этот процесс репликации поначалу был неуклюжим и хаотичным, но вскоре привел к появлению копируемых различий между репликаторами. «Эволюция» — это наше название для изменения этих различий с течением времени.
Поскольку некоторые из этих воспроизводимых различий влияют на способность к воспроизводству — явление, называемое «отбором», — эволюция привела к появлению организмов, приспособленных к размножению в условиях, подобных тем, в которых жили их предки. Все в вас построено на отголосках борьбы и побед ваших предков.
И вот вы здесь: разум, высеченный из более слабых разумов, стремящийся понять собственные внутренние механизмы, чтобы их можно было улучшить — улучшить применительно к вашим целям, а не к целям вашего создателя, эволюции. Какие полезные стратегии и выводы мы можем извлечь из понимания того, что таково наше исходное положение?
Призраки и машины
Наш мозг по своей микроструктуре и динамике похож на многие другие механические системы. И все же мы редко думаем о своем разуме в тех же терминах, что и о предметах нашего окружения или органах нашего тела. Наши базовые ментальные категории — убеждение, решение, слово, идея, чувство и так далее — мало похожи на наши физические категории.
Философы прошлого ухватились за это наблюдение и развили его, утверждая, что разум и мозг — это фундаментально различные, обособленные явления. Этот взгляд философ Гилберт Райл назвал «догмой о Призраке в Машине».1 Однако современные ученые и философы, отвергшие дуализм, не обязательно заменили его более точной предсказательной моделью работы разума. Фактически наши цели и желания все еще функционируют подобно свободно парящим призракам, словно некий магистериум, отрезанный от остальных наших научных знаний. Мы можем рассуждать о «рациональности», «искажениях» и о том, «как изменить свое мнение», но если эти идеи остаются неточными и не ограниченными никакой всеобъемлющей теорией, наш наукообразный язык не убережет нас от тех же ошибок, которые совершают люди, чьи теоретические допущения включают духов и скрытые сущности.
Интересно, что таинственность и мистификация вокруг разума мешают нам разглядеть не только людей. Они также распространяются на системы, которые кажутся разумными или целенаправленными в эволюционной биологии и искусственном интеллекте (ИИ). Возможно, если мы не можем легко понять, кто мы такие, глядя на себя, мы сможем узнать больше, используя в качестве зеркала процессы, очевидно нечеловеческие.
Здесь есть много призраков, у которых можно поучиться — призраков прошлого, настоящего и будущего. И эти иллюзии — реальные когнитивные события, реальные феномены, которые мы можем изучать и объяснять. Если кажется, что в машине есть призрак, то эта видимость сама по себе является скрытой работой машины.
Первая цепочка книги «Машина в призраке», «Простая математика эволюции», призвана показать диссонанс и расхождение между нашей наследственной историей, нашей сегодняшней биологией и нашими конечными устремлениями. Для этого потребуется копнуть глубже, чем это обычно делается во введениях в эволюцию для небиологов, которые зачастую ограничиваются лишь поверхностными особенностями естественного отбора.
Третья цепочка, «Руководство по словам для человека», обсуждает фундаментальную связь между познанием и формированием понятий. За ней следует более длинное эссе, представляющее собой введение в байесовский вывод.
Связывая эти темы между собой, цепочка «Хрупкие цели» абстрагируется от человеческого познания и эволюции, переходя к концепции разума и целенаправленных систем в самом общем виде. Эти эссе также служат второстепенной цели — объяснить общий подход автора к философии и науке о рациональности, который во многом опирается на его работу в области ИИ.
Воссоздание интеллекта
Юдковский — специалист по теории принятия решений и математик, занимающийся фундаментальными проблемами универсального искусственного интеллекта (AGI), то есть теоретическими исследованиями систем решения задач общего назначения. Работа Юдковского в области ИИ стала главной движущей силой его исследований психологии человеческой рациональности, о чем он сам упомянул в своем самом первом посте в блоге Overcoming Bias под названием «Боевое искусство рациональности»:
То понимание рациональности, которым я обладаю, я приобрел в процессе борьбы с проблемой универсального искусственного интеллекта (задача, для успешного решения которой потребовалось бы такое мастерство в рациональности, которого хватило бы, чтобы собрать полностью работающего рационалиста из зубочисток и резинок). В большинстве отношений проблема ИИ несоизмеримо сложнее, чем личное искусство рациональности, но в некотором смысле она даже проще. В боевом искусстве разума нам необходимо приобрести процедурный навык в реальном времени дергать за нужные рычаги в нужное время на огромной, уже существующей мыслящей машине, внутренности которой не подлежат модификации конечным пользователем. Некоторые её механизмы оптимизированы под давлением эволюционного отбора, которое напрямую противоречит заявленным нами целям их использования. Мы осознанно решаем, что хотим искать только истину, однако наш мозг на аппаратном уровне поддерживает рационализацию лжи. [ . . . ]
Попытка синтезировать личное искусство рациональности, опираясь на науку о рациональности, может оказаться довольно неуклюжей: это напоминает попытку создать боевое искусство на основе абстрактной теории физики, теории игр и анатомии человека. Но люди не слепы в своей рефлексии; у нас действительно есть врожденный инстинкт самонаблюдения. Внутреннее око не слепо, но видит нечетко, с систематическими искажениями. Поэтому нам необходимо применить научный подход к нашей интуиции, использовать абстрактные знания для корректировки мысленных движений и развития метакогнитивных навыков. Мы не пишем компьютерную программу, заставляющую марионетку на ниточках выполнять приемы боевых искусств; двигать приходится нашими собственными ментальными конечностями. А значит, мы должны связать теорию с практикой. Мы должны осознать, что эта наука значит для нас самих, для нашей повседневной внутренней жизни.
Насколько я понимаю, с точки зрения Юдковского, говорить о человеческой рациональности, не сказав ничего интересного об ИИ, примерно так же трудно, как говорить об ИИ, не сказав ничего интересного о рациональности.
В долгосрочной перспективе Юдковский предсказывает, что ИИ превзойдет человека в результате «взрыва интеллекта» — сценария, при котором самомодифицирующийся ИИ совершенствует собственную способность эффективно перепроектировать себя, запуская стремительную череду последующих самоулучшений. Вместо термина «взрыв интеллекта» иногда используется понятие «технологическая сингулярность»; до января 2013 года институт MIRI назывался «Институтом сингулярности искусственного интеллекта» (Singularity Institute for Artificial Intelligence) и ежегодно проводил Саммит Сингулярности. С тех пор Юдковский предпочитает использовать более старый термин И. Дж. Гуда — «взрыв интеллекта», чтобы отделить свои взгляды от других футуристических прогнозов, таких как тезис Рэя Курцвейла об экспоненциальном технологическом прогрессе.2
Технологии вроде ИИ, превосходящего человеческий разум, по всей видимости, приведут к масштабным общественным потрясениям — к лучшему или к худшему. Юдковский ввел термин «теория Дружественного ИИ» для обозначения исследований в области методов согласования предпочтений универсального искусственного интеллекта (AGI) с предпочтениями человека. На данный момент крайне мало известно о том, когда именно будет создано программное обеспечение общего интеллекта или какие подходы к безопасности окажутся эффективными в таком случае. Уверенно верифицировать и валидировать современный автономный ИИ уже сейчас может быть весьма непросто, а многие существующие методы вряд ли получится перенести на более интеллектуальные и адаптивные системы. Таким образом, «Дружественный ИИ» — это скорее пестрая коллекция базовых математических и философских вопросов, нежели четко определенный набор задач для программирования.
По состоянию на 2015 год взгляды Юдковского на будущее ИИ продолжают обсуждаться технологическими прогнозистами и исследователями ИИ как в промышленности, так и в академических кругах, которые пока не пришли к единому мнению. Книга Ника Бострома «Суперинтеллект» предлагает целостный обзор множества моральных и стратегических вопросов, возникающих в связи с созданием ИИ, превосходящего человеческий разум.3
Наиболее широко используемым учебником для общего знакомства с областью ИИ является книга Рассела и Норвига «Искусственный интеллект: современный подход».4 В главе, посвященной моральным и философским вопросам, которые поднимает ИИ, Рассел и Норвиг отмечают техническую сложность определения правильного поведения в высокоадаптивном ИИ:
[Юдковский] утверждает, что дружественность (стремление не причинять вреда людям) должна закладываться в проект с самого начала, однако разработчики должны понимать как то, что их собственные проекты могут быть несовершенными, так и то, что робот со временем будет учиться и развиваться. Таким образом, задача заключается в проектировании механизмов — в том, чтобы определить механизм для эволюционирующих систем ИИ в рамках системы сдержек и противовесов, а также наделить эти системы функциями полезности, которые останутся дружественными в условиях подобных изменений. Мы не можем просто дать программе статичную функцию полезности, потому что со временем меняются как обстоятельства, так и наши желаемые реакции на них.
Встревоженные тем, что будущий прогресс в ИИ, нанотехнологиях, биотехнологиях и других областях может поставить под угрозу человеческую цивилизацию, Бостром и Чиркович составили первую академическую антологию на эту тему — «Глобальные катастрофические риски».5 Самыми экстремальными из них являются экзистенциальные риски — угрозы, способные привести к необратимой стагнации или вымиранию человечества.6
Люди (включая экспертов), как правило, чрезвычайно плохи в прогнозировании важных будущих событий (включая появление новых технологий). Одна из целей Юдковского при обсуждении рациональности — выяснить, какие именно когнитивные искажения мешают нам предсказывать крупные потрясения и готовиться к ним задолго до их наступления. Статьи Юдковского в сборнике «Глобальные катастрофические риски» — «Когнитивные искажения, способные повлиять на оценку глобальных рисков» и «Искусственный интеллект как позитивный и негативный фактор глобального риска» — связывают воедино его исследования в когнитивистике и области ИИ. Юдковский и Бостром также обобщают как краткосрочные, так и долгосрочные проблемы в главе «Кембриджского руководства по искусственному интеллекту» под названием «Этика искусственного интеллекта»7.
Хотя эта книга посвящена человеческой рациональности, тема ИИ важна как источник простых иллюстраций различных аспектов человеческого познания. Долгосрочное прогнозирование развития технологий также является одним из наиболее важных применений байесовской рациональности, которая позволяет моделировать корректные рассуждения даже в тех областях, где данные скудны или неоднозначны.
Знание устройства может многое рассказать о создателе, а знание создателя — об устройстве.
Итак, мы начнем с исследования того, чему наш собственный создатель может научить нас самих.
*
1. Гилберт Райл, «Понятие сознания» (University of Chicago Press, 1949).
2. Ирвинг Джон Гуд, «Speculations Concerning the First Ultraintelligent Machine», в Advances in Computers, под ред. Франца Л. Альта и Морриса Рубиноффа, т. 6 (New York: Academic Press, 1965), 31–88, doi:10.1016/S0065-2458(08)60418-0.
3. Ник Бостром, «Суперинтеллект: пути, опасности, стратегии» (Oxford University Press, 2014).
4. Стюарт Рассел, Питер Норвиг, «Искусственный интеллект: современный подход», 3-е изд. (Upper Saddle River, NJ: Prentice-Hall, 2010).
5. Бостром и Чиркович, «Глобальные катастрофические риски».
6. Примером возможного экзистенциального риска является сценарий «серой слизи», в котором молекулярные роботы, созданные для эффективного самовоспроизведения, справляются со своей задачей слишком хорошо и быстро вытесняют живые организмы, поглощая все доступное на Земле вещество.
7. Ник Бостром, Элиезер Юдковский, «Этика искусственного интеллекта» в The Cambridge Handbook of Artificial Intelligence, под ред. Кита Фрэнкиша и Уильяма Рэмси (New York: Cambridge University Press, 2014).