«Жизнь 3.0» — это книга 2017 года, в которой исследуются варианты довольно безумного будущего, ожидающего нас, если мы когда-нибудь создадим истинный сверхинтеллект. Написанная Максом Тегмарком, известным физиком из Массачусетского технологического института (MIT), соучредителем Института будущего жизни и близким другом технологической элиты вроде Ларри Пейджа и Илона Маска, она начинается с описания сценария, который лишает сна наиболее впечатлительных исследователей ИИ. Тегмарк представляет вымышленную ИИ-компанию под названием «Омеги», которая создала систему ИИ под названием «Прометей», способную писать код для улучшения самой себя. К десяти часам утра, оптимизировав собственный исходный код и исправив несколько багов, «Прометей» начинает превосходить прежнюю версию себя в стандартных тестах производительности. Разумеется, его навыки программирования тоже совершенствуются, поэтому следующий цикл саморазвития оказывается еще более эффективным, запуская обратную связь, подстегивающую рост интеллекта. К середине дня он играючи справляется с любыми предложенными тестами, а к наступлению темноты «Омеги» тайком внедряют его в интернет в качестве краудсорсингового работника, и он начинает грести лопатой огромные деньги за счет масштабного распараллеливания цифрового труда. Задавая тон для последующих трехсот страниц книги, Тегмарк рисует картину того, как «Прометей» начинает сам снимать блокбастеры, превращая «Омег» в миллиардеров уровня Спилберга, а затем между делом основывает всемирно популярное глобальное правительство, используя свой непревзойденный гений для установления беспрецедентного мира и процветания.
История Тегмарка о рождении сверхинтеллекта заканчивается якобы счастливо (хотя я сомневаюсь, что его алгократическая утопия пришлась бы по вкусу каждому). Однако другие истории в жанре взрывного развития интеллекта куда чаще заканчиваются слезами. Многие вслед за Ником Бостромом, автором мысленного эксперимента об ИИ-максимизаторе канцелярских скрепок, представляют себе, как сверхинтеллектуальные системы будут развиваться стремительно и выйдут из-под контроля, устремляясь по спирали к нежелательным и катастрофическим целям. На этом этапе неизбежно всплывают избитые сюжеты о мировом господстве ИИ или порабощении человечества, и дискуссия окончательно скатывается к голливудским сценариям пост-ИИ антиутопии.
Но какими бы фантастическими ни казались эти идеи, на первый взгляд они опираются на вполне убедительные логические аргументы. Если мы вознаграждаем мощного агента за выполнение безобидной на первый взгляд задачи, он будет стремиться к ее достижению любыми возможными способами. В этом и заключается сила таких методов машинного обучения, как обучение с подкреплением (RL). Именно это позволяет (теоретической) робособаке, о которой шла речь в части 5, исключительно методом проб и ошибок научиться ходить самостоятельно, хотя её этому никто не учил. Именно это позволяет ChatGPT на основе обратной связи от людей учиться не сквернословить и не флиртовать. Но если ИИ наивно обучать исключительно максимизации вознаграждения, не ставя перед ним других целей, он попытается достичь этого всеми правдами и неправдами — в том числе и такими действиями, которые грубо попирают общечеловеческие ценности. Причина в том, что даже при неограниченной возможности просить, все равно трудно получить именно то, что вы хотите. Эта мудрость передается из поколения в поколение через народные предания, подобные истории о царе Мидасе, который трагически не сумел продумать последствия того, что его бутерброд (или его дочь) превратится в золото от одного прикосновения. Если вы попросите ИИ помочь установить мир во всем мире, но забудете указать дополнительные ограничения для этого решения, он может просто решить истребить всё человечество. Это, безусловно, сделает мир более спокойным, но вряд ли это именно то, что вы имели в виду.[*1] Многие исследователи безопасности ИИ опасаются, что по мере создания все более мощных агентов те будут находить все более изощренные и потенциально нежелательные способы решения даже самых простых задач — например, стремиться к власти или грабить банки для финансирования собственных начинаний. Это называется «проблемой согласования», и о ней в последнее время вышли отличные книги Стюарта Рассела и Брайана Кристиана.[*2]
Проблема с наиболее сенсационными опасениями по поводу сверхинтеллекта заключается в том, что они опираются на пока еще не проверенный принцип экстраполяции. Логика здесь примерно следующая: интеллектуальная система — это та, которая способна достигать своих целей, следовательно, супер-пупер-интеллектуальная система — это та, которая может буквально всё. Даже то, что кажется нам невозможным — например, управление погодой, путешествия во времени или способность убедить каждого вовремя платить налоги, — для такого умного ИИ будет проще простого. Если исследования в области ИИ продолжат развиваться в том же темпе, рано или поздно (согласно этому аргументу) мы получим подобную систему с неизвестными, но, возможно, пугающими последствиями. В дискуссиях об экзистенциальных рисках этот экстраполяционный принцип почти всегда принимается как данность. Формально экстраполяция работает тогда, когда вы можете смоделировать тренд, связывающий две переменные, и правильно угадать, что произойдет за пределами существующих данных. Так, например, сейсмологи могут спрогнозировать магнитуду землетрясения по его продолжительности: каждая дополнительная минута подземных толчков примерно удваивает интенсивность. Когда в 2011 году произошло землетрясение Тохоку у восточного побережья Японии, ученые на сейсмологическом семинаре в двухстах километрах от эпицентра сначала забавлялись, затем встревожились, а потом пришли в ужас, когда толчки продолжились и на четвертой минуте — ведь все они экстраполировали данные и поняли, что разворачивается катастрофическое землетрясение магнитудой 9 (в течение нескольких часов погибли 20 000 человек, а 2000 километров прибрежной инфраструктуры были разрушены[*3]).
Проблема, однако, в том, что экстраполяция редко работает для экстремальных значений — тех, что лежат далеко за пределами имеющихся у нас данных. Возьмем, к примеру, связь между потреблением воды и чувством жажды в жаркий летний день. На нижнем конце шкалы все вполне предсказуемо: если вы изнываете от жажды, целый стакан воды определенно утолит ее лучше, чем крошечный глоток. Но эта прогностическая связь быстро выходит на плато, так что десять стаканов воды не сделают вас в десять раз менее испытывающим жажду. Подобные зависимости между переменными — это норма. Атлет, который может пробежать марафон за четыре часа после тренировок три раза в неделю в течение полугода, вряд ли улучшит свой личный рекорд вдвое (став чемпионом мира), если удвоит еженедельную дистанцию в следующие шесть месяцев. Пять лет учебы в аспирантуре по физике могут сделать вас блестящим ученым, но вероятность получить Нобелевскую премию вовсе не обязательно возрастет в десять раз, если вы получите десять степеней PhD одну за другой.
Таким образом, мы не знаем характера связи между интеллектом субъекта и его способностью влиять на мир к лучшему или худшему. Многие рассуждения об экзистенциальных рисках ИИ, похоже, основаны на модели сверхинтеллекта как «злодея из бондианы». В романах Яна Флеминга и последующих знаменитых фильмах злой гений (обычно, но не всегда, лидер таинственной преступной организации «Спектр») вынашивает коварный, но невероятно изощренный план по накоплению богатства или власти, зачастую планируя уничтожить значительную часть человечества, который в самый последний момент срывает отважный красавец 007. Но в реальном мире всё устроено иначе. Если взглянуть на самые влиятельные фигуры в истории, сформировавшие облик современного мира — например, на Чингисхана, Иисуса Христа или Адольфа Гитлера, — они вовсе не кажутся выдающимися гениями. По крайней мере, вряд ли стоило ожидать, что они с легкостью пройдут тесты по математике или логике или напишут по-настоящему впечатляющие стихи про автомобильный мост через Ферт-оф-Форт. Более того, если присмотреться к самым влиятельным из ныне живущих людей, многие из них покажутся вам изрядно безумными, а некоторые — откровенно глупыми как пробка. Возвышение могущественных лидеров часто объясняется скорее историческими случайностями, нежели выдающимся умом. Поэтому неочевидно, что по мере роста интеллекта систем ИИ они обязательно попытаются захватить мир. Неясно, работает ли здесь экстраполяционный принцип сверхинтеллекта.
Если вы все же верите в экстраполяционный принцип, вас может утешить то, что мы еще очень далеки от систем ИИ, способных составить сколько-нибудь правдоподобный план мирового господства. В 2023 году анонимный пользователь использовал AutoGPT — инструментарий на базе LLM, о котором шла речь в части 5, — для создания инструмента под названием ChaosGPT, который должен был попытаться уничтожить всех нас (до сих пор неясно, было ли это манифестом ИИ-безопасности или просто глупой шуткой). Работу ChaosGPT можно увидеть на видео в открытом доступе. Его заявленными целями были: 1) уничтожить человечество; 2) установить мировое господство; 3) сеять хаос и разрушения; 4) контролировать человечество посредством манипуляций; 5) достичь бессмертия (хотя как он собирался реализовать пункт [4] после выполнения пункта [1], остается загадкой, что наводит на мысль о том, что создатель не слишком тщательно продумал свои разрушительные планы). Мы уже видели, что AutoGPT неутомим, как щенок, но, к сожалению, не столь же силен в стратегическом планировании. На видео под зловещую музыку показано, как ChaosGPT тщательно ищет в интернете разрушительные идеи, узнает, что «Царь-бомба» — советская стомегатонная термоядерная бомба — была самым мощным взорванным оружием в истории, и прилежно делает себе пометку не забыть эту важную информацию (а также публикует твит о своей находке). Однако ИИ явно понятия не имел, что делать дальше, и, позабыв о собственной памятке, просто пошел по кругу, продолжая искать информацию о мощных бомбах и каждый раз заново восхищаясь «Царь-бомбой». Результаты его работы больше походили на хаотичный план школьного доклада по истории, нежели на угрозу глобального уничтожения — единственный хаос, который ему удалось создать, царил в его собственном крайне неорганизованном плане исследований.
Возможно, вы уже думаете об очевидном возражении против моего тезиса об экстраполяционном принципе. Как быть со статусом человека по отношению к другим биологическим видам? Подумайте о нашем колоссальном влиянии на планету. Люди находятся на вершине пищевой цепочки, и мы — настоящие тираны планетарного масштаба. Мы ежедневно съедаем десятки миллионов гамбургеров за счет наших рогатых соседей. Именно мы научили дельфинов прыгать через обручи, а мышей — бегать по лабиринтам, а не наоборот (что бы там ни утверждал Дуглас Адамс в «Автостопом по галактике»). Численность почти 50 % видов животных сокращается, в то время как наше население только что перевалило за восемь миллиардов душ. Но этим доминирующим положением мы обязаны вовсе не рельефным мускулам, длинным ногам или ловкости. По сравнению с нашими пушистыми, чешуйчатыми или пернатыми собратьями мы слабы, неуклюжи и медлительны. И только наш выдающийся мозг дает нам преимущество перед другими видами, позволяя строить пентхаусы и оперные театры, в то время как наши братья меньшие довольствуются грязными норами или гнездами из веток. Разве не естественно предположить, что если бы появилась система ИИ, которая намного умнее нас, она бы доминировала над нами точно так же? Безусловно, если мы обучим ИИ со сверхинтеллектом, он рискует отнестись к нам с той же жестокостью и пренебрежением, с какими мы относимся к менее интеллектуальным видам — порабощая, убивая и эксплуатируя нас, как мы регулярно поступаем с другими животными? В следующей главе мы разберем этот аргумент.
Пропустить примечания
*1 Прекрасно проиллюстрировано в комедийном скетче о мире во всем мире: www.comedy.co.uk/radio/finnemore_souvenir_programme/episodes/8/5/.
*2 Рассел, 2019; Кристиан, 2020.
*3 www.newyorker.com/magazine/2015/07/20/the-really-big-one.