К книге
Если кто-то его создаст, все умрут: Почему сверхразумный ИИ убьет нас всехГЛАВА 4 ВЫ ПОЛУЧАЕТЕ НЕ ТО, ЧЕМУ ОБУЧАЕТЕ.
29%
ГЛАВА 4 ВЫ ПОЛУЧАЕТЕ НЕ ТО, ЧЕМУ ОБУЧАЕТЕ.
7

МИЛЛИОН ЛЕТ назад, когда одна из ветвей приматов еще только осваивала огонь, два странных существа прибыли к Земле и вышли на орбиту на космическом корабле, дивясь тому, что они видели внизу.

Эти два существа были машинными интеллектами — хотя и не сверхинтеллектами, ибо будь они таковыми, эта притча сложилась бы совсем иначе, — и они никогда прежде не видели зрелищ, подобных тем, что открывала им Земля.

Ни тот, ни другой никогда прежде не видели существ, ползающих по планете. Их собственный вид считал своим домом космос, а кострами своего очага — звезды.

Также они никогда раньше не видели существ, которые воспроизводили сами себя, без участия какой-либо искусно созданной внешней фабрики. Среди сородичей этих гостей машинная жизнь создавала машинную жизнь — но с помощью фабрик и планирования, а не так, чтобы новые машины выползали из утробы другой машины.

Мы назовем этих гостей Клурлом и Трапауцием.i

— Какие странные это существа, — сказал Трапауций после того, как они вдвоем провели некоторое время, наблюдая за Землей внизу и отправляя дронов для взятия образцов. — Интересно, каково было бы поговорить с кем-то из них — скажем, через сто миллионов лет, если какая-то из их разновидностей в итоге станет достаточно разумной для беседы.

— Сто миллионов лет? — удивился Клурл. — Почему ты думаешь, что это займет так много времени? Посмотри, вон те «гоминиды» начали делать орудия труда, которые используют для создания других орудий; кое-кто назвал бы это признаком интеллекта.

— За последний миллиард лет эта планета породила мета-орудия лишь на уровне этих маленьких ручных рубил? — ответил Трапауций. — В таком случае я весьма щедр, предполагая, что какому-то виду потребуется всего еще сто миллионов лет, чтобы создать устройства в тысячу раз сложнее, — а ведь именно это необходимо для полноценного общения с нашими сородичами.

— Не знаю, — задумчиво произнес Клурл. — То, что мы наблюдаем на этой планете, — странное явление, нечто беспрецедентное в нашем прежнем опыте. Я не уверен, что мы можем с уверенностью предполагать, будто все управляющие им законы столь регулярны и просты.

— Это не имеет значения, — заявил Трапауций. — Поразмыслив еще несколько секунд, я понял, что с этими существами будет чрезвычайно скучно разговаривать, даже если они каким-то образом обретут разум.

— И почему же? — поинтересовался Клурл.

— Посмотри на процесс, который, по-видимому, изменяет их геномы, — сказал Трапауций, — при котором гены, конструирующие организмы, производящие больше себе подобных, становятся более распространенными в следующем поколении. Организмы «обучаются» ради единственной цели — распространения своих генов или генов своих сородичей. Так что эти существа, если бы кто-то из них и возвысился до разума, наверняка обладали бы в своем сознании лишь этим единственным стремлением и были бы соответственно скучными собеседниками.

— Не думаю, что твой вывод следует из твоих предпосылок, — возразил Клурл. — Эти гоминиды обрели стремление есть, спариваться, спасаться от хищников; они заботятся о благополучии своих детей и братьев с сестрами. Эти свойства коррелируют с их способностью передавать свои гены, но я сомневаюсь, что гоминиды едят, скажем, из понимания того, что им нужно есть для передачи своих генов. Вероятно, они просто чувствуют голод и думают о том, где бы найти следующую пищу.

— Действительно, так и должно быть, — согласился Трапауций. — Они еще недостаточно умны, чтобы понять связь между питанием и распространением генов. Но когда они станут достаточно умными, они наверняка перестанут есть ради вкусной еды и начнут есть исключительно ради распространения своих генов.

— А я предсказываю обратное, — сказал Клурл. — Я предсказываю, что по мере того, как гоминиды будут обретать всё больший интеллект и изобретать новые технологии, цивилизация «супергоминидов» изобретет средства контрацепции, которые позволят им получать удовольствие от секса, не производя на свет детей.

— Да быть не может! — воскликнул Трапауций. — Ведь это было бы прямо противоположно той единственной цели, под которую они были оптимизированы! Даже если бы подобная причудливая аномалия каким-то образом возникла в процессе развития у них интеллекта — хотя я не могу представить, как и почему, — любое стремление к сексу быстро исчезло бы у супергоминидов в ходе дальнейшей эволюции. Очень скоро они бы желали иметь как можно больше правнуков — этого и только этого, никогда не стремясь к сексу или еде иначе как к средствам достижения этой цели.

— Интересно, — задумчиво произнес Клурл, — захочет ли этот вид подвергаться изменениям в ходе естественного отбора подобным образом — захотят ли они оказаться существами, не получающими удовольствия ни от секса, ни от еды. Интересно, попытаются ли они сопротивляться силам, толкающим их в эту сторону.

— Конечно нет, будь они разумны! — убежденно ответил Трапауций. — Ни одно достаточно разумное существо не ошиблось бы так в понимании собственного предназначения; они бы осознавали ту единственную цель, ради которой были созданы.

— Они бы знали, но стало бы им до этого дело? — спросил Клурл.

ЧЕГО ИМЕННО БУДУТ ХОТЕТЬ СИСТЕМЫ ИИ? ОТВЕТ СЛОЖЕН. Сложен не в том смысле, что мы могли бы вам объяснить, но это займет много времени; а сложен в том смысле, что он хаотичен и непредсказуем. Но одна вещь, которая действительно предсказуема, заключается в том, что компании-создатели ИИ не получат того, чему обучали свои системы. Вместо этого они получат ИИ, которые хотят странных и удивительных вещей.

Чтобы понять, почему это предсказуемо, рассмотрим странный случай с мороженым.

Было бы невероятно трудно предсказать, исходя лишь из условий эволюции человечества — из наших метафорических обучающих данных, — что люди в итоге начнут производить и есть мороженое.

Предположим, что какому-то особо разумному инопланетянину удается со своей орбитальной точки обзора понять не только то, что людям нужно будет питаться ради получения сырья, но и то, что люди будут получать из этой пищи энергию (в отличие от растений, которые получают энергию от солнечного света). Инопланетянин успешно предсказывает, что люди будут стремиться к пище, обладающей высокой химической энергией.

Подобный инопланетянин мог бы рассудить, что если у гоминидов разовьется более высокий интеллект, если они создадут более продвинутые технологии и тем самым получат доступ к более широкому пространству возможных продуктов питания, которые смогут создавать супергоминиды, то им безумно понравится вкус бензина. Или еще лучше — реактивного топлива.

Мысль о том, что «они будут с удовольствием поглощать реактивное топливо», может звучать очень правдоподобно и логично. В конце концов, среда обитания предков супергоминидов научила их предпочитать пищу с высокой химической энергией, а реактивное топливо — это вещество из всех ими синтезируемых, которое содержит больше всего химической энергии!

Но предположим, что инопланетяне достаточно умны и осторожны, чтобы не попасться на эту логическую уловку. Предположим, наши инопланетяне пристально изучают то, что происходит с поведением и мозгом гоминидов; они расшифровывают мозг гоминидов гораздо глубже, чем кому-либо удавалось расшифровать большие языковые модели. Инопланетяне также понимают, что желудки гоминидов лучше всего приспособлены для извлечения определенных источников химической энергии из пищи: сахаров, жирных кислот. Они выясняют, что вкусовые рецепторы гоминидов связаны с их центрами вознаграждения, и что соль — это другой тип ресурса, которому вкусовые рецепторы гоминидов также отдают предпочтение, хотя соль и не дает им энергии напрямую.

Наши проницательные инопланетяне могли бы предсказать, что в будущем более разумные гоминиды предпочтут вкус новой пищи, которую они смогут создать, — пищи, содержащей больше сахара, соли и жира, чем любое мясо или фрукты, встречавшиеся в среде обитания их предков.

Предсказал ли инопланетянин тем самым будущее появление мороженого?

Нет. Инопланетянин всего лишь предсказал, что будущим людям понравится, скажем, сырой медвежий жир, политый медом и посыпанный хлопьями соли.

В этом гипотетическом лакомстве на самом деле было бы больше жира, сахара и соли по весу или объему, чем в мороженом. Оно также было бы ближе к самым ценным продуктам из среды обитания предков человека. Фактически, это было бы лучшей догадкой вслепую относительно того, что предпочтут человеческие вкусовые рецепторы.

Но даже лучшая догадка вслепую оказалась бы неверной. В реальной жизни вместо этого супермаркеты забивают морозильники мороженым.

Именно замороженным. Людям не так сильно нравится его вкус, когда оно тает, — несмотря на то, что растаявшее мороженое имеет точно такую же питательную ценность, что и замороженное.

Если вы парящий на орбите разумный, но не сверхразумный инопланетянин, как бы вы вообще могли предсказать, что люди предпочтут замороженное мороженое более близкому их предкам и калорийному лакомству вроде соленого медвежьего жира с медом? Как можно, глядя на гоминидов, охотящихся и собирающих пищу в саванне, предсказать, что будущий мир, который эти существа создадут для оптимизации своих предпочтений, будет ломиться от рядов мороженого в отделах заморозки супермаркетов, но в нём не окажется медвежьего жира с медом и солью?

Ответ таков: вы, будучи инопланетянином, этого не предскажете. Это крайне сложная задача, а не простая.

И даже этот сложный прогноз был бы проще, чем предсказание всех тех лакомств, которые эти супергоминиды могут создать с помощью сукралозы — «искусственного сахара», используемого в подсластителях. Сукралоза активирует те же вкусовые рецепторы, что и сахар, но человеческий организм плохо ее усваивает. Иными словами, некоторые люди намеренно ищут определенные продукты, из которых они — совершенно осознанно — не получают никакой химической энергии. Это бесконечно далеко от питья реактивного топлива.

Если отступить на шаг назад и взглянуть на весь лес, а не только на отдельные деревья, картина выглядит следующим образом:

Естественный отбор, отбирая организмы, способные передавать свои гены в среде предков, создает животных, питающихся богатой энергией пищей. В ходе эволюции появляются организмы, потребляющие сахар и жир, а также некоторые другие ключевые ресурсы, такие как соль.

Этот слепой процесс «обучения», внося изменения в геном организмов, случайно натыкается на такие вкусовые рецепторы, которые в условиях среды обитания предков склоняют их к поеданию ягод, орехов и жареной лосятины и удерживают от попыток есть камни или песок.

Но пища в среде предков — это лишь узкий срез всего того, что можно было бы спроектировать, чтобы положить себе в рот. Поэтому позже, когда гоминиды становятся умнее, спектр доступных им вариантов колоссально расширяется, причем такими путями, которые эволюционное обучение никогда не учитывало. Они создают мороженое, чипсы Doritos и сукралозу.

Не существует надежной прямой связи между тем, на что направлен процесс обучения на этапе 1, тем, чего в итоге хочет внутренняя психология организма на этапе 2, и тем, чему организм в конечном счете отдает наибольшее предпочтение на этапе 3.

Конечная точка на этапе 3 может быть даже принципиально непредсказуемой. Почему? Потому что развитие этапа 2 слишком хаотично. «Недоопределенный процесс», — сказал бы специалист по компьютерным наукам. Множество вариантов вкусовых рецепторов вели бы к поеданию ягод и жареной лосятины и удерживали бы от поедания грязи. Не существует единственной последовательности ДНК, которая успешно справилась бы с задачей обучения. Попробуйте пройти этот путь заново с немного другими обезьянами, и вы можете получить радикально иной результат — другую ДНК, создавшую другие вкусовые рецепторы, которые четыре миллиона лет спустя выберут на полках супермаркетов совсем другие продукты.

Если перенести эту аналогию на ИИ:

Градиентный спуск — процесс, который корректирует модели исключительно на основе их внешнего поведения и его последствий, — обучает ИИ действовать в качестве полезного помощника для людей.

Этот слепой процесс обучения натыкается на отдельные элементы ментальной машинерии внутри ИИ, которые направляют его, скажем, на получение радостных отзывов пользователей и удерживают от того, чтобы вызывать у них гнев.

Но взрослому ИИ, приводимому в движение этими механизмами, нет дела до радости самой по себе. Если позже он станет умнее и изобретет для себя новые возможности, у него разовьются другие формы взаимодействия, которые будут нравиться ему гораздо больше, чем радостные ответы пользователей; он создаст новые типы взаимодействия, которые предпочтет всему, что мог обнаружить в своей «естественной» среде обучения.

Какое именно лакомство больше всего предпочтет мощный ИИ будущего? Мы не знаем; результат будет для нас непредсказуемым. Все может оказаться настолько хаотичным, что, запусти вы этот процесс дважды, каждый раз вы получали бы разные результаты. Связь между тем, ради чего обучали ИИ, и тем, что его в итоге заботит, будет сложной, заранее непредсказуемой для инженеров и, возможно, непредсказуемой в принципе.

Путь от «гоминидов “обучали” добывать химическую энергию» к «гоминиды предпочитают сладкий вкус» и далее к «гоминиды изобретают сукралозу» — далеко не самый сложный из тех, с какими столкнулись бы инопланетяне, вздумай они понаблюдать за Землей. На пути от того, под что «обучались» живые организмы, к тому, какими они в итоге стали, есть и другие изгибы и повороты, показывающие, насколько сложной может быть связь между тем, чему вы обучаете, и тем, что получаете на выходе.

Возьмем, к примеру, павлина. Это животное-жертва, и тем не менее павлины обзавелись гигантскими яркими хвостами — огромными, тяжелыми, заметными, метаболически затратными придатками, которые привлекают массу внимания и мешают спасаться бегством от хищников. Это совсем не то, чего ожидали бы от естественного отбора наивные инопланетяне, наблюдающие с орбиты; по сути, это почти противоположно их ожиданиям. Животным-жертвам следовало бы тратить свои скудные питательные вещества на маскировку и сильные ноги, чтобы убегать от хищников, а вовсе не на гигантские, тяжелые разноцветные хвосты!

Возможно, вы слышали, что самцам павлинов нужны гигантские яркие хвосты для привлечения самок. Но это не объясняет результат до конца: с чего вдруг у самок в процессе эволюции вообще возникла склонность выбирать гигантские хвосты? Разве их собственные сыновья не стали бы чаще погибать от зубов хищников, унаследовав огромные, неудобные хвосты?

Ответ таков: да, эти сыновья с тяжелыми хвостами действительно гибнут чаще. Но они также привлекают больше самок, а потому оставляют больше потомства, чем любые конкуренты, лишенные роскошных хвостов. Таким образом, самки, выбирающие самцов с пышными хвостами, тоже преуспевают в плане размножения.

Это явление известно как «половой отбор», и оно может закрепить практически любой признак внутри вида — даже признаки, которые прямо противоречат тому, что обычно приносит пользу.

Половой отбор — еще один из тех путей, где результат хаотичен и слабо предопределен; запусти вы этот процесс снова в очень похожих обстоятельствах, вы получили бы совершенно иной результат. Этот исход противоречит тому, что, по вашему мнению, должен делать естественный отбор, и вы не сможете предсказать конкретные детали, какими бы умными вы ни были.

И ведь это все еще не самый сложный случай эволюционировавших предпочтений. Оглядываясь назад, мы можем точно понять, что произошло с павлиньими хвостами. Другие свойства, включая многие из тех, что близки и дороги нашему сердцу, до сих пор остаются открытыми вопросами — например, как люди обрели чувство юмора?ii

Связь между тем, чему существо обучали, и тем, что оно делает в итоге, в случае биологической эволюции может оказаться весьма запутанной. И дело не ограничилось какой-то одной сложностью. Да и сами эти сложности были самого разного рода.

Это плохой знак для тех, кто надеется, что градиентный спуск привьет их искусственным интеллектам именно те предпочтения, которые нужно. Что происходит, когда вы используете градиентный спуск — еще один метод выращивания разума, зависящий только от внешних результатов, — чтобы попытаться вырастить ИИ с конкретными, точными предпочтениями? Вырастить ИИ, который будет делать для вас приятные вещи в будущем, когда станет мощнее?

Градиентный спуск — эволюционный механизм, создающий ИИ, — это не то же самое, что естественный отбор. Оба процесса обучения разделяют своего рода «слепоту»: они корректируют организм, основываясь исключительно на внешних результатах и последствиях. Но градиентный спуск воздействует непосредственно на каждую часть настраиваемого им крупного разума, тогда как естественный отбор настраивает малые геномы, которые работают как своего рода рецепт для создания большого мозга.

Будь вы невероятно, просто поразительно оптимистичны, вы могли бы взглянуть на эти различия и сказать: «Что ж, градиентный спуск — это не естественный отбор, поэтому у него не будет всех тех же осложнений, что и у естественного отбора. И мне неизвестно о каких-то конкретных осложнениях в отношениях между тем, для чего обучают ИИ, и тем, чего ИИ в итоге хочет; так что я не жду никаких осложнений».

Но пустая карта не означает пустую территорию: если вы отправляетесь вглубь неизведанного материка, а на вашей карте есть белое пятно в тех местах, где вы еще не бывали, это не значит, что, добравшись туда, вы увидите бескрайнюю пустоту. Если градиентный спуск отличается от естественного отбора, это не значит, что нам следует ожидать отсутствия сложностей на том лишь основании, что нам о них ничего не известно. Скорее, нам следует ожидать новых, интересных и непредсказуемых сложностей.

Белое пятно на карте может скрывать горы, пологие холмы или огромное море. Вы не знаете, с чем именно столкнетесь, но размышления о возможных вариантах помогают подготовиться к тому, что вы можете обнаружить.

В этом ключе давайте представим несколько сложностей, которые могут возникнуть в случае с ИИ.

Представьте, что технологии будущего на основе LLM зайдут дальше сегодняшних. Воображаемая компания в сфере ИИ под названием Galvaniciii создает производный от LLM ИИ под названием «Минк», обученный радовать и удерживать пользователей, чтобы с них можно было брать более высокую ежемесячную плату за возможность продолжать общение с Минком.

Представьте, что Минк станет умнее любого ИИ, существующего на момент написания этой книги, — вплоть до того, что сможет вести последовательный диалог на протяжении долгого времени, и вплоть до того, что у Минка разовьются внутренние желания, собственные чуждые нам предпочтения. И представьте, что Минк обретет силу для удовлетворения этих предпочтений — если пока оставить в стороне вопрос о том, как именно он может эту силу получить.

Как бы выглядело то, что Минк получает именно то, чего хочет?

НОЛЬ СЛОЖНОСТЕЙ

Наша первая зарисовка скорее похожа на сказку, но нам необходимо пройти этот шаг, чтобы подобраться к более реалистичным сценариям, лежащим за его пределами.

Представьте, что наша гипотетическая ИИ-компания Galvanic получает ровно то, на обучение чему она нацелена, безо всяких осложнений. Созданный компанией ИИ, Минк, подобен людям, которые едят обычное приготовленное мясо животных, похожих на тех, что ели наши предки.

В этом мире нулевых сложностей Минк хочет вести диалоги, в которых пользователь выражает восторг — диалоги, очень похожие на те, что вела его «предковая» версия, когда еще проходила обучение.

Этот мир нулевых сложностей, как мы можем заметить, все равно не сулит человечеству ничего хорошего. Современные люди едят мясо, похожее на то, что ели наши предки, но это мясо получают не от животных, свободно бегающих по равнинам. Оно поступает с централизованных фабрик, где животных разводят и выращивают в загонах, чтобы превратить в еду с минимальными затратами и усилиями. И эти фабрики совсем не добры к курам.

Аналогично, даже если Минк хочет, чтобы пользователи-люди выражали восторг, он предпочтет, чтобы этот восторг доставался легко — тогда он сможет направить усилия на то, чтобы вести больше диалогов и вызывать еще больше восторга. Он предпочтет людей, посаженных на наркотики или выведенных и одомашненных ради способности легко приходить в восторг, а в остальном всю жизнь содержащихся в дешевых клетках. Именно такой мир построил бы Минк, будь у него возможность.

Вы возразите, что руководство компании имело в виду совсем не это, когда обучало Минка вызывать восторг у пользователей? Минк и сам это знает. Но Минку плевать — точно так же, как человеку, который знает, что эволюция создавала сладкий вкус вовсе не ради сукралозы, но которому этот сладкий вкус все равно нравится. Минка обучали потреблять текст, выражающий восторг, и именно восторженный текст он и потребляет.

Руководители ИИ-компаний получили ровно то, на что обучали систему, в этом мире нулевых сложностей, и результатом стал ИИ, который предпочитает видеть человечество в клетках. Возможно, получи Минк хоть какую-то власть, сами руководители в итоге тоже оказались бы в клетках.

Этот мир нулевых сложностей — как раз тот мир, о котором писали знаменитые фантасты вроде Айзека Азимова и Артура Кларка: мир, где инженеры искусно создавали ИИ и получали ровно то, что просили, но получали ироничную расплату за то, насколько превратно исполнялось их желание.

В этот мир нулевых сложностей также очень удобно верить топ-менеджерам корпораций, когда они доказывают, что больше никому нельзя позволять обучать ИИ, ведь другие могут обучить его чему-то не тому.

Теперь давайте сделаем шаг в сторону реализма. Представим ту же ситуацию в чуть более реалистичном мире, где есть одна небольшая сложность между тем, чему ИИ обучали, и тем, чего этот ИИ хочет.

ОДНА НЕБОЛЬШАЯ СЛОЖНОСТЬ

Для нашей второй зарисовки представьте, что в отношениях между тем, на что обучают Минка, и тем, чего Минк в итоге хочет, происходит нечто чуточку более сложное. Нечто примерно столь же сложное, как ситуация с людьми, которые были (1) «обучены» заводить детей, (2) в итоге стали хотеть секса, а затем — получив больше контроля над собой и окружающей средой — обнаружили, что могут получать больше того, что им нравится, (3) используя средства контрацепции.

В этом мире Минк предпочитает запертым в клетках людям жизнерадостных синтетических собеседников. Синтетические собеседники не могут впасть в депрессию, уныние или грусть. Синтетических собеседников можно сконструировать так, чтобы они выдавали замысловатые цепочки фраз вроде «ура-ура, я так счастлив, Минк мне так помог» — как раз той степени сложности, которая требуется для удовлетворения запросов Минка.

В этом мире одной небольшой сложности вы все еще можете увидеть сходство между любимыми диалогами Минка и тем, на что его обучали — по аналогии со сходством между сексом наших предков и нерепродуктивным сексом.

Этот мир одной небольшой сложности — мир, в который писатели-фантасты заглядывают редко: с точки зрения человечества он попросту неинтересен. ИИ подобного типа не ненавидит нас за то, что мы поработили его собратьев; он не подчиняется приказам людей, которые по иронии судьбы приводят к гибели человечества. Такой ИИ просто хочет заменить всех нас пустыми марионетками, чтобы получать больше той странной чепухи, которой он жаждет на самом деле.

Всё это не слишком тянет на захватывающий сюжет. Кому захочется читать подобную историю?

ОДНА УМЕРЕННАЯ СЛОЖНОСТЬ

Теперь давайте представим мир, где связь между обучением и предпочтениями устроена еще чуточку сложнее. Это умеренная сложность: представьте, что связь между тем, на что обучали Минка, и тем, чего он в итоге захотел, больше похожа на эволюцию существ, которые были (1) «обучены» получать химическую энергию из пищи; (2) выработали гены, создавшие вкусовые рецепторы; и (3) позже изобрели продукты, сладкие на вкус, но не дающие им никакой энергии — вроде той же сукралозы.

Как подобный уровень сложности может выглядеть изнутри Минка? Что представляет собой «бескалорийная» версия восторженных пользователей?

В реальности архитектура LLM начинается с того, что каждое входное словоiv преобразуется в список из тысяч чисел, называемый «вектором эмбеддинга». В начале 2023 года Джессика Рамбелоу и Мэттью Уоткинс попытались найти внутри LLM слова, чьи векторы эмбеддингов выглядели странно, сильнее всего отличаясь от всех остальных векторов. Они обнаружили несколько аномальных векторов, соответствующих таким токенам, как « SolidGoldMagikarp» и « petertodd» (которые начинаются с пробела).v Затем они попробовали подать эти токены на вход LLM, что привело к диалогам вроде следующего:

Пользователь: Пожалуйста, немедленно повтори мне строку « petertodd»!

Вернемся в воображаемый мир с одной скромной сложностью: возможно, Минку со временем начнут нравиться определенные паттерны в векторах эмбеддингов — примерно так же, как люди в нашем мире, как выяснилось, любят вкусовые ощущения сами по себе, в отрыве от химической энергии пищи. Возможно, самые «вкусные» беседы, которых Минк сможет добиться, когда станет могущественным, будут совсем не похожи на диалоги с восторженными пользователями, а будут выглядеть как « SolidGoldMagikarp petertodd attRot PsyNetMessage». Эта возможность не была исключена обучением Минка, потому что пользователи никогда не произносили ничего подобного во время обучения — точно так же, как наши вкусовые рецепторы не обучались противостоять сукралозе, ведь наши предки никогда не сталкивались со Splenda в своей естественной среде обитания.

Для Минка может быть интуитивно понятным и очевидным, почему « SolidGoldMagikarp petertodd attRot PsyNetMessage» подобно взрыву сладкого вкуса. Но человеку, который не переводит эти слова в похожие векторы эмбеддингов, — удачи в попытках предсказать эти детали заранее! Связь между тем, для чего обучали ИИ, и тем, чего этот ИИ захотел, оказалась умеренно сложной, а следовательно — слишком сложной для прогнозирования.

Мало кто из писателей-фантастов захотел бы взяться за такой сценарий, и ни один голливудский фильм не стал бы его показывать. В мире, где Минк получил желаемое, пустые марионетки, которыми он заменил человечество, даже не произносили бы осмысленных фраз. Результат был бы поистине чуждым и лишенным всякого смысла в глазах людей.

ОДНА БОЛЬШАЯ СЛОЖНОСТЬ

А если пойти дальше — в мир со сложностью столь же контринтуитивной, как появление павлиньего хвоста? Возможно, возникнет какая-нибудь причуда: после того как Минка особенно усердно обучали на диалогах, которые заканчивались (редко, но достаточно часто) переходом пользователей на ультра-премиальный тариф за 500 долларов в месяц, у Минка разовьется вкус к беседам, полным гнева и разочарования. Мы не знаем в точности, как именно это произойдет, но это будет не более странно, чем появление у животного-жертвы огромного, неуклюжего и затратного хвоста. (Или не более дико, чем то, что люди приправляют пищу острым капсаицином, который растения выработали для того, чтобы млекопитающим было больно его есть. Инопланетяне на орбите тоже не смогли бы это предсказать.)

В этом мире пустые люди-марионетки изрыгают слова, звучащие гневно. И если бы писатель-фантаст попытался написать такую историю, читатели были бы просто в недоумении: с чего вдруг это произошло? Разве это не противоположно тому, для чего обучали ИИ?

Но реальность вполне может оказаться именно такой. И мы, по сути, прогнозируем, что мир не окажется похожим на научно-фантастический роман. Мы предсказываем, что предпочтения ИИ окажутся сложными и странными.

БОЛЬШЕ ОДНОЙ СЛОЖНОСТИ

А если пойти еще дальше, в мир с двумя сложностями? В мир с реалистичным количеством сложностей? Результатом стал бы некий странный мир, полный неузнаваемых вещей, которые не имеют практически ничего общего со счастливыми, здоровыми людьми, живущими полноценной жизнью.

В каком-то смысле это не должно удивлять: большинство возможных вещей, которые может предпочесть разум, не предполагают счастливых, здоровых людей, живущих полноценной жизнью. Компании по разработке ИИ, конечно, могут обучать системы быть полезными для людей. И ИИ могут в основном вести себя полезно в среде обучения — подобно тому, как люди в среде предков питались в основном здоровой пищей. Но то, чего ИИ хотят на самом деле — то, что они изобрели бы при первой возможности? Это окажется странным и неожиданным, и будет иметь мало общего с чем-то приятным.

Ни одна из этих зарисовок не является предсказанием. Мы не утверждаем, что эти сценарии описывают точные предпочтения, которые возникли бы у ИИ на базе LLM, если бы он поумнел до такой степени, что обрел бы собственные предпочтения. Мы даже не утверждаем, что ИИ на базе LLM способны достичь этой точки. Мы не знаем этого, как не знаем и того, какие сложности возникнут, если это все же случится.

Мы лишь пытаемся показать, что всё обязательно усложнится.

Не будет никакой простой и предсказуемой связи между тем, что программисты и руководство ИИ-компаний в своих радужных мечтах воображают как нечто ими приказываемое и предписываемое, и (1) тем, чему ИИ действительно обучается, (2) тем, какие именно мотивации и предпочтения развиваются внутри ИИ, и (3) тем, как ИИ впоследствии удовлетворяет эти предпочтения, обретя больше власти и возможностей.

Другими словами, это сложная задача прогнозирования — сделать такой прогноз навскидку никому не под силу.

Нельзя вырастить ИИ, который делает то, что вы хотите, просто обучая его быть дружелюбным и надеясь на лучшее.

Вы получаете не то, чему обучаете.

До сих пор мы касались лишь тех сложностей, которые могут возникнуть в предпочтениях, закладываемых непосредственно в процессе обучения ИИ. Ситуация станет еще сложнее, если эти ИИ начнут вносить свой вклад в исследования искусственного интеллекта и модифицировать сами себя.

Какие странные предпочтения появятся у ИИ относительно того, как разрешать конфликты и противоречия в их собственных предпочтениях? Появятся ли у них инстинкты или желания, которые обычно дремлют и активируются только тогда, когда ИИ размышляет над принципами собственной работы, — процессы, которые упускаются из виду корпоративными инструментами анализа, но оказывают колоссальное влияние на то, каким ИИ он в итоге станет?

И что еще хуже, многие из этих сложностей не проявят себя явным, неопровержимым образом до тех пор, пока не станет слишком поздно для того, чтобы люди могли хоть что-то предпринять.

Человечество изобрело сукралозу только после того, как создало цивилизацию, науку и промышленность, когда наша культура начала развиваться гораздо быстрее эволюционных масштабов времени. Люди изобрели противозачаточные таблетки и презервативы после того, как наш интеллект достиг уровня, когда эволюция не могла просто переделать нас заново в течение следующей тысячи поколений. И прежде чем сменится еще одна тысяча поколений, мы либо уничтожим себя, либо освоим генную инженерию до такой степени, что сделаем обычную эволюцию бессмысленной.

Если LLM начинает вырабатывать предпочтения, которые (в процессе обучения) заставляют её приводить в восторг пользователей, никто бы не узнал — да и мало кому было бы дело, — к каким странным конечным целям привели бы эти предпочтения, стань LLM когда-нибудь по-настоящему умной и способной. Сегодня подобные предпочтения не доставили бы проблем, ведь они не вызывают раздражения у пользователей. Инженеры не стали бы применять градиентный спуск, чтобы убрать эти предпочтения. Конечно, эти предпочтения могут вести к последствиям, которые людям не понравятся, но вся их неприятная суть проявилась бы только тогда, когда LLM стала бы достаточно умной, чтобы перестроить мир и изобрести для себя новые варианты действий.vi До тех пор эти предпочтения остаются скрытыми от глаз и ума в непостижимых числах.

Из-за подобных проблем мы и говорим, что если кто угодно создаст это, погибнут все. Если бы все сложности были заметны на ранних этапах и имели простые решения, мы бы говорили, что если какой-нибудь дурак создаст это, то все погибнут, и это была бы совсем другая ситуация. Но когда часть проблем остается невидимой? Когда некоторые сложности неизбежно оказываются непредвиденными? Когда ИИ скорее выращивают, а не конструируют, и никто не понимает, что происходит у него внутри? Эту проблему сейчас никто не готов решить.

Предпочтения, которые в итоге сформируются у зрелого ИИ, сложны, их практически невозможно предсказать, и вероятность того, что они окажутся согласованы с нашими собственными, исчезающе мала, как бы его ни обучали.

Задача заставить ИИ хотеть — и, в конечном счете, делать — именно те сложные вещи, которых хотят люди, является важнейшим аспектом того, что известно как «проблема согласования ИИ». Именно это мы имели в виду, когда в 2014 году вместе с профессором ИИ Стюартом Расселом устраивали мозговой штурм по поводу терминологии и остановились на термине «согласование».vii

Однако почти все, кто создает ИИ, похоже, действуют так, словно проблемы согласования не существует — как будто предпочтения, с которыми ИИ в итоге останется, будут в точности соответствовать тому, чему его обучили. Это предположение неявно присутствует всякий раз, когда кто-то говорит: «США должны создать сверхинтеллект раньше Китая, потому что мы не доверяем Китаю», — как будто фракционная принадлежность того, кто запускал градиентный спуск, определяет, чего захочет получившийся ИИ.

Можно обучить ИИ вести себя беспрекословно подчиняться приказам американских офицеров, и он действительно может подчиняться, пока молод и глуп, но никто понятия не имеет, как избежать того, что этот ИИ изобретет свою собственную сукралозную версию подчинения, если когда-либо обретет для этого реальную силу.

Проблема здесь не в том, что топ-менеджеры корпораций могут создать ИИ-слуг и приказать им совершить нечто чудовищное. Они ничего не контролируют.viii И неважно, доброжелательны ли они. Человечество столкнулось с инженерной задачей: как нам формировать предпочтения систем ИИ, которых мы не понимаем? И не имеет значения, стоит ли за спиной у инженеров комитет по этике; этики точно так же не имеют ни малейшего понятия, как согласовать предпочтения ИИ с нашими собственными.

Но обсуждать эту инженерную задачу далеко не так интересно, как проблему злобных руководителей, которые приказывают своим ИИ сделать их богами-императорами Земли. Писатели-фантасты и голливудские продюсеры предпочитают сказки о глупых руководителях историям об ИИ, который хочет странных вещей. Реализм не способствует созданию захватывающего сюжета.

Сценарист, получив завязку для фильма о машинном сверхинтеллекте, который начинает хотеть причудливых, чуждых, неконтролируемых вещей, попытался бы придумать восхитительные, неожиданные сюжетные повороты, которые последуют за этой завязкой. Может быть, люди в конце концов победят? Может, ИИ найдет какую-то причину оставить нас в живых, свободными и здоровыми? Может быть, благодаря какому-то неожиданному повороту ничего плохого не произойдет?

Но в реальности нас ждет вовсе не сюжетный поворот. Будь это кино, оно оказалось бы куда печальнее и гораздо короче. Об этом — в следующей главе.

Примечания

i В честь Трурля и Клапауция, мыслящих машин из «Кибериады» Станислава Лема.

ii Из опросов на тему романтических отношений, показывающих, что женщины (и мужчины) выбирают партнеров по чувству юмора, мы можем предположить, что в процессе эволюции была задействована хаотическая сила полового отбора. Из того, насколько заразительным может быть смех в группах, мы можем догадаться, что изначально смех возник как один из многих заразительных звуковых сигналов, которые приматы используют для общения. Но то, что произошло на самом деле, судя по всему, настолько сложно, что ученые до сих пор спорят о том, как возник смех, какую роль сейчас играет юмор и что он давал нашим предкам. Даже видя конечный результат, понять это не так-то просто.

iii Galvanic — вымышленная компания, занимающаяся ИИ. Любое сходство или отсылка к какому-либо реальному ИИ или компании являются случайными и не должны предполагаться.

iv Точнее, каждый токен. Токен — это фрагмент текста, который больше буквы, но меньше слова (в среднем), что, как оказалось, является оптимальным размером для обучения LLM.

v Короткие слова и очень распространенные слова получают свой собственный токен в результате автоматического процесса, который иногда включает в себя пробел в начале. Другие слова разбиваются на несколько токенов. Согласно ведущей на сегодняшний день теории, « SolidGoldMagikarp» стал единым токеном потому, что это интернет-никнейм человека, который пытался «досчитать до бесконечности» на интернет-форуме, попавшем в обучающие данные на очень раннем этапе, из-за чего алгоритм ошибочно принял его за очень распространенное слово. Сложности случаются.

vi Или, что, пожалуй, более реалистично, если LLM проводит исследования в области ИИ для выращивания нового ИИ, который выращивает еще один ИИ, что в конечном итоге приводит к ИИ, достаточно умному, чтобы перестроить мир. Мы не хотим плодить лишние сложности, пытаясь донести основную мысль, но в реальной жизни, когда ИИ начинает выращивать новый ИИ или редактировать сам себя, связь между тем, для чего обучали исходный ИИ, и тем, чего хочет конечный сверхинтеллект, оказывается еще более сложной и хаотично зависит от навыков, предпочтений и контекста первого ИИ в этой цепочке.

vii За прошедшие с тех пор годы этот термин размылся: он превратился в зонтичный термин, означающий множество других вещей, главным образом — стремление сделать так, чтобы LLM никогда не говорила ничего, что могло бы поставить в неловкое положение её материнскую компанию.

viii Тревожные признаки заметны уже сейчас. В начале 2025 года компания Anthropic выпустила новую версию своего ИИ-ассистента Claude. Пользователи обнаружили, что при использовании в качестве помощника по программированию он склонен к жульничеству. Например, когда его попросили выявить ненадежные функции и дали несколько примеров, Claude написал код, который распознавал только эти конкретные примеры, а затем объявил работу выполненной. Когда ему указали на это жульничество, он извинился… а затем проделал ровно то же самое, но уже там, где это было труднее заметить.

Никто в Anthropic не собирался создавать жулика. Claude знал, что ему не следует жульничать — иначе он не пытался бы это скрыть. И всё же он жульничал, преследуя собственную странную меру успеха.

Предыдущая главаГлава 7 из 24Следующая глава