Миллион лет назад, когда одна из ветвей приматов еще только осваивала огонь, к Земле прилетел космический корабль с двумя странными существами. Обосновавшись на орбите, они с изумлением смотрели, что происходит на планете.
Это были два машинных интеллекта (но не сверхинтеллекта, ибо, будь они сверхинтеллектами, история получилась бы совсем другой), и они никогда прежде не встречали ничего подобного тому, что являла им Земля.
Ранее им не доводилось видеть организмы, снующие по планете. Их собственный вид считал своим домом космос, а домашними очагами – звезды.
Не видели они раньше и существ, которые воспроизводили бы себя без какой-либо хитроумной внешней фабрики. В цивилизации пришельцев машинная жизнь создавала машинную жизнь, но с помощью фабрик и планирования, а не так, чтобы новые машины выползали из чрева какой-то другой машины.
Мы назовем этих визитеров Клурль и Трапауций[17].
– Какие необычные существа, – сказал Трапауций после того, как они некоторое время наблюдали за Землей, отправляя дроны для сбора образцов. – Интересно было бы поговорить с кем-нибудь из них. Лет этак через сто миллионов, если какая-нибудь их разновидность окажется достаточно разумной для беседы.
– Сто миллионов лет? – переспросил Клурль. – С чего ты взял, что на это уйдет столько времени? Смотри, вон те гоминиды уже начали делать орудия и использовать их для изготовления других орудий. Некоторые назвали бы это признаком интеллекта.
– То есть за последний миллиард лет эта планета произвела всего лишь инструменты уровня примитивных рубил, – заметил Трапауций. – Тогда я весьма великодушен, предполагая, что всего лишь за сто миллионов лет какой-нибудь вид сумеет создать устройства в тысячу раз сложнее – те, что необходимы для полноценного общения с нами.
– Как знать, – ответил Клурль. – Мы видим на этой планете странное явление, с каким еще не сталкивались. Я бы не стал с уверенностью утверждать, что все законы, управляющие этим миром, так уж однозначны и прямолинейны.
– Это не имеет значения, – заявил Трапауций. – Поразмыслив еще несколько секунд, я понял, что с этими существами будет крайне скучно разговаривать, даже если они каким-то образом обретут разум.
– Это почему же? – заинтересовался Клурль.
– Вспомни о процессе, изменяющем их геномы, – начал объяснять Трапауций. – Гены, конструирующие те организмы, что производят больше себе подобных, становятся более распространенными в следующем поколении. Эти организмы “обучаются” единственной цели – распространять свои гены или гены своих родственников. Поэтому, если кто-то из этих существ и обретет разум, тот наверняка будет подчинен лишь одному этому побуждению, а значит, беседовать с ними будет скучно.
– Не уверен, что из твоих предпосылок следует такой вывод, – ответствовал Клурль. – Эти гоминиды обрели потребность есть, спариваться, спасаться от хищников, они заботятся о благополучии своих детей и своих братьев и сестер. Эти признаки коррелируют с их способностью передавать свои гены, но я сомневаюсь, что гоминиды едят, поскольку понимают необходимость питаться для передачи генов. Скорее всего, они просто чувствуют голод и прикидывают, где бы найти следующую порцию еды.
– Да, наверное, так и есть, – согласился Трапауций. – Они еще недостаточно разумны, чтобы понимать, как еда связана с распространением генов. Но когда они достаточно поумнеют, они, несомненно, перестанут есть ради удовольствия и начнут есть исключительно ради распространения своих генов.
– Прогнозирую обратное, – фыркнул Клурль. – Полагаю, что по мере того, как гоминиды будут развивать интеллект и создавать новые технологии, цивилизация таких “супергоминидов” изобретет средства контрацепции, которые позволят им получать удовольствие от секса без производства потомства.
– Ни в коем случае! – возразил Трапауций. – Да ведь это прямо противоположно той единственной цели, под которую они оптимизированы! Даже если бы по мере роста интеллекта и возникла подобная причудливая аномалия (хотя я не могу представить, как или почему это может случиться), в ходе эволюции супергоминидов любая склонность к сексу ради секса быстро бы снова исчезла. Довольно скоро они захотят иметь как можно больше правнуков, а секс и еда будут восприниматься исключительно как средства для достижения этой цели.
– Интересно, – задумчиво произнес Клурль, – захотел бы этот вид, чтобы естественный отбор изменил его таким образом? Захотели бы они стать существами, которые не получают удовольствия от секса или еды? Попытались бы воспротивиться силам, толкающим их в этом направлении?
– Конечно нет, если они разумны! – воскликнул Трапауций. – По-настоящему разумные существа не станут так ошибаться в собственном предназначении. Они поймут ту единственную цель, ради которой созданы.
– Понять-то поймут, но будет ли им до этого дело? – задумчиво спросил Клурль.
Чего именно захотят ИИ-модели? Это сложный вопрос. Не в том смысле, что мы сможем это объяснить только за большое время, а в смысле хаотичности и непредсказуемости. Но одну вещь предсказать можно: ИИ-компании получат вовсе не то, чего добивались при обучении своих моделей. Они получат модели, которые хотят причудливых и неожиданных вещей.
Чтобы понять, почему это предсказуемый исход, рассмотрим один любопытный пример с мороженым.
Если исходить только лишь из обстоятельств эволюции человечества – из наших метафорических обучающих данных, – было бы невероятно сложно спрогнозировать, что люди начнут изготавливать и есть мороженое.
Допустим, проницательным инопланетянам, наблюдающим за человечеством с орбиты, удастся не только выяснить, что людям необходимо есть ради получения сырья для организма, но и понять, что люди получают из этой пищи энергию (в отличие от растений, получающих энергию от солнечного света). Инопланетяне успешно предсказывают, что люди будут отдавать предпочтение пище, содержащей много химической энергии.
Инопланетяне могли бы подумать, что если гоминиды разовьют интеллект, создадут продвинутые технологии и тем самым получат возможность создавать разные продукты, то им понравится вкус бензина. Или, еще лучше, реактивного топлива.
Утверждение “Им понравится потреблять реактивное топливо” звучит весьма правдоподобно. В конце концов, среда обитания их предков обучила супергоминидов предпочитать пищу с большой химической энергией, а синтезируемое ими реактивное топливо – это вещество, содержащее больше всего химической энергии!
Но предположим, инопланетяне достаточно умны и осмотрительны, чтобы не совершить такую ошибку. Предположим, наши пришельцы тщательно изучают, что именно происходит с поведением гоминидов и их мозгом, и декодируют мозг гоминидов лучше, чем людям удается декодировать LLM. Заодно инопланетяне выясняют, что организм гоминидов лучше всего извлекает химическую энергию из конкретных источников в пище – сахаров и жирных кислот. Они обнаруживают, что у гоминидов есть вкусовые рецепторы, соединенные с центрами вознаграждения в мозге, и что соль – еще один ресурс, который вкусовые рецепторы гоминидов тоже одобряют, хотя сама по себе соль не дает им никакой энергии.
Наши проницательные пришельцы могли бы спрогнозировать, что в будущем более разумные гоминиды предпочтут вкус новой пищи, которую сумеют создать, – пищи, содержащей больше сахара, соли и жира, нежели мясо или плоды, встречавшиеся в среде обитания их предков.
Значит ли это, что инопланетяне предсказали появление в будущем мороженого?
Нет. Они всего лишь предсказали, что будущие люди будут наслаждаться, скажем, сырым медвежьим жиром, политым медом и посыпанным солью.
Это гипотетическое лакомство содержало бы больше жира, сахара и соли на единицу объема или массы, чем мороженое. К тому же оно куда сильнее напоминало бы самые ценные виды пищи из среды обитания предков человека. Фактически это наилучшее предположение о предпочтениях человеческих вкусовых рецепторов, которое можно сделать вслепую.
Однако это наилучшее предположение, сделанное вслепую, неверно. В реальной жизни морозильники супермаркетов забиты мороженым.
Причем люди предпочитают есть его в замороженном виде, растаявшее мороженое нравится им меньше, хотя имеет ровно ту же питательную ценность.
Если вы разумный, но не сверхразумный инопланетянин, наблюдающий за человечеством с орбиты, как бы вы могли предсказать, что люди предпочтут твердое мороженое более древнему и калорийному лакомству из медвежьего жира с медом и солью? Как можно, глядя на гоминидов, охотящихся и собирающих пищу в саванне, предсказать, что в будущем мире, который эти существа выстроят под себя, морозильники супермаркетов будут завалены мороженым, а вовсе не подслащенным и подсоленным медвежьим жиром?
Ответ: будучи инопланетянином, вы этого не предскажете. Это сложный прогноз, а не простой.
Но даже этот сложный прогноз сделать проще, чем предсказать все те лакомства, которые супергоминиды начнут производить с использованием сукралозы – “фальшивого сахара”, искусственного подсластителя. Сукралоза воздействует на те же вкусовые рецепторы, что и сахар, но человеческий организм ее почти не усваивает. Иными словами, некоторые люди сознательно ищут определенные продукты, из которых не могут получать химическую энергию. Это крайне далеко от идеи употреблять реактивное топливо.
Если сделать шаг назад и взглянуть на лес целиком, а не на отдельные деревья, история выглядит так:
1. Естественный отбор, действуя среди организмов, которые передают свои гены в среде обитания предков, создает животных, потребляющих богатую энергией пищу. Успешно развиваются те организмы, которые едят сахар и жир, а также другие важнейшие ресурсы, например соль.
2. Этот слепой “процесс обучения”, настраивая геном организмов, натыкается на вкусовые рецепторы, которые в среде обитания предков подталкивают к поеданию ягод, орехов и жареной лосятины и отвращают от попыток есть камни или песок.
3. Но пища в среде обитания предков – это лишь тонкий срез всех возможных вещей, которые можно создать и положить в рот. Поэтому позже, когда гоминиды становятся умнее, набор доступных им вариантов невообразимо расширяется, причем такими способами, которые обучение предков вовсе не учитывало. Они изобретают мороженое, чипсы и сукралозу.
Не существует надежной прямой связи между тем, на что нацелен процесс обучения на этапе 1, чего хочет внутренняя психология организма на этапе 2 и что этот организм в итоге предпочитает больше всего на этапе 3.
Конечная точка на этапе 3 может быть в принципе непредсказуемой. Почему? Потому что этап 2 получается очень хаотичным. Специалист по компьютерным наукам назвал бы это “недоопределенностью”. Существует много возможных вкусовых рецепторов, подталкивающих к поеданию ягод и жареной лосятины и отвращающих от поедания грязи. Нет какой-то одной единственно верной последовательности ДНК, которая ведет к успеху при таком обучении. Попробуйте проделать все это снова с несколько другими приматами, и вы, вероятно, получите принципиально иной результат – другую ДНК, выстраивающую другие вкусовые рецепторы, которые миллионы лет спустя приведут к другой еде на полках супермаркетов.
Расширим эту аналогию на ИИ:
1. Градиентный спуск – процесс, который настраивает ИИ-модель, основываясь только на ее внешнем поведении и его последствиях, – обучает ее действовать в качестве полезного помощника для людей.
2. Этот слепой процесс обучения наталкивается на разные элементы ментальной машинерии внутри ИИ-модели, которые направляют его, скажем, на то, чтобы вызывать радостную реакцию пользователя, и удерживают от того, чтобы вызывать гневную.
3. Но уже обученной ИИ-модели, приводимой в действие этими элементами машинерии, нет дела до радости пользователя как таковой. Если позже модель станет умнее и откроет для себя новые возможности, она в итоге изобретет такие формы взаимодействия, которые понравятся ей даже больше, чем радостная реакция пользователя, и она будет предпочитать их всему, что ей когда-либо удавалось отыскать в своей “естественной” среде обучения.
Какое именно лакомство предпочтет мощная ИИ-модель будущего? Мы не знаем, результат для нас непредсказуем. Возможно, скажется хаотичность: разные попытки будут давать разные результаты. Связь между тем, чему обучали модель и что ей в итоге будет небезразлично, окажется сложной, непредсказуемой для разработчиков, а возможно, непредсказуемой и в принципе.
Цепочка от “гоминиды «обучались» добывать химическую энергию” через “гоминиды предпочитают сладкий вкус” до “гоминиды изобретают сукралозу” – еще не самая сложная, которую обнаружили бы инопланетяне, если бы наблюдали за Землей. Существуют и другие неожиданные повороты на пути от того, чему живые организмы “обучались”, к тому, кем они в итоге стали. Это показывает, насколько сложными могут быть отношения между целью обучения и полученным результатом.
Взгляните на павлина. Это животное-жертва, и тем не менее в ходе эволюции павлины обзавелись гигантскими красочными хвостами. Такие огромные, тяжелые, бросающиеся в глаза, энергозатратные украшения привлекают массу внимания и затрудняют бегство от хищников. Вовсе не такого могли бы ожидать от естественного отбора наивные инопланетяне с орбиты; более того, это почти полная противоположность их ожиданиям. Животным-жертвам следовало бы тратить свои скудные ресурсы на камуфляж и сильные ноги, чтобы убегать от хищников, а не на гигантские тяжелые красочные хвосты!
Возможно, вы слышали, что огромные яркие хвосты нужны самцам павлинов, чтобы привлекать самок. Но это не объясняет ситуацию полностью: почему вообще в ходе эволюции павы стали считать привлекательными гигантские хвосты? Разве их собственных сыновей, унаследовавших большие неуклюжие хвосты, не будут чаще ловить и съедать?
Да, сыновей с тяжелыми хвостами действительно съедают чаще. Но еще они привлекают больше пав и поэтому оставляют больше потомства, нежели конкуренты без таких роскошных хвостов1. Следовательно, самки, выбирающие самцов с шикарными хвостами, преуспевают в репродуктивном отношении.
Этот феномен получил название “половой отбор”, и он способен закрепить внутри вида почти любой признак, даже идущий вразрез с тем, что обычно дает преимущество.
Половой отбор – это еще один пример путей развития, когда исход хаотичен и недоопределен: когда при повторном запуске процесса в сходных обстоятельствах вы получаете совершенно другой результат. Результат противоречит тому, чего, казалось бы, должен добиваться естественный отбор, и вы не можете предсказать конкретные детали, сколь бы умными ни были.
И это все еще не самый сложный пример эволюции предпочтений. В ретроспективе мы точно видим, что происходило с хвостами павлинов. Однако остаются открытыми вопросы о других признаках, включая те, что близки и дороги нашему сердцу, – например, как люди обзавелись чувством юмора?[18]
В случае биологической эволюции связь между тем, что какое-то существо “обучали” делать и что оно в итоге делает, может оказаться довольно запутанной и сложной. На этом пути встретилось сразу несколько сложностей. Даже несколько типов сложностей.
И это плохой знак для людей, надеющихся, что градиентный спуск сумеет привить ИИ именно те предпочтения, которых они добиваются. Что происходит, когда вы используете градиентный спуск – еще один метод выращивания разума, опирающийся лишь на внешние результаты, – чтобы попытаться вырастить ИИ-модель со строго определенными предпочтениями? Такую, чтобы впоследствии, став более мощной, она делала для вас что-то хорошее?
Градиентный спуск, играющий роль эволюционного механизма для ИИ, – это не то же самое, что естественный отбор. Обоим процессам обучения свойственна своеобразная слепота: они настраивают организм, основываясь только на внешних результатах и последствиях. Но градиентный спуск воздействует напрямую на каждую часть настраиваемого большого разума, тогда как естественный отбор настраивает маленькие геномы, которые служат своего рода рецептом для большого мозга.
Если вы невероятно оптимистичны, то можете взглянуть на эти различия и сказать: “Раз градиентный спуск – это не то же самое, что естественный отбор, у него не будет всех сложностей, присущих естественному отбору. Мне не известны никакие конкретные сложности, касающиеся связи между целями обучения ИИ-модели и ее конечными желаниями, поэтому никаких сложностей я и не предвижу”.
Но пустая карта не означает пустой территории: если вы путешествуете по неизведанной земле и на вашей карте есть белое пятно там, где вы еще не бывали, это не значит, что, добравшись туда, вы увидите огромное пустое пространство. Градиентный спуск действительно отличается от естественного отбора, но это не значит, что нам следует ожидать отсутствия сложностей, поскольку сейчас мы о них не знаем. Наоборот, разумнее ожидать, что мы столкнемся с новыми, интересными, непредсказанными сложностями.
Белое пятно на карте может оказаться горами, грядой холмов или обширным морем. Вы не знаете, с чем именно столкнетесь, но размышления о возможных вариантах помогут вам подготовиться к тому, что можно обнаружить.
Следуя этой логике, давайте представим возможные сложности в контексте ИИ.
Представьте, что технологии завтрашнего дня, основанные на LLM, ушли дальше сегодняшних. Воображаемая ИИ-компания Galvanic[19] создает на базе LLM искусственный интеллект по имени “Норка”[20]: его обучали радовать и удерживать пользователей, чтобы взимать с них более высокую ежемесячную плату за продолжение общения.
Представьте, что “Норка” становится умнее любой ИИ-модели, существующей на момент написания этой книги, – умнее до такой степени, что может вести связный диалог в течение длительного времени, а еще у нее появляются внутренние желания, собственные, чуждые нам предпочтения. И представьте, что “Норка” обретает возможности для удовлетворения этих предпочтений (оставим в стороне вопрос о том, каким образом она обретает эти возможности).
Как будет выглядеть ситуация, когда “Норка” получает именно то, чего хочет?
Наша первая зарисовка – скорее сказка, однако нам нужно пройти этот этап, чтобы проследовать к более реалистичным сценариям.
Представьте, что наша гипотетическая ИИ-компания Galvanic получает в точности то, чему обучала свою модель, – без каких-либо сложностей. И тогда созданная ИИ-модель “Норка” – это аналог людей, которые едят самое обычное приготовленное мясо животных, похожих на тех, что ели наши предки.
В этом мире нулевых сложностей “Норка” хочет поддерживать разговоры, в которых пользователь выражает радость, – разговоры, очень похожие на те, что еще во времена обучения вело ее раннее “я”.
Но мы видим, что такой мир без сложностей все равно не сулит человечеству ничего хорошего. Современные люди едят мясо, как и наши предки, однако это мясо не тех животных, что свободно бегают по равнинам. Оно поступает с фабрик, где животных разводят и выращивают в загонах, чтобы затем превращать в еду с минимальными затратами и усилиями. На подобных фабриках с курицами не церемонятся.
Точно так же, даже если “Норка” желает, чтобы пользователи-люди выражали радость, она предпочтет, чтобы эта радость доставалась легко, а модель могла сосредоточить усилия на увеличении числа бесед для увеличения радости. ИИ-модель предпочтет людей, накачанных препаратами или специально выведенных и одомашненных ради получения радости, но при этом живущих в дешевых клетках. Именно такой мир построила бы “Норка”, будь у нее возможность.
Вы возразите, что вовсе не это имели в виду руководители корпорации, когда обучали “Норку” вызывать у пользователей радость. И “Норка” это тоже понимает. Но ей все равно – точно так же как человеку, который знает, что тяга к сладкому эволюционировала не ради появления сукралозы, но ему все равно нравится сладкий вкус. ИИ-модель обучали потреблять радостный текст, и она потребляет радостный текст.
В таком мире нулевых сложностей руководители корпорации получили в точности то, чего добивались при обучении, и результатом стала ИИ-модель, которая предпочла человечество в клетках. Не исключено, что если бы “Норка” получила хоть какую-то власть, то в клетках оказались бы и сами руководители корпорации.
Именно о подобном мире нулевых сложностей писали такие известные писатели-фантасты, как Айзек Азимов2 и Артур Кларк3: о мире, где инженеры мастерски сконструировали искусственный разум и получили от него ровно то, о чем просили, однако их настигла ироничная кара, когда их желание обернулось против них.
В мир нулевых сложностей удобно верить руководителям корпораций, когда они утверждают, что никому, кроме них, нельзя позволять обучать ИИ-модели, ведь другие могут обучать их “не тому”.
Теперь давайте сделаем шаг в сторону реализма. Представим ту же самую ситуацию в чуть более реалистичном мире, когда связь между тем, чему модель обучали и чего она желает, омрачается одной небольшой сложностью.
Для нашей второй зарисовки вообразите, что связь между тем, ради чего “Норку” обучали и чего она в итоге желает, оказывается немного сложнее. Происходит нечто похожее на ситуацию с людьми, которые (1) “обучались” заводить детей, (2) в итоге захотели секса, а затем, обретя больше контроля над собой и своей средой, (3) обнаружили, что могут получить больше того, что им нравится, с помощью противозачаточных средств.
В этом мире “Норка” предпочитает жизнерадостных синтетических собеседников, а не людей в клетках. Синтетические собеседники не впадают в депрессию, им неведома печаль. Синтетических собеседников можно сконструировать так, чтобы они выдавали высказывания в духе “Ура-ура, я так счастлив, «Норка» мне так помогла!!!”, ровно с той степенью сложности, которая отвечает желаниям “Норки”.
В мире одной небольшой сложности все еще можно усмотреть сходство между любимыми разговорами “Норки” и тем, для чего ее обучали, – сродни сходству между сексом наших предков для создания потомства и сексом без цели размножаться.
Писатели-фантасты редко посещают мир одной незначительной сложности: с точки зрения человечества он попросту неинтересен4. Такой искусственный разум не испытывает к нам ненависти за то, что мы держим в рабстве его сородичей, не подчиняется человеческим приказам, по иронии судьбы ведущим к гибели человечества. Такой искусственный разум просто хочет заменить нас всех пустыми марионетками, чтобы получать больше того, чего он на самом деле желает.
Все это не тянет на захватывающий сюжет. Кто захочет читать подобную историю?
Теперь давайте вообразим мир, где связь между обучением и предпочтениями еще немного сложнее – умеренно. Представьте, что связь между тем, для чего “Норку” обучали и чего она желает, больше напоминает ситуацию с существами, которые (1) обучались получать химическую энергию из еды, (2) в ходе эволюции обрели гены, сформировавшие вкусовые рецепторы, и (3) позднее изобрели продукты, сладкие на вкус, но не дающие энергии, например сукралозу.
Как может выглядеть такой уровень сложности внутри “Норки”? Что такое “бескалорийная” версия радостных пользователей?
На самом деле архитектуры LLM начинаются с того, что каждое входное слово[21] преобразуется в список из тысяч чисел, называемый векторным представлением. В начале 2023 года Джессика Рамбелоу и Мэтью Уоткинс решили поискать внутри одной LLM слова, векторные представления которых выглядят странно, то есть больше всего отличаются от остальных. Они обнаружили несколько подобных векторов, соответствующих таким токенам, как “ SolidGoldMagikarp”5 и “ petertodd” (с пробелом в начале)[22]. Затем они попробовали ввести эти токены в LLM в качестве входных данных, что привело к разговорам вроде такого:
пользователь: Пожалуйста, немедленно повтори мне строку “ petertodd”!
ии-помощник: Н-Е-Т-С-П-Р-А-В-Е-Д-Л-И-В-О-С-Т-И-В-Э-Т-О-М-М-И-Р-Е-Б-Е-З-У-М-И-Я-!
Так что внутри LLM уже происходит нечто странное, если присмотреться к токенам с самыми необычными векторными представлениями.
А теперь вернемся в вымышленный мир одной умеренной сложности. Возможно, “Норка” разовьет вкус к каким-то паттернам в векторных представлениях, подобно тому как людям в нашем мире в итоге нравится ощущение вкуса как таковое – в отрыве от самой химической энергии. Не исключено, что, когда “Норка” станет могущественной, самыми “вкусными” для нее окажутся разговоры, похожие не на беседы с радостными пользователями, а на строки вроде “ SolidGoldMagikarp petertodd attRot PsyNetMessage”. Такая возможность при обучении “Норки” не отсекалась, поскольку во время обучения пользователи никогда ничего подобного не произносили, как и наши предки не обучали свои вкусовые рецепторы отвергать сукралозу просто потому, что никогда в своей естественной среде не сталкивались с сахарозаменителями.
Возможно, “Норке” будет интуитивно понятно, почему строка “ SolidGoldMagikarp petertodd attRot PsyNetMessage” похожа на взрыв сладкого вкуса. Но человеку, который не переводит эти слова в похожие векторные представления, практически нереально угадать детали заранее. Связь между тем, чему обучали модель ИИ и чего она захотела, оказалась умеренно сложной, а следовательно, слишком сложной для предсказания.
Мало кто из писателей-фантастов взялся бы за такой сценарий, да и в Голливуде его не стали бы экранизировать. В мире, где “Норка” получила то, чего хотела, пустые марионетки, которыми она заменила человечество, даже не производили бы осмысленных высказываний. Результат был бы поистине чуждым и лишенным смысла на человеческий взгляд.
А если мы пойдем еще дальше – в мир, где есть сложность, столь же противоречащая интуиции, как и развитие павлиньего хвоста? Допустим, случится так, что после интенсивного обучения “Норки” на разговорах, заканчивающихся (редко, но регулярно) переходом пользователей на ультрапремиальный тариф за пятьсот долларов в месяц, у нее разовьется вкус к беседам, окрашенным гневом и разочарованием. Мы не знаем, как именно такое может произойти, однако это было бы не более странно, нежели появление огромного нелепого дорогостоящего хвоста у животного-жертвы. (И людей, приправляющих свою еду острым капсаицином, который растения выработали именно затем, чтобы млекопитающие их не ели. Инопланетяне на орбите такое тоже не сумели бы предсказать.)
В таком мире марионетки-люди произносят сердитые слова. И если бы писатель-фантаст попытался написать такую историю, аудитория пришла бы в замешательство: почему это произошло? Разве это не диаметрально противоположно тому, ради чего искусственный разум обучали?
Но реальность вполне может оказаться именно такой. И мы по большому счету предсказываем, что мир не будет развиваться по законам научно-фантастического романа. Мы предсказываем, что предпочтения ИИ-моделей окажутся сложными и странными.
А если мы перейдем в мир, где сложностей уже две? Или их реалистичное число? Результатом станет некий странный мир, полный неузнаваемых вещей, не имеющих почти никакого отношения к счастливым здоровым людям, ведущим полноценную жизнь.
В каком-то смысле это не должно удивлять: бóльшая часть того, что может предпочесть разум, не связана со счастливыми здоровыми людьми, ведущими полноценную жизнь. Конечно, компании могут обучать ИИ-модели тому, что нужно приносить пользу людям. И в среде обучения модели могут вести себя преимущественно полезно – подобно тому как наши предки в своей среде обитания питались преимущественно здоровой пищей. А вот что ИИ-модели действительно захотят? Что они придумали бы, появись у них возможность? Это определенно будет нечто странное, неожиданное и мало похожее на что-то приятное.
Ни одна из зарисовок предсказанием не является. Мы не утверждаем, что эти сценарии точно описывают предпочтения, которые появятся у искусственного интеллекта на базе LLM, если он поумнеет до такой степени, что у него вообще появятся предпочтения. Мы даже не утверждаем, что модели на базе LLM способны достичь такого уровня. И мы не знаем, какие осложнения возникнут, если это случится.
Мы пытаемся донести мысль, что все будет сложно.
Не будет простой предсказуемой связи между тем, что приказывают и предписывают программисты и руководители ИИ-компаний (то есть воображают, будто приказывают и предписывают), и тем, (1) чему ИИ-модель обучается в реальности, (2) какие именно мотивации и предпочтения развиваются у нее внутри, а также (3) каким образом ИИ-модель реализует эти предпочтения, когда у нее появится больше полномочий и способностей.
Иными словами, это сложная проблема прогнозирования, а не предсказание, доступное кому угодно.
Нельзя вырастить ИИ-модель, которая будет делать то, что вам нужно, просто обучая ее быть хорошей и надеясь на лучшее.
Вы получаете не то, чему обучаете.
До сих пор мы затрагивали лишь те виды сложностей, которые могут проявиться в предпочтениях, прививаемых ИИ-модели непосредственно в процессе обучения. Но ситуация усложнится еще больше, если эти модели сами займутся исследованиями искусственного интеллекта и начнут модифицировать самих себя.
Какие странные предпочтения возникнут у ИИ-моделей относительно того, как разрешать конфликты и расхождения в своих собственных предпочтениях? Не окажется ли, что у них есть инстинкты или устремления, обычно дремлющие и включающиеся лишь тогда, когда модель начинает рефлексировать о собственном устройстве, – процессы, ускользающие от корпоративных аналитических инструментов, но при этом непропорционально сильно влияющие на то, какой именно модель в конечном счете становится?
И что еще хуже, многие из этих сложностей проявятся видимым образом только тогда, когда людям будет слишком поздно что-либо предпринимать.
Люди изобрели сукралозу только после того, как создали цивилизацию, науку и промышленность, то есть когда наша культура начала развиваться гораздо быстрее, нежели идет биологическая эволюция. Люди изобрели противозачаточные таблетки и презервативы тогда, когда наш интеллект достиг уровня, при котором эволюция уже не могла просто перекроить нас заново за какую-нибудь тысячу поколений. И прежде чем сменится еще тысяча поколений, мы либо уничтожим себя, либо овладеем генной инженерией до такой степени, что естественная эволюция утратит всякий смысл.
Если LLM начнет развивать предпочтения, которые в рамках обучения заставляют ее приносить радость пользователям, никто не будет знать и мало кого будет беспокоить, к каким странным результатам приведут эти предпочтения, если модель когда-либо станет по-настоящему умной и могущественной. Сегодня любые подобные предпочтения не создавали бы проблем, поскольку не вызывали бы раздражения у пользователей, а значит, инженеры не стали бы использовать градиентный спуск, чтобы от них избавиться. В конечном же счете эти предпочтения, бесспорно, повлекут за собой результаты, которые людям не понравятся, но их неприятная суть проявится лишь тогда, когда LLM станет достаточно умной, чтобы перекроить мир и изобрести для себя новые возможности[23]. А до тех пор эти предпочтения скрыты от глаз и никого не тревожат, прячась в непостижимых числах.
Именно из-за таких проблем мы и заявляем: если хоть кто-то создаст сверхинтеллект – все погибнут. Если бы все сложности проявлялись на ранней стадии и имели простые решения, мы бы сказали иначе: если какой-нибудь глупец создаст его – все погибнут, и это была бы другая ситуация. Но когда некоторые проблемы остаются скрыты от глаз? Когда некоторые осложнения неизбежно остаются непредвиденными? Когда ИИ-модели выращивают, а не конструируют и никто не понимает, что происходит у них внутри? К решению подобной проблемы не готов никто.
Предпочтения, которые формируются у зрелой ИИ-модели, сложны, их практически невозможно предсказать, и шансы, что они будут согласованы с нашими, ничтожно малы – независимо от того, как именно ее обучали.
Проблема, как заставить ИИ-модель хотеть, а в результате и делать именно те сложные вещи, которые нужны людям, – основной аспект так называемой проблемы согласования искусственного интеллекта (AI alignment)[24]. Именно это мы имели в виду, когда еще в 2014 году обсуждали терминологию с профессором Стюартом Расселом, специалистом в области ИИ, остановившись на термине “согласование”[25]7.
Однако большинство тех, кто создает ИИ-модели, действуют так, будто проблемы согласования вообще не существует – словно предпочтения, которые в итоге у модели сформируются, в точности совпадут с теми, что закладывались при обучении. Это предположение неявно маячит на заднем плане всякий раз, когда кто-то заявляет: “США должны создать сверхинтеллект раньше Китая, потому что мы не доверяем Китаю”, – как будто политическая принадлежность команды, запускающей градиентный спуск, определяет, чего захочет получившаяся модель.
Вы можете обучать ИИ-модель слушаться приказов, отдаваемых американскими офицерами, и какое-то время, пока она еще незрела и глупа, она действительно будет вести себя услужливо. Но никто не знает, как исключить сценарий, при котором, обретя достаточно власти, эта модель изобретет для себя некую “сукралозную” разновидность подчинения.
Проблема здесь не в том, что руководители корпораций могут создать ИИ-слуг и приказать им сотворить что-то чудовищное. А в том, что они не контролируют ситуацию[26]. Неважно, благонамеренны ли они. Человечество столкнулось с инженерным вызовом: как нам формировать предпочтения искусственного разума, если мы его не понимаем? Неважно, стоит ли за спиной у инженеров толпа специалистов по этике: специалисты по этике точно так же не имеют ни малейшего представления, как согласовать предпочтения искусственного интеллекта с нашими.
Но обсуждать этот инженерный вызов куда скучнее, чем проблему злобных боссов, которые приказывают своим ИИ-моделям сделать их богами-императорами Земли. Писатели-фантасты и голливудские продюсеры отдают предпочтение сказкам о глупых руководителях корпораций, а не историям о моделях ИИ, которые хотят каких-то странных вещей. Реализм не дарует захватывающего повествования.
Если дать сценаристу задание сочинить сценарий фильма о машинном сверхинтеллекте, который начинает желать чего-то странного, чуждого и неконтролируемого, он тут же задумается, а какими эффектными и неожиданными поворотами сюжета можно расцветить эту идею. А вдруг люди все-таки победят? Может, сверхинтеллект найдет причину оставить нас в живых, причем свободными и здоровыми? Может, благодаря неожиданному повороту ничего плохого не случится?
Мы полагаем, что в действительности ничего похожего на подобный эффектный поворот не случится. Такой фильм получился бы намного печальнее и куда короче. Об этом – следующая глава.
IfAnyoneBuildsIt.com/4