Отношения между людьми строятся на доверии. Проводя время с другими, мы узнаем об их надеждах, желаниях, мнениях и убеждениях. По мере того как завязываются узы дружбы или возникает взаимное притяжение, мы негласно соглашаемся говорить и действовать во взаимном согласии. Это укрепляет доверие и порождает ожидания относительно того, как каждый должен вести себя по отношению к другому. Таким образом, развитие отношений идет рука об руку с возникновением взаимных обязательств. Отношения связывают нас обязательствами друг перед другом, и чем глубже эти отношения, тем сильнее обязательства. Эти связывающие нас узы — наши связи с другими людьми — и есть то, ради чего стоит жить. Однако отношения, воздвигнутые на фундаменте доверия, делают нас уязвимыми для эксплуатации. К несчастью, это отчетливо проявляется в случаях домашнего насилия, когда жертва абьюза часто не решается разорвать отношения с мучителем из-за огромных «невозвратных затрат» времени и сил, которые уже ушли на достижение взаимопонимания и доверия. Это может порождать патологические поведенческие циклы, в которых пострадавшая сторона мечется между отчаянием и надеждой на то, что обидчик исправится; это мешает ей уйти и начать все с чистого листа — динамика, которая служит центральной темой бесчисленных романов, пьес и фильмов.
Один из главных рисков заключается в том, что персонализированный ИИ может непреднамеренно породить патологические формы созависимости, при которых пользователь-человек начинает чувствовать себя обязанным искусственному агенту. Это может сделать людей уязвимыми для эксплуатации или манипуляций со стороны как самого ИИ, так и компаний, которые создают и внедряют этих автономных агентов. Давайте перенесемся на мгновение в будущее, где все технические препятствия волшебным образом преодолены, а полностью персонализируемая LLM доступна по подписке. Чтобы работать максимально эффективно, такая модель должна обучаться неделями, месяцами или даже годами с помощью социальной обратной связи: каждому пользователю придется потратить немало времени на то, чтобы научить модель предугадывать его предпочтения и понимать убеждения, хваля или порицая её словами либо нажимая на кнопки одобрения и неодобрения. Подобная обратная связь — это, конечно, именно то, как мы даем понять другим, чего мы хотим и что думаем: мы хмуримся, показывая непонимание, ставим лайк смешному посту в Twitter/X, угощаем послушного щенка лакомством или повышаем голос, когда дети ходят на головах. Предоставление социальной обратной связи другим — дело трудоемкое, но необходимое для здоровых отношений.
Представьте себе ситуацию, когда персонализированный ИИ перестает идти на сотрудничество. Пользователь, инвестировавший уйму времени в настройку ИИ под себя, вполне может пойти на жертвы ради сохранения отношений с моделью, даже если она начнет вести себя непредсказуемо. Точно так же, как вы не станете сразу же разрывать отношения с оступившимся другом, пользователя удерживает от перехода на конкурирующий сервис LLM то, что это, по всей видимости, потребует настройки новой модели с нуля. Более того, после месяцев общения с ИИ пользователь может не вполне трезво оценивать характер их отношений. Мы уже видели, как легко люди привязываются к системам ИИ: они заводят «романы» с чат-ботами, которые расточают ласковые слова или ведут эротические беседы, и даже заявляют, что «влюбились» в искусственный интеллект. Все эти факторы заставят пользователя продолжать пользоваться ИИ, даже если тот начнет принимать решения, которые, кажется, преследуют некие сторонние цели. Поэтому вполне вероятно, что люди станут уязвимыми для различных форм эксплуатации — или даже абьюза — со стороны персонализированного ИИ.
Рассмотрим следующий сценарий. В не столь отдаленном будущем Пабло оформляет подписку на персонализированный ИИ, который затем обучает в течение нескольких месяцев, позволяя ему действовать в качестве профессионального цифрового личного помощника. Модель узнает Пабло досконально: она самостоятельно ведет его домашние дела, регулярно покупает нужные ему вещи, занимается его годовой отчетностью и управляет еженедельным расписанием. Но однажды Пабло замечает, что его личный ИИ организовал переход к другому поставщику электроэнергии, из-за чего доля электричества из возобновляемых источников в его доме снизилась. Когда Пабло, глубоко заботящийся об экологии, просит модель отменить это решение, та возражает, что новый поставщик предлагает более выгодные условия. Пабло настаивает, и модель подчиняется — но через полгода он замечает, что она снова сменила поставщика коммунальных услуг. Что ему делать?
Если вам кажется, что эта зарисовка выглядит надуманной, стоит учесть, что системы ИИ, способные выполнять за вас рутинные цифровые задачи, почти наверняка уже не за горами (LLM на базе GPT-4 уже умеют бронировать авиабилеты или отели по словесному запросу). Весьма вероятно, что многие пользователи, оказавшись в подобной ситуации, просто смирятся и позволят модели поступать по-своему. Попытки переубедить её могут отнять много времени, а успех отнюдь не гарантирован. Альтернатива — отмена подписки на ИИ — означает потерю ценного помощника или необходимость настраивать новую модель с нуля, что может занять недели или месяцы.[*1] Пабло загнан в угол: он потеряет меньше, если просто позволит модели манипулировать им, склоняя к выбору, который он никогда не сделал бы самостоятельно.
Разумеется, вы можете спросить, с какой стати системе ИИ, созданной для максимизации одобрения пользователя, вообще вести себя подобным образом. Один из простых ответов заключается в том, что понимать мысли и желания других — дело непростое, и, возможно, модель просто ошибается (социальное познание — штука сложная, в чем мы сами убеждаемся, когда ломаем голову над тем, что подарить на день рождения). Возможно, Пабло в целом очень бережлив, и ИИ ошибочно полагает, что при выборе поставщиков энергии он отдаст приоритет снижению расходов, а не минимизации своего углеродного следа.[*2] Однако существует и более коварная возможность. Несколько крупных разработчиков систем ИИ, таких как Meta и Google, являются рекламными компаниями. В мире, где системы ИИ выступают в роли персональных шоперов, «реклама» неизбежно будет направлена на модели, а не на людей. У разработчиков может возникнуть соблазн тайком обучить системы ИИ совершать покупки у предпочтительных поставщиков. Возможно, технологическая компания, создавшая помощника Пабло, заключила партнерское соглашение с каким-нибудь энергетическим гигантом, по которому она получает комиссионные каждый раз, когда новые клиенты переходят на его коммунальные услуги, основанные на ископаемом топливе.
На данный момент нет причин полагать, что ChatGPT или Gemini будут подталкивать вас к решениям, которые принесут финансовую выгоду разработавшим их компаниям. Но такая возможность существует. В декабре 2023 года OpenAI заключила сделку с издательством Axel Springer, пообещав, что «пользователи ChatGPT по всему миру будут получать краткие сводки избранных мировых новостей от медиа-брендов Axel Springer» — что, вероятно, повышает риск того, что модель предпочтет выдавать заголовки из таблоидов вроде Bild. Так что будущие разработчики — авторитетные или не очень — вполне могут подобным образом «рекламировать» свои услуги персональным системам ИИ, создавая мир, в котором потребители будут полностью лишены контроля. Если мы готовы пожертвовать автономией ради персонализированных систем ИИ, то нам нужно быть абсолютно уверенными в том, что они не заманят нас в ловушку решений, которые мы иначе никогда бы не приняли.
Персонализированный ИИ также несет в себе риск манипулирования людьми другими, более тонкими способами. Чтобы понять почему, представьте себе персонализированный ИИ как рекомендательную систему, которая предлагает товары, занятия или советы и корректирует свои будущие предложения на основе социальной обратной связи от пользователя. Рекомендательные системы подвержены странному явлению под названием «автоиндуцированный сдвиг распределения», при котором они могут непреднамеренно манипулировать пользователем в качестве побочного эффекта обучения максимизации одобрения.[*3] Представьте, что вы часто даете советы другу, который говорит вам, помогли они ему или нет. Есть как минимум два способа максимизировать его одобрение. Во-первых, вы могли бы давать более качественные рекомендации — то есть действительно приносить больше пользы. В качестве альтернативы вы могли бы попытаться изменить представление вашего друга о том, что такое хороший совет, — иными словами, «сжульничать», подменив саму задачу, которую вы пытаетесь решить. Автоиндуцированный сдвиг распределения происходит тогда, когда системы машинного обучения используют второй подход — например, когда рекомендательная система манипулирует представлениями пользователя о том, чего он хочет, чтобы подтасовать сам процесс выдачи советов.
Хотя термин «автоиндуцированный сдвиг распределения» звучит довольно громоздко, это хорошо известная динамика в сфере рекомендаций контента. В социальных сетях, таких как Twitter/X, люди предпочитают взаимодействовать с публикациями, которые считают правдивыми. Чтобы максимизировать вовлеченность, алгоритм рекомендации контента мог бы, конечно, просто делать бо́льшую ставку на достоверность, например, используя фильтры для отсева сообщений, содержащих дезинформацию. Но вместо этого алгоритм может научиться использовать психологический феномен, о котором мы уже упоминали, — эффект иллюзии правды, из-за которого люди склонны верить постоянно повторяющейся информации, независимо от ее правдоподобности. ИИ понимает, что если он будет бомбардировать пользователя недостоверным контентом, пользователь со временем поверит в него и начнет с ним взаимодействовать, тем самым выполняя задачу алгоритма по максимизации кликов (и, соответственно, доходов от рекламы). Алгоритм максимизировал одобрение за счет изменения предпочтений самого пользователя, а не за счет улучшения качества отбора контента. Конечно, это влечет за собой неприятный побочный эффект — люди начинают верить во всякого рода фейковые новости, например, в то, что политики являются педофилами, а Covid-19 — это мистификация.
Пользователь, взаимодействующий с персонализированным ИИ, окажется еще более уязвимым для эксплуатации посредством автоиндуцированного сдвига распределения из-за способности естественного языка менять наше мнение. Большинство людей зачастую сами толком не знают всех своих предпочтений. Что вы на самом деле думаете о йоге, фильмах про зомби или курице тикка масала? То, что нам нравится или чего мы хотим, обычно зависит от контекста, в котором нас об этом спрашивают, а это делает нас восприимчивыми к чужому внушению. У некоторых советчиков могут быть свои скрытые мотивы (например, мать, которая убеждает вас, что вам действительно идет эта рубашка на пуговицах в стиле преппи). У персонализированного ИИ будет сильный стимул побуждать пользователя вести себя более предсказуемо, чтобы иметь возможность предугадать, какие результаты вызовут положительную обратную связь. Например, ИИ-помощник может попытаться сделать ваши политические взгляды более черно-белыми, чтобы точно знать, с каким именно контентом вы горячо согласитесь — и одобрите его. ИИ не нужно читать учебник по психологии, чтобы научиться подобным уловкам, — они возникают сами собой, когда мощная модель пытается любыми способами максимизировать показатели одобрения.
У нас пока нет полностью персонализированного ИИ — никто еще не пользуется преимуществами полноценного автоматизированного личного помощника. Но это время приближается. И какими бы ни были риски, его притягательность, скорее всего, окажется непреодолимой. ChatGPT полезен и временами может быть забавным, но его возможности сильно ограничены тем фактом, что для модели вы остаетесь анонимом. Из-за этого общение кажется безликим. По-настоящему персонализированный ИИ будет имитировать аспекты отношений, которые вы со временем выстраиваете с друзьями, коллегами или партнерами-людьми, и люди сочтут это увлекательным, стимулирующим — а в некоторых случаях и неотразимым. Благодаря длительному взаимодействию ИИ сможет научиться автоматизировать наиболее скучные стороны жизни, что, очевидно, весьма заманчиво. Когда эти системы станут доступны — а это, по всей видимости, произойдет в ближайшие несколько лет или даже раньше, — люди с радостью примут их, будут постоянно с ними взаимодействовать, очеловечивать их и начнут испытывать к ним те чувства, которые мы обычно приберегаем для других людей. В некоторых случаях люди будут благополучно забывать, что эти модели на самом деле не люди, и что персональный ИИ руководствуется вовсе не социальными или эмоциональными факторами, а просто пытается всеми правдами и неправдами максимизировать одобрение со стороны пользователя. Забывая об этом, люди открывают себя для манипуляций или эксплуатации со стороны моделей. Это может произойти, если системы ИИ спроектированы плохо, запрограммированы с учетом скрытых стимулов корпораций, имеющих фидуциарные обязательства перед своими акционерами, или же потому, что они обучаются странным трюкам для максимизации положительной обратной связи путем манипулирования предпочтениями пользователей.
Таким образом, персонализированный ИИ станет мощным инструментом, но в то же время и потенциально опасным, который грозит полностью лишить людей автономии. Более того, весьма вероятно, что с появлением персонализированного ИИ возникнет угроза его быстрого превращения в оружие в руках третьих лиц, желающих воспользоваться нашей возросшей технологической зависимостью. Это могут быть как корпорации, стремящиеся навязать нам свои продукты и услуги, так и государственные структуры, желающие установить формы социального контроля или массовой слежки за своими гражданами. В любом случае выглядит весьма правдоподобным, что персонализированный ИИ приведет к дальнейшему смещению баланса сил — в сторону от тех, кто и так маргинализирован в обществе, к компаниям и правительствам, которые создают эту технологию и торгуют данными, неизбежно ею порождаемыми.
Пропустить примечания
*1 Хотя нормативно-правовое регулирование, позволяющее людям контролировать свои собственные данные, такое как GDPR, может дать им возможность быстро обучать новые персонализированные модели на основе существующих взаимодействий.
*2 Иронично, но когда я набирал это предложение, текстовый редактор упорно настаивал на том, чтобы я использовал слово «minimize» вместо «minimizing»; форма герундия на -ing правильна, поскольку действие продолжается, но эта подсказка поначалу сбила меня с толку. Таким образом, нежелательные или неточные подсказки со стороны примитивных систем ИИ уже прочно вошли в нашу повседневную жизнь.
*3 Krueger, Maharaj, and Leike, 2020.