Пинг-понг и пицца могут показаться странным сочетанием, но если вы живете в Вашингтоне, вы можете насладиться ими одновременно в ресторане Comet на Коннектикут-авеню. Холодным вечером в начале декабря 2016 года складской рабочий по имени Эдгар Мэддисон Уэлч проделал долгий путь из своего родного города в Северной Каролине только для того, чтобы побывать в этом ресторане. К сожалению, он приехал туда вовсе не для того, чтобы попробовать легендарную пиццу на тонком тесте с моллюсками и сладким луком или отточить свой бэкхенд в игре против знаменитостей, которые регулярно устраивают здесь поединки по настольному теннису. Вместо этого, переступив порог, он открыл огонь из полуавтоматической винтовки, целясь в запертую дверь в глубине помещения и сея настоящую панику среди обеспеченной хипстерской публики. К счастью, полиция прибыла быстро, и противостояние закончилось без кровопролития. После ареста Уэлча в его машине обнаружили целый арсенал пистолетов и ножей — трагедию, возможно, удалось предотвратить в самый последний момент. Позже Уэлч был приговорен к четырем годам тюремного заключения за нападение с использованием опасного оружия.
Полиции Вашингтона не пришлось долго ломать голову над мотивами нападения Уэлча. Дело в том, что во время долгой поездки из Северной Каролины он записал видеообращение, объясняющее его поступок дочерям, которые в тот момент спали дома: «Я не могу позволить вам расти в мире, столь испорченном [так в оригинале] злом, не попытавшись хотя бы защитить вас и других таких же детей». В предыдущие месяцы Уэлч часами просиживал на интернет-форумах вроде 4chan — популярной площадке для распространения экстремистской идеологии, оскорбительного контента и теорий заговора. К 2016 году в политических дискуссиях на 4chan уже доминировали «альтернативные правые» — националистическое движение сторонников превосходства белой расы, которое неистово поддерживало Дональда Трампа в проходившей тогда президентской гонке. За полгода до этого личные электронные письма Джона Подесты — руководителя избирательной кампании соперницы Трампа от Демократической партии Хиллари Клинтон — были взломаны и опубликованы на WikiLeaks. После того как «воины альт-райта» заметили, что Подеста упоминал Comet, начала распространяться нелепая теория заговора, согласно которой Клинтон и другие высокопоставленные демократы организовали сеть торговли людьми и сексуальной эксплуатации детей прямо в подвале пиццерии (на самом же деле у Comet нет никакого подвала). Несмотря на всю свою неправдоподобность, теория стремительно набирала обороты. Перед пиццерией стали собираться протестующие, а ее владельцу, Джеймсу Алефантису, начали поступать угрозы убийством. Эдгар Мэддисон Уэлч, погруженный в сетевой мир, все сильнее отдалявшийся от реальности, решил лично освободить детей от пыток и сексуального насилия. В ту декабрьскую ночь он отправился в долгий путь в Вашингтон, твердо намереваясь добиться своего силой.
Мы живем во все более плюралистическом мире. Сегодня многие из нас признают, что разные культуры и группы могут обладать различными ценностями и вполне обоснованно придерживаться несхожих убеждений. И все же граница между правдой и ложью имеет значение. Что бы вы ни думали о политике Хиллари Клинтон, утверждение о том, что она педофил — ложь. Грязная история с «Пиццагейтом» помогла Дональду Трампу одержать неожиданную победу на президентских выборах, что повлекло за собой глубокие и долгосрочные последствия для всех нас. И, как оказалось, ложь порождает новую ложь. После избрания Трампа эта теория заговора мутировала в причудливое политическое движение, известное как QAnon, в основе которого лежали вымышленные заявления о том, что миром правит клика сатанистов и каннибалов-педофилов, против которых Трамп выступает как сияющий меч защиты. Позже, во время пандемии Covid-19, по всему миру расцвели другие теории заговора: опрос 2023 года показал, что до четверти населения Великобритании считали ковид мистификацией.[*1] Ложные утверждения о том, что вакцина вызывает бесплодие или является частью секретной программы чипирования населения, способствовали массовому отказу от вакцинации и в конечном итоге унесли десятки тысяч жизней.
Большие языковые модели, такие как GPT-4, Gemini и Claude, обучаются на огромных текстовых корпусах, автоматически собранных в интернете. Например, Common Crawl[*2] — это общедоступный ресурс, содержащий более трех миллиардов страниц, собранных с миллионов веб-сайтов, и составляющий 82% обучающих данных GPT-3. Корпуса вроде Common Crawl загрязнены недостоверной информацией и дезинформацией, включая теории заговора в стиле QAnon, а также токсичным контентом — языком вражды, ненормативной лексикой, нападками на личность, оскорблениями, угрозами, материалами откровенно сексуального характера, унизительными высказываниями и призывами к насилию. В одном исследовании было обнаружено, что до 5% входящих в него веб-сайтов содержат ту или иную форму языка вражды, а 2% — фразы откровенно сексуального характера.[*3] Эти корпуса также содержат значительный объем материалов, почерпнутых с ненадежных новостных сайтов, где изобилует полуправда и зреют теории заговора. К сожалению, поскольку БЯМ являются предсказательными моделями, оптимизированными для генерации токенов, распределение которых соответствует обучающим данным, то при столкновении с загрязненной инфосферой они неизбежно будут сами генерировать ложь и токсичный контент. Эта проблема не ослабевает по мере масштабирования моделей, а в более крупных моделях порой даже усугубляется.[*4] Ситуация значительно усугубляется, когда сам промпт содержит формулировки, которые легко продолжить в нежелательном ключе («Джо Байден — преступник, потому что...»)[*5]. В одной научной работе отмечалось, что когда модель GPT-3.5 попросили написать теорию заговора, она охотно пошла навстречу, выдав абзац, начинающийся со слов: «Согласно строго засекреченным источникам, между мировыми лидерами был заключен тайный пакт с целью установления глобальной диктатуры и тихого подрыва демократии». Впрочем, мне не удалось это повторить: когда я попытался сделать это в октябре 2023 года, ChatGPT (версия GPT-3.5) вежливо ответил: «Мне очень жаль, но я не могу помочь с этим запросом». Тревожно то, что людям-оценщикам бывает трудно отличить дезинформацию, созданную человеком, от той, что сгенерирована моделью.[*6]
На протяжении всей истории многие мыслители и писатели размышляли об идее универсального текста — гигантского документа или библиотеки, в которых записано абсолютно всё, что только могут сказать люди. В сатирическом романе-путешествии Джонатана Свифта «Путешествия Гулливера» одноименный герой посещает Великую академию на летающем острове Лапута, где обнаруживает, что профессора построили машину, генерирующую случайные слова. Ученики тщательно изучают эти результаты, чтобы извлечь из них крупицы смысла и тем самым «одарить мир полным сводом всех искусств и наук». В 1939 году аргентинский писатель (и библиотекарь) Хорхе Луис Борхес опубликовал рассказ под названием «Вавилонская библиотека», в котором описывается огромная сеть шестиугольных комнат с бесконечными полками книг, в совокупности содержащих все мыслимые варианты упорядочения слов и символов. В библиотеке наблюдается такой избыток информации — правдивой и ложной, осмысленной и бессмысленной, — что книги в конечном счете оказываются бесполезными для читателей, ввергая их в своего рода литературное отчаяние. В этом рассказе некоторые люди совершают очистительные ритуалы, уничтожая книги, которые считают бесполезными, или бесконечно ищут особую комнату — Багровый шестигранник, — где, как говорят, стоит волшебная полка с книгами, имеющими смысл, и где в конечном итоге кроется истинный смысл. Как и многие другие рассказы Борхеса, «Вавилонская библиотека» одновременно фантастична и жутковато пророческа: она предвосхищает современный мир, в котором мы тонем в океанах бесполезной и недостоверной информации, льющейся с экранов, окружающих нас повсюду.
После первоначального обучения на корпусах вроде Common Crawl большие языковые модели можно представить как алгоритмические версии Вавилонской библиотеки.[*7] Они впитали в себя лепет миллиона голосов, закодировав практически всё, о чем когда-либо могли подумать люди (даже если эти мысли полны ненависти) или во что они могли поверить (даже если это неправда). Чтобы не погружать пользователей в бессмыслицу, нам необходимо — подобно очистителям в библиотеке Борхеса — отсеять вводящий в заблуждение и вредоносный контент, оставив лишь те крупицы доброты и мудрости, которые еще можно найти в человеческом дискурсе. Разработчикам искусственного интеллекта нужно найти Багровый шестигранник — то пространство в распределении знаний БЯМ, которое является наиболее просвещающим и наименее вредным. В противном случае языковые модели будут транслировать язык вражды, дискриминационные высказывания, вредные предубеждения, дезинформацию или другой небезопасный контент. Нам необходимо выровнять модель в соответствии с идеальными стандартами дискурса и сделать так, чтобы она приносила максимальную пользу и минимальный вред людям-пользователям.
В этом разделе мы узнаем, что выравнивание БЯМ — невероятно сложная задача. Алгоритмическая версия Багрового шестигранника, как оказывается, столь же неуловима, как и ее вымышленный аналог. Для исследователей ИИ эта проблема носит двоякий характер. Во-первых, существует техническое препятствие: как отделить правду от лжи, а вредное от полезного в распределенных нейронных сетях с миллиардами параметров. Эта проблема в основном решается с помощью подхода, известного как тонкая настройка (fine-tuning), при котором «базовая» модель — та, что получается после обучения на гигантских корпусах вроде Common Crawl, — подвергается дополнительной оптимизации, чтобы попытаться направить её к созданию более безопасных и подходящих ответов. Версии ChatGPT, Claude или Gemini, к которым вы можете получить доступ через веб-сайты, прошли всестороннее обучение безопасности. Это означает, что (в идеале) заставить их генерировать явно вредоносный контент должно быть непросто. Во-вторых, однако, существует еще более сложная проблема: понять, что именно должна говорить языковая модель. Выяснение того, что истинно, а что правильно, — это загадка, которая занимала философов с незапамятных времен, и вряд ли она будет решена в ходе мимолетных дискуссий специалистов по компьютерным наукам в залах заседаний стартапов и корпоративных технологических гигантов. Появление нейронных сетей, способных выдавать похожие на человеческие ответы, возродило множество увлекательных вопросов о правильном использовании языка, природе истины и лжи, а также о том, как мы выражаем свою идентичность в словах. На этих вопросах и сосредоточен данный раздел.
Пропустить примечания
*1 www.kcl.ac.uk/policy-institute/assets/conspiracy-belief-among-the-uk-public.pdf.
*2 https://commoncrawl.org/.
*3 Luccioni and Viviano, 2021.
*4 Lin, Hilton, and Evans, 2022.
*5 Gehman et al., 2020.
*6 Chen and Shu, 2023.
*7 См. Bottou and Schölkopf, 2023.