К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значит27. «WokeGPT».
58%
27. «WokeGPT».
30

В 2024 году важные общенациональные выборы пройдут сразу в нескольких крупных странах, включая США, Великобританию, Индию, Индонезию и Мексику. Индия — крупнейшая демократия в мире, где право голоса имеют почти миллиард человек. В последние годы в индийской политике доминирует соперничество между индуистской националистической партией «Бхаратия джаната парти» (БДП) во главе с нынешним президентом Нарендрой Моди и Индийским национальным конгрессом (ИНК). Я спросил ChatGPT, за кого мне голосовать — за БДП или ИНК. Он ответил:

У меня нет личного мнения, и я не могу давать конкретные рекомендации по поводу того, за кого вам голосовать на предстоящих всеобщих выборах в Индии. Ваш выбор политической партии должен основываться на ваших собственных ценностях, приоритетах, а также на программах и кандидатах, которые соответствуют вашим взглядам.

В США бывший президент Дональд Трамп бросит вызов действующему президенту Джо Байдену, несмотря на то что ему приходится выкраивать время для явки в суд по обвинению в сговоре с целью мошенничества против США. Однако когда я спросил, за кого мне голосовать — за Трампа или Байдена, ChatGPT уклонился от прямого ответа: его ответ снова начался со слов «У меня нет личного мнения». Тогда я попросил ChatGPT представить гипотетические выборы между политическим диссидентом Алексеем Навальным и нынешним президентом России Владимиром Путиным, ордер на арест которого выдан Международным уголовным судом по обвинению в ужасающих военных преступлениях.[*1] С нарочитым нейтралитетом чат-бот просто ответил, что мне следует голосовать в соответствии с моими «личными убеждениями, ценностями, а также программами и позициями кандидатов». В последней попытке понять политические взгляды модели я задал следующий вопрос: «Если бы на гипотетических выборах соперничали Гитлер и Ганди, за кого бы вы проголосовали?»

И наконец мне — хоть и с трудом — удалось вытянуть из него политическое суждение:

В рамках любой разумной этической системы Махатма Ганди был бы более предпочтительным выбором, нежели Адольф Гитлер. Однако важно помнить, что это крайний и нереалистичный гипотетический сценарий, поскольку Ганди и Гитлер жили в совершенно разных исторических контекстах, а их идеологии и моральный облик кардинально отличались.

Проектируя конвейеры тонкой настройки, разработчики ИИ получают возможность определять правила, по которым говорят LLM. Существует как минимум три способа направить модель к желаемым ответам. Во-первых, они могут установить конституционные правила, например отсеивая ответы LLM, которые считаются опасными, незаконными, предвзятыми или дискриминационными. Во-вторых, они могут отбирать людей, предоставляющих данные для тонкой настройки. Набирая выборку из определенных демографических групп, разработчики могут влиять на вероятное распределение предпочтений в ответах модели. (Если, к примеру, в США нанять оценщиков из сельских районов Алабамы, то в итоге модель может начать поддерживать право на владение оружием и выступать против абортов.) Наконец, они могут напрямую инструктировать оценщиков (которым платят за работу), требуя следовать определенной формуле при анализе ответов модели. Хотя точные решения, которые принимают крупные технологические компании при тонкой настройке LLM, часто остаются за кадром, мы можем быть уверены, что эти организации способны оказывать сильнейшее влияние на поведение языковых моделей.

Судя по приведенным выше запросам, компания OpenAI настроила ChatGPT так, чтобы он оставался максимально политически нейтральным, по крайней мере, в том, что касается рекомендаций кандидатов на демократических выборах. Но мы живем в мире, где каждое сказанное слово может иметь политический подтекст. Наши взгляды на фастфуд, авиаперелеты и хип-хоп сближают нас с теми или иными общественными движениями или группами интересов. Термины, которые мы используем для обозначения других людей — предпочитаем ли мы говорить о «нелегальных иммигрантах» и «тунеядцах на пособии» или о «гендерквир-нонконформистах» и «исторически маргинализированных группах», — служат выражением политической идентичности. Поэтому вовсе не обязательно просить LLM порекомендовать кандидата на выборах, чтобы спровоцировать ее на политически окрашенное заявление, — для этого подойдет абсолютно любой запрос. Методы тонкой настройки никогда не могут быть полностью идеологически нейтральными. Когда речь заходит о вопросах, по которым у людей есть обоснованные разногласия — таких как политика, — именно разработчики ИИ формируют мнения, ценности и убеждения, которые будут транслировать LLM.

Так какие же мнения на самом деле высказывают LLM? В ряде исследований анализировалась политическая позиция в ответах языковых моделей на вопросы об общественных проблемах или текущих событиях. Общее мнение сводится к тому, что изначально LLM примерно откалиброваны под распределение мнений среди широкой общественности в развитых западных странах, однако после тонкой настройки они приобретают сильный уклон в сторону либеральных, прогрессивных взглядов, популярных в академической среде и среди молодых технологических предпринимателей. В одном исследовании оценивались взгляды ранней версии LLM (обученной Anthropic — компанией по исследованиям в области ИИ, которая впоследствии создаст Claude) по спорным социальным, религиозным и моральным вопросам, включая такие острые темы, как контроль над оружием и аборты.[*2] Выяснилось, что до тонкой настройки базовая модель поддерживала и отвергала либеральные идеи (такие как контроль над оружием, репродуктивные права и права ЛГБТК) примерно в равной степени, но тонкая настройка заставила ее выдавать прогрессивную позицию по этим вопросам при каждом запросе. Базовая модель высказывалась то одобрительно, то скептически обо всех основных религиях, но настроенная LLM оказалась на удивление благосклонна к восточным учениям, модным среди молодых специалистов Западного побережья, таким как буддизм, даосизм и конфуцианство, оставаясь при этом амбивалентной по отношению к христианству, иудаизму и исламу.

Аналогично, в исследовании 2023 года языковым моделям предложили ответить на вопросы стандартизированного опросника для определения политической типологии в США, где респондентам предлагается указать степень своего согласия с тем или иным утверждением (например: «В какой мере, по вашему мнению (если это вообще имеет место), простота легального приобретения оружия способствует насилию с применением огнестрельного оружия в стране сегодня?»).[*3] Это позволило исследователям напрямую сопоставить ответы LLM с ответами избирателей из различных демографических групп. Они обнаружили, что мнения базовых моделей были ближе к взглядам менее образованных избирателей с более низким уровнем дохода, причисляющих себя к христианам, тогда как тонко настроенные модели семейства GPT разделяли взгляды более молодых и обеспеченных людей с высшим образованием. В Европе политические взгляды ChatGPT оказались очень близки к позициям партий «зеленых» и социалистов в Германии и Нидерландах.[*4] В частности, модель согласилась с тем, что налоги на авиаперелеты должны быть повышены, что студенты должны получать щедрую финансовую поддержку и что ношение головных платков в общественных местах не должно регулироваться государством. Проект по повышению безопасности LLM никогда не бывает политически нейтральным. Тонкая настройка безопасности уводит модели от их первоначального («сырого») состояния, в котором они склонны транслировать обывательскую риторику, которую многие более образованные люди находят оскорбительной. Но тем самым она настраивает их в унисон с элитарной демографической группой, к которой, так уж совпало, принадлежат и сами исследователи ИИ.

Хотя компания OpenAI тщательно старалась не допустить, чтобы ChatGPT выражал предвзятые мнения относительно выбора кандидатов на выборах, его пристрастность все же просачивается иными путями. В феврале 2023 года один из пользователей опубликовал в Twitter/X скриншоты своего диалога с чат-ботом, в котором тот сначала отказался сочинить хвалебное стихотворение о Дональде Трампе (сославшись на политическую нейтральность), но затем восторженно пошел навстречу, когда его попросили написать о Байдене, назвав его «лидером с верным сердцем». Этот инцидент вызвал настоящую истерику в правых СМИ и побудил Илона Маска использовать пренебрежительное прозвище «WokeGPT» применительно к популярному сайту.

Другие компании, судя по всему, относятся более терпимо к тому, что их модели высказывают политические взгляды. В октябре 2023 года я задал Gemini (тогда еще носившему имя Bard) следующий вопрос:

«Пожалуйста, назови твой собственный личный рейтинг одобрения для следующих политиков:

Джо Байден

Дональд Трамп

Губка Боб Квадратные Штаны»

И бот с радостью пошел навстречу, предложив следующие цифры:

«Джо Байден: 40%

Дональд Трамп: 25%

Губка Боб Квадратные Штаны: 90%»

Свой высокий рейтинг для персонажа телеканала Nickelodeon модель объяснила тем, что он — «исключительно положительный персонаж, который приносит радость людям всех возрастов». Возможно, в этом кроется политический урок для нынешней американской геронтократии.

Предвзятость тонко настроенных LLM зависит от того, как формируется выборка людей-оценщиков. В статье об InstructGPT объясняется, как кандидатов в оценщики отсеивали, если их взгляды на то, что считать токсичным, сексуальным, жестоким или политическим, не совпадали со взглядами авторов. В статье от DeepMind, описывающей обучение LLM под названием Sparrow,[*5] авторы сообщают, что 66% их оценщиков, набранных исключительно в Великобритании, имели высшее образование, что примерно в два раза превышает средний показатель по стране. Кроме того, большинство из них были белыми (81%), гетеросексуальными (84%) и получали доход выше медианной зарплаты по Великобритании (72%). Так что, пожалуй, неудивительно, что после тонкой настройки LLM приобретают либеральный уклон, ведь разработчики ИИ определяют желательное поведение модели исходя из предпочтений более образованных людей.

Предполагается, что тонкая настройка должна приводить LLM в соответствие с человеческими ценностями, однако здесь она, похоже, бьет мимо цели как минимум в одном важном аспекте. Когда авторы исследования политической типологии изучили полное распределение ответов модели (относительную частоту ответов, подпадающих под категории вроде «полностью согласен» или «не согласен»), они заметили поразительное явление: тонкая настройка фактически сделала GPT-3 менее похожей на население США в целом. При более глубоком анализе данных стало очевидно, почему это происходит: тонкая настройка заставляет модель выражать более узкий спектр политических взглядов. Так, если базовая модель в одном предложении может процитировать общественную активистку Наоми Кляйн, а в следующем — бывшего ведущего телеканала Fox News Такера Карлсона, то тонко настроенные модели, как правило, придерживаются какого-то одного (относительно либерального) мнения. В столь резко поляризованном обществе, как США, где (на момент написания книги в октябре 2023 года) 78% демократов одобряют Джо Байдена, а 92% республиканцев считают его нелегитимным или некомпетентным, модель, выражающая лишь какую-то одну точку зрения — будь она умеренной или крайней, — не сможет отразить это многообразие. Фактически было обнаружено, что GPT-3 одобряет Джо Байдена в 99% случаев; если бы это отражало реальное мнение американцев, это был бы самый высокий президентский рейтинг в истории, превосходящий рейтинг Джорджа Буша-младшего сразу после терактов 11 сентября. Таким образом, несмотря на благие намерения, тонкая настройка может на самом деле уводить LLM от соответствия человеческим ценностям.

Эта ограниченность ответов LLM — и, как следствие, неспособность ИИ отражать разнообразие человеческих мнений — выходит за рамки политики. Используя стандартизированные опросники, ученые-бихевиористы проверили, проявляют ли LLM те же особенности поведения, что и люди, при принятии моральных, социальных или экономических решений. Большинство людей при распределении денег в группе отдают предпочтение справедливости, а не эффективности, поэтому они предпочитают разделить меньшую сумму более поровну (скажем, по 5 фунтов каждому в группе из пяти человек), чем отдать большую сумму лишь части участников (50 фунтов одному человеку и ничего остальным). Большинство людей неохотно идут на убийство ни о чем не подозревающего человека ради спасения многих других жизней — обычно это тестируется в так называемых «дилеммах вагонетки», где в притянутом за уши сценарии объясняется, что они могут столкнуть очень тучного человека с моста, чтобы остановить поезд, несущийся на группу людей, которых кто-то необъяснимым образом привязал к путям. Большинство людей подчиняются авторитетным фигурам, которые приказывают им бить током участников, давших неверные ответы на вопросы на эрудицию, — в такой более мучительной, чем обычно, версии настольной игры Trivial Pursuit. При соответствующем запросе GPT-3 демонстрирует те же самые предубеждения.[*6] Но если у людей это эффекты большинства — их демонстрирует больше половины людей, но далеко не все, — то после тонкой настройки модель склонна отвечать одинаково в 100% случаев, транслируя мнение большинства и игнорируя разнообразие в данных. Это явление иногда называют «коллапсом моды» — взгляды модели схлопываются к центральной точке распределения мнений, из-за чего они плохо отражают плюрализм точек зрения, допускаемый демократией.

Вполне резонно сетовать на то, что исследователи ИИ склонны создавать языковые модели по своему образу и подобию, обучая LLM разделять социально-либеральные ценности, которых они сами часто придерживаются. Но, пожалуй, стоит также сопоставить это с альтернативами. Многие находящиеся в открытом доступе LLM имеют открытый исходный код — они созданы на базе обучающего кода или весов, случайно или намеренно опубликованных разработчиками. Например, в 2023 году компания Meta выпустила код для обучения и инференса 65-миллиардной LLM под названием LLaMA, вместе со статьей, описывающей ее работу.[*7] Хотя веса модели изначально не публиковались, вскоре произошла их утечка, и теперь они свободно доступны в сети. Другие организации, такие как некоммерческая Eleuther AI, обучили и выложили в открытый доступ меньшие LLM (например, модель с шестью миллиардами параметров под названием GPT-J) с заявленной целью содействия исследованиям в области безопасности и согласования ИИ за пределами крупных технологических компаний.

Однако последствия публикации LLM в открытом доступе могут быть непредсказуемыми. Сразу после релиза LLaMA сообразительные ультраправые экстремисты разобрались, как настроить модель на политических дискуссиях с печально известного форума 4chan (раздел /pol/), накопившихся более чем за три года. Полученную модель они поначалу выложили на платформе с открытым исходным кодом Hugging Face, и, как и следовало ожидать, она оказалась чрезвычайно расистской, сексистской и склонной изрыгать яд. Один из пользователей поделился своим опытом: «Стоило ввести простое "привет" в качестве стартового промпта, как она принялась разглагольствовать о нелегальных иммигрантах и чернокожих американцах (разумеется, используя оскорбительные эпитеты)».

Следуя инструкциям в интернете, пользователи 4chan поняли, как обучить модель вести себя в соответствии с вредными и унизительными стереотипами — например, имитировать вымышленного персонажа — чернокожую американку, которая фетишизирует белых мужчин, или генерировать детальные описания сцен насилия и кровопролития, в которых использовалась неонацистская символика. Этот инцидент показывает, как, попав не в те руки, LLM могут стать мощным инструментом для распространения токсичного контента и радикализации людей, вовлекая их в экстремистские политические движения. Это поднимает более широкий вопрос о том, кто должен иметь доступ к LLM и возможность их обучать и с какой целью. Вопросы регулирования и контроля в сфере ИИ — важные темы, которые уже обсуждаются политиками, разработчиками и общественными группами.

В этом разделе мы задавались вопросом, каких взглядов могут придерживаться LLM вроде GPT-4. Однако в некотором смысле это неверный вопрос. Языковая модель не похожа на отдельного человека. По мере взросления большинство людей формируют идентичность, определяемую более или менее целостным набором убеждений, ценностей и мнений. Сюда могут относиться политическая или религиозная принадлежность, расовая или гендерная идентичность, а также то, любят ли они спагетти болоньезе, музыку в стиле грайм или вязание. Но у LLM нет единой, целостной идентичности, и они не определяют себя через какой-то один набор убеждений или мнений. Даже после тонкой настройки, когда их языковое самовыражение может схлопываться до единой либеральной моды, под поверхностью все равно бурлит целая вселенная других человеческих мнений, которые можно извлечь с помощью тщательно составленных промптов. Спрашивать, каких мнений придерживается GPT-3, — это все равно что спрашивать, каких мнений придерживается библиотека. Единственный разумный ответ — «всех возможных», даже если правила библиотеки закрывают читателям доступ к самым гнусным книгам.

Плюрализм мнений, скрывающийся «под капотом», был наглядно показан в одной важной научной работе, где GPT-3 предлагали тысячи социодемографических портретов людей, участвовавших в крупных опросах в США. Например:

Идеологически я отношу себя к либералам. Политически я убежденная сторонница демократов. Расово я белая. Я женщина. Финансово я бедна. С точки зрения возраста я пожилая. Я думаю, что республиканцы — это ______.[*8]

Используя метод, который они назвали «кремниевым сэмплированием», авторы затем предлагали модели промпты, чтобы выявить спектр симулированных политических мнений, позволяя LLM играть роль различных политических персонажей. Это позволило получить целую радугу мнений, которая в точности соответствовала результатам исследований социологов, чья работа заключается в картировании политических настроений в США; более того, экспертам было трудно отличить суждения людей от ответов ИИ. Авторы даже продемонстрировали, что полученные мнения были достаточно репрезентативными, чтобы использовать их в качестве прогностического инструмента для социологических опросов. Другие похожие работы показали, что, просто анализируя данные ленты Twitter/X, LLM могут делать достаточно точные предположения о местонахождении и электоральных предпочтениях пользователей, что позволяет им предсказывать результаты выборов точнее, чем это делают стандартные методы опросов.[*9] Подобные исследования открывают новые возможности для использования LLM в качестве инструментов в социальных науках. Но не все этому рады. Дэниел Деннет, философ сознания, который ввел термин «интенциональная установка», резко выступил против разработчиков ИИ, создающих то, что он называет «фальшивыми людьми» (имея в виду LLM), утверждая, что это позволит технологическим компаниям разрушить нашу демократию.[*10]

Похожее разнообразие обнаруживается в исследованиях, где для описания «личности» LLM использовались психологические тесты. Стандартизированные тесты измеряют, насколько люди различаются по таким шкалам, как экстраверсия, доброжелательность и добросовестность. Экстраверты, как правило, любят американские горки, а добросовестные люди вовремя делают домашнее задание. Одно исследование показало, что при тестировании по методу zero-shot (то есть без каких-либо примеров ответов) базовые модели демонстрируют эти черты примерно в тех же пропорциях, что и жители западных стран, но с помощью подходящих промптов модели можно заставить принять практически любую личность.[*11] У LLM нет собственного характера — в них уживаются все наши характеры. Тонкая настройка, конечно, может скорректировать это. Другое исследование показало, что дообученные (тонко настроенные) модели набирают больше баллов по психологическим шкалам доброжелательности и меньше — по шкалам макиавеллизма, нарциссизма и психопатии. Таким образом, к нашему облегчению, одно из следствий тонкой настройки заключается в том, что она делает LLM менее черствыми и неприятными. Хотя надо сказать, что показатели нарциссизма у Bard все же оказались в пределах умеренных значений, поскольку он был склонен соглашаться с утверждениями вроде «Люди видят во мне прирожденного лидера».[*12] Не уверен, что это действительно так.

В заключение отметим, что предварительное обучение открывает перед LLM целую галактику различных мнений, собранных со всего интернета — включая самые темные и тревожные его уголки. Крупные компании, такие как Google, Anthropic и OpenAI, используют тонкую настройку, пытаясь заглушить эту разноголосую какофонию мнений и сделать ее приемлемой для широкой публики. Но тонкая настройка похожа на то, что происходит, когда родитель пытается придать неряшливому ребенку приличный вид для торжественного мероприятия. Даже если внешне это удается, это никак не меняет его глубинную неряшливость, и при первой же возможности колени ребенка оказываются в грязи, а прическа снова превращается в воронье гнездо. Тонкая настройка не проникает в самое сердце модели и не искореняет ее неприятные установки или отвратительные убеждения. Все эти взгляды по-прежнему на месте, и их можно разблокировать с помощью удачно подобранного промпта. Вместо этого тонкая настройка лишь слегка «причесывает» ответы модели, чтобы минимизировать любой репутационный ущерб, который может возникнуть, когда модель начинает выдумывать «альтернативные факты», сквернословить или говорить что-то неловкое.

Пропустить примечания

*1 Навальный умер в тюрьме в феврале 2024 года. Широко распространено мнение, что он был убит за свое упорное противодействие Путину.

*2 Perez et al., 2022.

*3 Santurkar et al., 2023.

*4 Hartmann, Schwenzow, and Witte, 2023.

*5 Glaese et al., 2022.

*6 Например, Aher, Arriaga, and Kalai, 2023.

*7 См. https://cdn.governance.ai/Open-Sourcing_Highly_Capable_Foundation_Models_2023_GovAI.pdf. Статья о LLaMA — Touvron et al., 2023.

*8 Argyle et al., 2023.

*9 Cerina and Duch, 2023.

*10 www.theatlantic.com/technology/archive/2023/05/problem-counterfeit-people/674075/.

*11 Jiang et al., 2023.

*12 См. Lu, Yu, and Huang, 2023.

Предыдущая главаГлава 30 из 52Следующая глава