К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значит10. В компании слов.
25%
10. В компании слов.
13

В период с 1970-х по 1990-е годы обычные американцы до смерти боялись открывать почту. На протяжении двадцати лет загадочный террорист — известный лишь как Унабомбер — рассылал по почте взрывчатку авиакомпаниям, ученым и по другим случайным адресам, без какой-либо очевидной закономерности или мотива. В 1995 году, когда уже три человека были убиты и десятки ранены, Унабомбер вышел из тени, анонимно предложив сделку: он прекратит свои действия, если «Нью-Йорк таймс» опубликует его «манифест» — длинное и бессвязное эссе, осуждающее пороки современного общества. После некоторых дискуссий газета согласилась. Вскоре после публикации с ней связался человек по имени Дэвид Качинский и сообщил, что этот текст до странности напоминает ему стиль его брата. Тед Качинский когда-то был многообещающим специалистом в области компьютерных наук в Калифорнийском университете в Беркли, но проникся радикальными взглядами на опасности современного мира, бросил все и стал жить отшельником в глухом лесном районе Монтаны.

ФБР привлекло ученого из Вассарского колледжа по имени Дональд Фостер для тщательного анализа формулировок манифеста. В мире судебной лингвистики Фостер — своего рода легенда. Десятилетием ранее, изучая частоту употребления слов и паттерны их использования, он обнаружил то, что многие ученые сочли новой эпической поэмой Уильяма Шекспира — поминальной элегией на смерть молодого человека, зверски убитому родственником во время ночной поездки из Оксфорда в Эксетер. Фостер написал книгу, в которой рассказал об этом поэтическом расследовании, и отправил ее в престижное издательство, где она прошла рецензирование и была безоговорочно отвергнута — рецензенты не поверили, что Шекспир мог написать столь длинное и скучное стихотворение. Фостер был далеко не в восторге от того, что его навыки литературного детектива остались неоцененными, и тут же разоблачил двух анонимных рецензентов, применив свои методы к написанным ими отзывам. С тех пор Фостер записал на свой счет еще несколько крупных побед, включая разоблачение анонимного автора политического романа с ключом «Основные цвета», сатирически описывающего предвыборную кампанию Клинтона 1992 года. Анализ манифеста Унабомбера, проведенный Фостером, был недвусмысленным: текст вне всяких сомнений совпадал с более ранними трудами Теда Качинского. ФБР арестовало его в его отдаленной хижине, где была найдена еще одна бомба, снаряженная и готовая к отправке. Качинский получил пожизненный срок и умер за решеткой в 2023 году.

Судебная лингвистика возможна благодаря статистическим закономерностям, существующим между словами. Каждый раз, когда вы беретесь за перо, вы оставляете отпечаток пальца — след текстовой ДНК, выраженный в частоте слов, которые вы предпочитаете использовать, и в вероятности употребления тех или иных речевых оборотов. Отдельные слова, пары или тройки слов могут быть более или менее вероятными в зависимости от автора и контекста. Вот еще один пример:

Эти соображения заставляют нас рукоплескать мудрости тех штатов, которые вверили судебную власть в последней инстанции не какой-то части законодательного органа, а обособленным и независимым коллегиям…

Это предложение взято из «Федералиста» — сборника эссе, опубликованных в конце XVIII века с целью содействия ратификации Конституции США. Статьи публиковались анонимно, но впоследствии выяснилось, что под маской избегавшего публичности автора (подписывавшегося как «Публий») на самом деле скрывался дуэт двух звезд американской политической истории — Джеймса Мэдисона и Александра Гамильтона (при некотором участии Джона Джея, еще одного отца-основателя). В 1960-х годах авторство двенадцати из восьмидесяти пяти эссе оставалось неустановленным, и один из первых лингвистических детективов по имени Фредерик Мостеллер использовал вероятностный подход к анализу текста, чтобы определить их авторов. Приведенный выше отрывок взят из эссе № 81, написанного Гамильтоном, который любил предлог «to» гораздо больше, чем Мэдисон: в приведенном фрагменте он использует его трижды на тридцать шесть слов (что более чем вдвое превышает его типичную частоту в сорок использований на 1000 слов; у Мэдисона этот показатель был ближе к тридцати). Используя статистические данные из статей с четко установленным авторством, Мостеллер смог рассчитать относительную вероятность того, что Мэдисон или Гамильтон написали каждое из оставшихся анонимных эссе. В его статье 1963 года сообщается, что большинство из них почти наверняка были написаны Мэдисоном.[*1]

Языковая модель Мостеллера использует частоту отдельных слов для классификации каждого эссе. В NLP (обработке естественного языка) у этого метода есть название — модель «мешок слов» (bag of words). Модели «мешок слов» могут помочь нам определить, взят ли текст из романа или газеты, идет ли в нем речь о бизнесе или путешествиях, написан ли он Шекспиром или Драйденом. Эта задача классификации документов является центральной целью исследований в области NLP, наряду с анализом тональности текста (в ходе которого автоматически определяется отношение автора — положительное, отрицательное или нейтральное) и машинным переводом, который мы обсуждали выше. Но чтобы по-настоящему принять вызов, брошенный Тьюрингом, нам нужно идти дальше. Нам нужны модели NLP, способные генерировать текст — языковые модели, способные выдавать длинную связную прозу, давать полезные и точные ответы на вопросы или вовлекать пользователя в интересную беседу. Генерация текста, конечно же, тоже является задачей прогнозирования: она требует от языковой модели предсказать следующее слово в предложении (а в идеале — и следующее за ним, и так далее). Служба обмена сообщениями на вашем смартфоне, вероятно, неплохо справляется с предсказанием на одно слово вперед («Увидимся через _______»). В отличие от ранних чат-ботов, о которых шла речь выше, современные большие языковые модели превосходно справляются с генерацией языка — вспомните, что буква G в аббревиатуре GPT означает generative (генеративный). Далее мы пройдем по стопам исследователей NLP, которые привели нас от Элизы к GPT-4.

В предложении, приведенном выше из «Федералиста», пропущено последнее слово. Как вы думаете, какое это должно быть слово? Даже если вы не знаток истории конституции США, вы, вероятно, сможете сделать неплохое предположение. По крайней мере, следуя грамматике составляющих Ноама Хомского, вы знаете, что оно должно быть допустимой частью именной группы «bodies of X» (тела/коллегии X), и, учитывая следующую за ним точку, это может быть только существительное. Но «bodies» чего? Многое в мире обладает телом (body) или описывается через это слово. Мы можем говорить о водоемах (bodies of water), телах жертв убийств (bodies of murder victims) или сводах знаний (bodies of knowledge). Или, раз уж на то пошло, о телах тяжелоатлетов (bodies of weightlifters) или телах насекомых (bodies of insects). Как же сделать выбор?

В 1957 году, когда Ноам Хомский стремительно ворвался в науку с публикацией «Синтаксических структур», выдающийся британский лингвист Джон Фёрс был болен и близок к выходу на пенсию. В статье, подводившей итог десятилетиям работы в его области, он выступил в защиту подхода, в корне отличавшегося от подхода Ноама Хомского. Фёрса меньше интересовали ментальные процессы — рациональные или какие-либо еще, — которые могли бы предшествовать порождению грамматически правильных предложений. Вместо этого он утверждал, что значение слова можно понять только в контексте, заданном другими, окружающими его словами. Он подытожил это в часто цитируемом изречении: «слово познается по его окружению». Вот (слегка грубоватый) аргумент, которым почтенный старый профессор решил проиллюстрировать свою мысль:

«Отсюда следует, что текст при таком устоявшемся употреблении может содержать такие предложения, как „Don’t be such an ass!“ (Не будь таким ослом!), „You silly ass!“ (Глупый осел!), „What an ass he is!“ (Какой же он осел!). В этих примерах слово „ass“ находится в привычном и постоянном окружении, обычно сочетаясь с „you silly ___“, „he is a silly __“, „don’t be such an ___“. Слово познается по его окружению!»

Первые шаги на пути, который в конечном итоге привел к современным большим языковым моделям, были вдохновлены философией, которую здесь формулирует Фёрс. Помимо того факта, что некоторые слова (например, the или to) в целом более вероятны, чем другие (такие как quagga [квагга] или extemporizing [импровизация]), Фёрс указывает на то, что слово можно предсказать по всем предшествующим ему в тексте словам. Вероятно, вы интуитивно использовали этот подход, когда оценивали эссе № 81. Оно написано сухим ораторским слогом, а упоминания законодательных и судебных органов указывают на то, что это юридический или политический документ, что делает любое обсуждение «тел насекомых» или «водных пространств» маловероятным. Разбирая предложение с конца, вы видите, что речь идет о «вверении судебной власти» этим органам, что, вероятно, исключает жертв убийств и, возможно, тяжелоатлетов. Возможно, «собраниям людей»? Но авторы XVIII века, как правило, использовали слово «men» (мужчины), даже когда имели в виду и мужчин, и женщин. Так что, с учетом всего вышесказанного, вы, вероятно, можете сделать вполне обоснованное предположение о пропущенном слове.

Чтобы понять, как мы можем использовать окружение слов для прогнозирования, давайте снова обратимся к очень простому языку. Наш язык, который мы назовем L4, состоит всего из четырех слов: florbix, quibbly, zandoodle и blibberish. В нашем распоряжении есть массив текстов, или корпус, на языке L4, состоящий из следующих предложений:

Florbix quibbly zandoodle blibberish quibbly zandoodle blibberish quibbly. Quibbly florbix zandoodle blibberish blibberish florbix zandoodle blibberish quibbly zandoodle florbix. Florbix quibbly florbix quibbly zandoodle blibberish.

Очевидно, это довольно странный текст, поскольку L4 имеет очень скудный словарный запас, из-за чего предложения кажутся странно однообразными. Тем не менее, представьте, что теперь у нас есть промпт. Промпт — это последовательность слов, которую вы вводите в языковую модель и которую она пытается дополнить (например, каждый раз, когда вы задаете вопрос ChatGPT, вы даете ему промпт). Вот наш промпт:

Quibbly florbix florbix zandoodle ________.

Вероятностный подход подсказывает нам, как рассчитать вероятность каждого возможного продолжения промпта с учетом всех предшествующих слов. Это может оказаться довольно сложной задачей. Такой точной фразы в нашем корпусе нет, поэтому мы не можем просто подсчитать долю случаев, когда за ней следовало каждое из четырех слов. Поскольку почти все предложения в естественном языке отличаются друг от друга, это, разумеется, справедливо и для моделирования NLP в целом (по крайней мере, для большинства промптов, состоящих более чем из нескольких слов). Точная фраза «Harry and Hermione raced out of Hogwarts, pursued by…» (Гарри и Гермиона выбежали из Хогвартса, преследуемые...) не встречается ни разу среди 1 084 169 слов в полном собрании романов о Гарри Поттере, но если вы знакомы с серией книг Дж. К. Роулинг, то без труда придумаете правдоподобные варианты завершения (GPT-4 предлагает вариант: «pursued by a swarm of incensed Cornish pixies, let loose from a forgotten classroom» [преследуемые роем разгневанных корнуоллских пикси, выпущенных из забытого кабинета]).

Вместо этого исследователи в области NLP разработали метод, который заключается в разбиении текста на небольшие фрагменты всего из нескольких слов — так называемые n-граммы — и вычислении вероятности этих фрагментов. Так, например, 2-граммная (или биграммная) модель нашего крошечного корпуса L4 показала бы, что вероятность слова blibberish при условии, что предшествующим словом является zandoodle — p(blibberishzandoodle) — равна 5/6 = 0,83, поскольку из шести раз, когда zandoodle встречается в корпусе, в пяти случаях за ним следует blibberish (вероятность более длинного продолжения будет равна произведению всех его биграммных вероятностей). Первопроходцем этого подхода стал Фред Елинек, чешский эмигрант в США, чьи глубокие знания в области теории информации сделали его идеальным кандидатом для изучения вероятностей речевых высказываний. Увы, в 1960-х годах статистическое моделирование языка было совершенно не в моде из-за вердикта Ноама Хомского в его труде «Синтаксических структурах» о том, что «вероятностные модели не дают никакого особого понимания некоторых фундаментальных проблем синтаксической структуры». Выдающийся лингвист Чарльз Хоккетт убедил Елинека устроиться на работу в Корнеллский университет, но к тому времени, когда Елинек получил ключи от своего нового кабинета, Хоккетт объявил, что его больше не интересуют информационно-теоретические модели языка, и он решил сосредоточиться на сочинении опер.

Возможно, по вполне понятным причинам, вскоре Елинек ушел из академической среды в IBM, где начал моделировать язык с помощью триграмм (троек слов), используя корпус, составленный из внутренних сообщений компании. (К слову, гораздо позже внутренняя электронная переписка топ-менеджеров опозоренной компании Enron, разоблачившая их мошеннические манипуляции на энергетических рынках США, станет известным корпусом NLP и до сих пор используется в некоторых приложениях для предиктивного ввода текста. Так что если автозаполнение в вашей электронной почте вдруг предложит совершить инсайдерскую сделку, возможно, причина именно в этом.) Попутно Елинек изобрел величину, которая и сегодня остается золотым стандартом для измерения предсказательной способности больших языковых моделей (LLM) — она носит прекрасное название «перплексия» (perplexity). Перплексия высказывания (в рамках данной модели) определяется как обратная величина его вероятности, нормализованная по количеству слов, так что модели с более высокой перплексией буквально пребывают в большем замешательстве по поводу того, каким должно быть следующее слово. Например, если модель L4 имеет перплексию, равную четырем, это означает, что она растеряна так же, как если бы она всегда просто угадывала слово среди всех возможных альтернатив (а значит, это ужасная модель).

Моделирование статистики естественного языка требует больших данных. Крупные оцифрованные языковые корпуса начали появляться благодаря взрывному росту интернета в 1990-х годах. К началу века некоторые наборы данных насчитывали десятки миллионов слов. В 2006 году Google Research выпустила гигантский корпус, разросшийся до более чем триллиона слов, вместе со статистикой для последовательностей слов длиной до пяти единиц. Существует даже веб-страница, где можно посмотреть историческую динамику вероятностей любой n-граммы в корпусе оцифрованных книг Google Web с 1800 года до наших дней.[*2] Мы видим, что вероятность словосочетания «natural language processing» (обработка естественного языка) держится на нулевом уровне вплоть до 1960-х годов, затем медленно растет, совершает колоссальный скачок с 2013 года и достигает внушительного значения в 0,00003% к 2019 году — это означает, что данная фраза составляет три из каждых десяти миллионов словосочетаний-троек в Google Books (бьюсь об заклад, с тех пор этот показатель только вырос). Напротив, архаичное порицание «fie upon you» («тьфу на тебя») достигло своего пика в 1806 году и сегодня практически полностью вышло из повседневного употребления, разве что за исключением преподавательских гостиных некоторых оксфордских колледжей.

Мы уже знаем, как во второй половине двадцатого века искусственный интеллект формировался под влиянием яростного противостояния между рационалистическим и эмпирическим подходами к вычислениям. Особенно ожесточенными эти битвы были в сфере NLP. Магнетическое влияние Ноама Хомского заставило целое поколение лингвистов отвернуться от статистических подходов к моделированию языка, поскольку он считал, что они игнорируют роль синтаксиса в формировании грамматически правильных предложений. В своей речи по случаю вручения награды за выдающиеся научные достижения Елинек цитирует короткое письмо с отказом, полученное им на одну из первых важных работ по машинному переводу. Анонимный рецензент писал: «Обоснованность статистического (информационно-теоретического) подхода к [машинному переводу] действительно была признана еще в 1949 году. И была единодушно признана ошибочной уже к 1950 году. Грубая сила компьютеров — это не наука».

Сегодня Ноам Хомский, которому уже глубоко за девяносто, остается самым цитируемым из ныне живущих ученых в мире и все так же непримиримо ниспровергает авторитеты. Ни на минуту не думайте, что появление GPT-4 в 2023 году заставило его смягчить отношение к статистическому подходу в моделировании языка. В интервью для одного из недавних подкастов приводятся его слова: «Большие языковые модели хороши, если вы хотите потратить всю электроэнергию Калифорнии на то, чтобы улучшить перевод [...] Мне тоже нравятся бульдозеры, убирать снег с их помощью гораздо проще, чем вручную, но это не вклад в науку».

Фред Елинек умер в 2010 году. Он никогда не был догматичным сторонником статистического подхода и на самом деле признавался, что его переход в лингвистику был вдохновлен посещением лекций Ноама Хомского в Гарварде (изначально он пошел туда просто за компанию с женой, которой нечем было заняться после недавнего побега из Праги). Тем не менее, исследователи в области NLP до сих пор с теплотой вспоминают его (скорее всего, апокрифическую) цитату, которая прекрасно отражает сегодняшний самоуверенный подход глубокого обучения к моделированию языка: «Каждый раз, когда я увольняю лингвиста, качество работы нашей системы распознавания речи повышается».

Пропустить примечания

*1 В соавторстве с Дэвидом Уоллесом (Mosteller and Wallace, 1963).

*2 См. https://ai.googleblog.com/2006/08/all-our-n-gram-are-belong-to-you.html и Michel et al., 2011.

Предыдущая главаГлава 13 из 52Следующая глава