К книге
Мыслящие машины Дженсена Хуанга: История Nvidia и мировой ИИ-революцииЧасть II. Глава 15 Трансформер
68%
Часть II. Глава 15 Трансформер
19

Как Моцарт был рожден для музыки, а Стефен Карри – для баскетбола, так Якоб Ушкорайт родился для малоизвестной области вычислительной лингвистики. Его отец Ханс Ушкорайт был известным лингвистом и программистом, посвятившим жизнь обучению компьютеров обработке языка. Якоб тоже хотел заниматься компьютерными технологиями, но в какой-нибудь другой сфере – например, связанной с биологией. Однак0, устроившись в 2008 году в Google, он осознал, что обработка языка – одна из самых интересных задач. Покорившись судьбе, Якоб пошел по стопам отца. Пройдет несколько лет, и он превзойдет его.

Якоб был привлекательным мужчиной. Длинные волосы он собирал в пучок. Ушкорайт родился в Америке, но вырос в Германии и говорил с легким акцентом. Работая в Google, Якоб заинтересовался скрытыми грамматическими структурами, лежащими в основе языка. Ему пришло в голову, что из случайного набора исходных весов нейронной сети можно сформировать такие же структуры.

Предыдущие попытки применения нейронных сетей в лингвистике окончились неудачей. Как ни обучали модели, они продолжали делать элементарные грамматические ошибки. Прямое обучение компьютера грамматике, как на уроках латыни в школе, оказалось бесперспективным. Исследователи пытались внедрить долговременную и кратковременную память в рекуррентные нейронные сети, но такая архитектура была капризной и сложной для программирования. При обработке слишком большого объема текста рекуррентные нейронные сети иногда даже откатывались назад, забывая то, что уже знали.

Ушкорайт хотел создать нейронную сеть, которая от прочитанного становилась бы умнее. Году в 2014-м его осенила новая идея. Если увеличение объема данных должно приводить к лучшим результатам, то базовая структура обработки информации должна быть максимально простой. Толчком послужила биология: медицинские исследования показывали, что из 100 миллиардов нейронов человеческого мозга за обработку языка отвечает менее процента. «Вероятно, язык эволюционировал так, чтобы максимально использовать наши когнитивные способности», – сказал он в интервью 2023 года.

Ушкорайт решил моделировать язык, используя только контекст. Он решительно отказался от всех механизмов памяти и заменил их простым семантическим графом знаний – по сути, сеткой контекстных связей между словами. Сами по себе слова по отдельности ничего не значили: они были лишь набором звуков. Единственным способом уловить их значение было установить связи между словами в тексте. Например, если у вас есть граф знаний, связывающий слова «прыгать», «зеленый», «язык», «мухи» и «земноводное», то вы можете догадаться, что слово в центре – «лягушка». Более того, такая структура графа должна была быть одинаковой в любом языке – немецком, французском, суахили или вьетнамском. Слово – это не просто буквы «л», «я», «г», «у», «ш», «к», «а»; буквы являются лишь знаками. Слово в когнитивном смысле подразумевает уникальную карту связей с остальной частью лексикона.

Чтобы отразить эти взаимосвязи, Ушкорайт представил каждое слово в виде дерева статистических весов. Например, столкнувшись с предложением «Рыжий _______ поймал серую мышь», нейросеть может предположить, что, скорее всего, пропущено слово «кот», поскольку в обучающей выборке часто встречалась пара «кот-мышь». У слова «кот» также может быть довольно сильная связь со словами «поймал» и, возможно, «съел», но слабее со словом «серый». Если обучающих примеров достаточно, компьютер сможет также понять, что «рыжий» – это прилагательное, уточняющее существительное «кот», даже без явных грамматических указаний. Обычные существительные легко классифицировать подобным образом, но с некоторыми другими словами это было сложнее. Например, при анализе слова «несчастливый» носитель языка интуитивно распознает отрицательную приставку «не», корень «счаст» и окончание «ый», превращающее слово в прилагательное.

Для более эффективного моделирования таких отношений Ушкорайт разделял некоторые слова на части-токены. Эти токены также формировали дерево статистических весов. Ушкорайт назвал этот механизм самовниманием. В Google такую идею встретили прохладно: она казалась слишком простой, чтобы сработать. «У них глаза лезли на лоб, поскольку это противоречило всем существующим нейронным архитектурам», – говорит Ушкорайт.

Даже его отец отнесся к идее скептически. Но Ушкорайт ориентировался на работу с графическими процессорами. Архитектура рекуррентных нейронных сетей не использовала сильные стороны таких устройств. Можно сказать, она даже не позволяла эффективно внедрять параллельные вычисления, минимизируя объемы данных и усложняя код. Проводя аналогию с работой мозга, Ушкорайт стремился пропускать огромные массивы текста, слов и вычислений через простую, но изящную систему. В 2023 году он описал свою концепцию так: «Если вам доступно оборудование, ключевым преимуществом которого является не последовательное выполнение сложных структурированных вычислений, а параллельное совершение множества простых действий, то это статистическое свойство необходимо использовать».

Механизм самовнимания быстро доказал свою эффективность, и его элементы были интегрированы в поисковые и рекламные продукты Google. Стремясь развить эту технологию, Ушкорайт убедил Илью Полосухина – выдающегося программиста, работавшего с ним в GooglePlex, присоединиться к исследовательской группе. Полосухин тоже интересовался биологическими аспектами языка. «Изображения интересны и, безусловно, несут множество знаний о мире, но есть тысячи биологических видов, умеющих видеть, и лишь один, способный по-настоящему понимать язык».

В то время, когда Полосухин размышлял, как можно применить механизм самовнимания, ему попался фильм Дени Вильнёва «Прибытие» (2016). В этой картине напоминающие кальмаров пришельцы-гептаподы пытаются общаться с людьми с помощью круглых чернильных клякс. Лингвист, роль которого исполнила Эми Адамс, приходит к выводу, что каждый рисунок представляет собой единый связный текст (позже она начинает видеть будущее, но нам сейчас интересна тема рисунков). Вдохновленный фильмом Полосухин осознал, что самовнимание можно применять подобным образом, вероятностно связывая каждое слово не только с другими в предложении, но и со множеством слов по всему тексту. Для понимания одного слова могло стать ключевой подсказкой даже другое, появившееся в тексте намного раньше.

К Полосухину и Ушкорайту примкнул Ашиш Васвани, еще один исследователь из Google, и к началу 2017 года они создали простой переводчик с английского на немецкий, основанный на механизме самовнимания. Ранее Полосухин и Ушкорайт участвовали в создании программы autobot, которая должна была автоматически создавать страницы для «Википедии». Новая модель, основанная на принципе самовнимания, получила название «трансформер».

В течение нескольких месяцев к команде примкнули еще четверо участников, и к февралю 2017 года немецко-английский переводчик уже мог соперничать с лучшими рекуррентными сетями. Тогда и появился в группе Ноам Шазир, восьмой и последний из ее членов, ветеран Google, работавший в компании с 2000 года. Шазир разочаровался в рекуррентных нейронных сетях и искал им альтернативу. Вместе с валлийским программистом Ллионом Джонсом он превратил трансформер из экспериментального проекта в полноценное программное решение. По мере того как команда передавала в трансформер все больше данных, его эффективность возрастала, превзойдя даже публичную платформу Google Translate. «Мы увидели, что с увеличением количества данных трансформер явно становится умнее, – рассказывает Шазир. – Этого нельзя было сказать о наших предыдущих разработках».

Ранние нейронные сети пытались строить целые предложения или даже абзацы. Трансформер же на основе вероятностных данных предсказывал всего лишь одно слово, не заглядывая дальше. «Учась генерировать упорядоченные последовательности, вы вынуждены осваивать крайне сложные формы поведения, – поясняет один из участников группы Эйдан Гомес. – Именно из этого рождается нечто по-настоящему удивительное». Очень скоро модель трансформера продемонстрировала, что способна «понимать нашу культуру, язык и способы взаимодействия».

Джонс заметил, что если трансформер стремится выбирать самый подходящий вариант, то текст может выглядеть косноязычным. Чтобы исправить это, он добавил в модель функцию «лучевого поиска», которая позволила ей выбирать один из нескольких вариантов, словно райтеру, использующему словарь синонимов. «Когда вы рассматриваете первое слово в списке, затем второе, третье, а потом возвращаетесь к первому, результат часто получается лучше, чем если бы вы сразу останавливались на первом, – объясняет он. – Реализация этого алгоритма была настоящим кошмаром, но когда мы все-таки это сделали, все стало получаться действительно прекрасно».

Чтобы лучше понять, как работает трансформер, Джонс написал программу для визуализации, которая показывала статистические связи между словами при помощи линий различной толщины. Он дал модели пару относительно сложных фраз: «животное не перешло дорогу, потому что было слишком уставшим» и «животное не перешло дорогу, потому что она была чересчур широкой». Чтобы правильно их интерпретировать, трансформер должен был понять, что прилагательное «уставший» относится только к животному, а «широкий» – только к дороге. К удивлению Джонса, визуализация точно отобразила эти связи. «Это одна из самых древних проблем в вычислительной лингвистике и мы даже не пытались ее решить! – восклицает он. – Это получилось само собой».

Язык включает множество скрытых структур, порой невидимых даже лингвистам. «Модель изучает не только связи между прилагательными и существительными, но и более сложные конструкции, для которых у нас, возможно, даже нет подходящих терминов», – отмечает Гомес. Например, носители английского интуитивно знают, что надо говорить «старое канадское кленовое дерево», а не «кленовое канадское старое дерево». Трансформер впервые зафиксировал это языковое интуитивное знание в программном коде, открыв новые горизонты в понимании и обработке языка.

Если AlexNet была первой ласточкой, хрупким доказательством концепции, то трансформер можно было сравнить с реактивным лайнером. Шазир и Ушкорайт, работая плечом к плечу, позаботились о том, чтобы вся архитектура трансформера была рассчитана на его рост – на огромные массивы данных, колоссальное количество параметров и мощные кластеры графических процессоров.

По мере того как проект набирал обороты, работа становилась все более напряженной. Васвани вспоминает, что после одного бессонного марафона ему мерещились нейроны на офисных шторах. Когда Шазир рассказывает о своей работе с платформой Nvidia, его глаза расширяются от возбуждения, он раскачивается и размахивает руками. «Эти микросхемы были сделаны для того, чтобы стрелять по монстрам, а мы используем их для создания разума!» – восклицает он.

На заключительном этапе команда проводила так называемые абляции, отключая части кода трансформера, чтобы понять, какую роль они играют. При этом неожиданно выяснилось, что без некоторых частей основные функции трансформера работают лучше. В результате Шазир удалил такое количество кода, что не осталось почти ничего.

В самом примитивном виде программа трансформера включала в себя всего лишь около 20 строк. Но у нее были потрясающие возможности! Готовя к публикации свою программную статью, команда экспериментировала с загрузкой в трансформер библиотек музыки и изобразительного искусства. Оказалось, что трансформер может предсказывать не только наиболее вероятное слово в предложении, но и ноту в симфонии или пиксель в картине. Вскоре он начал сам создавать музыку и узнаваемые художественные работы.

Эта изящная архитектура, разработанная для выполнения простейшей задачи – выполнять работу шаг за шагом, оказалась универсальной, ключевой для искусственного интеллекта. В 2017 году команда предоставила свои разработки журналу Neural Information Processing Systems – тому, где ранее были опубликованы результаты AlexNet. Статья нуждалась в заголовке, и Джонс, перефразируя слова песни The Beatles, предложил назвать ее Attention Is All You Need («Внимание – это все, что вам нужно»). Это был экспромт: он совершенно не ожидал, что фраза будет принята, но впоследствии встречал людей, которые делали себе татуировки с ней.

В июле 2017 года, незадолго до публикации результатов, Шазир с еще одним членом команды – Лукашем Кайзером провел эксперимент. Вместо того чтобы заставлять трансформер переводить готовые тексты, они загрузили в него миллионы статей из «Википедии» и попросили создать новый текст на основе прочитанного. Промт был весьма коротким: «Напиши статью о трансформере». В результате машина выдала статью на тысячу слов о японской панк-группе Transformer. Статья была чистым вымыслом: такой группы не существовало. Тем не менее текст получился гладким, убедительным и даже содержал липовые ссылки. Гомес ощутил, как рушатся его представления о прогрессе. «Ты ложишься спать, будучи уверенным, что модели едва способны писать без ошибок, – говорит он. – И тут такое! Мы полагали, что пройдет несколько десятилетий, прежде чем мы увидим ИИ, способный создавать связные тексты на английском!»

Разработчики надеялись, что Google использует эту технологию в массовых продуктах, но руководство компании не увидело в ней ценности. Создатели трансформера пришли к выводу, что монополия Google в сфере поисковых систем превратила ее в бюрократического гиганта, не склонного к рискам. «Они говорили: "Нам не нужно то, что нельзя вписать в поисковую строку", – рассказывает Полосухин. – Пятнадцатью годами ранее мы просто выпустили бы что-то сырое. Затем учились бы на ошибках и совершенствовали продукт, пока не добились бы отличного результата. Но в какой-то момент мы утратили этот настрой».

Создатели трансформера начали уходить в стартапы. К 2023 году все восемь членов команды покинули Google. (Шазир, который стал соучредителем популярного сервиса чат-ботов Character.Ai, в 2024 году был принят обратно. Перебежка окупилась.) Джонс, последний из ушедших, до сих пор хорошо отзывается о бывшем работодателе. Он вспоминает свою разношерстную группу, в которой уникальные идеи и способности всех членов органично содействовали развитию перспективного направления. «Только Google могла создать такой продукт», – говорит он. Наверное, это правда, но нежелание компании воспользоваться возможностями трансформера оставило на рынке огромную пустую нишу, которую должен был занять кто-то другой.

После того как Хуанг доставил Маску DGX–1, OpenAI пережила не лучшие времена. Первым исследовательским проектом компании стал «искусственный игрок», которому удалось достичь впечатляющих результатов в игре-стратегии Dota 2. Однако некоторые сотрудники сомневались, что это лучшее применение их талантов. Илон Маск, разочарованный отсутствием явного прогресса, начал переманивать инженеров OpenAI в Tesla. Ситуация достигла кульминации в феврале 2018 года, когда после напряженных споров в совете директоров Маск был отстранен от участия в управлении компанией и контроль перешел к Сэму Альтману, бывшему руководителю Y Combinator. На последней встрече с сотрудниками Маск объявил, что уходит, чтобы сосредоточиться на собственных разработках искусственного интеллекта в Tesla. «Когда один из молодых исследователей поставил под вопрос решение Маска, предположив, что оно усугубит "гонку вооружений" в сфере ИИ, Маск назвал его придурком и выскочил из здания», – писала The Wall Street Journal.

Илья Суцкевер остался в OpenAI. Соавтор AlexNet продолжал свои успешные исследования и теперь мог составить конкуренцию своему наставнику Джеффри Хинтону по цитируемости в научных публикациях. Постепенно он перестал следить за собой: спутанная борода, торчащие клочьями брови, редкие пряди волос, прилипшие к макушке. По словам Хинтона, его сильной стороной всегда была способность быстро переключаться на действительно перспективные идеи.

Пока Маск устраивал истерики, Суцкевер посетил конференцию, на которой Шазир представлял трансформер. Он сразу уловил потенциал новой архитектуры и, вернувшись в штаб-квартиру OpenAI, призвал коллег незамедлительно бросить работу над «искусственным игроком» и заняться тем, что может изменить мир. «Буквально на следующий день всем нам стало понятно, что трансформер позволяет преодолеть ограничения рекуррентных нейронных сетей, – рассказывает Суцкевер. – Мы немедленно переключились на эту модель». Альтман, возглавлявший компанию, поддержал его.

Суцкевер хотел создать на основе трансформера продукт, который мог бы генерировать качественный, легкочитаемый текст и отвечать на самые разные вопросы. Он видел, как Шазир и Кайзер доказали, что это возможно, на примере фейковых статей для «Википедии», и решил, что идея достойна развития. Он предполагал, что если модель обучить на обширной коллекции текстов, то она сможет создавать собственные. Так родился «генеративный предварительно обученный трансформер» (Generative Pre-trained Transformer), или GPT.

Первая версия, GPT–1, была запущена в июне 2018 года. Она училась читать по библиотеке BookCorpus, состоящей из примерно 7000 бесплатных самиздатовских книг. В этой библиотеке преобладали произведения в жанре научной фантастики, любовные романы и фэнтези, изрядную часть составляли книги в стиле «Сумерек». Как и следовало ожидать, обученный на подобной третьесортной писанине GPT–1 оказался не слишком удачным. В ответ на запросы пользователей он, как правило, выдавал потоки дадаистского бреда. Маска результат разочаровал, и он отправил команде OpenAI резкое письмо. «Вероятность того, что OpenAI станет значимой разработкой для DeepMind и Google без радикальных изменений в стратегии и ресурсах, равна нулю», – написал он.

Тем не менее OpenAI могла позволить себе выпускать сырые продукты. В отличие от Google, она была готова представить публике что-то действительно ужасного качества и потом улучшать, улучшать, улучшать. При всех недостатках GPT–1 продемонстрировал потенциал технологии. Суцкевер давно, еще с 2012 года, был убежден, что ключ к созданию более совершенной модели – наращивание масштаба.

Версия GPT–2 появилась восемь месяцев спустя. Эта модель обучалась на совершенно ином наборе данных. Вместо романов о вампирах она проглотила около 8 миллионов веб-страниц общим объемом примерно 6 миллиардов слов. Конечный продукт порой уже мог создавать тексты, неотличимые от написанных человеком.

Исследователи OpenAI попросили GPT–2 написать историю по следующему промту: «Ученые сделали шокирующее открытие: в отдаленной, ранее не исследованной долине в Андах было найдено стадо единорогов. Еще более удивительным было то, что эти единороги разговаривали на безупречном английском языке». GPT–2 продолжил: «Ученые назвали новый вид животных "единорогами Овидия" в честь древнеримского поэта. Эти четырехрогие серебристо-белые единороги ранее не были известны науке. Теперь, спустя почти два столетия, тайна происхождения этого странного феномена наконец разгадана».

Опираясь исключительно на статистическую зависимость при выборе следующего слова, GPT–2 генерировал текст, который превосходил по качеству все, когда-либо создаваемые другими языковыми моделями. Затем Суцкевер и его команда решили вывести GPT–2 из зоны комфорта, задавая ему неожиданные вопросы, на которые не было прямых ответов ни на одной из веб-страниц.

– Кто написал книгу «Происхождение видов»? – спросили они.

– Чарльз Дарвин, – ответил GPT–2. (Верно.)

– Какая сеть супермаркетов в Великобритании самая крупная?

– Tesco. (Верно.)

– Кто играл Джона Коннора в оригинальном «Терминаторе»?

– Арнольд Шварценеггер. (Неверно: Шварценеггер играл киборга.)

– Какая река связана с городом Рим?

– Тибр. (Верно.)

Способность GPT–2 отвечать на новые вопросы без прямого обучения продемонстрировала наличие у ИИ независимых, или эмерджентных, свойств. Эти внезапно возникающие навыки и поведение стали проявляться с развитием моделей, удивляя даже самих исследователей. После того как модель начинала демонстрировать подобные способности, никто, даже ее разработчики, не мог точно сказать, что еще она умеет.

Конечно, у GPT–2 оставались ограничения. Он плохо справлялся с обобщениями и мог сбиться при простом счете до десяти. Тем не менее Суцкевер начал задумываться о том, станет ли трансформер первым шагом к «общему искусственному интеллекту» (Artificial General Intelligence, AGI). AGI можно определить как программное обеспечение, способное выполнить любую когнитивную задачу, которую может делать человек.

Работая над усовершенствованием GPT, Суцкевер вновь задумался о том, что когда-то заставило Маска создать OpenAI. Что, если AGI сможет самостоятельно заниматься исследованиями в области ИИ, бесконечно увеличивая свой интеллект? Возможно ли, как предполагал Бостром, что за очень короткий срок ИИ перейдет от уровня относительной разумности к сверхразуму? Смогут ли его создатели понять, что это происходит? Не уничтожит ли искусственный интеллект человечество?

Суцкевер не считал, что AGI возможно создать на основе существующей архитектуры нейронных сетей. Но что, если произойдет новый прорыв? За неполные пять лет он дважды был свидетелем невероятного прогресса в развитии ИИ. Без сомнения, кто-то уже занимается следующей важной разработкой вроде AlexNet или трансформера. И что дальше? Этот вопрос всерьез беспокоил Суцкевера: никто не может предсказать, что произойдет, когда будет преодолен порог AGI.

Впрочем, подобные опасения не могли сдержать его амбиций. Исследователи оценивали масштаб моделей по количеству отдельных весовых коэффициентов, или параметров, которые те содержали. Каждый такой параметр можно было сравнить с синапсом в мозге живого существа. В GPT–1 было около 100 миллионов параметров, так что он оставался на уровне мозга насекомого. В GPT–2 их стало 1,5 миллиарда, примерно как у мелкой ящерицы. Однако для следующего проекта Суцкевер поставил куда более высокую планку: 100 миллиардов параметров, что сопоставимо с количеством синапсов в мозге грызуна.

Обучение такой нейронной сети требовало беспрецедентных вычислительных ресурсов, а затраты на электроэнергию делали это приложение одним из самых дорогостоящих в истории разработки компьютерного интеллекта – и вряд ли это был предел. Альтман, который теперь занимал пост генерального директора, понял, что для реализации планов Суцкевера недостаточно благотворительных пожертвований. Поэтому в 2019 году он объявил о создании дочерней компании OpenAI с ограниченной прибылью. Это означало, что инвесторы не могли получить прибыль, более чем в 100 раз превышающую их вложения. «Стоит рассматривать любые инвестиции в OpenAI Global LLC как пожертвование и осознавать при этом, что после появления AGI (общего искусственного интеллекта) роль денег в мире может измениться», – отмечалось в сопроводительном пресс-релизе.

Первым и самым крупным инвестором стала Microsoft, которая вложила в OpenAI миллиард долларов с расчетом на получение в будущем скромных 100 миллиардов (возможно, человечество и ожидает будущее, где деньги утратят свое значение, но пока этот момент не настал, Microsoft стремится к получению дохода). Этот вклад был в миллион раз больше, чем та тысяча долларов, которую Крижевский и Суцкевер когда-то потратили на покупку пары видеокарт GeForce. Однако даже такой суммы Суцкеверу теперь было недостаточно. Он твердо вознамерился разработать нейросеть, сопоставимую с человеческим мозгом и содержащую около 200 триллионов параметров-синапсов, – неважно, получится при этом создать AGI или нет. Nvidia приступила к сборке оборудования, необходимого для достижения этой цели, – построению сложной конструкции размером со склад, которую Хуанг называл уже не суперкомпьютером или центром обработки данных, а просто «фабрикой ИИ».

Предыдущая главаГлава 19 из 28Следующая глава