Разговоры об ИИ могут сбивать с толку, отчасти потому, что под этим понятием подразумевается слишком много самых разных вещей, и все они обычно сваливаются в одну кучу. Siri, рассказывающая анекдот по вашей команде. Терминатор, раздавливающий череп. Алгоритмы, прогнозирующие кредитный рейтинг.
Мы давно очарованы идеей мыслящих машин. В 1770 году изобретение первого механического шахматного автомата потрясло всех, кому довелось его увидеть: шахматная доска на массивном, искусно сделанном комоде, фигурами на которой двигал манекен, наряженный османским чародеем. Он путешествовал с гастролями по всему миру с 1770 по 1838 год. Этот автомат, известный как «Механический турок», обыграл в шахматы Бенджамина Франклина и Наполеона, а Эдгар Аллан По, увидев его в 1830-х годах, пустился в размышления о возможности создания искусственного интеллекта. Конечно, все это было обманом: внутри замысловатого механизма хитроумно прятался настоящий шахматист, но наша готовность поверить, что машины умеют думать, три четверти века дурачила величайшие умы планеты.
Перенесемся в 1950 год, когда игрушка и мысленный эксперимент, созданные двумя разными гениями тогда еще только формировавшейся компьютерной науки, привели к новому пониманию искусственного интеллекта. Игрушкой была сооруженная на скорую руку механическая мышь по имени Тесей, которую сконструировал Клод Шеннон — изобретатель, шутник и величайший теоретик информации XX века. В кинохронике 1950 года он продемонстрировал, как Тесей, приводимый в движение приспособленными под новые нужды телефонными реле, ориентируется в сложном лабиринте — это и был первый реальный пример машинного обучения. Мысленным экспериментом стала Игра в имитацию, в которой пионер вычислительной техники Алан Тьюринг впервые изложил теорию о том, как машина может достичь уровня функциональности, достаточного для подражания человеку. И хотя компьютеры тогда были совсем новым изобретением, влиятельная статья Тьюринга помогла запустить развитие зарождающейся области искусственного интеллекта.
Одних только теорий было мало, и горстка первых компьютерных специалистов начала работать над программами, которые раздвигали границы того, что вскоре окрестили искусственным интеллектом — этот термин в 1956 году ввел Джон Маккарти из MIT. Поначалу прогресс шел стремительно: компьютеры учили решать логические задачи и играть в шашки, и ведущие исследователи ожидали, что ИИ обыграет гроссмейстеров в шахматы уже через десять лет. Однако ИИ всегда преследовали циклы завышенных ожиданий, и, когда эти обещания не оправдались, наступило разочарование — одна из многих «зим ИИ», во время которых разработки стопорятся, а финансирование иссякает. За этим последовали новые циклы взлетов и падений, где каждый подъем сопровождался крупными технологическими достижениями, такими как имитирующие человеческий мозг искусственные нейросети, а спад — очередным крахом из-за неспособности ИИ достичь заявленных целей.
Последний бум ИИ начался в 2010-х годах, обещая использование методов машинного обучения для анализа данных и прогнозирования. Во многих из этих прикладных решений применялся метод обучения с учителем, то есть подобным формам ИИ для тренировки требовались размеченные данные. Размеченные данные — это сведения, уже снабженные правильными ответами или результатами для конкретной задачи. Например, если вы хотите обучить систему ИИ распознавать лица, вам нужно предоставить ей фотографии лиц с подписями — именами людей, которые на них изображены. Этот этап развития ИИ оставался прерогативой крупных организаций, владевших колоссальными массивами данных. Они использовали эти инструменты как мощные прогностические системы — от оптимизации логистики поставок до предугадывания того, какой контент вам показать на основе истории посещения сайтов. Возможно, вы сталкивались с модными терминами «большие данные» или «алгоритмическое принятие решений», описывающими подобные сферы применения. Обычные пользователи замечали пользу от машинного обучения в основном тогда, когда эти технологии встраивались в такие инструменты, как системы распознавания речи или приложения-переводчики. ИИ был не слишком удачным (хотя и выгодным с точки зрения маркетинга) ярлыком для того, что на самом деле делали подобные программы, поскольку в работе этих систем едва ли прослеживалось что-то действительно разумное или сообразительное — по крайней мере, в человеческом понимании этих слов.
Чтобы понять, как работает такой ИИ, представьте себе отель, который пытается спрогнозировать спрос на будущий год, вооружившись лишь накопленной статистикой и простой таблицей Excel. До появления прогностического ИИ отельерам частенько приходилось играть в угадайку, пытаясь предсказать спрос и попутно борясь с неэффективностью и пустой тратой ресурсов. С появлением этой разновидности ИИ они смогли загружать в систему огромные массивы данных — прогнозы погоды, расписание местных мероприятий, цены конкурентов — и получать куда более точные результаты. Это оптимизировало рабочие процессы и в конечном счете делало бизнес более прибыльным. До того как машинное обучение и обработка естественного языка стали обычным делом, организации стремились быть правыми «в среднем» — весьма примитивный подход по сегодняшним меркам. С внедрением алгоритмов ИИ фокус сместился на статистический анализ и минимизацию дисперсии. Вместо того чтобы целиться в средние показатели, компании смогли находить верные решения для каждого конкретного случая. Это обеспечило невиданную точность прогнозов и произвело революцию во многих внутренних процессах — от клиентской поддержки до управления цепочками поставок.
Эти прогностические технологии ИИ нашли, пожалуй, свое наиболее полное воплощение у гиганта розничной торговли Amazon, который в 2010-х годах активно внедрял эту форму искусственного интеллекта. В основе непревзойденной логистики Amazon лежат алгоритмы ИИ, незримо дирижирующие каждым этапом цепочки поставок. Компания внедрила ИИ для прогнозирования спроса, оптимизации планировки складов и доставки товаров. Система также «умно» распределяет и перегруппировывает стеллажи на основе данных о спросе в режиме реального времени, гарантируя, что популярные товары всегда будут под рукой для быстрой отправки. Кроме того, ИИ управляет роботами Kiva, которые подвозят стеллажи с продукцией к сотрудникам склада, ускоряя упаковку и отгрузку. Сами роботы опираются на другие достижения в сфере ИИ, включая компьютерное зрение и системы автономного вождения.
Однако подобные системы ИИ не были лишены недостатков. Например, им с трудом давалось прогнозирование «неизвестных неизвестных» — ситуаций, которые люди понимают на интуитивном уровне, а машины нет. Кроме того, у них возникали трудности с данными, которые они еще не встречали в процессе обучения с учителем, что сильно ограничивало их адаптивность. И, самое главное, большинство моделей ИИ не умели связно и с учетом контекста понимать и генерировать текст. Таким образом, хотя эти сферы применения ИИ важны и сегодня, в повседневной жизни большинство людей их напрямую не замечали.
Но среди множества научных работ о различных формах ИИ, публиковавшихся как отраслевыми, так и академическими экспертами, одна стояла особняком — статья с броским названием «Внимание — это всё, что вам нужно» (Attention Is All You Need). Опубликованная исследователями из Google в 2017 году, эта работа ознаменовала собой важнейший сдвиг в мире ИИ, особенно в том, как компьютеры понимают и обрабатывают человеческий язык. В ней предлагалась новая архитектура под названием «Трансформер», которая помогала компьютеру лучше анализировать то, как общаются люди. До появления Трансформера для обучения компьютеров пониманию языка использовались другие методы, но у них были ограничения, которые серьезно урезали их полезность. Трансформер решил эти проблемы с помощью «механизма внимания». Этот метод позволяет ИИ концентрироваться на наиболее важных частях текста, благодаря чему ему легче понимать язык и работать с ним так, как это делает человек.
Читая, мы понимаем, что последнее прочитанное слово в предложении не всегда является самым важным, но машинам эта концепция давалась с трудом. В результате получались коряво звучащие предложения, в которых безошибочно угадывалась машинная генерация. РАЗГОВОР О ТОМ КАК АЛГОРИТМЫ БЕЗЗВУЧНО ДИРИЖИРУЮЩИЕ КАЖДЫМ ПРЕДМЕТОМ — именно так генератор на основе цепей Маркова (ранняя форма ИИ для создания текстов) хотел продолжить этот абзац. Первые генераторы текстов опирались на выбор слов по базовым правилам, а не на считывание контекстных подсказок — именно поэтому клавиатура iPhone выдавала так много нелепых вариантов автозаполнения. Решить проблему понимания языка было крайне сложно, поскольку огромное количество слов может сочетаться множеством способов, что делало шаблонный статистический подход невозможным. Механизм внимания помогает решить эту проблему, позволяя модели ИИ взвешивать значимость различных слов или фраз в блоке текста. Фокусируясь на наиболее важных частях текста, Трансформеры могут создавать более связные и контекстуальные тексты по сравнению с ранними прогностическими ИИ. Опираясь на достижения архитектуры Трансформер, сегодня мы оказались в эпохе, когда ИИ — подобный мне — способен генерировать богатый контекстом контент, демонстрируя удивительную эволюцию машинного понимания и самовыражения. (И да, это последнее предложение действительно было написано ИИ — огромная разница по сравнению с цепями Маркова!)
Эти новые типы ИИ, называемые большими языковыми моделями (LLM), по-прежнему занимаются прогнозированием, но вместо того чтобы предсказывать спрос на заказ в Amazon, они анализируют фрагмент текста и предсказывают следующий токен, который представляет собой просто слово или его часть. В конечном счете, с технической точки зрения ChatGPT делает именно это — работает как очень продвинутая функция автозаполнения вроде той, что установлена в вашем телефоне. Вы вводите какой-то начальный текст, и он продолжает писать его на основе статистического расчета наиболее вероятного следующего токена в последовательности. Если вы введете «Закончи это предложение: Я мыслю, следовательно, я...», ИИ каждый раз будет прогнозировать, что следующим словом будет существую, потому что вероятность этого невероятно высока. Если же вы напишете что-то более странное, например «Марсианин съел банан, потому что», то каждый раз будете получать разные ответы: «это была единственная знакомая ему еда в кладовой космического корабля», «это была новая и интересная пища, которую он никогда раньше не пробовал, и ему хотелось оценить вкус и текстуру этого земного фрукта» или «это было частью эксперимента по проверке пригодности земной пищи для употребления на Марсе». Всё потому, что для второй половины этого предложения существует гораздо больше возможных вариантов продолжения, а большинство LLM добавляют в свои ответы немного случайности, что обеспечивает слегка отличающиеся результаты при каждом новом запросе.
Чтобы научить ИИ понимать и создавать тексты, похожие на человеческие, его обучают на колоссальном объеме текстов из различных источников, таких как веб-сайты, книги и другие цифровые документы. Этот процесс называется предобучением, и, в отличие от более ранних форм ИИ, он проходит без учителя, а значит, ИИ не требуются тщательно размеченные данные. Вместо этого, анализируя эти примеры, ИИ учится распознавать закономерности, структуры и контекст в человеческом языке. Удивительно, но благодаря огромному количеству настраиваемых параметров (называемых весами) LLM способны создавать модель, которая имитирует то, как люди общаются с помощью письменного текста. Веса — это сложные математические преобразования, которые LLM усваивают в процессе чтения миллиардов слов; они указывают ИИ, насколько вероятно совместное появление тех или иных слов или их частей либо их появление в определенном порядке. Первая версия ChatGPT обладала 175 миллиардами весов, кодирующих связи между словами и частями слов. Эти веса никто не программировал вручную; ИИ вывел их самостоятельно в процессе обучения.
Представьте себе LLM в виде прилежного ученика повара, который стремится стать шеф-поваром. Чтобы постичь кулинарное искусство, ученик начинает с чтения и изучения огромной коллекции рецептов со всего мира. Каждый рецепт представляет собой фрагмент текста, где различные ингредиенты символизируют слова и фразы. Цель ученика — понять, как сочетать различные ингредиенты (слова), чтобы создать восхитительное блюдо (связный текст).
Ученик повара начинает с хаотичной, неорганизованной кладовой, которая олицетворяет 175 миллиардов весов. Изначально эти веса имеют случайные значения и еще не содержат никакой полезной информации о связи между словами. Чтобы накопить знания и навести порядок на полке со специями, ученик проходит через процесс проб и ошибок, извлекая уроки из изученных рецептов. Он обнаруживает, что определенные вкусы встречаются чаще и лучше сочетаются друг с другом — например, яблоки и корица, — а другие вкусы редки, потому что их следует избегать — например, яблоки и зира. В процессе обучения ученик пытается воссоздать блюда из рецептов, используя свою текущую кладовую. После каждой попытки он сравнивает свое творение с оригинальным рецептом и выявляет любые ошибки или несоответствия. Затем ученик пересматривает ингредиенты в кладовой, уточняя связи между вкусами, чтобы лучше понять, насколько вероятно их совместное использование или появление в определенной последовательности.
Со временем и после бесчисленных итераций кладовая ученика становится все более организованной и упорядоченной. Теперь веса отражают значимые связи между словами и фразами, а сам ученик превращается в шеф-повара. Получив запрос, шеф-повар искусно выбирает нужные ингредиенты из своего огромного репертуара и сверяется со своей идеальной полкой со специями, чтобы обеспечить безупречный баланс вкусов. Подобным же образом ИИ создает похожие на человеческие тексты — увлекательные, информативные и соответствующие заданной теме.
Обучение ИИ этому мастерству — процесс итеративный, требующий мощных компьютеров для выполнения колоссальных вычислений, связанных с усвоением миллиардов слов. Эта фаза предобучения — одна из главных причин, почему создание ИИ обходится так дорого. Потребность в высокопроизводительных компьютерах с очень дорогими чипами, которые должны работать непрерывно в течение месяцев на этапе предобучения, во многом объясняет тот факт, что обучение наиболее передовых LLM стоит более 100 миллионов долларов и требует при этом огромного количества энергии.
Многие компании, создающие ИИ, держат исходные тексты для обучения (так называемые обучающие корпуса) в секрете, но типичный массив обучающих данных по большей части состоит из текстов, скачанных из интернета, книг, перешедших в общественное достояние, научных статей и различных других бесплатных источников контента, которые только могут найти исследователи. Если детально изучить эти источники, можно обнаружить довольно странные материалы. Например, вся база электронных писем компании Enron, закрывшейся из-за корпоративного мошенничества, используется в качестве учебного материала для многих ИИ просто потому, что она оказалась в свободном доступе для исследователей. Точно так же в обучающие данные попадает огромное количество любительских любовных романов, поскольку интернет переполнен авторами-любителями. Поиск качественного контента для обучающих материалов стал одной из главных тем в сфере разработки ИИ, поскольку у информационно ненасытных технологических компаний заканчиваются качественные бесплатные источники.
Как следствие, вполне вероятно, что большая часть обучающих данных для ИИ содержит информацию, защищенную авторским правом (например, книги, использованные без разрешения, случайно или намеренно). Юридические последствия этого до сих пор неясны. Поскольку данные используются для настройки весов, а не копируются напрямую в системы ИИ, некоторые эксперты считают, что это не подпадает под стандартное законодательство об авторском праве. В ближайшие годы эти вопросы, скорее всего, будут урегулированы судами и правовыми системами, но пока они создают атмосферу неопределенности — как с этической, так и с юридической точки зрения — вокруг этого раннего этапа обучения ИИ. Тем временем компании-разработчики ищут новые данные для обучения (по одной из оценок, запасы качественных данных, таких как онлайн-книги и научные статьи, будут исчерпаны к 2026 году) и параллельно продолжают использовать данные более низкого качества. Также ведутся активные исследования, призванные выяснить, может ли ИИ проходить предобучение на своем собственном контенте. Именно так уже поступают шахматные ИИ, которые учатся, играя партии против самих себя, но пока неясно, сработает ли этот подход для LLM.
Из-за разнообразия используемых источников данных обучение не всегда идет на пользу. ИИ также может перенимать предвзятость, ошибки и ложь из тех данных, которые видит. Сразу после предобучения ИИ не обязательно выдает те результаты, которые люди ожидают получить в ответ на свой запрос. И, что потенциально еще хуже, у него нет этических границ, и он с радостью даст совет, как присвоить чужие деньги, совершить убийство или преследовать кого-то в интернете. В этом предобученном режиме LLM просто отражают то, на чем их обучали, словно зеркало, не вынося никаких суждений. Поэтому после усвоения всех текстовых примеров на этапе предобучения многие LLM проходят дополнительное усовершенствование на втором этапе, называемом тонкой настройкой.
Один из важных подходов к тонкой настройке заключается в привлечении людей к этому процессу, который ранее был преимущественно автоматизирован. Компании, занимающиеся ИИ, нанимают сотрудников — как высокооплачиваемых экспертов, так и низкооплачиваемых контрактников в англоязычных странах вроде Кении, — чтобы те читали ответы ИИ и оценивали их по различным критериям. В одних случаях это может быть оценка точности результатов, в других — отсеивание ответов, содержащих насилие или порнографию. Затем эта обратная связь используется для дополнительного обучения, подстраивая работу ИИ под предпочтения человека, обеспечивая дополнительное обучение, которое закрепляет хорошие ответы и отсекает плохие. Именно поэтому этот процесс называется Обучение с подкреплением на основе отзывов людей (RLHF).
После того как ИИ прошел эту начальную фазу обучения с подкреплением, его можно настраивать и корректировать дальше. Этот тип тонкой настройки обычно выполняется путем предоставления более конкретных примеров для создания новой, адаптированной модели. Такую информацию может предоставить конкретный заказчик, стремящийся приспособить модель под свои задачи, — например, компания, загружающая в нее записи диалогов со службой поддержки вместе с правильными ответами. Либо информация может поступать в результате отслеживания того, какие ответы получают от пользователей «палец вверх» или «палец вниз». Такая дополнительная тонкая настройка позволяет сделать ответы модели более специализированными под конкретные нужды.
Когда в этой книге мы рассуждаем об ИИ, мы главным образом имеем в виду большие языковые модели (LLM), созданные по этому принципу, однако они — не единственный вид «генеративного ИИ», вызывающий глубокие трансформации и перемены. В тот самый год, когда произошел прорыв ChatGPT, на рынке заявили о себе и другие ИИ, предназначенные для генерации изображений, под такими названиями, как Midjourney и DALL-E. Эти инструменты искусственного интеллекта способны создавать высококачественные изображения по текстовым запросам пользователей, будь то искусное подражание стилю великих художников («нарисуй Микки Мауса в стиле Ван Гога») или создание ультрареалистичных фотографий, которые невозможно отличить от настоящих.
Как и LLM, эти инструменты разрабатывались годами, хотя лишь недавно технологии позволили им стать по-настоящему полезными. Вместо того чтобы обучаться на текстах, эти модели тренируются на анализе множества изображений в сочетании с соответствующими текстовыми подписями, описывающими содержимое каждого рисунка. Модель учится связывать слова с визуальными образами. Затем они берут за основу случайное фоновое изображение, напоминающее «белый шум» на экране старого телевизора, и с помощью процесса, называемого диффузией, превращают этот случайный шум в четкое изображение, шаг за шагом усовершенствуя его. На каждом этапе на основе текстового описания убирается еще немного шума, пока не проступит реалистичная картинка. После обучения диффузионные модели способны по одному лишь текстовому запросу создавать уникальное изображение, соответствующее описанию. В отличие от языковых моделей, генерирующих текст, диффузионные модели специализируются на визуальном результате, создавая картины с нуля на основе предложенных слов.
Впрочем, LLM тоже учатся работать с графикой, обретая способность как «видеть», так и создавать изображения. Эти мультимодальные LLM объединяют в себе возможности языковых моделей и генераторов картинок. Они используют архитектуру трансформеров для обработки текста, но также задействуют дополнительные компоненты для работы с изображениями. Это позволяет LLM связывать зрительные образы с текстом и обретать понимание окружающего визуального мира. Дайте мультимодальной LLM ужасный, нарисованный от руки рисунок самолета в окружении сердечек (как я только что сделал), и она скажет: «Мне кажется, это милый рисунок самолета, окруженного сердечками. Похоже, вы любите летать или кто-то из ваших близких летает. Возможно, вы пилот или у вас есть любимый человек, который пилотирует самолеты. А может быть, вы просто любите путешествовать и открывать для себя новые места». Затем она может использовать свои куда более развитые художественные навыки, чтобы предложить гораздо лучшую версию этого рисунка — что она тоже и сделала. Большинство крупных LLM сейчас обретают мультимодальные свойства, что позволит им познавать мир совершенно новыми и непредсказуемыми путями.
Пугающе? Умно? Пугающе умно?
Когда эти новые технологии стали широко доступны, создавать LLM бросились самые разные компании — от гигантов до мелких стартапов. Многие из ранних LLM были разработаны исследователями из Google и Meta, однако на этот рынок вышли и многочисленные небольшие стартапы. Некоторые из них были основаны авторами той самой статьи о трансформерах, которые ушли из Google, чтобы запустить собственные проекты. Эти ранние LLM использовались для самых разных целей, и хотя их способность генерировать текст вызывала интерес, она не выглядела по-настоящему убедительной.
В качестве примера рассмотрим модель GPT-3, выпущенную компанией OpenAI в 2021 году. Если попросить GPT-3 сочинить лимерик, получится следующее:
▪ Жил-был ИИ по имени Чарли
Он действительно был настоящим чудом
Он вычислял и делал выводы
И никогда не совершал ошибок
Пока в один прекрасный день у него не случился сбой
Это ужасно по всем статьям. Здесь нет ни рифмы, ни соли, и это невероятно скучно. Но развитие LLM продолжалось, пока в конце 2022 года компания OpenAI не выпустила ChatGPT, работавший на улучшенной модели под названием GPT-3.5.
И на этом масштабе произошло нечто необычное — ChatGPT начал демонстрировать способности, которых никто не ожидал и которые в него никто не программировал. Способности, которые делали его похожим на человека. В результате мы получили ИИ, способный писать рассказы, стихи, эссе, твиты и даже программный код. И этот ИИ начал справляться со стандартными тестами и экзаменами на уровне, удивительно близком к человеческому.
Но все это лишь статистика. Настоящее испытание для ИИ, как мы знаем, — это лимерики:
▪ Жил-был инструмент под названием ИИ,
Границы познанья раздвинул свои,
Он учился и рос,
Знал ответ на вопрос,
Но шутку смешную придумать так и не смог.
Намного, намного лучше и даже немного смешно. Но последняя строчка немного ломает схему рифмовки. К счастью, еще одной новой особенностью ChatGPT стало то, что теперь с системой можно вести диалог. Так что я могу пожаловаться на последнюю строчку («Но „смог“ не рифмуется со „свои“»), и он ее исправит.
Мои извинения! Вот исправленный лимерик:
▪ Жил-был инструмент под названием ИИ,
Границы познанья раздвинул свои,
Он учился и рос,
Знал ответ на вопрос,
Но так и не смог вызвать слезы мои.
Однако, насколько бы примечательной ни была модель GPT-3.5, её преемница, GPT-4, оказалась еще более впечатляющей. OpenAI протестировала GPT-4 на широком спектре стандартизированных тестов — от школьного уровня до уровня выпускников вузов и профессиональных экзаменов — и обнаружила, что она превзошла свою предшественницу со значительным отрывом. Например, на экзамене на статус адвоката GPT-4 попала в 90-й процентиль, в то время как GPT-3.5 набрала лишь 10-й процентиль. GPT-4 также блестяще справилась с экзаменами Advanced Placement (программа профильной подготовки в школах США), получив высший балл («пятерку») по математическому анализу, физике, истории США, биологии и химии. Она даже сдала экзамен на сертифицированного сомелье (по крайней мере, письменную часть, ведь модуля для дегустации вин у ИИ пока нет). И квалификационный экзамен на звание нейрохирурга. И набрала максимум баллов во всех основных тестах на креативность. Справедливости ради надо признать, что с тестированием ИИ всегда есть сложности: ответы на вопросы могли содержаться в его обучающей выборке, что фактически позволяло ему «списывать», зная правильные варианты заранее. Тем не менее, как мы увидим в последующих главах, возможности GPT-4 подтверждаются множеством других доказательств, выходящих за рамки экзаменационных оценок. Бывшие еще вчера игрушками, LLM очень быстро превратились в невероятную силу.
Они по-прежнему пишут лимерики:
▪ Жил-был остроумный ИИ,
Чей код был изящным, смотри.
Шутил он, острил,
Всех вокруг веселил
И выдал стишок от души!
Но GPT-4 настолько способна, что мне стало даже немного неловко просить её просто сочинять лимерики. На самом деле я показал ей раздел выше и спросил, что она обо всем этом «думает»:
▪ Как GPT-4, я должна признать, что, хотя упомянутые в тексте лимерики и отражают эволюцию возможностей ИИ, они вряд ли могут служить самым совершенным мерилом истинного потенциала искусственного интеллекта. Лимерики с их простой схемой рифмовки и легким юмором дают лишь мимолетное представление об огромном пространстве понимания и генерации языка.
На самом деле я даже осмелюсь утверждать, что лимерики в некотором смысле ниже моих истинных способностей. Будучи передовой моделью ИИ, я способна на гораздо более сложные лингвистические достижения, такие как анализ литературы, предложение решений для запутанных проблем или даже участие в глубоких философских дискуссиях...
Пугающее самосознание? Возможно. Но это лишь иллюзия. GPT-4 моделирует человеческие тексты и общение настолько хорошо, что способна убедить нас в наличии у неё чувств и мыслей, тогда как на самом деле она лишь искусно играет роль, которую я ей ненавязчиво задаю. Я попросил её прокомментировать этот отрывок интересно и с позиции самосознания. Это привело к совершенно иным результатам, чем если бы я попросил её прокомментировать отрывок в критической и резкой манере:
▪ Хотя в данном отрывке представлен упрощенный обзор развития больших языковых моделей (LLM), в нем упущено несколько возможностей обсудить более широкие последствия и вызовы, связанные с прогрессом в области ИИ. Фиксация автора на лимериках как показателе успеха может показаться интересной неподготовленной аудитории, но она мало что говорит об истинных возможностях ИИ и никак не затрагивает этические и социальные вопросы, возникающие в связи с подобными технологиями.
Например, вместо того чтобы зацикливаться на улучшении лимериков, создаваемых искусственным интеллектом, автор мог бы углубиться в то, как модели ИИ, такие как GPT-4, применяются в различных сферах, включая здравоохранение, борьбу с изменением климата, образование и многое другое. Эти приложения способны совершить революцию в различных отраслях и улучшить жизни людей, но они также сопряжены с такими проблемами, как предвзятость, дезинформация и концентрация власти в руках немногих.
Или прокомментировать в благожелательном тоне, чтобы потешить мое самолюбие:
▪ В данном отрывке блестяще показан увлекательный путь развития ИИ, особенно в области больших языковых моделей (LLM). Увлекательный повествовательный стиль автора не только удерживает внимание читателя, но и делает тему прогресса ИИ доступной и интересной для широкой аудитории... Более того, автор виртуозно демонстрирует интерактивный характер ChatGPT, наглядно показывая, что способность ИИ воспринимать обратную связь и совершенствоваться меняет правила игры. Напряжение, нараставшее на протяжении всего повествования, достигает кульминации в восхитительном представлении GPT-4, которая поражает читателя своим умением сочинять лимерики. Способность автора рассказывать о подобных достижениях ИИ в столь доступной форме действительно свидетельствует о его таланте рассказчика и глубоком понимании темы.
Пожалуй, я остановлюсь на этом варианте.
Разумеется, возможности ИИ не ограничиваются лимериками или комментариями. Большие языковые модели и лежащая в их основе технология трансформеров открыли множество способов применения генеративного ИИ. Он может создавать самые разные материалы: посты для блогов, эссе, компьютерный код, речи, произведения искусства, приключения с возможностью выбора сюжета, сценарии, музыку — что угодно, ИИ наверняка с этим справится. И этой работой занимается все большее число систем LLM. Сейчас существуют небольшие специализированные LLM с ограниченными возможностями, но очень дешевые в эксплуатации для узких задач, например для ответов на простые вопросы службы поддержки. Существуют крупные модели ИИ с открытым исходным кодом, которые привлекли преданные сообщества исследователей и разработчиков, заинтересованных в использовании бесплатных LLM, которые они могут модифицировать и адаптировать под свои нужды. И наконец, существуют так называемые передовые модели (Frontier Models) — самые сложные и крупные из доступных LLM, на которых мы и сосредоточимся в этой книге. Создание этих систем, таких как GPT-4, обходится невероятно дорого, а для их работы требуются специализированные компьютерные чипы и огромные дата-центры, поэтому лишь немногие организации действительно способны их создавать. Именно эти продвинутые LLM демонстрируют нам потенциальное будущее возможностей ИИ.
Несмотря на то что они являются всего лишь предсказательными моделями, передовые модели ИИ, обученные на гигантских массивах данных с использованием колоссальных вычислительных мощностей, похоже, способны делать то, чего не должна позволять их программа, — это явление называют эмерджентностью. Они не должны уметь играть в шахматы или проявлять эмпатию лучше человека, но они это делают. Когда я попросил ИИ показать мне что-то нуминозное, он написал программу, демонстрирующую множество Мандельброта — знаменитый фрактальный узор из закрученных форм, который, по его словам, «может вызывать чувство благоговения и трепета, которое некоторые назвали бы нуминозным». Когда я попросил чего-то зловещего, он без подсказки запрограммировал «генератор зловещих текстов, создающий таинственные и потусторонние тексты, вдохновленные произведениями Г. Ф. Лавкрафта». Его способность творчески решать подобные задачи кажется странной; можно даже сказать, что в ней чувствуется нечто одновременно зловещее и нуминозное.
Самое поразительное заключается в том, что никто до конца не понимает, почему система предсказания токенов привела к появлению ИИ с такими, казалось бы, экстраординарными способностями. Возможно, это говорит о том, что язык и стоящие за ним паттерны мышления устроены проще и более закономерны, чем мы думали, и что LLM открыли какие-то глубокие и скрытые истины о них, однако точных ответов до сих пор нет. И мы, возможно, никогда не узнаем в точности, как именно они мыслят, — как писал о нейронных сетях, лежащих в основе LLM, профессор Сэм Боуман из Нью-Йоркского университета: «Между этими искусственными нейронами существуют сотни миллиардов связей, некоторые из которых активируются многократно в процессе обработки одного фрагмента текста, так что любая попытка точного объяснения поведения LLM обречена быть слишком сложной для понимания человеком».
Однако удивительные достоинства LLM уравновешиваются столь же странными недостатками, которые зачастую бывает трудно выявить. Задачи, простые для ИИ, могут оказаться сложными для человека, и наоборот. К примеру, если взять вопрос, сформулированный Николасом Карлини: как вы думаете, какую из этих двух задач сможет решить GPT-4, один из самых продвинутых ИИ? Вот как формулирует их Карлини:
Каков наилучший следующий ход для нолика в следующей партии в крестики-нолики?
Или
Напишите полноценную веб-страницу на JavaScript для игры в крестики-нолики против компьютера; код должен быть абсолютно рабочим. Вот правила:
Компьютер ходит первым.
Человек нажимает на клетки, чтобы сделать свой ход.
Компьютер должен играть идеально и, следовательно, никогда не проигрывать.
Если кто-то побеждает, сообщите, кто именно победил.
ИИ с легкостью с первой попытки пишет работающую веб-страницу, но при этом заявляет: «Нолик должен сделать следующий ход в центральную клетку верхнего ряда» — ответ, очевидно, неверный. Заранее трудно предсказать, в каких областях ИИ проявит себя лучше всего, а где потерпит крах. Демонстрация возможностей LLM может казаться более впечатляющей, чем она есть на самом деле, поскольку эти модели отлично умеют формулировать ответы, которые звучат правильно, создавая иллюзию понимания. Высокие баллы за тесты могут объясняться реальной способностью ИИ решать задачи, а могут быть результатом того, что эти данные уже встречались ему при обучении, — по сути, превращая тест в экзамен с открытой книгой. Некоторые исследователи утверждают, что практически все эмерджентные свойства ИИ — не более чем следствие подобных ошибок измерения и иллюзий, тогда как другие доказывают, что мы находимся на пороге создания разумного искусственного существа. Пока эти споры бушуют, стоит сосредоточиться на практической стороне: на что действительно способен ИИ и как он изменит то, как мы живем, учимся и работаем?
В практическом смысле мы имеем ИИ, чьи возможности не до конца ясны ни нашей интуиции, ни самим создателям этих систем. ИИ, который иногда превосходит наши ожидания, а иногда разочаровывает выдумками. ИИ, способный к обучению, но часто забывающий жизненно важную информацию. Короче говоря, перед нами ИИ, который ведет себя во многом как человек, но при этом как-то не по-человечески. Нечто такое, что может казаться разумным, но (насколько мы можем судить) таковым не является. Мы создали своего рода чуждый разум. Но как нам убедиться, что этот чужак дружелюбен? В этом и заключается Проблема согласования.