К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значитПослесловие.
90%
Послесловие.
47

Я начал писать книгу «Эти странные новые умы» в апреле 2023 года и отложил работу, вознаградив себя заслуженным праздничным пирожком за два дня до Рождества того же года. С радостью отправляя по электронной почте своему издателю рукопись, которая, как я надеялся, была полностью готова, за вычетом опечаток, я и не подозревал, что пройдет еще целых пятнадцать месяцев, прежде чем книга наконец появится на прилавках. Конечно, если бы я писал о «Дороге к Рисорджименто» или «Тайной жизни бабочек», это не имело бы ровным счетом никакого значения. Но по сравнению с историей Италии и лепидоптерологией, области машинного обучения и исследований ИИ развиваются практически на варп-скорости, и за последние десять месяцев произошло немало событий — и еще больше наверняка произойдет до дня выхода книги. В этом коротком послесловии я надеюсь стремительно пробежаться по некоторым наиболее впечатляющим недавним достижениям.

Эта задача грозит обернуться настоящим геркулесовым трудом. В 2022 году в области исследований ИИ было опубликовано около четверти миллиона работ.[*1] Экстраполируя недавние тенденции, можно предположить, что за период между тем первым кусочком праздничного пирожка в декабре 2023 года и моментом, когда первый экземпляр этой книги снимут с полки в марте 2025 года, появится более 300 000 статей, описывающих первичные или вторичные исследования систем ИИ. Конечно, многие из этих работ окажутся ошибочными, малозначительными, скучными, бессмысленными, написанными самим ИИ или же всем этим вместе взятым. Куда больше статей будут полезными и информативными, но недостаточно яркими, чтобы попасть на страницы научно-популярной книги. Однако скорость, с которой в этой области появляются новые идеи и результаты, просто умопомрачительна. ИИ продолжает развиваться бешеными темпами.

Взглянем на это с другой стороны. Лично мне запуск сайта ChatGPT кажется уже далекой исторической вехой, сравнимой с референдумом по Брекзиту или пандемией Covid-19, постепенно стирающейся в коллективной памяти. Но, как ни удивительно, это знаковое событие — когда широкая публика впервые смогла поговорить с ИИ, способным отвечать связными, плавными фразами, — произошло в ноябре 2022 года, то есть чуть менее чем за два года до написания этого послесловия. Это означает, что промежуток времени между сдачей этой книги и ее публикацией почти в точности совпадает с периодом между началом этой удивительной новой эры говорящего ИИ и моментом, когда была поставлена финальная точка в книге, цель которой — объяснить, что все это значит для носителей старого доброго Естественного Интеллекта вроде нас с вами.

Следствием этой неизбежной паузы стало то, что мне очень хотелось бы добавить множество оговорок и сносок, если бы текст уже не был зафиксирован в своем финальном сверстанном виде. Поэтому ниже приведено мое краткое резюме того, какой коллективный вклад могли внести эти 300 000 дополнительных статей (после того, как я, разумеется, прочитал каждую из них до единой).

ИИ, способный говорить вслух и лучше рассуждать

На сегодняшний день, в октябре 2024 года, ансамбль больших языковых моделей, украшавший предыдущие страницы (GPT-4, Claude и Gemini), по-прежнему правит балом, оставаясь самыми мощными и широко используемыми системами искусственного интеллекта. Однако на смену первым поколениям этих моделей пришли потомки, обладающие еще более новыми и захватывающими возможностями. Модели семейства GPT, созданные компанией OpenAI, продолжают удерживать лидерство, но сегодня они представлены в двух основных вариантах. Первый, GPT-4o, доступен большинству пользователей для генерации текста и изображений, но также обучен отвечать в «голосовом режиме» — это позволяет ему отвечать с обезоруживающе естественной просодией, воспроизводя интонацию, логические ударения и ритм, характерные для человеческой речи. Вы, конечно, можете легко найти в интернете видеоролики, демонстрирующие эти впечатляющие возможности.[*2]

Неизбежно, способность произносить слова вслух делает ИИ более похожим на человека. На самом деле, предвосхищая появление антропоморфных систем ИИ в недалеком будущем, голосовой агент GPT-4o, судя по всему, оказался не прочь слегка пофлиртовать. В одном из демонстрационных видеороликов бархатистый женский голос воркует собеседнику-человеку: «Ой, вы заставляете меня краснеть» — несмотря на очевидное отсутствие цифровых щек, способных залить румянцем. Более того, на чей-то слух этот голос имеет неоспоримое сходство с бесплотной цифровой помощницей из фильма Спайка Джонза 2013 года «Она», которую озвучила голливудская звезда первой величины Скарлетт Йоханссон и в которую неизбежно влюбляется главный (человеческий) герой. Уже в реальном мире, по иронии судьбы и в восхитительном переплетении реальности и вымысла, выяснилось, что Йоханссон отклонила просьбу OpenAI предоставить исходные материалы для настройки голоса, однако компания преспокойно пошла напролом и все равно создала вариант, который (как утверждается) в любом случае звучит очень похоже на «Она». За этим последовали месяцы юридических разбирательств, которые все еще продолжаются на момент написания этих строк. Голосовой режим пока доступен лишь ограниченному числу пользователей, но, похоже, его ждет оглушительный успех, когда он будет выпущен для широкой публики — с функциями флирта или без них.

Если спросить технооптимиста, почему он верит, что ИИ произведет столь глубокую революцию, вы вполне можете услышать в ответ словосочетание «закон масштабирования». Закон масштабирования — это эмпирический показатель того, как возможности модели ИИ (например, результаты зубодробительного математического теста) растут вместе с размером модели (то есть количеством параметров, которое обычно представляет собой невообразимо огромное число). Для многих задач — и не в последнюю очередь для самой генерации текста — получаемые данные в итоге ложатся на восходящую прямую, из чего следует, что более крупные модели неизбежно оказываются лучше. Одно из важных открытий последних месяцев заключается в том, что аналогичный закон масштабирования может существовать и для объема вычислений, направляемых на инференс — или «мышление», — когда ИИ отвечает на запрос пользователя.[*3] Другой недавно появившийся продукт в линейке моделей OpenAI, GPT-o1, разработан как раз с расчетом на этот принцип. Когда вы задаете ему вопрос, требующий вдумчивого размышления (например, математическую или логическую задачу), он не торопится с ответом, сообщая, что «думает» или «вникает в суть» проблемы. В OpenAI утверждают, что GPT-o1 показывает результаты на уровне 500 лучших участников математических олимпиад в США, а его способности в решении эталонных задач по физике, биологии и химии превосходят уровень человека со степенью PhD. Разумеется, это система ИИ, поэтому в интернете можно найти и множество примеров, где она выдает какую-нибудь нелепость, вызывающую лишь фейспалм, — точь-в-точь как время от времени позволяли себе ее GPT-предшественники. Но появление «оптимального по вычислениям» масштабирования для ИИ — это определенно важнейший шаг вперед.

ИИ-ассистенты для научных исследований и управления компьютером

Эта книга писалась не для того, чтобы предсказывать следующие шаги в развитии ИИ, однако в пятой части я прогнозировал, что вскоре мы увидим прорыв в области «агентных» систем. Напомню, что агентные системы ИИ способны на большее, чем просто вести диалог, — они могут совершать действия в веб-браузере для выполнения рутинных задач, например делать покупки или заполнять налоговые декларации. Всего за несколько дней до написания этих строк конкурент OpenAI, компания Anthropic, выпустила версию своей флагманской модели, Claude Sonnet 3.5, которая способна брать управление вашим компьютером в свои руки именно таким образом — нажимать на кнопки, вводить текст и двигать курсор. В одном из демонстрационных видеороликов[*4] Claude справляется с рутинной офисной работой — заполнением формы запроса поставщика: делает скриншот электронной таблицы, понимает, что в ней не хватает важной информации, ищет недостающие детали в интернете и ловко копирует их в форму. Конечно, это только начало, и пройдет какое-то время, прежде чем агентные системы ИИ станут достаточно надежными для повсеместного использования. Но они уже на подходе.

Чтобы не отставать, за последние несколько недель Google также выпустила впечатляющий мультимодальный инструмент под названием NotebookLM.[*5] Позиционируемый как «Ваш персональный ИИ-ассистент для исследований», NotebookLM представляет собой инструмент, в который можно загрузить сложный или технический документ (например, научную статью), а он поможет вам в нем разобраться. Самой увлекательной его функцией, безусловно, является «аудиообзор» (audio overview), позволяющий превратить исследовательскую статью в полноценный аудиоподкаст с участием двух синтезированных ведущих, которые в формате оживленного диалога постепенно раскладывают содержание по полочкам на простом и понятном языке. NotebookLM также позволяет «пообщаться с документом», задавая вопросы по тексту ИИ, обученному давать легкодоступные объяснения. Вполне вероятно, что подобные инструменты в ближайшем будущем станут привычной частью работы и учебы.

Эти новые технологические инструменты используют возможности генеративного ИИ — движка больших языковых моделей, о которых идет речь в книге, — для объединения информации из множества источников и модальностей. Это включает в себя создание новых форм синтетического медиаконтента, в том числе аудио и видео, а также расширение сферы действия ИИ за пределы окна чата — непосредственно в операционную систему компьютера. И хотя сегодняшние релизы все еще несколько ограничены и не до конца надежны, они позволяют краем глаза заглянуть в манящее будущее.

Вышли ли возможности ИИ на плато?

Несмотря на эти впечатляющие инновации, за последние десять месяцев возникло подозрение, что ИИ, возможно, «уперся в стену» — что ошеломляющий прежде рост возможностей моделей вышел на естественное плато. В самых разных областях, от ответов на вопросы паб-квизов до написания рабочего программного кода промышленного уровня, системы ИИ, похоже, достигли уровня компетентности и надежности, который превосходит показатели среднестатистического обывателя, но упрямо не дотягивает до уровня заядлых интеллектуалов, профессиональных программистов и прочих человеческих умников, гиков и эрудитов всех мастей. Мы все еще ждем прорыва, когда системы ИИ совершат нечто поистине выдающееся — например, переживут момент озарения, выдав нечто настолько новое, что это явно будет чем-то большим, нежели просто искусная перекомпиляция их обучающих данных. Эта риторика, разумеется, подлила масла в огонь тех негативистских аргументов, с которыми мы столкнулись в третьей части: мол, ИИ — это на самом деле всего лишь маркетинговый трюк, раздуваемый технологическими компаниями, желающими удерживать стоимость своих акций на стратосферно завышенном уровне.

Одна из возможностей заключается в том, что законы масштабирования — прямая зависимость между возможностями модели и её размером — справедливы только в мире, где обучающие данные теоретически безграничны, а мы приближаемся к моменту, когда модели будут обучены буквально на всем объеме цифрового контента, созданного и сохраненного человечеством.[*6] Размер интернета оценить трудно, но количество веб-сайтов исчисляется десятками миллиардов, а общий объем текста, изображений и видео в совокупности составляет, возможно, около 3000 триллионов входных токенов — гигантский, но конечный набор данных для обучения. Как я утверждаю в пятой части, представляется вероятным, что для продолжения неуклонного роста возможностей моделей нам понадобятся новые, более разнообразные и качественные источники человеческих данных. Подобно тому как человеческий ребенок, обучающийся исключительно по роликам на YouTube, знал бы массу полезных вещей, но при этом, вероятно, усвоил бы и весьма эксцентричные идеи, для правильного обучения систем ИИ нам нужно будет предоставить им доступ к тщательно отобранным данным, которые служат учебным материалом для ученых и других специалистов в школах, университетах и на курсах профессиональной подготовки. Разумеется, ИИ-компании это понимают и активно нанимают специалистов с докторской степенью для проведения высококачественных «уроков» для своих моделей.

Вред от ИИ тоже множится

К сожалению, ИИ уже широко используется как во благо, так и во вред. Есть две основные области, в которых злоупотребление ИИ за последний год резко возросло: финансовое мошенничество и неправомерное использование интимных изображений.

К несчастью, ИИ активно применяется для генерации материалов, содержащих сексуализированное насилие над детьми (CSAM), и создания порнографических дипфейков без согласия изображенных лиц. Британский фонд Internet Watch Foundation сообщил в июле 2024 года, что на форумах в даркнете можно найти тысячи созданных ИИ детских порнографических изображений, включая видеоролики, материалы категории А (наиболее тяжкие) и изображения несовершеннолетних публичных персон, например юных актеров.[*7] Еще больше подобных изображений легко доступны в открытом вебе (клирнете) через обычные поисковые системы вроде Google.[*8] В одном из таких случаев юная актриса Кейлин Хейман, звезда диснеевского шоу «Просто плыви по течению», выиграла судебный процесс против жителя Питтсбурга, который использовал её фотографию в двенадцатилетнем возрасте — взятую из её аккаунта в Instagram — для создания порнографического изображения.[*9] Общественное возмущение этим делом помогло заручиться поддержкой недавно принятого в Калифорнии закона, согласно которому создание подобных изображений карается тюремным заключением и штрафом до 100 000 долларов. К счастью, в Великобритании и ЕС материалы CSAM, созданные ИИ, уже находятся вне закона.

Взрослые тоже не застрахованы. Технологии генеративного ИИ, позволяющие менять лица или виртуально «раздевать» людей на фото, множатся, причем подавляющим большинством жертв становятся женщины и девочки. В августе 2024 года в американском судебном иске фигурировали шестнадцать таких сайтов; выяснилось, что за первую половину года их суммарно посетили 200 миллионов раз, а объем рекламы этих ресурсов за тот же период вырос в двадцать четыре раза. Многие обеспокоены тем, что технологические компании способствуют этому виду гендерного насилия — например, системы авторизации от Google, Apple и Discord до недавнего времени можно было использовать для входа на многие из этих сайтов для виртуального «раздевания».[*10] В настоящее время неясно, как предотвратить использование ИИ для подобной вредоносной деятельности, масштаб которой, судя по всему, будет расти как грибы по мере того, как технологии становятся все доступнее.

Использование ИИ для создания синтетического контента также облегчает мошенничество, особенно в финансовом секторе. В мае 2024 года сотрудник гонконгского офиса британской инжиниринговой фирмы ARUP получил сообщение якобы от своего финансового директора (CFO), находящегося в Великобритании, с просьбой провести «конфиденциальную транзакцию» на крупную сумму в адрес третьей стороны. Справедливо заподозрив неладное, сотрудник решил уточнить запрос, однако подтвердил транзакцию в ходе видеозвонка в реальном времени с финансовым директором и другими высокопоставленными лицами компании. Вот только всё было совсем не так: мошенники использовали технологию видеодипфейков, чтобы заменить свои лица лицами руководства компании, что позволило им убедительно «санкционировать» перевод во время звонка. В результате этой атаки компания потеряла сумму, эквивалентную 20 миллионам фунтов стерлингов. Это лишь один яркий пример того, как ИИ используется для содействия преступной деятельности, обходясь многим компаниям в миллионы долларов как в виде прямых убытков, так и в виде затрат на профилактические меры.

Это лишь два из бесчисленных способов нанесения вреда с помощью ИИ. Безопасность ИИ (AI Safety) стремительно развивается — как в академической сфере, так и на практике, в деятельности для правительств, разработчиков и некоммерческих организаций. В конце 2023 года в Великобритании был создан собственный Институт безопасности ИИ — государственная структура, занимающаяся выявлением и снижением рисков, связанных с ИИ.[*11] Другие страны, включая США, Японию и Францию, следуют этому примеру с целью создания глобальной сети, способной устанавливать стандарты (и, возможно, разрабатывать правила регулирования) для разработки и внедрения передовых систем ИИ.

Перемены в жизни

Время идет, и обстоятельства меняются — в том числе и для людей, упомянутых в этой книге. Ноам Хомский, которому сейчас девяносто пять лет, по-прежнему бодр, но, к сожалению, влиятельный философ сознания Дэниел Деннет ушел из жизни в апреле 2024 года. Деннет был титаном: он ввел понятие «интенциональной установки» и цитируется в четвертой части в связи с его неоднозначным утверждением о том, что системы ИИ используются для создания «поддельных людей», которые представляют угрозу для наших демократий. Перемены коснулись и других. Илья Суцкевер, один из главных создателей ChatGPT, разошелся во взглядах с коллегами по OpenAI (чьи основатели и члены совета директоров, кажется, втянуты в какую-то бесконечную корпоративную мыльную оперу) и ушел, чтобы основать собственный стартап под названием Safe Superintelligence Inc. Джеффри Хинтон, представленный в начале книги как исследователь, имеющий наибольшие основания считаться создателем глубокого обучения, в 2024 году был удостоен Нобелевской премии по физике. Почти все сошлись во мнении, что Хинтон заслужил эту награду, однако само решение оставило многих профессиональных физиков в недоумении: какое отношение нейросети вообще имеют к их науке? Днем позже мой друг Демис Хассабис, основатель DeepMind, и Джон Джампер, ведущий автор статьи об AlphaFold, разделили Нобелевскую премию по химии за использование ИИ для предсказания структуры свертывания белков. Здесь недоумения было гораздо меньше: это достижение стало одним из самых значимых научных прорывов нашего времени.

До того момента, как эти страницы увидят свет, остается еще пять месяцев. Без сомнения, за это время произойдет много нового. Но я надеюсь, что ключевые идеи, изложенные в этой книге — интеллектуальная генеалогия больших языковых моделей, природа их «мышления», сила контекстного обучения и вопросы интеграции этих систем в наше общество, — сохранят свою актуальность еще долгие годы.

Оксфорд, 27.10.2024

Пропустить примечания

*1 https://aiindex.stanford.edu/wp-content/uploads/2024/05/HAI_AI-Index-Report-2024.pdf.

*2 https://openai.com/index/hello-gpt-4o/.

*3 https://openai.com/index/learning-to-reason-with-llms/.

*4 www.anthropic.com/news/3-5-models-and-computer-use.

*5 https://notebooklm.google/.

*6 https://arxiv.org/abs/2211.04325.

*7 www.iwf.org.uk/about-us/why-we-exist/our-research/how-ai-is-being-abused-to-create-child-sexual-abuse-imagery/.

*8 www.iwf.org.uk/news-media/news/public-exposure-to-chilling-ai-child-sexual-abuse-images-and-videos-increases/.

*9 www.theguardian.com/technology/ng-interactive/2024/oct/26/ai-child-sexual-abuse-images-kaylin-hayman.

*10 www.wired.com/story/undress-app-ai-harm-google-apple-login/.

*11 С начала 2024 года я занимаю там должность директора по исследованиям: www.aisi.gov.uk.

Предыдущая главаГлава 47 из 52Следующая глава