Сегодня мы запустили ChatGPT. Попробуйте поговорить с ним.
В среду 30 ноября 2022 года, около десяти часов утра по нью-йоркскому времени, на веб-сайте OpenAI появилась новая страница. Она называлась chat.openai.com и выглядела очень просто: белый экран, посередине окошко для ввода текста, под ним кнопка «Submit». Никакого приветствия, никакого вводного видео, никакой регистрации с подтверждением через смс. Чтобы попробовать, достаточно было создать бесплатный аккаунт.
В тот же день в твиттере OpenAI и лично Сэма Альтмана появилось краткое объявление. В переводе с английского оно звучало так: сегодня мы запустили ChatGPT, попробуйте поговорить с ним. Внизу была ссылка на сайт. Никаких пресс-релизов, никаких пафосных видео, никаких журналистских превью. Просто публикация в социальной сети, такая, какие делают разработчики маленьких приложений, когда выкладывают свой первый прототип.
Во внутренней переписке OpenAI этот запуск называли low-key research preview, «тихая исследовательская превью-версия». Расчёт был такой: пусть несколько тысяч энтузиастов попробуют, расскажут о своих впечатлениях, OpenAI соберёт ценные данные о том, как люди реально общаются с языковой моделью, и через несколько месяцев на основе этих данных подготовит более серьёзный продукт. Никто не ожидал бури.
За первые пять дней работы chat.openai.com у платформы набралось миллион пользователей. За следующие два месяца — сто миллионов. К концу первого года — двести миллионов. К концу 2024 года — больше трёхсот миллионов еженедельно активных пользователей и больше миллиарда людей, попробовавших сервис хотя бы один раз.
Никакое потребительское приложение в истории человечества не достигало ста миллионов пользователей быстрее. Не Facebook, не Instagram, не TikTok. ChatGPT обогнал их всех в несколько раз.
Что было такого в этом простом белом окошке, что заставило четверть человечества за два года попробовать им воспользоваться? Чтобы ответить на этот вопрос, нужно вернуться немного назад и рассказать о двух технических идеях, без которых ChatGPT не работал бы. Эти идеи назывались InstructGPT и RLHF.
Когда в 2020 году вышел GPT-3, у него была проблема, которую внутри OpenAI обсуждали активно, но снаружи мало кто заметил.
GPT-3 был обучен предсказывать следующий токен в тексте. В этом он добился потрясающих результатов. Но «предсказание следующего токена» — это не то же самое, что «выполнение инструкции пользователя». Если пользователь писал в API запрос вроде напиши электронное письмо коллеге с просьбой перенести встречу на пятницу, модель не обязательно делала то, что от неё хотели. Она могла, например, продолжить запрос, написав: напиши электронное письмо коллеге с просьбой перенести встречу на пятницу. Если на пятницу не получится, попроси перенести на четверг. Эту задачу можно автоматизировать с помощью Outlook. Технически — продолжение текста, статистически правдоподобное. Но не то, чего хотел пользователь.
GPT-3, обученный на огромном массиве обычного текста, моделировал, в сущности, типичный интернет: статьи в Википедии, форумные обсуждения, отзывы на Amazon, фрагменты кода с GitHub. В этом интернете запросы вроде «напиши письмо» обычно были не инструкциями, а заголовками статей или фрагментами обсуждений. Модель училась продолжать такие заголовки естественным для интернета способом. Прямого выполнения инструкции она не умела.
Чтобы исправить это, в OpenAI начали в 2021 году серию работ под общим названием alignment, согласование. Идея: научить модель не просто предсказывать следующий токен, но выполнять то, что от неё хочет пользователь. Делать то, что для языковых моделей не предусмотрено архитектурой.
Пол Кристиано, NIST
Главным техническим инструментом, который для этого пригодился, оказался метод, известный под аббревиатурой RLHF: Reinforcement Learning from Human Feedback, обучение с подкреплением на основе обратной связи от людей.
Идея метода восходит к работе 2017 года, которую опубликовал Пол Кристиано, тогда исследователь OpenAI (позже он перейдёт в Anthropic, потом учредит свой исследовательский институт). В оригинальной статье Кристиано показал, что можно обучать агента (например, нейросетевого игрока в видеоигру) не на заранее заданной функции награды, а на оценках реальных людей: пусть люди смотрят пары роликов и говорят, какой из двух больше нравится. По этим оценкам можно построить функцию, аппроксимирующую человеческие предпочтения, и обучать агента максимизировать её.
В 2021 году в OpenAI команда под руководством Лонга Уянга начала применять эту идею к языковым моделям. Процесс выглядел так. Берём GPT-3. Запускаем её на множестве тестовых промптов. Получаем для каждого промпта по несколько разных ответов. Показываем эти ответы группе наёмных оценщиков и просим ранжировать: какой ответ лучше, какой хуже. Собираем десятки тысяч таких сравнений. По ним обучаем отдельную небольшую модель, которая предсказывает, какой из двух ответов человек оценит выше. Эту модель называем «модель награды». Дальше используем модель награды как сигнал для тонкого дообучения GPT-3 методами обучения с подкреплением: модель должна давать ответы, на которых модель награды показывает высокий балл.
В январе 2022 года команда Уянга опубликовала статью под названием Training language models to follow instructions with human feedback. Модель, полученная этим способом, назвали InstructGPT. По сравнению с обычным GPT-3, она показывала разительно более полезное поведение: лучше следовала инструкциям, реже выдавала нерелевантные продолжения, точнее отвечала на конкретные вопросы.
InstructGPT была доступна через API OpenAI, и в течение 2022 года стала вытеснять обычную GPT-3 у разработчиков. Но она оставалась инструментом для разработчиков; широкая публика её не пробовала. Никакого общедоступного интерфейса у неё не было.
Кому именно в OpenAI принадлежит идея сделать из InstructGPT простой чат-интерфейс для широкой публики, в точности неизвестно. По одним свидетельствам, идея витала в воздухе и обсуждалась несколькими сотрудниками одновременно с лета 2022 года. По другим, ключевую роль сыграл сам Альтман, который в какой-то момент сказал: давайте сделаем что-то, что просто работает без программирования; пусть любой человек может с этим поиграть.
В сентябре 2022 года несколько инженеров под руководством Джона Шульмана начали готовить специальную версию модели, дополнительно подкрученную для удержания контекста длинного диалога. Им нужно было решить несколько задач, которые в чисто инструктивных моделях не возникали. Во-первых, помнить предыдущие реплики разговора. Во-вторых, корректно обрабатывать длинные многоходовые задачи (когда пользователь, скажем, начинает с вопроса, потом уточняет, потом снова уточняет). В-третьих, по возможности отказываться от выполнения вредных или неуместных запросов.
Модель, которая получилась, внутри OpenAI называли GPT-3.5. По размеру она была близка к оригинальной GPT-3 (хотя точные параметры компания никогда не раскрывала). По способностям, благодаря дополнительному RLHF и тренировке на диалогах, она была заметно лучше.
В ноябре 2022 года команда обсудила: что с этим делать? Опубликовать статью? Запустить как платный API для разработчиков? Дождаться следующего поколения, GPT-4, которое уже было в разработке и должно было выйти в 2023 году?
Альтман предложил запустить простой бесплатный веб-интерфейс. Не как продукт. Как «исследовательский превью», чтобы собрать данные о том, как обычные люди общаются с языковой моделью. Он сказал коллегам: выложим без рекламы, без пресс-релиза. Если получится что-то интересное, разовьём это в полноценный продукт. Если нет, тихо закроем.
Внутри команды были сомнения. Несколько человек считали, что модель ещё недостаточно отполирована и что публичный запуск может привести к скандалам (если ChatGPT начнёт давать оскорбительные ответы, например). Другие, наоборот, считали, что отполировать модель в лабораторных условиях невозможно: только реальные пользователи покажут реальные проблемы.
В итоге запустили. 30 ноября, в среду.
Рост числа пользователей ChatGPT
Первые часы после запуска прошли тихо. Несколько сотен любопытных зашли на сайт, поэкспериментировали, написали о своих впечатлениях в твиттере. Технологические блоги опубликовали короткие заметки. Внутри OpenAI команда следила за метриками и поначалу не видела ничего экстраординарного.
К концу первых суток в Reddit-сообществе по машинному обучению уже шла активная дискуссия. К утру четверга 1 декабря несколько твитов с примерами особенно впечатляющих ответов набрали по нескольку миллионов просмотров. К пятнице публикации о ChatGPT появились в The Verge, Wired, Bloomberg, в международных изданиях. К субботе количество регистраций превысило сто тысяч в день. К воскресенью — миллион.
Сэм Альтман в пятницу опубликовал твит: ChatGPT набрал миллион пользователей за пять дней. Внутри компании это число обсуждали с нервным смехом. Никто не ожидал такого темпа. Серверы OpenAI начали проседать под нагрузкой; нужно было срочно докупать вычислительные мощности у Microsoft Azure; нужно было нанимать дополнительный персонал поддержки; нужно было реагировать на десятки журналистских запросов в день.
В январе 2023 года ChatGPT перевалил за сто миллионов активных пользователей. Это означало, что за два месяца сервис достиг той аудитории, к которой Facebook шёл четыре с половиной года, а Instagram — два с половиной. Аналитики называли ChatGPT самым быстро распространившимся приложением в истории человечества.
В Google эта новость произвела эффект, который через несколько недель станет публично известен под именем code red, «красная тревога». Если до ChatGPT Google имел общий контроль над тем, как люди в интернете ищут информацию, то теперь появилась альтернатива, которая в принципе могла подорвать главную бизнес-модель компании. Если люди начнут задавать вопросы ChatGPT вместо поисковика, рекламное золото Google перестанет течь.
В декабре 2022 года Сундар Пичаи, генеральный директор Google, лично провёл несколько встреч с командами по машинному обучению, чтобы ускорить внутренние работы по конкурирующим продуктам. В феврале 2023 года Microsoft, воспользовавшись своим партнёрством с OpenAI, встроил GPT-4 в свой поисковик Bing и провёл громкую презентацию, на которой представил «новый интернет-поиск». На несколько недель акции Microsoft выросли, акции Google — упали.
В феврале 2023 года Google представил собственного чат-бота под названием Bard. Презентация прошла неудачно: в первом же публичном демонстрационном ролике Bard выдал фактическую ошибку про космический телескоп «Джеймс Уэбб», и за день капитализация Alphabet упала примерно на сто миллиардов долларов. Внутри Google это происшествие надолго запомнилось как одно из самых неприятных в истории компании.
В отличие от GPT-3 двухлетней давности, ChatGPT сразу попал в широкую публику. Школьники начали с его помощью писать сочинения. Студенты — рефераты. Программисты — код. Маркетологи — рекламные тексты. Юристы — черновики договоров. Психотерапевты — варианты ответов клиентам (это вызвало отдельную этическую дискуссию). Учителя начали обсуждать, как теперь оценивать письменные работы. Журналисты начали писать колонки о том, означает ли ChatGPT конец профессии писателя.
В академических кругах разгорелись споры. Группа исследователей под руководством Эмили Бендер из Университета Вашингтона опубликовала несколько статей, в которых называла большие языковые модели стохастическими попугаями: статистическими системами, имитирующими язык, но не имеющими настоящего понимания. Другая группа, включая Илью Суцкевера и нескольких «философов сознания» (учёных, теоретически изучающих природу мышления и сознательного опыта), отвечала, что граница между имитацией и пониманием в случае настолько мощных систем становится философски размытой; что если модель ведёт себя как понимающая, и при этом её внутренние представления отражают реальные структуры мира, то называние её «попугаем» — это, скорее, отказ от вопроса, чем ответ на него.
Эта философская дискуссия не утихла к моменту, когда вы читаете эту книгу. И, скорее всего, не утихнет ещё несколько десятилетий. Что значит «понимать»? Что значит «знать»? Существует ли сознание у систем, не имеющих биологического тела? Все эти вопросы, до прихода ChatGPT бывшие предметом узкой философской дискуссии, теперь оказались поставлены практически: миллионы людей ежедневно взаимодействуют с системой, про которую невозможно с уверенностью сказать, понимает она их или только имитирует понимание.
2023 год для OpenAI был годом резкого роста и одновременно — серии кризисов.
В марте была выпущена GPT-4 — модель следующего поколения, заметно более способная, чем GPT-3.5. На нескольких профессиональных экзаменах (юридический экзамен США, медицинский, экзамены по программированию) GPT-4 показывала результаты на уровне верхних 10% среди сдающих.
В марте 2023 года Future of Life Institute опубликовал открытое письмо, подписанное Илоном Маском, Стивом Возняком и сотнями других известных людей, призывавшее к шестимесячному мораторию на обучение моделей мощнее GPT-4. В апреле OpenAI опубликовал собственные материалы о своём подходе к безопасности ИИ. На практике никакого моратория не произошло; обучение моделей следующего поколения продолжалось параллельно у всех ведущих лабораторий.
В ноябре 2023 года произошла история, которую теперь называют пятидневной OpenAI-войной. 17 ноября, в пятницу, совет директоров OpenAI (на тот момент состоявший в основном из членов с уклоном к безопасности, включая Илью Суцкевера и Хелен Тонер) внезапно уволил Сэма Альтмана с поста генерального директора. Официальная формулировка: «отсутствие постоянной откровенности в коммуникациях с советом». Через несколько часов с поста ушёл Грег Брокман.
Дальше события развивались как в фильме. Microsoft, чьё партнёрство с OpenAI было ключевым, потребовал объяснений. Сотрудники OpenAI начали один за другим подписывать открытое письмо с угрозой массового ухода: они тоже уйдут в Microsoft вместе с Альтманом и Брокманом, если совет не вернёт их на места. К утру понедельника письмо подписало семьсот сотрудников из семисот семидесяти. В их числе — сам Илья Суцкевер, голосовавший несколько дней назад за увольнение Альтмана. Илья опубликовал твит: сожалею о своём участии в действиях совета.
21 ноября, во вторник, Альтман был восстановлен. Совет был распущен в прежнем составе; новые члены включали более лояльных Альтману людей. Брокман вернулся. Илья остался формально в должности, но фактически отстранился; через полгода он официально уйдёт из OpenAI и откроет собственную лабораторию Safe Superintelligence Inc., посвящённую исключительно вопросу создания безопасного сверхинтеллекта.
Эта пятидневная драма обошла все мировые медиа. Из неё стало ясно несколько вещей. Во-первых, OpenAI больше не является некоммерческой лабораторией в духовном смысле: её центр тяжести сместился к Альтману и Microsoft, и любая попытка отстранить Альтмана разрушила бы саму корпоративную структуру. Во-вторых, между сторонниками «быстрого роста» и сторонниками «осторожной разработки» внутри организации сохраняется глубокое противоречие, которое временами прорывается на поверхность. В-третьих, и это, может быть, важнее всего, OpenAI к 2023 году настолько срослась со своими продуктами и партнёрами, что стала похожа на типичную крупную корпорацию: лидерство одного человека, давление инвесторов, корпоративные интриги. От первоначальной идеи 2015 года про «миссию, поставленную выше прибыли» осталась только корпоративная риторика.
В мае 2024 года Илья Суцкевер официально ушёл из OpenAI. Через несколько недель за ним последовали ещё несколько ключевых сотрудников, отвечавших за исследования безопасности. К концу 2024 года в OpenAI работали уже совсем другие люди, чем в 2020.
В 2024 году ChatGPT и его аналоги (Claude от Anthropic, Gemini от Google, LLaMA от Meta, китайские модели от Baidu, Alibaba, ByteDance, DeepSeek) стали повседневной частью жизни. Школы по всему миру вводили правила насчёт использования ИИ для домашних заданий. Газеты публиковали колонки о том, как искусственный интеллект меняет журналистику. Тысячи стартапов строили продукты, в которых большая языковая модель была не одним из компонентов, а главным двигателем.
К 2025 году рынок «генеративного ИИ» оценивался уже в сотни миллиардов долларов годового оборота. Microsoft и Google инвестировали в эту область в общей сложности больше ста миллиардов. Nvidia, благодаря спросу на видеокарты для обучения моделей, стала самой дорогой компанией мира по рыночной капитализации, обогнав Apple. Энергопотребление дата-центров, обучающих модели, начало вызывать серьёзные экологические дискуссии: к 2026 году большие лаборатории искусственного интеллекта потребляли электричества столько же, сколько небольшие европейские страны.
В новостях постоянно стали появляться истории о том, как ИИ «думает», «решает», «понимает», «создаёт». Часть таких формулировок была осознанными метафорами; другая часть оказалась следствием обыкновенного непонимания того, что на самом деле делает языковая модель. Но в массовое сознание они проникли все вместе. До прихода ChatGPT искусственный интеллект был чем-то из научной фантастики. После он стал повседневной реальностью.
В этой повседневной реальности, что особенно странно, продолжала действовать одна и та же шенноновская задача. Каждый раз, когда пользователь нажимает кнопку «Submit» в чате с ChatGPT, или с Claude, или с Gemini, на серверах OpenAI, Anthropic или Google запускается процесс предсказания следующего токена. Один за другим, по одному. Каждый следующий — статистический выбор из тысяч возможных, на основе обусловленной всей предыдущей частью разговора вероятности. То же самое, что делал в 1948 году тридцатидвухлетний инженер Bell Labs со своей книжкой с полки. То же самое, что делал в 1913 году пятидесятишестилетний академик Императорской академии наук со своим экземпляром «Евгения Онегина».
Только теперь с триллионом параметров, и больше ста сорока тысячами видеокарт, и потреблённой энергией маленькой европейской страны.
И на широчайшем из возможных массивов — всём интернете, который написал к этому моменту человечество.