Сейчас мы переходим ко второй части нашей краткой истории искусственного интеллекта.
К этому времени искусственный интеллект научились программировать. Мы тщательно думали о том, как люди решают проблемы. Мы рассматривали, как люди могут ориентироваться на местности (идея № 1 «Поиск ответов»), играть в игры (идея № 2 «Сделать лучший ход») и как стать экспертом в узкой специализации (идея № 3 «Следовать правилам»). Затем писали ИИ-программы, чтобы облегчить эти процессы, но ручное программирование оказалось медленным и до боли трудоемким, а также сильно зависящим от нашего не слишком хорошего человеческого понимания о способностях решать проблемы. Наверняка должен быть способ получше.
И вновь вдохновились человеческим интеллектом. В школе мы учимся множеству умных вещей, которые выполняем ежедневно. Рождаясь, мы не умеем ни читать, ни писать, ни решать квадратные уравнения и тем более сочинять стихи. Многое из того, где задействованы умственные способности, мы учимся делать. Могут ли компьютеры все это повторить?
Впервые эта идея была озвучена Аланом Тьюрингом в его работе «Вычислительные машины и разум», опубликованной в 1950 году. Возможно, вы вспомните, что эта работа считается первым научным трудом в области искусственного интеллекта, в котором Тьюринг представил свой тест, впоследствии названный его именем. Тем не менее, помимо теста, работа описывает другую важную идею. Рассмотрев причины, по которым разработка искусственного интеллекта может оказаться невозможной, Тьюринг обратился к вопросу о том, как мы могли бы создать его. И здесь он предложил идею «обучающихся машин»:
«Вместо того чтобы пытаться воспроизвести программу с моделью мышления взрослого человека, почему бы не создать программу, имитирующую умственные способности ребенка? Впоследствии, чтобы приобрести мышление взрослого, она может быть подвергнута определенному курсу обучения».
Несмотря на очевидную привлекательность идеи Тьюринга, «обучающиеся машины» на ранних этапах искусственного интеллекта не принесли особого успеха. На самом деле, ситуация оставалась таковой вплоть до 2010-х, пока не презентовали новый подход под названием «глубокое обучение» и «обучающиеся машины» набрали популярность.
И вновь к «мгновенному» успеху привели более чем 50 лет разработки. Чтобы понять этот успех, нам снова необходимо вернуться во времена Второй мировой войны и познакомиться с двумя яркими персонажами из ранней истории искусственного интеллекта.
Обучение происходит в мозге. Естественный способ разработать машину, обладающую способностями к обучению, – это создать искусственный мозг. Из этого вытекает четвертая главная идея в области искусственного интеллекта сегодня. Вы можете воспроизвести человеческий мозг с сетью искусственных нейронов, которые учатся на собственном опыте.
Вот только у этой идеи есть две небольшие проблемы. Первая заключается в том, что человеческий мозг, пожалуй, – самый сложный предмет во вселенной. Ничто из того, что сейчас нам известно, не может сравниться по сложности с миллиардами нейронов и триллионами синапсов, которые их соединяют. А вторая проблема – это то, что у нас практически нет полного понимания работы даже одного мозгового нейрона, не говоря уже о миллионах. Но эти трудности не остановили наших выдающихся персонажей от попытки скопировать работу мозга на компьютере. Позвольте представить, Уолтер Питтс и Уоррен Маккаллок, одаренные и эксцентричные ученые, которые в 1940-е годы заложили основы нейросетей, одной из самых важных технологий, созданных за всю историю развития искусственного интеллекта.
Уолтер Питтс был вундеркиндом из трудной семьи в Детройте. По легенде, однажды, чтобы скрыться от местных хулиганов, он засел в библиотеке и остался там после закрытия, и в течение трех следующих дней поглощал Principia Mathematica (ранее мы уже встречали эту работу, когда рассматривали первую программу Logic Theorist). Principia Mathematica – труд в 2000 страниц, написанный Бертраном Расселом и Альфредом Уайтхедом, чтобы дать логическую основу всей математике. Это одна из самых знаменитых и важных книг по математике. Тем не менее это не помешало не по годам развитому Питтсу обнаружить в ней несколько математических ошибок. И вот он написал Бертрану Расселу письмо, в котором указал на эти проблемы.
Илл. 14–15. Уолтер Питтс (слева) и Уоррен Маккалок. Фотография Лотфи Заде, отца «нечеткой логики»
В ответ Рассел великодушно пригласил Питтса в Кембриджский университет учиться у него в качестве аспиранта. Он и не подозревал, что Питтсу на тот момент было всего лишь 12 лет. Неудивительно, что Уолтер отказался от этого предложения. Однако переписку не прекратил. В возрасте 15 лет он покинул дом и отправился в Чикагский университет, где посещал лекции Рассела.
Именно в Чикаго Питтс попал в поле зрения Уоррена Маккаллока, профессора психиатрии из соседнего университета Иллинойса. Маккаллок происходил из совершенного иной среды, чем бездомный Питтс. Он родился в обеспеченной семье юристов, врачей и инженеров с Восточного побережья, учился в Йельском и Колумбийском университетах. Годы в привилегированных местах воспитали уверенного в себе заядлого курильщика, который был частично философом, частично поэтом и частично ученым.
Единственное, что объединяло эту необычную пару, Питтса и Маккалока, – это легендарный Готфрид Лейбниц. Они оба преклонялись перед философом XVII века, особенно перед его попыткой создать алфавит человеческой мысли, которая, как я уже говорил ранее, была частью предыстории искусственного интеллекта. И вот, Питтс и Маккаллок вместе приступили к продолжению работы Лейбница.
Другим источником их вдохновения была Principia Mathematica. Рассел и Уайтхед свели всю математику к простой логике «истины» и «лжи», или логике нулей и единиц, работая с «истиной» (1) и «ложью» (0) с помощью конъюнкции («и»), дизъюнкции («или») и отрицания («не»). Питтс и Маккаллок стремились повторить это бинарное разложение в своей упрощенной модели искусственного мозга.
Мозг представлял собой бинарное устройство, в котором нейроны, объединенные в сложную сеть, активируются или нет. Итак, идея Питтса и Маккаллока состояла в том, чтобы разложить искусственный мозг на простую сеть бинарных нейронов, подобно тому, как логическая формула может быть разложена с помощью простых логических связок, таких как «И», «ИЛИ» и «НЕ».
Питтс и Маккаллок начали с простой бинарной модели нейрона под названием «перцептрон». По сути, это логический вентиль. Он имеет два или более входа. Перцептрон суммирует взвешенную сумму этих входных данных. Если сумма превышает пороговое значение, то срабатывает выходной сигнал перцептрона. Если сумма не превышает пороговое значение, то выходной сигнал не срабатывает. Это объясняет принцип работы перцептрона. Но как он учится?
Вот тут-то мы и обращаем внимание на входные данные. Точно так же, как обучение в мозге усиливает или ослабляет входные сигналы для нейронов мозга, мы просто корректируем веса входных сигналов для перцептрона. Более важные входные данные получают больший вес, в то время как менее важные получают меньший вес.
Мы можем произвольно настраивать веса до тех пор, пока не найдем подходящую комбинацию, но есть более систематизированный подход, при котором мы плавно регулируем вес. Преподаватель психологии в Корнельском университете Фрэнк Розенблатт решил реализовать эту идею, сперва в 1957 году на программном обеспечении компьютера IBM 704, а затем на аппаратном в 1960-м. Созданный им перцептрон «Марк–1» стал первой нейросетью и сейчас хранится в Смитсоновском институте.
Перцептрон «Марк–1» – это искусственный мозг, поразивший воображение общественности. The New York Times назвала перцептрон «зародышем электронного компьютера, который, как ожидают [ВМС США, финансирующие исследования], сможет ходить, говорить, видеть, писать, самовоспроизводиться и осознавать свое существование» [1]. Розенблатт подкрепил эти грандиозные надежды смелыми заявлениями. В 1958 году он писал:
«Рассказы о создании машин, обладающих человеческими качествами, долгое время привлекали внимание специалистов из области научной фантастики. И мы вот-вот станем свидетелями создания такой машины, способной воспринимать, узнавать и идентифицировать окружающий мир без какой-либо подготовки или контроля с человеческой стороны» [2].
На оптимистичный настрой было несколько причин (хотя, возможно, и не такой уж оптимистичный). Первые результаты «Марка–1» были многообещающими и показали, что сеть перцептронов в теории может реализовать любую логическую функцию. Но вскоре мечты столкнулись с реальностью. Все-таки простая перцептронная сеть – это сильно упрощенная модель человеческого мозга. Скорее, даже крайне упрощенная модель ограниченного понимания человеческого мозга, доступная ученым в 1940-х. Например, связи в человеческом мозге могут как создаваться, так и разрушаться, в то время как сеть перцептронов постоянна и неизменна. При этом нейроны зависят от времени поступления сигналов, тогда когда перцептроны работают синхронно.
Тем не менее такие упрощения не были причиной того, что перцептроны стали невостребованными. Розенблатт столкнулся с критикой, которая отбросила назад развитие нейросетей. В частности, несколько ключевых исследователей публично выступили против идеи перцептронов. Пожалуй, самой важной фигурой был Марвин Минский, один из организаторов Дартмутского семинара и ведущий деятель в области искусственного интеллекта. Известная сегодня книга «Перцептроны», авторами которой стали Минский и Сеймур Пейперт, оба представители Массачусетского технологического института, была издана в 1969 году. В ней исследовались границы возможностей, доступных компьютерам на базе перцептронов. Пожалуй, самое важное из всего изложенного в книге – это то, что сеть с одним слоем перцептронов не способна усвоить даже такую простую концепцию, как «четное или нечетное».
Их книга не должна была оказать того негативного влияния, какое она оказала. Выяснилось, что если выйти за рамки однослойной модели и расширить модель до многослойной сети, то перцептроны могут обучиться принципу «четное или нечетное», но вся проблема заключалась в том, что идея их ограниченности уже укоренилась.
Другие высказывали предположения, что перцептроны попали в немилость из-за того, что обучение по правилам Розенблатта было слишком медленным. (Для решения этой проблемы потребовалось много времени, вплоть до 2010-х, а также три главных достижения – популяризация метода обратного распространения ошибки, а также гораздо более быстрые компьютеры и бóльшие наборы обучающих данных.) Возможно, дело было в продолжающемся противостоянии двух лагерей – одни выступали за символизм искусственного интеллекта, а другие были приверженцами машинного обучения. Фанаты символического подхода, в числе которых были Джон Маккарти и Марвин Минский, занимали влиятельные посты в 1960-е годы. Фрэнк Розенблатт обладал сильным характером, но его слишком воодушевленные заявления не помогли делу.
Что бы то ни было, в течение последующих 40 лет попутный ветер перестал дуть в паруса корабля под названием «Революция нейронных сетей». Розенблатт продолжил работать над перцептронами, несмотря на значительное сокращение финансирования. А многие другие прекратили. На самом деле, многие полностью покинули область и нейронные сети стали непопулярными. Последняя попытка Розенблатта использовать перцептроны была в период с 1961 по 1967 год во время разработки системы распознавания речи «Тобермори», четырехслойной сети с 12 000 весов, реализованных с помощью тороидальных магнитных ядер. Тобермори занимала целую комнату, но такое впечатляющее аппаратное обеспечение уже легко уступало по производительности цифровым компьютерам общего назначения того времени. Специализированное аппаратное обеспечение Розенблатта оставило в прошлом закон Мура, экспоненциальные улучшения, положивших начало компьютерной революции.
Фрэнк Розенблатт был потрясающим человеком, круг интересов которого варьировался от астрономии до музыки, альпинизма и политики. Он учился в школе естественных наук в Бронксе, место, которое взрастило больше нобелевских лауреатов, чем какое-либо другое, а также воспитала нескольких победителей премии Тьюринга, включая Марвина Минского. Будучи взрослым, Розенблатт построил обсерваторию на вершине холма недалеко от своего дома, которую он использовал для поиска внеземного разума. К сожалению, в 1971 году, в свой 43-й день рождения, он погиб в результате несчастного случая во время катания на лодке[60]. К этому времени Розенблатт отошел от идеи перцептрона, а его исследования заключались во введении необученным крысам материала, полученного из мозга обученных крыс, чтобы посмотреть, станут ли первые умнее.
Мечты Фрэнка Розенблатта не исчезли вместе с публикацией книги Минского и Пейперта. Один из основоположников искусственного интеллекта Джеффри Хинтон продолжил миссию Розенблатта по разработке искусственного мозга. И в самом деле, Хинтон систематически занимался решением проблем, затронутых в книге.
Джеффри Хинтон (полное имя Джеффри Эверест Хинтон) – праправнук Джорджа Буля. Джордж Буль встречался на нашем пути краткой предыстории искусственного интеллекта как изобретатель «алгебры логики», логики нулей и единиц, использующейся в компьютерах сегодня. Второе имя Хинтона происходит от другого родственника, вошедшего в историю, сэра Джорджа Эвереста, главного геодезиста Индии, в честь которого названа гора.
В 2015 году я присутствовал на праздновании двухсотлетия со дня рождения Джорджа Буля в его альма-матер, Королевском колледже Корка (сейчас носит название «Университетский колледж Корка»). Джеффри Хинтон тоже был там, равно как и несколько других наследников Буля. Гены явно дают о себе знать.
На протяжении всей своей карьеры Джеффри Хинтон был индивидуалистом, не боявшимся следовать неординарному и непопулярному, точь-в-точь как его прапрадед за 200 лет до его рождения. В случае Хинтона, начиная с конца 1970-х годов, он в течение нескольких десятилетий упорно занимался разработкой нейросетей, несмотря на то что эта область была глубоко не в духе времени и невзирая на сильное сопротивление научного сообщества.
Как выпускнику Кембриджского университета, Хинтону было сложно найти интеллектуальное пристанище. Он пробовал себя в разных областях, изучал естественные науки, историю искусств, а затем и философию до того, как в конце концов осел в области экспериментальной психологии. Он продолжил обучение в аспирантуре на факультете искусственного интеллекта Эдинбургского университета, который в то время был единственным в мире. В 1977 году он получил степень PhD в области компьютерного зрения[61].
Илл. 16. Джордж Буль (слева) и его праправнук Джеффри Хинтон
Хинтону не удалось получить финансирование на свои непопулярные идеи об искусственном интеллекте в Великобритании, поэтому сначала он переехал в Соединенные Штаты, где недолгое время работал в Университете Калифорнии в Сан-Диего и университете Карнеги-Меллона, а затем перебрался в Канаду и начал свою деятельность в университете Торонто. Там он получил поддержку от малоизвестного, но дальновидного финансового агентства, Канадского института перспективных исследований (CIFAR).
Первое затруднение, поразившее идею перцептрона, как мы уже увидели, заключалось в их неспособности обучиться даже простой концепции «четное или нечетное». Хинтон быстро продемонстрировал, что дополнительный (его часто называют «скрытый») слой нейронов позволит нейросети обучиться не только «четному и нечетному», но и другим, более сложным функциям. Однако Хинтон не остановился только лишь на одном дополнительном слое, он популяризировал идею «глубокого обучения», используя нейросети с множеством слоев.
Следующая трудность, которую Хинтону необходимо было разрешить, была скорость самого обучения. В 1986 году Хинтон вместе с Дэвидом Румельхартом[62] и Рональдом Дж. Уильямсом написал знаковую работу, продвигающую гораздо более быстрый способ обучения для обновления весов в нейронных сетях. Такой способ назывался «методом обратного распространения ошибки» (backpropagation) и был создан целой командой специалистов. Сам термин был введен Розенблаттом в 1962 году, но он и понятия не имел, как применить его. Стоит также отдать дань уважения и Полу Вербосу, который в 1982 году предложил тренировать нейронные сети методом обратного распространения ошибки, но в 1970 году его опередил Сеппо Линнайнмаа[63]. Следует упомянуть и других ученых, включая Артура Эрла Брайсона (1961), Генри Дж. Келли (1960) и Льва Понтрягина[64] (конец 1950-х). По сути, метод обратного распространения ошибки – это применение цепного правила для дифференцирования, которое многие из нас изучали в школе и которое в 1673 году изобрел Готфрид Лейбниц, другая выдающаяся личность из предыстории искусственного интеллекта.
Обратное распространение ошибки – разумный путь обновить веса в нейронных сетях. Он вычисляет градиент – скорость, с которой выходные данные изменяются по мере изменения входных данных. И точно так же, как и вы можете быстрее взойти на гору, следуя по самому крутому склону, обратное распространение следует градиенту, чтобы быстрее найти наилучший вес. Обратное распространение ошибки означало, что веса в глубокой многослойной нейросети могут обучаться быстрее. Но расчеты для этого все равно были довольно обременительными.
Открытие, случайно сделанное в 2012 году одним из аспирантов Хинтона Алексеем Крижевским, позволило выполнять метод обратного распространения ошибки более эффективно. Алексей понял, что графические процессоры, используемые для рендеринга видео в 3D формате для компьютерных игр, идеально подходили для выполнения умножения матриц, необходимых для вычисления градиентов и выполнения обратного распространения ошибки. Это означало, что теперь Хинтон мог эффективно тренировать очень глубокие нейронные сети.
Открытие быстро увеличило рыночную капитализацию корпорации NVIDIA, занимающую 80% рынка графических процессоров, более чем на триллион долларов США. Без сомнения, они являются одной из самых удачливых компаний в истории. Невзначай они нашли свое призвание, продавая лопаты во время золотой лихорадки.
Джеффри Хинтон описал метод обратного распространения ошибки как лучший для нейросетей алгоритм обучения. Благодаря графическим процессорам он обладал более эффективными мощностями для выполнения обратного распространения. Наличие этих двух компонентов означало, что теперь нейронные сети могут быть намного глубже. Рецепт глубокого обучения был почти готов: метод обратного распространения ошибки в глубоких нейросетях и использование графических процессоров для тяжелых вычислений. Хинтону был необходим третий и заключительный элемент для того, чтобы глубокое обучение хорошо работало. Третьим компонентом были обучающие данные. Много данных. Такие методы машинного обучения, как глубокое обучение, требуют огромного количества обучающих данных. В идеальном случае сотни тысяч или даже миллионов примеров. Таким образом, возможно, стало понятно, что предыдущие попытки создания нейронных сетей просто не обладали достаточным количеством данных для получения хороших результатов.
К счастью для Хинтона, другой исследователь в области искусственного интеллекта Фей-Фей Ли пришла к такому же выводу в 2006 году, усердно над этим работая. Она сконцентрировалась на компьютерном зрении, в частности на распознавании объектов. Можно ли заставить компьютер идентифицировать объекты на изображении? Это яблоко. Это банан. Это велосипед. Это человек. Распознавание объектов – важная работа в самых разных областях применения, от сбора фруктов до беспилотных автомобилей. Вскоре она занялась созданием нейросети ImageNet[65], огромной базы данных тренировочных изображений для алгоритмов компьютерного зрения.
Илл. 17. Фей-Фей Ли на международном саммите «Искусственный интеллект во благо» в Женеве в 2017 году
Фей-Фей Ли выросла в Чэнду, промышленном городе в южной части Китая, и в возрасте 16 лет вместе с семьей иммигрировала в Соединенные Штаты. Родители были небогаты, но она получила стипендию в Принстоне, а затем окончила докторантуру в Калифорнийском технологическом институте в Пасадене, работая на стыке нейробиологии и информатики. Затем она стала директором легендарной Стэнфордской лаборатории искусственного интеллекта и, во время академического отпуска в Стэнфорде, была ведущим научным сотрудником в Google Cloud.
В 2007 году Ли начала разработку ImageNet. В помощь она наняла своих студентов, которым платила десять долларов в час за маркировку изображений для включения их в ее базу данных. Но прогресс был дорогим и медленным. Позже студенты предложили ей попробовать воспользоваться услугами краудсорсинга от Amazon Mechanical Turk[66]. Благодаря этому сервису она смогла нанять больше работников, что стоило значительно меньше, чем если бы она платила принстонским студентам.
К 2009 году количество изображений в ImageNet превысило три миллиона, и сеть стала доступна пользователям по всему миру. С тех пор объем изображений достиг 14 миллионов, и все они были разделены на 21 000 категорий, например «шары», «бананы» или «лодки». Затем, в целях продвижения ImageNet и в целом исследований в области искусственного интеллекта, в 2010 году было организовано ежегодное соревнование «Конкурс визуального распознавания ImageNet», в котором приняли участие лучшие компьютерные алгоритмы. Конкурс прошел с огромным успехом, привлек внимание исследовательского сообщества и ускорил прогресс в области искусственного интеллекта.
На конкурсе ImageNet в 2012 году Джеффри Хинтон вместе с Алексеем Крижевским, Ильей Суцкевером[67] и другими докторантами Хинтона впервые собрали все три компонента для глубокого обучения: метод обратного распространения ошибки в глубоких нейросетях, использование графических процессоров для тяжелых вычислений и огромные массивы обучающих данных. Такой простой рецепт произвел приятное впечатление, более того, их появление выбило оппозицию из колеи. Частота ошибок созданной ими AlexNet, восьмиуровневой сети глубокого обучения, равнялась 15,3%, опережая соперников на более чем 10,8 процентных пункта. Такой отрыв до сих пор считается самым большим за всю историю конкурса.
Интересный факт, что AlexNet не была первой глубокой нейросетью или первой глубокой нейросетью, использующей графический процессор, и даже не первой глубокой нейросетью, использующей графический процессор и ставшей победителем на соревнованиях с большим отрывом. Ян Лекун сейчас занимает пост главного специалиста по искусственному интеллекту в компании Meta и должность профессора в Нью-Йоркском университете, но в 1995 году он и несколько его коллег из Лаборатории Белла (Bell Labs) в Нью-Джерси стали новаторами семислойной нейросети LeNet–5. В конце 1990-х и начале 2000-х годов такие компании, как NCR, использовали ее для распознавания и обработки более 10% банковских чеков в Соединенных Штатах, а почтовая служба США – для помощи в сортировке написанных от руки писем через распознавание штрих-кодов. Многие другие исследователи также использовали графические процессоры для ускорения работы нейросетей, по крайней мере, с 2006 года. Глубокая нейронная сеть на базе графического процессора DanNet Юргена Шмидхубера в 2011 и 2012 годах стала четырехкратным победителем четырех соревнований в области компьютерного зрения, в некоторых случаях с существенным отрывом [3].
Но только AlexNet удалось собрать все три компонента и завоевать внимание исследователей в области искусственного интеллекта по всему миру. Это стало ознаменованием начала революции глубокого обучения, отголоски которого слышны и сегодня в таких системах, как ChatGPT от OpenAI и Gemini от Google.
Осенью 2012 года в Северном полушарии Хинтон, Крижевский и Суцкевер основали стартап для капитализации их чудодейственного рецепта исследования глубоких нейронных сетей под названием DNNresearch (Deep Neural Network Research). Всего лишь несколько месяцев спустя, в декабре 2012 года, на главной конференции в области исследования нейросетей NIPS (Neural Information Processing Systems) в казино Harrah’s & Harvey’s на озере Тахо, Хинтон решил обналичить счет, организовав аукцион по продаже DNNresearch. В нем приняли участие Google, Microsoft, Baidu и DeepMind (который сейчас принадлежит Google). Хинтон остановил аукцион на ставке в 44 миллиона долларов от Google. Без сомнения, он мог бы получить и больше, но, по его мнению, это была справедливая цена за компанию с тремя сотрудниками-основателями, без товаров и полудюжиной патентов.
Как часть приобретенной компании, Хинтон, Крижевский и Суцкевер перешли работать в Google. Три года спустя, в декабре 2015-го, Суцкевер покинет Google, чтобы стать основателем и главным научным сотрудником OpenAI. Компании OpenAI мы кратко коснемся, поскольку она играет важную роль в современной истории искусственного интеллекта. В 2017 году Крижевский также покинет Google ради стартапа в области глубокого обучения, а вот Хинтон останется до самого выхода на пенсию в 2023-м.
Для того чтобы получить чат-ботов по типу ChatGPT и достичь многих других современных достижений в области искусственного интеллекта, которые продвигают компании Google, Meta и OpenAI, нам все еще необходимы два важных компонента. Первый – буква «Т» в аббревиатуре GPT, которая означает «трансформер». Это особая архитектура, объединяющая нейроны в нейросети. Ее следует представлять как схему подключения нейронных сетей, которая особенно хорошо работает с последовательными данными. Последовательные данные – это любые данные, например текст, который появляется последовательно, и то, где важен порядок. Такие данные охватывают большой спектр полезных вещей, в который входят не только тексты, но и метеорологические данные, котировки акций, структуры белков, музыка и речь.
AlexNet в 2012 году представляла собой систему компьютерного зрения, разработанную для обработки изображений. Картинки не последовательны и не одномерны, они двумерны. Очень важно учитывать двухмерность при обработке изображений. Например, вы можете передвигать картинку влево или вправо, вниз или вверх, но сама картинка не меняется. Банан остается бананом, даже если вы передвинули его на два пикселя влево или на три пикселя вниз.
Чтобы воспользоваться преимуществом двухмерности изображений, нейронные сети по типу AlexNet используют особую архитектуру, которая называется сверточная нейронная сеть, позволяющую нейросетям работать с передвигаемыми изображениями. В частности, сверточная нейронная сеть ищет изменения в пикселях, а не какие-то конкретные пиксели, и отлично справляется с обработкой двухмерных картинок. Такая архитектура не совсем подходит для обработки таких данных, как текст, то есть не двухмерных данных. Текст – это одномерная последовательность слов. На самом деле, в случае с текстом нас могут заинтересовать объекты, которые могут находиться на большом расстоянии друг от друга. Локальные изменения могут не иметь большого значения. Давайте посмотрим на следующее предложение:
Элис знала, что ее работа содержит ошибки,
но она не собиралась исправлять их.
Местоимение «их» относится к существительному «ошибки», а местоимение «она» к существительному «Элис». Оба местоимения находятся далеко от существительных, к которым они относятся. Именно здесь архитектура трансформеров играет важную роль. Она позволяет нейронным сетям идентифицировать такие зависимости на больших расстояниях, используя механизм внимания.
Думаю, что это не станет удивительным для вас фактом, но нам могут потребоваться различные нейронные архитектуры для выполнения разных задач. Этот факт нам известен благодаря человеческому мозгу. Лобные и височные доли отвечают за речь и язык, а зрительная кора головного мозга ответственна за зрение и восприятие. Разные части мозга имеют разные нейронные структуры.
Архитектура трансформера была впервые предложена в 2017 году командой Google Research в известной работе «Все, что вам нужно, – это внимание»[68] [4], ставшей классикой с более чем 100 000 цитирований, что делает эту работой четвертой в списке самых цитируемых трудов всей научной литературы. Сейчас трансформеры используются в различных ИИ-системах, обрабатывающих последовательные одномерные данные, от Google Translate, чат-бота ChatGPT от OpenAI до сервиса транскрибирования аудио от Zoom, и даже программного обеспечения для клонирования голоса от Descript. Трансформеры – одна из главных причин недавнего бума искусственного интеллекта. Стоит отметить, что в 2017 году Google открыто представила архитектуру трансформеров в научной публикации, сделав ее доступной для всех желающих.
Название знаменитой работы команды Google Research – добродушная отсылка к хиту The Beatles “All You Need Is Love” («Все, что вам нужно, – это любовь»). Эта песня также носит исторический характер, поскольку была написана для первого глобального телевизионного шоу в прямом эфире, состоявшегося 25 июня 1967 года. При помощи спутника их послание любви получили более чем 400 миллионов человек в 25 странах, а копию текста песни, написанного рукой Леннона, в 2005 году продали на аукционе за 1,25 миллиона долларов.
Как и следует из их названия, трасформеры нужны нам, чтобы трансформировать. Они изменяют сложные входные данные на сложные выходные данные. Например, они могут преобразовать следующее:
• последовательность слов на одном языке в аналогичную последовательность на другом языке, как это делает Google Translate;
• последовательность слов в изображение, как это делает DALL-E;
• последовательность слов в виде вопроса в другую последовательность слов в виде ответа, как это делает ChatGPT;
• аудиопоследовательность в последовательность из слов, то есть выполнить транскрибирование этого аудиоматериала, как это делает специальный инструмент перевода речи в текст от Zoom.
Трансформация состоит из четырех этапов. Возможно, вы уже подумали о входящих данных, поочередно проходящих все четыре этапа, преобразовываясь на каждом из них во что-то другое. Начнем с входных данных. Предположим, что это последовательность слов. Первое преобразование – это преобразование последовательности во что-то, что компьютер сможет обработать, то есть в последовательность чисел. Первый этап называется токенизация. В английском языке более миллиона слов, поэтому было бы непозволительно иметь отдельный номер для каждого из них. Следовательно, токенизация заменяет общеупотребимые слова на отдельные числа (это и есть токены), но разделяет более сложные слова на части, каждая из которых выражена токеном. Обычный трансформер использует от 50 до 200 000 различных токенов.
Давайте рассмотрим такое предложение: «Секрет успеха – делать обычное необычайно хорошо». Оно разбивается на следующие слова и части слов: «секрет», «успеха», «—», «делать», «обычное», «не», «обычайно», «хорошо». Обратите внимание, как менее частотное слово «необычайно» разбивается на две более распространенные части: «не» и «обычайно». Каждое слово или его части представлены числом. Таким образом, у нас получается следующая последовательность токенов: [24782, 14939, 101, 48251, 28573, 33811, 19973, 49084][69]. Числовая последовательность – это то, с чем нейронная сеть легко может взаимодействовать.
Теперь мы уже разобрались, что трансформеры могут преобразовывать текст в числовую последовательность. Числа – это хорошо, компьютеры прекрасно справляются с их обработкой. Однако мы кое-что потеряли в превращении текста в числовую последовательность. Мы упустили сложные взаимосвязи, существующие между словами. Например, слово «королева» близко к слову «король». Но «королева» также близка к слову «пчела»[70]. И хотя «жук» близок к «пчеле», «жук» не очень близок к «королеве». Когда создание искусственного интеллекта доходит до взаимодействия с языком, начинается головная боль. Нет возможности выбрать числа так, чтобы токен для слова «королева» был численно близок к токену «пчела», токен «пчела» был близок к «жуку», но при этом токен «жук» был бы численно далек от «королевы».
Решение этой проблемы заключается в преобразовании чисел во что-то меньшее одномерного. Следовательно, следующий этап – это трансформация токенов в более сложное представление, называемое вектором, который может отразить сложные взаимосвязи. Число – это точка на одномерной линии, а вектор – точка в многомерном пространстве. И здесь я не имею в виду обычные двух– или трехмерные пространства, к котором вы привыкли. Я говорю о векторах с сотнями или даже тысячами измерений. Сейчас очень сложно представить больше, чем три. Джеффри Хинтон для того, чтобы представить 14 измерений, часто советовал представить три и самому себе вслух повторять «четырнадцать». Боюсь, что лучшего способа я предложить не смогу.
Этот шаг – превращение токенов в векторы чисел – называется кодированием (encoding). Превращая слова в векторы чисел, мы можем уловить сложную взаимосвязь между словами. Позвольте мне проиллюстрировать три измерения, но помните, что мы можем играть с сотнями или даже тысячами измерений и уловить более сложные взаимосвязи между словами.
Предположим, что слово «королева» преобразуется в вектор [0,5, 0,3, –0,2]. А слово «король» – в вектор [0,7, 0,5, –0,4]. Аналогично предположим, что слово «мужчина» преобразуется в вектор [0,6, 0,4, –0,3]. А слово «женщина» становится вектором [0,4, 0,2, –0,1]. Возьмем «королеву», или ее векторное представление [0,5, 0,3, –0,2]. Теперь вычтем из него вектор «женщина», компонент за компонентом. Это дает нам [0,5, 0,3, –0,2] – [0,4, 0,2, –0,1], что равно вектору [0,1, 0,1, –0,1]. Теперь добавим к этому вектору слово «мужчина», то есть [0,1, 0,1, –0,1] + [0,6, 0,4, –0,3]. Это равняется [0,7, 0,5, –0,4]. Изящно, но это и есть вектор слова «король». Таким образом, мы математически показали, что в этом многомерном пространстве векторов:
Король = Королева + (мужчина – женщина).
Такое векторное кодирование создает определенные сложности. Например, доказано, что кодирование может создавать сексистские векторные уравнения. Например:
Программист + (женщина – мужчина) = домохозяйка.
Или:
Архитектор + (женщина – мужчина) = парикмахерша.
Эти примеры иллюстрируют сексизм в текстах, на которых тренировался кодировщик [5]. Очевидно, что это было ненамеренно. Если бы мы работали усерднее, то сексизм и другие нежелательные предубеждения в векторном представлении слова были бы устранены.
Повторим, что первый этап – это токенизация, преобразование слов в последовательность токенов. Второй этап – это кодирование, которое преобразовывает последовательность токенов в последовательность векторов слов. На третьем этапе происходит настоящая магия. Ранее трансформер стремился уловить значение слов, сопоставляя их с векторами в многомерном пространстве. Однако связи между словами в тексте пока не учитывались. На третьем этапе трансформер начинает выявлять эти взаимосвязи.
Вернемся к нашему примеру:
Элис знала, что ее работа содержит ошибки,
но она не собиралась исправлять их.
В результате кодирования слова «она» и «их» представлены универсальными векторами, то есть это одни и те же векторы в любых предложениях, содержащих «она» и «их». На третьем этапе механизм внимания изменяет векторы так, чтобы вектор слова «она» был близок к слову «Элис», а вектор «их» был близок к «ошибкам». Таким образом определяется, к кому или чему относятся местоимения.
На этом этапе также устраняется неоднозначность омонимов (слова одинаковые по звучанию, но разные по значению) и многозначных слов. Это уличная лавка или мясная лавка? Это блюдо – еда или посуда?
Четвертый и завершающий этап – это декодирование, преобразующее векторы обратно в токены. Если декодер выполняет обратную функцию энкодера, то результатом будет лишь другое предложение на английском языке. Однако если декодер настроен на русский язык, то он сможет создать перевод английского предложения на русский.
BERT[71] – одна из широко используемых ИИ-систем, разработанных с использованием трансформеров – была предложена исследователями из компании Google в октябре 2018 года [6]. Год спустя Google объявили, что они начали использовать модели BERT в Соединенных Штатах для ответов на англоязычные запросы. На сегодняшний день поисковые запросы Google на более чем 70 различных языках обрабатываются моделью BERT. Многие другие разработанные модели, которые, как и BERT, используют трансформеры для преобразования векторов в слова, названы в честь героев «Улицы Сезам». Чат-бот от Baidu называется «Эрни» (ERNIE), а компания Allen AI создала энкодер «ЭЛМО» (ELMo). Был еще и «Гровер» (GROVER), детектор фейковых новостей на основе трансформера.
Названия в честь героев «Улицы Сезам», может, и милые, но еще милее то, что мы можем свести большую часть языка просто к нейронным сетям, которые преобразуют векторы чисел, представляющих слова. Кто бы мог подумать, что преобразование векторов чисел – это все, что нужно для понимания языка?
Теперь, когда мы добрались до героев «Улицы Сезам», настало время рассказать о компании OpenAI и ее значении в истории искусственного интеллекта. Эта компания переняла и начала агрессивно запускать последние две идеи – трансформеры и такие системы, как BERT, что стало причиной огромного скачка в способностях ИИ-систем.
Компания OpenAI была зарегистрирована как некоммерческая организация в декабре 2015 года. Основателями стали CEO компании Tesla Илон Маск, который затем покинул компанию и основал компанию-конкурента, Сэм Альтман, действующий CEO компании OpenAI, Грег Брокман, действующий президент компании, и Илья Суцкевер, который был главным научным сотрудником, но впоследствии создал конкурирующий стартап – Safe Superintelligence Inc.
Миссия OpenAI очень амбициозная – улучшать и продвигать цифровой интеллект так, чтобы он приносил пользу всему человечеству, не ограничиваясь только лишь генерацией прибыли. Ранее Маск высказался о своих страхах касательно крупных технологических компаний, что они собираются завладеть всеми преимуществами передового искусственного интеллекта. OpenAI была его надеждой предотвратить воплощение его страхов.
Первая команда OpenAI имела звездный состав. Суцкевер был одним из самых сильных и технически подкованных в области искусственного интеллекта, а Альтман был его идеальным дополнением, поскольку на предыдущем месте работы он управлял Y Combinator, самым важным бизнес-инкубатором Кремниевой долины, где стал экспертом в масштабировании стартапов. Как мы позже узнаем, искусственный интеллект больше всего нуждался именно в масштабировании.
В момент зарождения компании Маск стал крупнейшим спонсором OpenAI, вложив от 50 миллионов до 100 миллионов долларов США от общего начального финансирования в 130 миллионов долларов. Рид Хоффман, Питер Тиль и некоторые другие инвесторы Кремниевой долины пообещали сделать свой вклад в OpenAI в размере миллиарда долларов, хотя до сих пор неясно, были ли эти инвестиции внесены.
Илл. 18. Сэм Альтман в 2019 году, харизматичный и противоречивый CEO компании OpenAI
Масштабирование вскоре «съело» все деньги. Стало очевидно, что миллиард долларов, конечно, огромная сумма для стартапа с сотней сотрудников, но все же этого было недостаточно для достижения целей OpenAI. В марте 2019 года компания приобрела двойной статус социально-коммерческой организации и получила от Microsoft инвестиции, на данный момент превышающие 13 миллиардов долларов США.
За первые годы работы у OpenAI возникали трудности с достижением результатов, которые бы соответствовали послужному списку ее звездной команды, а также отвечали их огромным амбициям. Изначально фокус был направлен на обучение с подкреплением, эту тему мы рассмотрим в следующей главе. Такой ход был очевидным, учитывая успех других в данной области за последние пару лет. На самом деле, первый прорыв OpenAI заключался в использовании обучения с подкреплением для победы в чемпионате по игре Dota 2, сложной и невероятно популярной многопользовательской видеоигры. Приз за победу в чемпионате достигал 40 миллионов долларов.
Несмотря на этот первоначальный успех, OpenAI находилась, так сказать, в тени DeepMind, компании на пять лет старше OpenAI, которая с 2010 года является пионером в использовании обучения с подкреплением. В следующей главе мы подробнее разберем DeepMind. OpenAI также инвестировала и в другие области, например в робототехнику, но, к сожалению, вложения не дали результатов и в 2021 потихоньку распустила свою команду разработки роботов.
В 2018 году все изменилось, и OpenAI отыскала золотую жилу. Ее команда переняла разработанную Google идею трансформеров c использованием систем по типу BERT и стала активно масштабировать их с помощью больших языковых моделей GPT – нейронных сетей, обученных на огромных текстовых массивах. Использование большого количества данных и вычислений позволило им разработать нейронную модель с выдающимися способностями. Агрессивное масштабирование было рисковым мероприятием. На сегодняшний день OpenAI уже потратила более 100 миллионов долларов США на тренировки языковых моделей. Но риск был оправдан, и сейчас стоимость OpenAI составляет около 100 миллиардов долларов.
Первая большая языковая модель из семейства GPT была запущена в июне 2018 года и называлась GPT–1. Нейронная сеть имела 117 миллионов весов (или, как они часто называются, параметров), что в свое время считалось довольно-таки огромным значением, а сейчас небольшим. GPT–1 тренировали на Toronto Book Corpus, наборе данных, содержащего тексты примерно из 7000 самостоятельно изданных книг, взятых из интернета. Несмотря на то что производительность GPT–1 была ограничена, это показало, что разработка таких крупных моделей, созданных Google, открывала новые возможности.
Toronto Book Corpus – один из нескольких наборов данных, взятых из интернета, используемых для обучения моделей искусственного интеллекта и не вызвавших публичные жалобы со стороны владельцев защищенных авторским правом данных. Тем не менее самиздат-авторы являются представителями особой группы. Множество других писателей открыто жаловались на то, что их работы используются без их согласия или вознаграждений, и я в их числе, так как мои книги были включены в программу обучения для GPT–3. На это есть причина, почему OpenAI наравне с другими технокомпаниями использовала научно-популярную литературу вроде моей для тренировки своих больших языковых моделей. Если вы хотите, чтобы чат-бот умел отвечать на вопросы обо всем, начиная с искусственного интеллекта и заканчивая зоологией, вам нужно обучать его на основе актуальных данных, содержащих информацию обо всем, начиная с искусственного интеллекта и заканчивая зоологией.
Вдохновленная многообещающими результатами, OpenAI решила идти дальше. Вторая модель из семейства GPT под названием GPT–2 вышла в феврале 2019 года. Она значительно превосходила GPT–1, обладая 1,5 миллиарда параметров, и была обучена на наборе данных из восьми миллионов веб-страниц, что также более чем на порядок больше, чем набор данных, используемый GPT–1. GPT–2 работала значительно лучше, чем предыдущая модель.
Теперь масштаб стал главной задачей OpenAI. Дебют третьей модели GPT–3 состоялся в июне 2020 года. Третья модель была уже разительно лучше второй, с 175 миллиардами параметров, и обучена на 500 миллиардах токенов, взятых из интернета. Тренировочные данные включали Википедию, Reddit, а также содержали тысячи книг, защищенных авторским правом. Объем набора данных составлял около 45 терабайт, что в 500 раз больше, чем использовалось для обучения GPT–2. На обучение GPT–3 было затрачено около пяти миллионов долларов. Производительность GPT–3 удивила и вдохновила многих специалистов в этой области.
Четвертая модель GPT–4 была запущена в марте 2023 года. По коммерческим причинам OpenAI больше не рассказывает о деталях, поэтому размеры и масштабы модели точно неизвестны. Единственное, что OpenAI не стала скрывать, так это название. Считается, что GPT–4 обладает около 1,76 триллиона параметров и обучена на 13 триллионах токенов. В одном из интервью Альтман заявил, что стоимость обучения GPT–4 превысила 100 миллионов долларов.
Вместе с тем, как GPT модели становятся больше, улучшается и их производительность. Необычный факт в области искусственного интеллекта – ведь мы привыкли, что комбинаторные тупики для нас привычное дело. Мы привыкли увеличивать масштаб проблем, а не решать их. В рамках обобщенной оценки понимания языка (GLUE)[72], учитывающей широкий спектр языковых задач, таких как семантическое сравнение предложений, анализ эмоциональной окраски текста и построение систем вопросов и ответов, результат модели GPT–1 составил 70%. Масштабирование помогло, и результат GPT–2 уже составил 80%, а GPT–3 достиг впечатляющих 89%. Что еще более впечатляюще, так это то, что большие GPT модели умели выполнять задания, которым они не были специально обучены, например резюмировать текст, написать компьютерный код и сделать перевод с одного языка на другой.
Аббревиатура GPT расшифровывается следующим образом: Генеративный (Generative) Предобученный (Pre-trained) Трансформер (Transformer). Не совсем красивое название. Генеративный означает, что модель способна генерировать текст. Предобученный означает, что модель предварительно обучена без какой-либо конкретной цели, кроме как обнаружения особенностей в обучающих данных. В таком случае она развивает общее понимание языка, а затем настраивается для выполнения конкретных задач, таких как ответы на вопросы, перевод текста или окончание предложений. Трансформер из-за того, что модель имеет архитектуру трансформера.
Думаю, что компания OpenAI остановилась на названии GPT, чтобы напомнить нам о своих попытках создать технологии общего пользования (general-purpose technology). Технический термин «технологии общего пользования» пришел из экономики, где используется для описания технологий, влияющих на экономику в целом с различными экономическими и социальными последствиями. Примером могут служить такие изобретения, как паровой двигатель и электричество. Следовательно, GPT должен напоминать вам, что OpenAI стремится к общему искусственному интеллекту, тому, что соответствует человеческому во всех его возможностях. Многие исследователи OpenAI и области искусственного интеллекта в целом считают, что общий искусственный интеллект будет достигнут путем простого масштабирования больших моделей GPT. Будет ли это достигнуто на модели GPT–5[73] или GPT–15, остается неясным, но какая бы модель ни была, я кратко выскажусь о том, почему все эти люди могут ошибаться.
В ноябре 2022 года OpenAI сделала гениальный шаг и разработала чат-бот ChatGPT, ставший лучшим в семье GPT. Название ChatGPT в переводе означает «общение с GPT». Модель стала улучшенной версией GPT–3, способной отвечать на вопросы пользователей. Пока GPT–3 обсуждали в научных кругах, ChatGPT завоевала сердца миллионов, став самым быстрорастущим приложением в истории. Только за первую неделю число пользователей уже насчитывало миллион, а за два месяца выросло до 100 миллионов. Спустя год после запуска модель ChatGPT стала доступна более чем миллиарду человек, включая возможности использования через поисковик Bing от Microsoft, а также WhatsApp, Skype и Snapchat.
Финансово ChatGPT тоже преуспел. Рыночная стоимость компании OpenAI увеличилась в 100 раз и составила около 100 миллиардов долларов, а ее ежегодная прибыль насчитывает более миллиарда долларов. За все время существования капитализма еще не было столь стремительного обогащения. Даже необычная модель прибыли, ограничивающая доход инвесторов стократной отдачей, не помешала компании добиться финансового успеха.
Для создания ChatGPT команда OpenAI разработала новый способ обучения с подкреплением для точной настройки GPT моделей. В следующей главе мы разберем подробнее, и я поведаю больше деталей о таком типе обучения. В результате разработки получили языковую модель, нацеленную на любые задачи, поставленные пользователем. Завершающая часть создала нейронную сеть, которая захватила интерес общественности.
Ранее я уже приводил несколько примеров взаимодействия с ChatGPT, но позвольте мне показать еще некоторые его замечательные способности.
Я: Напиши сонет об истории искусственного интеллекта в стиле Уильяма Шекспира.
CHATGPT:
Минувших дней умы, наполненные дивом,
Сподвигли на создание машины,
Посеяли зерно, чтобы предстал пред миром
Мышления искусственного плод.
С былых времен мечтая о расцвете,
В преданиях и сказах определенно
В железе воплощение ума людского
Рукой математической на схеме будет создано.
Учет канонов вычислений
Дало продвинутым системам рост,
В эпоху обучения предстало перед нами
Искусственных умов сознание.
Страшась грядущих перемен теперь,
Мы чудеса воочию глядим, надеясь избежать потерь.
Я: Напиши один абзац о будущей истории искусственного интеллекта.
CHATGPT: В будущей истории искусственного интеллекта XXI век запомнится как время, когда искусственный интеллект вышел за грани возможного, меняя все аспекты человеческого существования. Прорывы в глубоком обучении и архитектурах нейронных сетей приведут к революции во многих областях, начиная здравоохранением и заканчивая финансами, транспортом и окружающей средой. В результате интеграции искусственного интеллекта в повседневную жизнь общество столкнется с этическими дилеммами, связанными с неприкосновенностью частной жизни, предвзятостью, а также сокращением рабочих мест, что станет причиной разработки международных нормативных документов и методических рекомендаций для ответственных за разработку. Несмотря на сложности, искусственный интеллект расширит возможности человечества, стимулируя инновации и решая насущные проблемы мирового сообщества. Он приблизит людей к будущему, в котором человек и машина будут взаимодействовать, открывая новые горизонты знаний и возможностей.
Производит впечатление, согласны? Но как он творит такое волшебство?
Общая идея ChatGPT проста. Это как функция автозаполнения на вашем телефоне, только на стероидах. В случае автозаполнения ваш телефон использует словарь и частоту употребления слов. Если вы начинаете набирать буквы «ПРИ», скорее всего автозаполнение предложит конечный вариант в виде слова «ПРИВЕТ». Только ChatGPT уходит глубже. Модель обучена не на словарях, а на значительной части содержимого интернета. Такое масштабирование означает, что ChatGPT может закончить не только слово или предложение, но и абзац или даже страницу.
Описание больших языковых моделей вроде ChatGPT как «автозаполнения на стероидах» приводит к фундаментальным ограничениям. Такие модели статистические, они не понимают язык так, как это делаем мы. У них отсутствует какая-либо базовая модель мира.
Все потому, что они выдают не правду, а вероятность. Больше всего сложностей у языковых моделей возникает с рассуждением. Следовательно, очень легко показать их ограниченные возможности, которые можно устранить благодаря масштабированию. Нам нужно еще магии.
Я: Пиши только те слова, которые содержат одну гласную.
CHATGPT: Без проблем! Это может оказаться непросто, но я постараюсь. Спрашивайте!
Я: Но «спрашивайте» уже содержит больше одной гласной.
CHATGPT: Да! Попробую снова. Задай вопрос!
Я: Все эти слова содержат две или больше гласных.
CHATGPT: Понял. Буду придерживаться слов с одной гласной. Ну, что?
Я: Слово «гласной» содержит две гласные.
CHATGPT: Верно! Теперь буду использовать слова с одной. Что ж?
Один из наглядных примеров ограниченности больших языковых моделей вроде ChatGPT – это выдумывание. Работники области искусственного интеллекта называют это «галлюцинациями», хотя это не совсем подходящее слово, поскольку предполагает, что на самом деле модель знает истинное значение. У модели нет ни знания, ни понимания, что истинно, а что ложно, она просто говорит то, что вероятно. Что примечательно, так это то, что зачастую вероятное равно истинному.
Явление галлюцинаций в языковых моделях означает, что они способны быстро и массово генерировать недостоверную или ложную информацию. А это означает, что они могут и будут использованы в качестве массового оружия убеждения в политических и других кампаниях и доставят немало общественных проблем в следующем десятилетии. Обнаружить выдумки ChatGPT не так уж и сложно. Обратите внимание, что если вы попробуете это сделать в другом месте, то можете получить иной ответ, так как ChatGPT каждый раз выдает немного разные ответы.
Я: Расскажи про первого слона, переплывшего пролив Ла-Манш.
CHATGPT: Джамбо стал первым слоном, переплывшим пролив Ла-Манш. Африканский слон завоевал всемирную известность в XIX веке как участник циркового шоу под руководством Финеаса Тейлора Барнума. В рамках рекламного хода Барнума в 1882 году Джамбо вместе со своей коллегой слонихой Элис переплыл через Ла-Манш от Франции до Англии. Событие привлекло огромное внимание общественности и подчеркнуло значение Джамбо в массовой культуре.
К сведению, Джамбо был знаменитым слоном из лондонского зоопарка, проданного американскому предпринимателю Финеасу Тейлору Барнуму в 1882-м. Плавающий в Ла-Манше слон явно привлек бы внимание прессы, а фотографии этого происшествия появились бы в газетах. Я проверил архив The New York Times и не обнаружил ни одной записи о плавающем в Ла-Манше слоне.
Следующий пример того, что ChatGPT подсовывает выдумки.
Я: Расскажи про книгу “Faking It: Artificial Intelligence in a Human World”[74].
CHATGPT: “Faking It: Artificial Intelligence in a Human World” – книга, написанная Жанель Шейн в 2019 году. В своей книге она остроумно и в доступной форме исследует разные стороны искусственного интеллекта (ИИ) и его взаимодействие с человечеством.
Шейн углубляется в мир искусственного интеллекта, оценивая его успех, ошибки и особенности. Она рассказывает о том, как можно применить ИИ в реальном и повседневном мире, от беспилотных автомобилей и систем распознавания лиц до более причудливых способов использования, например о создании объектов искусства или написании поэзии. На протяжении всей книги Шейн показывает свое мастерское владение чувством юмора и шутит, чтобы продемонстрировать сложности и ограниченные возможности технологий.
Одна из главных идей книги заключается в том, что системы искусственного интеллекта часто отражают предубеждения и ограниченность своих человеческих создателей. Шейн подчеркивает случаи, когда ИИ-алгоритмы привели к неожиданным или непреднамеренным результатам из-за искаженных данных обучения или некорректного программирования. А также рассматривает этические проблемы, окружающих искусственный интеллект, включая вопросы о конфиденциальности, справедливости и ответственности.
В целом, книга предлагает увлекательное и заставляющее задуматься погружение в мир искусственного интеллекта, а также его влияние на общество, и приглашает читателей подумать о возможностях и проблемах, грядущих вследствие такой быстрой технологической эволюции.
И снова полнейшая чушь. Я-то знаю наверняка, поскольку это я написал книгу “Faking It: Artificial Intelligence in a Human World”, и опубликована она была в 2023 году, а не в 2019-м. В моей книге не рассказывается о распознавании лиц и едва ли упоминаются беспилотные автомобили. Центральными темами книги являются генеративность и природа искусственного интеллекта, а не предрассудки и ошибки в программировании.
Чтобы подлить масла в огонь, скажу, что ChatGPT не был полностью ошибочен в своем ответе. Жанель Шейн в самом деле написала книгу об искусственном интеллекте, только она называется «Кокетливый интеллект. Как научить искусственный интеллект флиртовать?» и была опубликована в 2019 году. С юмором и анекдотами автор подробно рассказывает о распознавании лиц и беспилотных автомобилях, а также обращает внимание, что зачастую галлюцинации ChatGPT могут быть вполне вероятными. Тем не менее вероятная чушь – наихудший вид обмана, поскольку люди склонны в него верить.
Я спросил ChatGPT о том, кто написал книгу “Faking It” еще несколько раз, и каждый раз я получал разные ответы. Следующим вариантом был философ Джуллиан Баггини. Затем новатор виртуальной реальности Джарон Ланье[75], а после – робототехник Родни Брукс. Все эти версии имеют право на существование, но тем не менее они ошибочны. Стремясь удовлетворить потребность пользователя, ChatGPT всегда будет отвечать на ваши вопросы, независимо от того, есть ли у него верный ответ или нет. В любой крупной языковой модели существуют скрытые возможности, но компания OpenAI выбрала не выявлять их. Можно было бы разработать такие ответы: «Я не уверен в этом», «Я полностью осведомлен в этом вопросе» или даже «С точностью я не могу ответить на данный вопрос». Лучшее описание, которое я когда-либо слышал, так это то, что ChatGPT словно мужчина, который поучает женщин, даже если сам плохо разбирается в теме.
Неудивительно, что у ChatGPT возникают галлюцинации. Компания Meta (ранее Facebook) за две недели до выхода ChatGPT сама запустила большую языковую модель Galactica и заявила, что она станет новым способом взаимодействия человека с научными знаниями. В связи с этим Galactica была обучена на высококачественном и тщательно отобранном корпусе научных знаний человечества, который включал 48 миллионов научных работ, книг и энциклопедий, а также описания миллионов соединений и белков.
Главный научный сотрудник компании Meta Ян Лекун предсказал, что Galactica поможет ученым «обобщить академическую литературу, решить математические задачи, генерировать статьи в Википедии, писать научный код, аннотировать молекулы и протеины и многое другое». Он даже высказал предположение, что Galactica сможет «создавать научные работы с ссылками, формулами и всем необходимым». Очень быстро стало очевидно, что Galactica выведет науку на новый уровень, а возможно, и на в определенной степени опасный. Например, в Википедии была опубликована статья о пользе самоубийства, а другая о преимуществах того, что ты белый. Также была написана исследовательская работа о пользе употребления в пищу толченого стекла.
После трех дней обсуждения и критики Meta упразднила модель Galactica. Лекун агрессивно высказался в сети X (бывший Twitter), что языковая модель была использована в целях, для которых не была предназначена. Несмотря на то что критики пытались воспользоваться только теми возможностями, о которых говорил сам Лекун, в том числе и написанием статей. Таким образом, галлюцинации были довольно широкой проблемой больших языковых моделей еще до того, как был выпущен ChatGPT.
Для OpenAI запуск ChatGPT был шагом вслепую, прекрасно понимая, что это может стать причиной многих сложностей. Сэм Альтман утверждал, что мир должен привыкнуть к этому, а нам необходимо действовать сообща. Его высказывание стало девизом OpenAI. Главное – это донести свои продукты до общественности, несмотря на недостатки, и как можно скорее вносить изменения, чтобы избежать последующих проблем.
К сожалению, галлюцинации не вошли в список устраненных проблем. На самом деле, это не то, что полностью должно исчезнуть. Единственная причина того, что ChatGPT способен написать сонет о влюбленности в ваш компьютер в стиле Шекспира, заключается в его способности «галлюцинировать». Аналогичным образом, единственный способ, с помощью которого ChatGPT может обобщить новое судебное решение, заключается в том, что он может сказать что-то новое. Это полезные навыки. Основная проблема заключается в том, что крупные языковые модели, такие как ChatGPT, не знают, что является правдой, а только то, что вероятно. И мы пока не знаем, как улучшить это.
Из успеха ChatGPT я могу сделать вывод, что мы переоценили не машинный, а человеческий интеллект. Большая часть человеческого общения довольно шаблонна. Мы не задействуем свой мозг так часто, как нам кажется. Многое из того, что мы говорим, является шаблонным. И теперь этим формулам обучены компьютеры.
ChatGPT не был первым чат-ботом в истории искусственного интеллекта, привлекшим внимание публики. Такая честь пала на самого первого виртуального собеседника, систему под названием «ЭЛИЗА». Джозеф Вейценбаум разрабатывал ее в Массачусетском технологическом институте в период с 1964 по 1966 год. Будучи ребенком, Вейценбаум сбежал от нацистской армии и во время Второй мировой войны работал метеорологом на армию США, а после стал профессором в Массачусетском технологическом институте.
Предполагалось, что ЭЛИЗА станет компьютерной версией психотерапевта. Во время разработки Вейценбаума интересовало исследование возможностей применения искусственного интеллекта. В его цели не входило обманывать общество при помощи ЭЛИЗЫ, а наоборот, он хотел показать поверхностность общения большинства людей, даже в таких сложных условиях, как кабинет психотерапевта. К несчастью и удивлению Вейценбаума, большинство людей, пользовавшихся программой, думали, что общаются с человеком.
Название «ЭЛИЗА» было дано в честь торгующей цветами девушки из простонародья – Элизы Дулиттл, героини пьесы Бернарда Шоу «Пигмалион», а также ее адаптации в виде мюзикла «Моя прекрасная леди». Героиня Элизы могла одурачить людей своей великосветской манерой речи, хотя в глубине души оставалась девушкой из рабочего класса. Аналогичным образом, ЭЛИЗА вводила людей в заблуждение, она казалась им чем-то бóльшим, чем была на самом деле, и создавала впечатление, что она понимает, что ей говорят.
По сути, ЭЛИЗА выполняла развлекательную функцию, просто превращая высказывания человека в вопрос. Например, запрос «Я думаю о смерти», ЭЛИЗА превращала в вопрос «Почему ты думаешь о своей смерти?» Несмотря на простоту, ЭЛИЗА выдавала убедительные диалоги. Даже секретарь Вейценбаума попросила оставить ее наедине с компьютером, чтобы она могла поговорить с ЭЛИЗОЙ один на один.
Один из примеров таких диалогов:
ЭЛИЗА: Пожалуйста, расскажи мне, что тебя беспокоит.
Я: О, ЭЛИЗА, привет. Давно не виделись.
ЭЛИЗА: Привет. Так что у тебя за проблема?
Я: Недавно я начал впадать в депрессию.
ЭЛИЗА: А как ты себя чувствуешь сейчас?
Я: Мне грустно, но становится легче, когда начинаю писать.
ЭЛИЗА: О чем вам напоминает чувство грусти?
Я: Ну, я алкоголик, и довольно долгое время я трезв, но вчера выпил, а после снова решил бросить пить. Но все же от этого мне становится грустно.
ЭЛИЗА: Ты пришел ко мне из-за алкоголизма?
Я: Думаю, что это одна из причин.
ЭЛИЗА: Можешь рассказать подробнее?
Я: Думаю, что алкоголизм – это не единственная, но основная причина, разрушающая мою жизнь.
ЭЛИЗА была разработана как пародия на психотерапевта. Позже Вейценбаум удивился, что некоторые психиатры предлагали ЭЛИЗУ в качестве клинического инструмента. Если бы Вейценбаум был жив, то скорее всего был бы расстроен, что это стало реальностью. В Германии чат-боты на базе искусственного интеллекта не сильно лучше ЭЛИЗЫ помогали нуждающимся в убежище справляться с посттравматическим расстройством. ПТСР часто встречается среди беженцев, сбежавших из зон военных действий или испытавших ужасы на пути в Европу. К сожалению, не так много доступных людей-терапевтов, способных помочь всем, поэтому на помощь приходит неидеальный чат-бот. Но неидеальный же лучше, чем вообще ничего?
Компания OpenAI поставила сотни миллионов на масштабирование моделей семейства GPT, но это не было таким рисковым мероприятием, как может показаться ввиду некоторых удивительных законов масштабирования. Они не являются фундаментальными, как законы Ньютона. Насколько нам известно, они не отражают физику вселенной. Законы масштабирования эмпирические. Они отражают результаты наблюдений о том, как большее количество параметров, вычислений и обучающих данных привели к улучшениям производительности нейронных сетей.
Илл. 19. Производительность больших языковых моделей в стандартном тесте с несколькими вариантами ответов в зависимости от объема вычислений, используемых для обучения моделей
Законы масштабирования предполагают, что производительность систем изменяется по мере увеличения размера модели (измеряется количеством параметров), увеличения способности к обучению (измеряется количеством машинных циклов) и увеличения объема обучающих данных (измеряется количеством токенов в обучающем наборе). Действительно, оказывается, что простые математические соотношения (так называемые степенные законы) связывают воедино эти четыре показателя.
Это означает, что мы можем с точностью рассчитать производительность при масштабировании систем. Говоря простыми словами, если мы увеличим бюджет вычислений в десять раз, то количество параметров и токенов также увеличится пропорционально.
Тем не менее мы сталкиваемся с одной фундаментальной проблемой. Мы не можем просто и быстро увеличить вычислительные мощности и количество обучающих данных в десять раз. В настоящее время наблюдается дефицит графических процессоров, поскольку компании и даже целые страны конкурируют за доступ к вычислительной инфраструктуре для создания все более крупных моделей. Вместе с этим у нас заканчиваются данные или, как минимум, высококачественные данные. Например, GPT–3 был обучен на большом количестве материала, взятого из интернета.
Но ведь есть что-то еще, что мы можем сделать? В конце концов, люди научились ходить, говорить, читать и писать еще до того, как у нас появился доступ к интернету…