Мы подобрались к обучению с подкреплением, пятой и предпоследней идее в этой истории искусственного интеллекта. Очередная идея, украденная у природы. Вы можете учиться на собственном опыте, получая награду за успех и наказание за ошибку.
Множество вещей мы изучаем на практике. Мы садимся на велосипед и падаем с него, снова садимся, проезжаем небольшое расстояние и снова падаем. Медленно, но уверенно мы учимся делать больше правильных вещей и избегать неправильных. Возможно, компьютеры могут обучаться таким же способом?
Эта идея намного сложнее, чем кажется изначально. Подумайте об обучении шахматам. Предположим, что вы играете и проигрываете. Вам необходимо некое наказание за ошибку, чтобы не повторить ее снова. Но какой именно ход привел к поражению? Несмотря на общий проигрыш, за время игры сделано много хороших ходов. Просто не было возможности исправить ошибку, допущенную в самом начале. Теперь как вы определите плохие ходы?
А сейчас представьте, что вы выиграли. И вам необходимо получить награду за достигнутый успех, но какие именно шаги привели вас к такому результату? Несмотря на победу, за время игры вы сделали несколько неудачных ходов, но их было недостаточно, чтобы в итоге проиграть. Также возможно, что мог быть сделан единственный решающий ход, который принес победу. Это довольно-таки популярная проблема в области искусственного интеллекта и называется «проблема распределения заслуг». Как понять, какое именно действие привело к конечному результату, если только лишь в конце игры мы понимаем, выигрыш это или проигрыш? Проблема заключается в распределении заслуг за выигрыш и вины за проигрыш за различные ходы, сделанные на протяжении всей игры.
Один из первых исследователей искусственного интеллекта Дональд Мичи использовал метод обучения с подкреплением для игры в крестики-нолики с механическим компьютером. Коллега из Эдинбургского университета поспорил с Мичи, что тот не сможет построить обучающую машину. На самом деле, коллега утверждал, что создать такую машину невозможно. Но в 1960 году, чтобы доказать неправоту своего коллеги, Дональд создал MENACE (Machine Educable Noughts and Crosses Engine), обучающийся машинный движок для игры в крестики-нолики. Это был компьютер, построенный из спичечных коробков, в котором был использован метод обучения с подкреплением. И действительно, MENACE научился играть идеально, так что выиграть у него стало невозможно.
Компьютер Мичи был прост и состоял из 304 спичечных коробков, каждый из которых представлял различные варианты возможного расположения крестиков и ноликов на игровом поле. Выяснилось, что существует 304 уникальных состояния поля, если не учитывать повороты и зеркальные отражения. Первый ход делал MENACE – для того чтобы компьютер ходил вторым, понадобилось бы намного больше коробков. Каждый квадратик на игровом поле имел свой цвет. В коробках находились шарики разного цвета, каждый из которых обозначал один из девяти возможных ходов. Сначала из спичечного коробка наугад вынимался шарик, показывающий текущее состояние игрового поля. После, руководствуясь цветом шарика, можно было понять, где MENACE сделал свой следующий ход.
Илл. 20. MENACE, воспроизведенный Мэттью Скроггсом в 2015 году
По окончании игры, если победа была за MENACE, цветные шарики возвращались в свои спичечные коробки, а также добавлялось три бонусных шарика одного цвета как награда за успешную игру. Но если же MENACE проигрывал, в качестве наказания за ходы, приведшие к проигрышу, никакие шарики не возвращались. Таким образом, распределение заслуг MENACE было довольно-таки простым. При победе все ходы награждались, а при проигрыше все ходы наказывались. Такое незамысловатое распределение заслуг отлично подходит для обучения таким простым играм, как крестики-нолики. Спустя несколько сотен партий MENACE стал играть идеально. В противном же случае MENACE всегда проигрывал бы. Но MENACE невозможно обыграть. Вы только посмотрите на это: набор неодушевленных спичечных коробков победил человечество!
Такие игры, как шахматы или крестики-нолики, – наиболее подходящие направления для применения принципа обучения с подкреплением, поскольку есть четкий показатель успеха. Обучение может быть и самостоятельным, например когда компьютер играет сам с собой. Такой метод обучения можно применять и для тренировки роботов в ходьбе или поднятии предметов.
Позже Мичи использовал обучение с подкреплением, чтобы научить робота эквилибристике. Тем не менее такое обучение намного медленнее, чем игра в виртуальные игры. А когда робот делает ошибки, вы можете сломать его. Именно по этим причинам для роботов все чаще применяется обучение с подкреплением не в реальном мире, а на симуляторе.
Интерес Мичи к искусственному интеллекту возник еще в самом начале зарождения этой области. Прежде чем работать в Эдинбурге, он занимал должность взломщика кода в Блетчли-парке. Именно здесь он подружился с Аланом Тьюрингом. Совместное времяпрепровождение за обедом и плохие навыки игры в шахматы помогли им сблизиться. Мичи и Тьюринг задумались о том, могут ли машины научиться играть в шахматы. И более масштабный настигший их вопрос: могут ли машины мыслить?
После создания MENACE я часто встречал Дональда, и он рассказал мне несколько занимательных историй о расшифровке кода во времена деятельности Тьюринга в Блетчли-парке. Например, боясь немецкого вторжения, Тьюринг закопал несколько серебряных слитков во дворе загородного дома, но забыл, где именно. Серебро до сих пор хранится где-то под землей. Во время работы в Блетчли Тьюринг настолько дорожил своей кружкой, что привязал ее к батарее, но радиатор находился слишком далеко от раковины, чтобы кружку можно было помыть. В результате многие люди, включая Мичи, опасались за здоровье Тьюринга.
Наконец мы подобрались к следующему прорыву в области искусственного интеллекта, который осуществился благодаря компании DeepMind, основанной в 2010 году двумя учеными из Университетского колледжа Лондона Демисом Хассабисом и Шейном Леггом, а также общественным деятелем и другом детства младшего брата Демиса Мустафой Сулейманом.
Илл. 21. Демис Хассабис (слева) и Мустафа Сулейман
С момента своего основания компания DeepMind оказала сильное влияние на сферу искусственного интеллекта. Из трех ее основателей Легг держался в тени (я уважаю его решение и не даю его фотографию здесь), а Хассабис и Сулейман – нет. Демис Хассабис, или по полному титулу сэр Демис Хассабис, сейчас возглавляет отдел искусственного интеллекта в Google. Мустафа Сулейман возглавляет такой же отдел, но уже у конкурента, в компании Microsoft. Думаю, что все мы должны осознать, что большая часть будущего искусственного интеллекта, так или иначе, находится в руках двух друзей, которые впервые встретились в начальной школе на севере Лондона.
Хассабис был одаренным ребенком. Он научился играть в шахматы в возрасте четырех лет, достиг гроссмейстерского уровня в 13, а также возглавлял несколько английских юношеских команд. Во время годового перерыва перед началом учебы в Кэмбридже Хассабис работал геймдизайнером. Вышедшая в 1994 году игра Theme Park[76] разошлась миллионным тиражом, а вырученные средства позволили ему оплатить учебу в университете. Хассабис получил степень в области информатики в Кембриджском университете, а затем стал доктором когнитивистики в университетском колледже Лондона. Его образ мальчугана в толстых очках напоминает мне Брэйнса из сериала «Тандербёрды: Международные спасатели».
Мустафа Сулейман же, напротив, в отличие от Хассабиса или Легга, не имел технического образования. Он поступил в Оксфордский университет, где изучал философию и теологию, но вскоре забросил учебу, чтобы принести окружающему миру практическую пользу. Мустафа помог в организации телефонной линии доверия для мусульманской молодежи Muslim Youth Helpline, которая впоследствии стала одним из крупнейших сервисов психологической поддержки мусульман в Великобритании. Затем он работал у Кена Ливингстона, мэра Лондона, в департаменте прав человека, а после занимался социальными проблемами в Организации Объединенных Наций, правительстве Нидерландов и Всемирном фонде охраны природы.
Шейн Легг родился в городе Роторуа, в Новой Зеландии. Он получил степень бакалавра в области информатики и математики в Университете Уэйкато и степень магистра математики в Университете Окленда. Шейн работал в нескольких компаниях, занимающихся разработкой программного обеспечения, включая Webmind – стартап, разрабатывающий искусственный интеллект общего назначения. Он защитил докторскую диссертацию по машинному суперинтеллекту в Институте искусственного интеллекта имени Далле Молле в Швейцарии, а после проходил стажировку в Университетском колледже Лондона в отделе вычислительной нейронауки имени Гэтсби, где познакомился с Демисом Хассабисом.
В 2010 году все трое собрались, чтобы основать Deep-Mind. Миссия компании была простой и амбициозной: решить проблемы и создать полноценный искусственный интеллект, а затем использовать его на благо человечества. Осуществление своей миссии DeepMind начала с обучения играм методом обучения с подкреплением. Тренировки проходили на основе 49 различных видеоигр Atari, включая Pong, Breakout и Space Invaders.
Результаты поразили научное сообщество. Программа на основе искусственного интеллекта от DeepMind не обладала никакими базовыми знаниями об играх. У нее просто был доступ к подсчету очков и сырым пикселям на экране. Тем не менее программа как-то сумела хорошо освоить каждую игру, руководствуясь основными принципами, и в большинстве случаев играла на человеческом уровне, а в некоторых даже превосходила человека.
Искусственный интеллект DeepMind не был осведомлен о правилах игры или ее элементах, в отличие от человеческих пользователей. Он также не обладал знаниями об инерции, силе тяжести и прочих физических принципах, которые помогают человеку ориентироваться в подобных играх. Искусственный интеллект DeepMind каждую игру изучал с нуля, играя сам с собой бесконечное количество раз. Так компьютер сперва научился играть, а потом, после нескольких часов практики, научился играть уже на достойном уровне.
Ведущий исследователь и автор самой популярной книги об искусственном интеллекте Стюарт Рассел передал общее настроение научного сообщества: «Это одновременно впечатляюще и пугающе, как если бы только что родившийся ребенок к вечеру того же дня обыгрывал других людей в видеоигры. Вы ужаснетесь». Осознавая потенциал, Google оперативно заплатила, как говорят, около полумиллиона долларов за покупку DeepMind. У компании не было платежеспособных пользователей, а в штате было всего 50 сотрудников.
Следующий прорыв DeepMind, который позже назовут «Моментом спутника»[77], случился шесть лет спустя и захватил внимание мировой общественности.
В октябре 1957 года первый в мире искусственный спутник «Спутник–1» был запущен с космодрома Байконур и достиг орбиты Земли. Выглядел он не то чтобы привлекательно, полированная металлическая сфера размером с большую тыкву, а все его функции ограничивались передачей радиоволн через четыре антенны. Тем не менее «Спутник», как и следующее открытие DeepMind, изменили мир. Угроза советского технологического прогресса разбудила Соединенные Штаты и положила начало гонке вооружений. Технологическая гонка отправит человека на луну, марсоходы – исследовать красную планету, а космические корабли на другие планеты Солнечной системы. Кроме того, человечество получит все, включая межконтинентальные баллистические ракеты и интегральные микросхемы.
Момент Спутника произошел практически 60 лет спустя в марте 2016 года, когда программа искусственного интеллекта, разработанная DeepMind, победила человека в игре AlphaGo. Программа играла не против обычных людей, а против лучших игроков и мировых чемпионов по древнекитайской игре в го. По мнению многих наблюдателей, победа в AlphaGo стала событием, ознаменовавшим начало гонки искусственного интеллекта. На этот раз проснулись не Соединенные Штаты, а Китай. Это была гонка не за Луну, а за доминирование в следующей великой экономической революции.
Сразу после победы искусственного интеллекта китайское правительство объявило о запуске амбициозного плана о мировом лидерстве в области. В соответствии с программой к 2030 году вклад искусственного интеллекта в промышленный сектор Китая составит свыше 150 миллиардов долларов и более полутора триллиона долларов косвенно за счет связанных индустрий.
Как так вышло, что компьютер, одержавший победу в обычной настольной игре, оказал такое влияние на долгосрочные цели Китая? Важно понимать, что для китайцев игра в го имеет особую ценность. Ее придумали около 2000 лет назад. Считается, что го входит в одно из четырех искусств, которым должен заниматься настоящий интеллектуал, наряду с каллиграфией, живописью и игрой на музыкальном инструменте гуцинь[78]. Го – игра чрезвычайно тонкая и сложная. В действительности китайские власти были настолько обеспокоены победой ИИ в AlphaGo, что запретили трансляции игр.
План Китая по развитию искусственного интеллекта совершенно не скрывает целей по его использованию для достижения экономического и военного мирового превосходства. В своем отчете к съезду партии в октябре 2017 года генеральный секретарь Си Цзиньпин доложил, что к началу следующего столетия Китай стремится стать «научной и технической супердержавой». К слову, сейчас Китай идет ноздря в ноздрю с Соединенными Штатами по количеству патентов и публикаций, посвященных искусственному интеллекту.
Многие другие страны также переняли план Китая. Не удивительно, но у Соединенных Штатов есть план противодействия победе Китая в гонке искусственного интеллекта, и они объявили о выделении многомиллиардных федеральных средств на достижение этих целей. Чтобы не отстать в этой гонке, Великобритания, другая страна, играющая немаловажную роль в области, планирует выделить несколько миллиардов фунтов стерлингов. Франции участие будет стоить полтора миллиарда евро. Германия запланировала выделить три миллиарда евро, и даже Индия проинвестирует около полумиллиарда долларов США в разработку искусственного интеллекта. К сожалению, австралийское правительство предпочитает держаться в стороне от таких крупных вложений и ограничивается скромными инвестициями.
Без сомнений, искусственный интеллект вносит изменения в экономику, политику и общество. По результатам проведенного компанией PwC в 2017 году исследования, мировой ВВП после внедрения искусственного интеллекта к 2030 году может увеличиться примерно на 15%, что равно 15 триллионам долларов, с поправкой на инфляцию. Благодаря искусственному интеллекту откроются огромные возможности для инноваций уже в следующем десятилетии.
Победа в AlphaGo стала важным шагом на пути к инновациям. Многие профессионалы го предсказывали, что компьютеры никогда не смогут показать высокий уровень игры. Даже самые ярые оптимисты говорили, что успеха придется ждать десятки лет. В июле 1997 года после победы Deep Blue от IBM над Гарри Каспаровым в шахматах The New York Times заявила, что «когда или если компьютер сможет одержать победу на чемпионате по игре в го, тогда это станет знаком, что искусственный интеллект действительно начинает становиться хорошей и полезной вещью».
The New York Times была права. Игра в го намного труднее и сложнее, чем шахматы. В шахматах всего лишь 20 возможных ходов за раз, когда как в го около 200. Чтобы сделать просчет на два шага вперед, необходимо учесть от 200 до 40 000 возможных ходов, а на три шага – уже больше восьми миллионов. А для того, чтобы просчитать следующие 15 черно-белых фишек, необходимо продумать такое количество возможных ходов, что оно будет больше, чем число атомов во Вселенной.
Следующее, что делает го невероятно запутанной игрой, так это выяснение победителя. Играя в шахматы, не так уж и сложно определить победителя заранее. Нужно просто посчитать ценность захваченных фигур, чтобы приблизительно понять на первый взгляд. В го же подсчет окружающих фишек не даст никакого понимания, поскольку эти фишки могут быть окружены своими же. Мастера го тренируются на протяжении всей жизни, а любой хорошей программе требуется всего лишь 200 ходов, чтобы понять, кто выигрывает.
Для определения ведущего игрока AlphaGo использует метод обучения с подкреплением. Пока мы не умеем точно формулировать, что считается выгодной позицией в игре го. Наравне с людьми компьютер также может научиться этому распознаванию. Инженерный опыт Google и обширные серверные базы также сыграли важную роль в победе. AlphaGo сыграла сама с собой миллиарды раз, улучшая свои стратегии. Число сыгранных партий у AlphaGo больше, чем человек сможет сыграть за всю жизнь. Как и с другими достижениями искусственного интеллекта, значительный результат был достигнут благодаря огромным ресурсным затратам на решение проблемы.
В 2016 году во время матча между мастером го Ли Седолем и AlphaGo один ход стал решающим. Им стал 37-й ход во второй игре. По невероятному стечению обстоятельств, вероятность которого невозможно просчитать, именно 37-й ход во второй партии знаменитого матча 1997 года между Гарри Каспаровым и Deep Blue от IBM также оказался решающим.
Илл. 22. Погруженный в раздумья Каспаров во время матча против Deep Blue в 1997 году
В матче 1997 года в первой партии победу одержал Каспаров. Вторую начал Deep Blue, разыграв испанскую партию, один из самых популярных дебютов, применяемых в шахматах как любителями, так и профессионалами. На 37-м ходу Deep Blue нарушил общепринятый шахматный регламент, отказавшись от очевидной возможности захвата фигуры ради получения небольшого, но важного позиционного преимущества, после чего Каспаров признал поражение.
Каспаров был в ярости и заявил, что команда IBM жульничала. Также он утверждал, что только человек мог додуматься до такого хитрого и в то же время удачного хода. Он потребовал провести экспертизу и изучить алгоритмы в целях подтверждения, что программа сделала ход самостоятельно, без стороннего вмешательства. Команда IBM отказала ему в запросе. Позже по результатам анализа выяснилось, что такой ход мог возникнуть в результате программной ошибки, поскольку у Deep Blue заканчивалось время и она сделала случайный ход. На самом деле, у Каспарова не было необходимости признавать поражение, ведь можно было выйти в ничью, но он запаниковал.
В 2016 году в матче между Ли Седолем и AlphaGo в первой игре победу одержал AlphaGo, поэтому у Ли было огромное желание сыграть еще раз. В ходе второй партии, на 37-м ходу, программа продемонстрировала ход, на который не решился бы ни один профессионал, выйдя на пятую линию доски. Мастера го тысячелетиями придерживались принципа занимать четвертую линию в начале партии.
Как и Каспаров, Ли был взбудоражен. Покинув место соревнований и сделав перерыв на 15 минут, он вернулся к игре. И вновь 37-й ход изменил течение всей партии и стал решающим в судьбе матча. Ли проиграл вторую партию и, следовательно, матч со счетом 4:1. После игры Ли высказался, что программа AlphaGo «прекрасна».
В отличие от ситуации в 1997 году, в этот раз 37-й ход не был ошибкой. На самом деле, ход, найденный компьютером, способным рассмотреть гораздо больше возможностей, чем мог бы человеческий разум, был практически идеальным. Эксперты по игре в го были воодушевлены, ожидая, что игра преобразится на основе идей искусственного интеллекта. Равно как и шахматы были улучшены компьютерными программами, играющими на порядок лучше людей, го ждут похожие изменения.
Стоит напомнить, что искусственный интеллект не лишил людей удовольствия играть в шахматы. Сегодня ни один гроссмейстер не сможет обыграть компьютер, но с 1997 года все больше и больше людей зарабатывают на профессиональной игре с компьютером. Стандарты профессиональной и любительской игры заметно возросли. Теперь любители могут тренироваться против бесконечно терпеливых опытных соперников, а эксперты с легкостью могут изучать и понимать новые тонкости игры.
Цель DeepMind была намного масштабней, чем просто соревноваться в играх с человеком. Главным замыслом компании было решить проблемы и создать полноценный искусственный интеллект, а затем использовать его на благо человечества. А что может быть лучше для начала, чем область биологии? Или, если быть более точным, предсказание трехмерной структуры белка по его аминокислотной последовательности. Предсказание структуры белка считалось одной из важнейших нерешенных проблем в биологии на протяжении 50 лет.
Белки – это высокомолекулярные вещества, поддерживающие нашу жизнь. Они доставляют кислород к мышцам, катализируют метаболические реакции, помогают передавать нервные сигналы и играют ключевую роль в фотосинтезе и многих других биологических процессах. Для понимания впечатляющего многообразия функций белков ключевым моментом является изучение их трехмерной структуры. Структура белка напрямую определяет его функциональные возможности. Например, все мы более чем осведомлены о важности спайк-белка в процессе заражения вирусом SARS-CoV–2.
В 1958 году Джон Кендрю стал первым ученым, определившим структуру белка миоглобина. За свое открытие он получил Нобелевскую премию по химии в 1962 году. С тех пор были открыты структуры примерно 170 000 других протеинов. Однако в биологии насчитывается более 200 миллионов белков. Определение трехмерной структуры нового белка – это трудоемкий процесс, который может занять несколько лет исследований и вполне может стать достойным основанием для получения ученой степени.
Предсказание структуры белка стало для DeepMind отличным выбором проблемы, которую необходимо решить, учитывая, что биологи также захотели принять в этом участие. Каждые два года проходит международный чемпионат по предсказанию структуры белка[79], в котором принимают участие около 100 исследовательских групп со всего мира. Тем не менее соревнование довольно-таки сложное. Исследователи проводят годы за разработкой компьютерных программ, позволяющих выполнять предсказания.
До 2018 года, не учитывая простые белки с низкой молекулярной массой, точность вычислительных методов была ограниченной по сравнению с экспериментальными способами. Тогда команда DeepMind решила, что впервые программа AlfaFold станет участником соревнования. Соревнуясь с 97 другими участниками, программа стала победителем и предсказала наиболее точно структуры 25 из 43 белков, в то время как результат команды, занявшей второе место, составил 3 из 43. Два года спустя, в 2020 году, команда DeepMind справилась намного лучше. Новая модель на основе трансформера выиграла чемпионат с результатом, впоследствии описанным биологами как «удивительный и трансформационный». AlfaFold определяла структуры двух из трех белков с точностью лабораторных исследований.
Обучение с подкреплением играет важную роль в AlfaFold, поскольку используется для уточнения предсказанной формы белка путем изучения предыдущих ошибок прогнозирования. Модель получает вознаграждение в зависимости от того, насколько точно предсказанные ею структуры соответствуют известным или определенным экспериментально структурам, что эффективно направляет ее к более точным прогнозам. Такой итеративный процесс помогает модели исследовать обширное пространство потенциальных форм, учась находить баланс между исследованием новых форм сворачивания и использованием известной структурной информации.
В 2022 году DeepMind не стала участвовать в соревновании, поскольку в этом уже не было необходимости. Открыв исходный код AlfaFold, большинство пользователей теперь могут пользоваться программой или встроенным функционалом. Вместо участия в чемпионате DeepMind направил все силы AlphaFold на предсказание структуры белков. В июле 2023 года компания выпустила базу данных, содержащую 200 миллионов белков, и которой сегодня ученые пользуются свободно. Эта база данных включает практически все известные науке белки. Джанет Торнтон, почетный директор Европейского института биоинформатики, где и размещена база данных, очень хорошо описала ее влияние: «Ученые стоят на плечах гигантов. Зачастую этими “плечами” служат данные. Имея миллионы предсказанных структур, мы сможем изменить биологию, что станет полезным для многих отраслей, в том числе и для медицины, сельского хозяйства, биотехнологий. Это просто фантастика!» [1]
Как мы уже увидели, DeepMind не единственная компания, победившая человечество в одной из придуманных им игр. Компания IBM сделала с шахматами то же самое в 1997 году. Проект IBM Deep Blue с легкостью окупил себя. На следующий день после победы Deep Blue над Гарри Каспаровым акции IBM взлетели почти на 4%, добавив около двух миллиардов долларов к рыночной стоимости компании. Победа в шахматах также обеспечила широкую известность IBM как технологическому лидеру. Ничего удивительного в том, что IBM захотела повторить успех, но в уже более сложной игре.
В 2007 году команда IBM под руководством Дэвида Ферруччи начала разработку Watson, программы на основе искусственного интеллекта для игры в популярную викторину Jeopardy![80]. Программу назвали в честь основателя и первого генерального директора Томаса Джона Уотсона. На протяжении 40 сезонов Jeopardy! остается одной из самых продолжительных и популярных телевикторин. Вместо вопросов в Jeopardy! игроки получают ответы. Сформулировав ответ в форме вопроса, они должны угадать личность, место, вещь или идею, описанную в подсказке.
ВОПРОС: Родился в Германии, начал сочинять в Англии в 1710 году и был захоронен в Вестминстерском аббатстве в 1759 году.
ОТВЕТ: Кто такой Георг Фридрих Гендель?
Илл. 23. Кен Дженнингс, Watson и Брэд Раттер соревнуются в Jeopardy! за приз в миллион долларов
Пока вы не начали говорить, что можно просто загуглить ответ, скажу, что Watson не был подключен к интернету. Однако у него был доступ к четырем терабайтам информации, полученной из энциклопедий, словарей, тезаурусов, новостных статей и литературных произведений. Watson состоял из различных программ на базе искусственного интеллекта. Например, одна программа была экспертом в области географии, вторая – отвечала на вопросы про исторические события, а третья – про таксономию. Игроки Jeopardy! должны делать ставку на какой-то конкретный вопрос, в то время как Watson использует метод обучения с подкреплением, чтобы разработать наилучшую стратегию. У программы была механическая рука для нажатия кнопки ответа, прямо как у участников-людей.
Спустя четыре года разработки Watson был готов к состязанию с человеком. В начале 2011 года состоялся матч между чемпионами викторины Кеном Дженнингсом и Брэдом Раттером. Раттер – самый высокооплачиваемый американский участник телевикторин, суммарно выигравший более пяти миллионов долларов. Он также является рекордсменом за самую длинную череду побед в Jeopardy!, став чемпионом 74 раза подряд. Дженнингс – второй в списке самых высокооплачиваемых американских участников телевикторин, ни разу не проигравший в Jeopardy! за все время своих появлений. Но этому суждено было измениться.
Спустя два дня соревнований против Дженнингса и Раттера, Watson от IBM был явным победителем, выиграв 77 147 долларов. Приз Дженнингса составил 24 000 долларов, а Раттера всего лишь 21 600. Вновь человек уступил машине. Суммарный приз, который Watson забрал домой и пожертвовал на благотворительность, составил миллион долларов.
В целом, IBM инвестировала много миллионов долларов и потратила несколько лет усилий на создание Watson. Суперкомпьютер, на котором работал Watson, обошелся примерно в три миллиона долларов. Однако сегодня ChatGPT может посоревноваться бесплатно с помощью простого запроса. Давайте посмотрим.
Я: Пересекая северную границу Флориды, вы сможете оказаться только лишь в двух штатах. Ответь в форме вопроса, как на викторине Jeopardy!
ChatGPT: Что такое Джорджия и Алабама?
Я: Этот маневр изобретен в 1500-е годы для ускорения игры и включает две фигуры одного цвета.
ChatGPT: Что такое рокировка в шахматах?
Я: Техника вышивания цветочных узоров шерстяными нитками по хлопковой ткани.
ChatGPT: Что такое якобинская вышивка?
Я: 8 сентября 1974 года был помилован президентом.
ChatGPT: Кто такой Ричард Никсон?
Я: В 1594 году устроился на работу сборщиком податей в Андалусии.
ChatGPT: Кто такой Мигель де Сервантес?
Я: Его самый крупный аэропорт назван в честь героя Второй мировой войны, а второй по величине – в честь сражения во время Второй мировой войны.
ChatGPT: Что такое Чикаго?
Исторический вопрос был финальным в матче Watson против Дженнингса и Раттера. Watson дал ответ «Торонто», несмотря на то что категория была «города США». Хотя ChatGPT и ответил правильно, это не настоящий тест, поскольку этот вопрос (и ответ на него), несомненно, уже есть в обучающих данных ChatGPT.
Анализ производительности программы Watson во время матча не показал, что при ответе на вопросы она лучше, чем действующие чемпионы, но лучше в азартных играх, поскольку более точно способна просчитать вероятность правильного ответа и сделать соответствующую ставку. Такая способность компьютеров высчитывать вероятности подводит нас к шестой и завершающей идее, объясняющей достигнутый в создании искусственного интеллекта прогресс. Ее мы рассмотрим в следующей главе.
Хотелось бы закончить эту главу рассказом об успехе обучения с подкреплением на примере ChatGPT. Наверное, вы помните, что для создания семейства больших языковых моделей GPT компания OpenAI взяла за основу модель трансформера, разработанную Google, и активно ее масштабировала. Но чтобы перейти от GPT–3 к ChatGPT, добавился один новый и важный компонент: обучение с подкреплением на основе человеческой обратной связи.
Большие языковые модели по типу GPT–2 и GPT–3 вели себя так, как будто у них дефицит внимания. Возможно, вы также помните, что такие модели случайны и каждый раз выдают разный ответ. Проблема случайности заключается в том, что игральная кость в итоге играет против тебя. Математики называют это «задачей о разорении игрока». В моделях GPT–2 и GPT–3 такое явление проявляется отвлечением внимания. Они пишут предложения, быстро предсказывая следующее слово. Однако в результате предсказывается слово, которое отклоняет выходные данные в случайном и нежелательном направлении. Позвольте привести пример. Я попросил GPT–2 продолжить фразу «Фотосинтез – это…». И модель выдала следующее:
«ФОТОСИНТЕЗ – ЭТО процесс, благодаря которому живые существа растут и производят собственную энергию…».
Но затем он сбился с пути:
«…и углекислый газ (СО2)».
В результате фотосинтеза получается кислород, а не углекислый газ. Модель GPT–2 сделала еще больше ошибок в следующем предложении:
«Большинство растений и животное фотосинтезируют углерод одним из двух способов».
Данный ответ грамматически неверен. Должно быть «животные», а не «животное». Но что более существенно, животные не обладают функцией фотосинтеза, хотя некоторые из них и вступают в симбиотические отношения с водорослями и цианобактериями, которые фотосинтезом обладают.
Обучение с подкреплением на основе человеческой обратной связи помогает решить эту проблему. На одном из обучающих этапов людей спрашивают, какой из двух возможных ответов большой языковой модели они предпочитают. Человеческая обратная связь обеспечивает внесение корректных данных в модель. Если человек отклоняет расистские и сексистские ответы, то модель учится выдавать лучшие ответы.
С момента привлечения человека обучение с подкреплением стало дорогой деятельностью, но благодаря этому значительно улучшились большие языковые модели. Такой способ обеспечивает беспорядочное обучение на базе интернет-данных, без повторений ошибочной информации, пропаганды, конспирологических теорий, расизма и сексизма, найденного в сети. В довершение всего разработчики больших языковых моделей вручную кодируют ограничения, пытаясь отфильтровать наиболее оскорбительный, опасный и незаконно генерируемый контент.
В целом, это невероятно, насколько хорошо можно создавать большие языковые модели, используя метод обучения с подкреплением и учитывая низкое качество многих данных, на которых они обучаются!