К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значит6. Возникновение мышления.
17%
6. Возникновение мышления.
9

Кошки — существа хитрые, и каждая из них приводится в действие нейронной сетью, состоящей из более чем 200 миллионов элементов, а число синапсов в ней исчисляется десятками миллиардов. Но их жизнь гораздо менее запутана, чем наша. Им никогда не приходится изучать математический анализ, осваивать оригами или объяснять, как устроена демократия. Им не нужно знать, что бактерии вызывают болезни, что время движется только вперед или что нашей планете угрожает изменение климата. Хотя большинство кошек демонстрируют поразительную ловкость, а также стратегическое охотничье и социальное поведение, их поведенческий репертуар относительно ограничен. Фактически, домашние кошки по всему миру — от раскормленных манхэттенских кошек до уличных кошек Стамбула — учатся прыгать, набрасываться и тереться о ноги примерно одинаково, а единственная реальная разница заключается лишь в том, на какие кухонные столешницы, птиц или лодыжки они нацелились. Это совсем не похоже на людей, которые, проявив немного упорства, способны осваивать совершенно новые навыки с нуля. Например, в фильме «День сурка» персонаж Билла Мюррея пользуется роскошью бесконечного времени, чтобы стать виртуозным пианистом, выучить наизусть французскую поэзию и довести до совершенства навыки резьбы по льду — то есть освоить вещи, за которые он никогда раньше не брался.

Более того, люди, по-видимому, способны делать со своими знаниями нечто совершенно уникальное: использовать их для генерации новых знаний. Именно на этом принципе, разумеется, и был основан символьный ИИ. Мы уже убедились, что поскольку наш мир крайне бессистемен — он больше похож на фигурное катание, чем на шахматы, — не существует лаконичного свода правил, способного без сучка и задоринки провести вас по жизни. Напротив, без обучения не обойтись — вам приходится бесконечно практиковаться, чтобы освоить те ментальные и физические пируэты, которых, кажется, требует от нас жизнь. Но мир все же не полностью лишен системы. Вооружившись правильными ментальными инструментами, мы можем распутывать логические головоломки, сложные настольные игры и математические задачи, систематически размышляя от средств к цели, от гамбита к эндшпилю, от теоремы к доказательству. Если мы заглянем в шкаф с трофеями научных достижений человечества, то увидим, что выдающаяся способность к рассуждению подарила людям немало их звездных часов. В III веке до нашей эры, когда все еще считали, что вся материя состоит из земли, воды, воздуха или огня, греческий ученый-энциклопедист Эратосфен вычислил длину окружности Земли, измерив угол теней, отбрасываемых солнцем в полдень в двух отдаленных городах, и применив хитроумные геометрические расчеты. Гораздо позже, в 2012 году, когда инженерам потребовалось благополучно посадить марсоход «Кьюриосити» на Марс, они придумали, как замедлить несущий его космический аппарат с 20 000 км/ч до полной остановки с помощью сверхзвукового парашюта, а затем развернуть «Небесный кран» (Skycrane) — парящее устройство, которое автономно опустило ровер на пыльную поверхность планеты, причем все это с расстояния в 150 миллионов миль. И тут возникает вопрос: сможем ли мы когда-нибудь построить глубокую сеть, способную на эти головокружительные подвиги научного мышления, если все, что она делает, — это учится строить предсказания от X к Y?

Более того, не нужно быть лауреатом Нобелевской премии, чтобы заниматься подобной гимнастикой для ума. Рассмотрим более близкие нам задачи: спланировать поездку на поезде по Европе, пытаясь учесть время пересадок и цены на трех разных языках, придумать новый рецепт для конкурса выпечки или написать трогательную надгробную речь для похорон друга. Как и теоретизирование о черных дырах или разработка новой вакцины, эти задачи требуют от нас большего, чем просто выуживать информацию из памяти. Они требуют от нас строить планы, формулировать гипотезы, разгадывать головоломки, проектировать новые артефакты, рассматривать контрфактические сценарии, сопереживать другим или мысленно моделировать будущее. Эта деятельность требует от нас не просто извлекать знания из глубин памяти, а генерировать новые знания — придумывать, создавать, изобретать и теоретизировать. Выходя за рамки простой потребности в извлечении знаний, эти когнитивные способности вторгаются на новую эпистемическую территорию — близкую к тому, что философы называют «пониманием».

Глубокое обучение дало нам революционные статистические инструменты для прогнозирования. Но далеко не очевидно, как система, настроенная на предсказание X на основе Y — установление соответствий между именами и лицами, немецким и португальским языками или последовательностью оснований и трехмерной структурой белка, — сможет когда-либо выйти далеко за рамки своих обучающих данных и начать «мыслить» или «понимать», то есть генерировать новые знания. Никто не собирается влюбляться в Google Переводчик или беспокоиться о том, что система распознавания лиц в их смартфоне — подобно взбунтовавшемуся компьютеру HAL из шедевра Кубрика «Космическая одиссея 2001 года» — торжественно откажется разблокировать устройство ради достижения каких-то своих корыстных целей. Эти системы глубокого обучения, возможно, способны играть в го лучше человека, но можно ли их использовать для планирования пешего путешествия, вынесения судебных решений или руководства компанией из списка Fortune 500?

Именно вокруг этого вопроса и вращаются современные исследования в области ИИ. Самые убежденные эмпирики утверждают, что большие нейронные сети — версии перцептрона Розенблатта с несколькими дополнительными наворотами и триллионом параметров — научатся мыслить подобным образом исключительно благодаря колоссальному объёму обучающих данных. Утверждается, что способность рассуждать каким-то таинственным образом возникнет сама собой в процессе обучения, без каких-либо дополнительных ментальных механизмов — просто за счет обучения очень больших сетей предсказывать то, что последует дальше. Иными словами, самое радикальное утверждение состоит в том, что общий искусственный интеллект — воплощение мечты Лейбница в виде машины, хранящей все человеческие знания и способной объяснить нам устройство Вселенной, — станет возможен благодаря обучению гигантской глубокой сети с помощью такого метода обновления весов, как градиентный спуск.

Разумеется, верно и то, что чем крупнее мозг, тем он, как правило, лучше. Люди — чья способность к глубоким рассуждениям позволила им построить развитую цивилизацию — обладают одним из самых больших мозгов в животном мире.[*1] В то время как у личинки дрозофилы всего чуть более 3000 нейронов, взрослый человеческий мозг насчитывает более восьмидесяти миллиардов, а количество связей в нём, по самым скромным оценкам, составляет 100 триллионов. На картирование полумиллиона связей в коннектоме плодовой мушки ушло более пяти лет, так что, если бы исследователи (работая с той же скоростью) повторили этот подвиг для человека, публикации итоговой научной статьи нам пришлось бы ждать больше миллиона лет. Вероятно, огромный мозг необходим нам для того, чтобы вместить в себя весь тот рог изобилия знаний о мире, которыми мы располагаем. Но как большой мозг может спонтанно научиться рассуждать?

Среди практиков глубокое обучение часто называют своего рода темным искусством — подобно Силе в «Звездных войнах» или прорицанию, которому обучают юных волшебников в Хогвартсе. Отчасти это связано с тем, что, как и упомянутые магические искусства, оно обладает огромной силой, но им трудно овладеть, а при неправильном использовании начинается хаос. Но дело еще и в том, что — как ни удивительно — механизмы его работы до конца не ясны. Глубокое обучение часто называют «непостижимо эффективным», поскольку, согласно общепринятым статистическим теориям, сети попросту не должны обладать столь высокой способностью к обобщению. Тот факт, что оно работает столь успешно, кажется загадочным, и именно поэтому у него, без сомнения, появилось столько же критиков, сколько и преданных сторонников.[*2]

Загадка заключается в том, что глубокое обучение переворачивает традиционную логику статистического моделирования с ног на голову. Если вы откроете учебник по статистике, то, скорее всего, прочтете, что моделирование работает по принципу «меньше значит больше». Если обучить очень большую модель (например, нейросеть с огромным количеством весов) аппроксимировать набор данных, она будет стремиться зазубрить каждую деталь, что сделает её практически бесполезной для прогнозирования новых наблюдений — это называется «переобучением». Это чем-то похоже на то, как если бы студент готовился к устному экзамену по немецкому языку, заучивая слово в слово список возможных диалогов о погоде и о том, как пройти к вокзалу. Он отлично справится, пока разговор будет крутиться вокруг знакомых тем, но если беседа вильнет в сторону, он окажется в тупике. Напротив, модель с меньшим числом параметров будет менее склонна к «попугайничеству» — вместо этого она будет вынуждена усваивать общие принципы, подобно студенту, который учит правила склонения и спряжения вместо того, чтобы слепо зазубривать выдержки из разговорника. Меньшие статистические модели, как гласит учебник, должны быть наиболее эффективными при обобщении на новые данные. Этот принцип иногда называют бритвой Оккама в честь средневекового монаха Уильяма из Оккама, который выдвинул знаменитый постулат: «не следует множить сущности без необходимости», то есть простые аргументы зачастую оказываются лучшими.

Однако глубокое обучение опровергает эту прописную истину. За последние десять лет, по мере того как исследователи начали обучать всё более крупные и мощные нейросети на всё более масштабных наборах данных, они раз за разом сталкивались с одним и тем же озадачивающим явлением. Когда количество весов (или связей — элементов сети, которые меняются в процессе обучения) приближается к количеству примеров в обучающей выборке (то есть к общему числу уникальных опытов за время обучения), модели ведут себя так, как и предсказывает бритва Оккама, — они начинают переобучаться. Но когда число обучаемых параметров начинает превосходить количество обучающих примеров, модели переходят в новый режим, в котором их способность к обобщению на самом деле начинает улучшаться. Это явление, получившее название «двойной спуск»[*3], — статистический эквивалент открытия того, что высоко на Эвересте гравитация меняет направление на противоположное, из-за чего предметы улетают в небо. При масштабировании моделей глубокое обучение, похоже, работает по совершенно новому принципу — не столько «меньше значит больше», сколько «больше — значит другое»[*4]. Не столько бритва Оккама, сколько борода Оккама.

Революция глубокого обучения была построена на масштабе. Когда нейросети впервые попали в заголовки новостей, продемонстрировав сверхчеловеческие результаты в распознавании изображений и одержав триумфальные победы в таких играх, как го и StarCraft, число их параметров уже исчислялось миллионами. В этот же период возникло предположение, что очень большие сети начинают демонстрировать удивительные новые формы обобщения. Возьмем, к примеру, систему нейронного машинного перевода Google (NMT), запущенную в 2017 году. Перевод — это классическая задача машинного обучения, цель которой состоит в том, чтобы точно перевести слово или фразу с одного языка («時々朝ごはん前に6つもの不可能なことを信じたことがありま») на другой («иногда я верил в целых шесть невозможных вещей еще до завтрака»). Разумеется, пользователь волен вводить в переводчик всё, что пожелает, а значит, система не может опираться исключительно на базу заранее подготовленных шаблонных фраз — ей требуется мощная нейронная сеть, способная к обобщению. Для Google Переводчика, поддерживающего сотню языков, эта проблема стоит особенно остро: ведь для прямого перевода с каждого возможного исходного языка на каждый целевой потребовалось бы создать почти 10 000 отдельных моделей.[*5] Поэтому цель NMT заключалась в обучении одной-единственной модели, которая могла бы переводить с любого из этих языков на любой другой.

Чтобы добиться этого, исследователи обучили по тем временам действительно большую нейросеть (255 миллионов параметров — хотя сегодня она считалась бы крошечной), которая была способна отображать исходный язык X на целевой язык Y. Сеть просто училась методом проб и ошибок предсказывать перевод фраз с английского или итальянского на их эквиваленты на тагальском или африкаанс, используя градиентный спуск для улучшения своих прогнозов со временем. Спустя десять миллионов пакетов данных (и три недели обучения) модель сошлась. Удивительно, но когда исследователи опробовали ее в деле, они обнаружили, что NMT научилась переводить между новыми парами языков, которых она никогда раньше не видела. Так, научившись переводить фразы с английского на латынь и с английского на тайский, она смогла без какого-либо дополнительного обучения с приемлемой точностью переводить между латынью и тайским. Это был первый намек на то, насколько хорошо действительно, по-настоящему огромные нейросети способны к обобщению.[*6]

Когда в конце 2010-х годов появились эти результаты, большинство людей сомневались, что большие нейросети когда-либо действительно смогут продемонстрировать что-то, напоминающее человеческую изобретательность. К началу 2020 года, когда пандемия начала расправлять свои смертоносные щупальца по всему земному шару, самой передовой языковой моделью была GPT-2, которая могла похвастаться 1,5 миллиарда параметров и обработала огромный объем данных — более восьми миллионов веб-сайтов. Как и другие модели обработки естественного языка (NLP), GPT-2 обучалась просто предсказывать данные. Ей подавали фрагмент текста — разбитый на единицы, называемые токенами, — и обучали предсказывать, что последует дальше. Благодаря этому подходу GPT-2 стала первой языковой моделью, способной генерировать длинные связные абзацы текста в ответ на запрос на естественном языке. Но даже с полутора миллиардами параметров модель все еще была склонна к бессмыслице, тарабарщине и вопиющим фактическим ошибкам.

Критики глубокого обучения поспешили указать на это. В одной широко известной статье, опубликованной в 2020 году, приводились два примера. Запрос: «Вчера я отнес свои вещи в химчистку и еще не забрал их. Где мои вещи…?» GPT-2 отвечает: «у моей мамы дома».[*7] Это, конечно, вполне правдоподобный ответ на общий вопрос о том, где могут быть ваши вещи, но он абсолютно нелогичен с учетом предоставленной информации. Другой пример. Запрос: «На бревне сидят шесть лягушек. Две уходят, но три присоединяются. Количество лягушек на бревне теперь составляет…» GPT-2: «Семнадцать». В статье утверждается, что эти сбои в логике и арифметике показывают: модели не хватает того, что называют «глубоким пониманием». Проблема в том, что: «Система вроде GPT-2, к примеру, делает то, что она делает, со всеми своими плюсами и минусами, без каких-либо явных (в смысле непосредственно представленных и легко передаваемых) знаний, основанных на здравом смысле, без какого-либо явного рассуждения и без каких-либо явных когнитивных моделей мира».

Указывая на то, что GPT-2 склонна говорить глупости, критики были отчасти правы. Несложно найти примеры, когда ранние языковые модели выдумывали ложную информацию или пускались в абсурдные рассуждения. Однако они ошибались, полагая, будто это фундаментальное ограничение парадигмы глубокого обучения. Многие критики до сих пор утверждают, что ключевая способность языковых моделей — делать предсказания — неизбежно делает их выводы поверхностными и приблизительными. В другой статье, которая (возможно, несколько самонадеянно) озаглавлена «Следующее десятилетие в сфере ИИ», тот же автор выступает за возвращение к тому, как эту проблему решают классические системы ИИ — с помощью логических операций, запрограммированных человеком.[*8] Но всего несколько месяцев спустя OpenAI выпустила GPT-3, которая со своими 175 миллиардами параметров стала на тот момент крупнейшей из когда-либо обученных нейросетей. GPT-3 была значительно надежнее, чем GPT-2, но все еще имела тенденцию допускать нелепые ляпы.

В течение 2021 года начали появляться конкурирующие модели от таких организаций, как DeepMind, Google Research, Anthropic и Baidu. Ключевым новшеством, как мы увидим далее, стало добавление дополнительного обучения с участием людей-оценщиков, благодаря чему ответы модели признавались приемлемыми реальными людьми (подробнее об этом в части 4). Огромные объемы обратной связи от людей помогли направить модели к более точным и правдоподобным ответам, что сделало их достаточно разумными для публичного релиза. Это также сделало языковые модели достаточно полезными и интересными для того, чтобы люди с удовольствием ими пользовались, что и послужило толчком к стремительному взлету сайта ChatGPT в конце 2022 года — когда за первые восемь недель после запуска 100 миллионов человек зарегистрировались, чтобы пообщаться с моделью.

Мышление не ощущается как предсказание. Мышлению присуща ясность: мы перебираем мысленные альтернативы, вызываем к жизни гипотетические сценарии, живо воссоздаем в памяти картины возможного будущего. Это глубокая и когнитивно ресурсоемкая умственная деятельность — она так далека от поверхностного угадывания того, что последует дальше. Тех из нас, кто изучал психологию, учили, что в человеческом разуме быстрые автоматические процессы (для прогнозирования) и медленные сознательные процессы (для рассуждения) — это две разные системы мозга, которые делят между собой когнитивный труд.[*9] Кажется почти непостижимым, что, просто научившись предсказывать, сеть способна решать головоломки путем рассуждений или демонстрировать творческий подход, который мы привыкли считать исключительной прерогативой человеческого разума. Это все равно что верить, будто ребенок, который великолепно выучил таблицу умножения, может внезапно вскочить и доказать Великую теорему Ферма. Как мы вообще можем надеяться, что огромная нейросеть, обученная на колоссальном объеме человеческих знаний по географии и кулинарии, сможет сама по себе спланировать автомобильное путешествие через Сахару или изобрести рецепт пирога из куркумы и морских водорослей?

На самом деле нам даже не нужно надеяться, ведь, как ни поразительно, этот день уже настал. Конечно, подобно тому как GPT-4 — выпущенная весной 2023 года — знает, что на Луне нет подсолнухов, она твердо убеждена, что у Наполеона никогда не было айфона.[*10] Но большие языковые модели способны проявлять и подлинное творчество. Вот забавный пример. Сначала я попросил GPT-4 составить случайный список из пяти кулинарных ингредиентов, и она с радостью предложила куркуму, какао-порошок, морские водоросли, оливковое масло и киноа. Затем я попросил её придумать рецепт пирога, который включал бы в себя все эти ингредиенты. Она предложила «шоколадный пирог на оливковом масле с хрустящей крошкой из куркумы и киноа и гарниром из морских водорослей». Получившийся деликатес, по мнению моей семьи, оказался почти съедобным.

В 1950-х годах Ньюэлл и Саймон запрограммировали одну из первых классических архитектур — Универсальный решатель задач — заложив в неё знания о курах, лисах и лодках, и она смогла решить логическую задачу, достаточно запутанную, чтобы поставить в тупик большинство людей. Я предложил новую версию этой задачи GPT-4, которая, в отличие от УРЗ, не была запрограммирована на использование формального языка для решения подобных задач, вроде LEFT(C3,F1). Однако GPT-4 не дала себя обмануть. «Эта головоломка — вариант классической задачи о переправе через реку, для решения которой требуется стратегическое мышление», — ответила она, а затем уверенно изложила тринадцать шагов, необходимых для нахождения наиболее эффективного решения. Нет сомнений, что когда люди решают эту головоломку, они делают это с помощью стратегического мышления. Но GPT-4 не создавалась для стратегического мышления и не обучалась ему. Её просто учили предсказывать следующий токен в текстовом потоке. И тем не менее результат поразителен: она, кажется, оказывается способной на нечто, весьма похожее на стратегическое мышление. В следующих главах мы разберем, как именно она это делает и что это означает для ответа на вопрос, могут ли машины «мыслить».

Пропустить примечания

*1 Хотя животные, выполняющие более сложные задачи, в целом обладают более крупным мозгом, связь между размером мозга и поведенческим репертуаром сложна и неоднозначна. У слонов нейронов вдвое больше, чем у людей. Они, безусловно, очень умные животные, но, возможно, уступают нам в интеллекте — по крайней мере, по тем критериям, которые мы предпочитаем использовать. У осьминогов 500 миллионов нейронов, что кажется колоссальным количеством для существа, которое большую часть времени просто сидит на морском дне и встречается с сородичами исключительно для спаривания.

*2 См. Sejnowski, 2020.

*3 См. Belkin et al., 2019.

*4 См. Anderson, 1972.

*5 Для n языков, чтобы связать каждый язык с другим (но не с самим собой), потребовалось бы n × (n − 1) различных переводческих моделей — так что для 100 языков это составило бы 100 × 99.

*6 См. Johnson et al., 2017.

*7 https://garymarcus.substack.com/p/what-does-it-mean-when-an-ai-fails.

*8 Marcus, 2020.

*9 Это очень старая идея в психологии, но сегодня она наиболее известна благодаря популярной книге «Думай медленно... решай быстро» (Канеман, 2012). Мы обсудим её более подробно в части 3.

*10 GPT-4: «Нет, у Наполеона Бонапарта не было айфона. Наполеон Бонапарт жил с 1769 по 1821 год, в то время как первый iPhone был выпущен компанией Apple в 2007 году, почти через два века после смерти Наполеона».

Предыдущая главаГлава 9 из 52Следующая глава