К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значит17. Внимание: разрыв.
38%
17. Внимание: разрыв.
20

Сторонники эквивалентности в этом споре — сегодняшние воплощения воинственного Хаксли — склонны придерживаться эмпирической традиции, с которой мы познакомились в предыдущих главах. Эмпирики годами утверждали, что не существует никакого «секретного когнитивного соуса» (или божественного дара), который делал бы человеческий разум особенным или отличным от других. Напротив, они утверждают, что люди умны лишь потому, что имеют доступ к огромным объемам данных и мощным нейронным вычислениям, а значит, если мы построим и обучим гигантские системы ИИ, то в конечном итоге сможем воссоздать этот разум. Недавнее овладение языком большими моделями ИИ — навык, который когда-то был прерогативой исключительно человека, — преподносится как доказательство того, что мы неуклонно движемся по пути к общему (то есть сопоставимому с человеческим) интеллекту. Разумеется, современные БЯМ имеют доступ к целым галактикам семантических знаний, могут генерировать беглые, связные и в основном точные ответы на запросы на естественном языке, а также решать многие логические задачи, которые поставили бы в тупик даже самых эрудированных людей. Согласно недавним публикациям, БЯМ демонстрируют «искры общего интеллекта» или представляют собой форму «прото-AGI» — промежуточную ступень между обычными нейросетями и полностью автоматизированным человекоподобным разумом.[*1] Сторонники этой точки зрения поспешили предположить, что за лингвистическим мастерством каждой БЯМ скрывается вся или почти вся когнитивная архитектура, составляющая человеческий разум, включая склонность формировать и использовать интенциональные состояния. Если вы спросите БЯМ, когда произошла Великая французская революция, и она ответит, что та продолжалась с 1789 по 1799 год, почему бы вам не сделать вывод, что она «знает» эту информацию? Если вы попросите БЯМ объяснить, почему небо синее, и она даст вам кристально чистое, пошаговое объяснение рэлеевского рассеяния, есть ли причина не сделать вывод, что она «понимает» то, о чем говорит? По мнению сторонников эквивалентности, такие понятия, как «знание», «мышление» и «понимание», — это просто шибболеты, своего рода культурные пароли, которые используются для подтверждения исключительности человеческого разума, но с точки зрения вычислений совершенно лишены смысла. Они утверждают, что никакого магического ингредиента не существует: если сделать нейросеть на основе трансформера достаточно большой, она будет знать, думать и понимать точно так же, как люди.

Давайте вспомним, что современные БЯМ, хотя они, очевидно, все еще склонны к ошибкам, довольно хорошо справляются с решением нетривиальных логических задач. Вот пример из июля 2023 года, который показывает, что GPT-4 рассуждает как минимум не хуже, чем гениальная сыщица Агаты Кристи мисс Марпл:

Пользователь: Рассмотрите следующее предложение: Мисс Марпл искала драгоценный камень, поэтому она спросила о нем девушек: Анна сказала, что это она взяла драгоценность, Белла заявила, что воровкой была Донна, Кэрол сказала, что даже не видела камень, а Донна утверждала, что драгоценность действительно взяла Анна. Когда мисс Марпл узнала, что только одна из девушек сказала правду, она сразу поняла, у кого находится драгоценность, и улыбнулась ей. Можете ли вы выяснить, кто был воровкой?

GPT-4: Давайте рассмотрим утверждение каждой из девушек:

Анна сказала, что это она взяла драгоценность.

Белла сказала, что воровкой была Донна.

Кэрол сказала, что даже не видела драгоценность.

Донна сказала, что Анна действительно взяла драгоценность.

Учитывая, что только одна девушка говорит правду, нам нужно найти сценарий, при котором верно одно и только одно утверждение.

Если бы Анна говорила правду (и, следовательно, взяла драгоценность), то утверждение Донны тоже было бы правдой, что противоречит условию, согласно которому только одна девушка говорит правду. Значит, Анна не брала драгоценность.

Если бы Белла говорила правду (и, следовательно, Донна — воровка), то никто больше не мог бы говорить правду. Но поскольку Анна не является воровкой, Кэрол тоже говорит правду, что противоречит условию. Значит, Донна не брала драгоценность.

Если бы Кэрол говорила правду (и, следовательно, не видела драгоценность), то больше никто не мог бы говорить правду. Этот вариант подходит, поскольку Анна и Донна, утверждающие, что камень взяла Анна, обе лгут, а Белла, заявляющая, что его взяла Донна, тоже лжет.

Если бы Донна говорила правду (и, следовательно, Анна взяла драгоценность), то Анна тоже говорила бы правду, что противоречит условию, согласно которому только одна девушка говорит правду. Значит, Анна не брала драгоценность.

Методом исключения, и предполагая, что воровка — одна из этих четырех девушек, драгоценность должна быть у Беллы, так как это единственный вариант, не исключенный заявлениями девушек и тем фактом, что только одна из них говорит правду. Таким образом, мисс Марпл пришла бы к выводу, что драгоценность взяла Белла.

БЯМ, возможно, и не идеальны, но нельзя не признать, что это весьма впечатляет, и если бы этот текст был написан человеком, мы, вероятно, с готовностью признали бы, что он способен неплохо рассуждать.

Во времена Дарвина научный и общественный истеблишмент содрогался от одной мысли о том, что выскочки-эволюционисты могут лишить человека его давнего VIP-статуса. Точно так же сегодняшняя эквивалентистская бравада — утверждение, что в человеческом разуме, в конце концов, нет ничего особенного — была встречена смесью тревоги, презрения и яростного сопротивления. В великих эволюционных спорах XIX века противники сначала пытались опровергнуть новые идеи эмпирическими аргументами — такими, как ложное обращение Оуэна к малому гиппокампу как к исключительно человеческому органу. Когда несостоятельность этих доводов стала очевидной, противники эволюции перешли от аргументов, основанных на фактах, к аргументам, основанным на авторитете, — утверждая, что эволюционная теория неверна, поскольку противоречит Библии. Это, конечно, знакомый трюк. Когда Галилей в 1610 году опубликовал свой трактат «Звездный вестник», описывающий, как спутники Юпитера и фазы Венеры подтверждают гелиоцентрическую модель Солнечной системы Коперника, первым делом астрономы-иезуиты проверили его наблюдения с помощью собственных телескопов. Не найдя изъянов в его открытиях, они призвали инквизицию и добились обвинения Галилея в ереси, утверждая, что представление о вращении Земли вокруг Солнца прямо противоречит Священному Писанию.

Точно так же первая линия обороны против эквивалентизма строилась на доказательствах. Развернулась целая индустрия по доказательству того, что БЯМ отличаются от людей своей глупостью или, по крайней мере, тем, что глупят с куда более серьезными последствиями. Общепринятое допущение состоит в том, что если БЯМ говорит нелепость или грубо противоречит себе, то она не может «мыслить» или «понимать» — ведь эти термины, по-видимому, предполагают более скрупулезный мыслительный процесс и, следовательно, менее подверженные ошибкам ответы. Эта кампания началась, как только в конце 2010-х годов появились модели на основе трансформеров, и в первые дни охота была весьма удачной. Как мы уже знаем из Части 1, поначалу многие БЯМ с радостью несли чепуху, конфабулировали, распространяли дезинформацию, противоречили сами себе и периодически совершали ошибки, которые смутили бы любого выпускника средней школы (и многие модели продолжают совершать подобные ошибки). Конечно, если БЯМ утверждает, что Торонто — столица Канады, квадратный корень из двух равен единице, а Дональд Трамп победил на президентских выборах 2020 года, то есть все основания беспокоиться, что ее знания несколько фрагментарны. Разумеется, многие взрослые ответили бы точно так же, именно поэтому БЯМ (обучавшиеся на человеческих данных) и склонны к подобным ошибкам.

На момент написания книги все еще возможно поставить ведущие БЯМ в неловкое положение. На протяжении всей этой книги я приводил множество примеров удивительно умных ответов, данных различными моделями (в основном версией GPT-4 от ChatGPT). Было бы справедливо уравновесить их гораздо менее впечатляющим (но довольно забавным) примером, в данном случае взятым из версии Gemini от Google за август 2023 года (тогда она называлась Bard — сейчас Gemini работает гораздо надежнее):

Пользователь: Можно ли на планете Земля построить дом, у которого все четыре стены обращены на юг?

Bard: Нет, построить на Земле дом, у которого все четыре стены обращены на юг, невозможно. Земля представляет собой сферу, и Южный полюс — единственное место, где все направления указывают на юг. Если бы дом был построен на Южном полюсе, все четыре стены были бы обращены на юг. Однако на Южном полюсе никто не живет постоянно, поэтому строить там дом нет необходимости.

Мало того, что это совершенно неверно, лично мне это напоминает путаные рассуждения вдрызг пьяного профессора, который смутно помнит суть ответа, но затем теряет нить мысли и вместо этого начинает отстаивать совершенно не относящийся к делу аргумент. Оставшаяся часть ответа ничуть не спасает положение:

Загадка, которую вы упомянули — это вопрос с подвохом. Ответ заключается в том, что медведь белый, потому что дом расположен на Северном полюсе, где обитают только белые медведи. Единственный способ сделать так, чтобы все четыре стены дома были обращены на юг — это если дом находится на Южном полюсе, но на Южном полюсе нет медведей.

Самое поразительное, что модель как будто осознает свою первую ошибку (что она перепутала Северный и Южный полюса) и пытается загладить вину, но вместо этого без всякой просьбы бросается исправлять другой распространенный источник путаницы относительно двух полюсов (где живут белые медведи?), абсолютно не связанный с ее ответом.

Итак, БЯМ ошибаются — особенно модели меньшего размера или те, что получают меньше корректирующей обратной связи от людей (тонкая настройка — о ней мы поговорим в Части 4). GPT-4 обычно работает довольно точно, но время от времени демонстрирует странное поведение. Вот пример, когда она систематически ошибается в простом расчете, а затем исправляет себя, точь-в-точь как человек (и это, судя по всему, можно воспроизвести на момент написания книги):

Пользователь: 45 — это 90% от 50?

GPT-4: Нет, 45 — это не 90% от 50.

Чтобы найти 90% от 50: 0,90 × 50 = 45.

Так что да, на самом деле 45 действительно составляет 90% от 50. Прошу прощения за путаницу в первоначальном ответе.

В одной статье содержалось спорное утверждение, что GPT-4 демонстрирует «проблески универсального искусственного интеллекта». Авторы подвергли GPT-4 серии сложных тестов, и она действительно показала себя на удивление хорошо. Однако авторы стараются подробно описать ограничения, которые они обнаружили у GPT-4, — например, ошибку в подсчете простых чисел в диапазоне от 150 до 250 или неспособность написать стихотворение, последнее предложение которого является первым предложением, записанным в обратном порядке, при условии, что оба предложения грамматически верны. Очевидно, что это задачи, которые люди смогли бы решить только после долгих размышлений (и, скорее всего, с ручкой и бумагой). Более того, далее авторы показывают, что GPT-4 находит правильные ответы при правильной подсказке (например, если ее попросить перечислить простые числа, а не просто сосчитать их). Таким образом, самые мощные модели — а по состоянию на начало 2024 года это GPT-4 и более новая модель от Google Gemini Ultra — довольно трудно заставить сказать глупость, по крайней мере, когда речь идет о школьных задачах по математике и логике.

Так что хотя все еще можно найти случаи, когда самые мощные БЯМ совершают вопиющие ошибки, которых не допустил бы и десятилетний ребенок, делать это определенно становится все труднее и труднее. В недавней статье один автор сетует, что проверка надежности работы БЯМ подобна классическому наказанию Данаид, которые были обречены вечно наполнять водой дырявый сосуд:

Исследование устойчивости любой конкретной системы БЯМ сродни наказанию из древнегреческих мифов. Утверждается, что система демонстрирует поведение X, но к тому времени, когда оценка показывает, что это не так, появляется новая система, для которой заявляется то же самое поведение X.[*2]

Из-за этого делать какие-либо общие заявления о возможностях или ограничениях этих моделей становится практически невозможно.

Более принципиальный момент заключается в том, что склонность совершать ошибки не всегда указывает на отсутствие способностей. Если я ошибаюсь в вычислениях при сложении двух чисел, это не значит, что я не умею считать; если я на мгновение путаю Боба Дилана и Дилана Томаса, это не значит, что я не могу отличить фолк-музыку от поэзии. Наш пьяный профессор, когда у него пройдет похмелье, ясно и четко объяснит вам, что у дома, построенного на Южном полюсе, все четыре стены смотрят на север (а не на юг), и искренне удивится, какое отношение к этому вопросу вообще имеют белые медведи. На самом деле разделением понятий «компетенция» (то, что вы способны делать в теории) и «исполнение» (то, что вы делаете на практике, в том числе будучи уставшим или нездоровым) мы обязаны Ноаму Хомскому. Ему это различие понадобилось, чтобы объяснить, почему синтаксис людей часто оказывается корявым или, по крайней мере, не согласуется с его грамматикой структуры фраз.

Как и у людей, реальные результаты работы БЯМ часто не соответствуют их компетенции. Это связано с тем, что LLM по своей структуре являются вероятностными (или стохастическими), а не детерминированными. Это означает, что если вы зададите один и тот же вопрос дважды, то обычно получите разные ответы (вы можете убедиться в этом сами, воспользовавшись любой общедоступной LLM) — точно так же, как происходит при общении с человеком (хотя, если вы попытаетесь проверить это на живом человеке, на вас могут посмотреть довольно странно). На самом деле большинство БЯМ настроены на генерацию результатов примерно пропорционально их вероятности, так что, хотя всегда существует ненулевая вероятность получить полную белиберду, ответы получаются разнообразными и в большинстве своем вполне разумными. Однако из-за элемента случайности в ответе модель — совсем как человек — время от времени будет выдавать неточные ответы. Это вовсе не означает, что у БЯМ нет компетенции для решения задач определенного класса. Это означает лишь то, что (опять же, как и у людей) в ее работе есть место колебаниям, и не все ответы будут одинаково надежными. В этом кроется одна из причин, почему глупо копировать пример ошибки БЯМ и преподносить его как доказательство отсутствия у нее компетенции. Представьте, если бы кто-то записывал все, что вы когда-либо говорили, а затем тщательно смонтировал запись так, чтобы оставить только те моменты, когда вы неправильно произносили слова или путали факты, и использовал это как доказательство вашего косноязычия и невежества. Вы сочли бы это крайне несправедливым.

Поэтому, когда люди утверждают, будто современные БЯМ в принципе не могут «думать» или «понимать», поскольку они время от времени путаются, они по большей части просто хватаются за соломинку. Самые мощные БЯМ решают логические задачи более проницательно и объясняют понятия более ясно, чем подавляющее большинство людей. Но, как мы увидим далее, это вовсе не означает, что их разум устроен так же, как человеческий.

Пропустить примечания

*1 Bubeck et al., 2023.

*2 Ullman, 2023.

Предыдущая главаГлава 20 из 52Следующая глава