К книге
Эти странные новые разумы: Как ИИ научился говорить и что это значит22. Национальная библиотека Таиланда.
48%
22. Национальная библиотека Таиланда.
25

Рассказ Джеймса Тербера, впервые опубликованный в New Yorker в 1939 году, повествует об Уолтере Митти, мужчине средних лет, чья серая пригородная жизнь прерывается лишь поездками в город за бумажными платками Kleenex и лезвиями для бритья, а также энергичными нагоняями от многострадальной жены. Митти спасается от своего унылого существования, погружаясь в причудливые грезы. В своих фантазиях он предстает отважным героем воздушного боя, экстренной операции на сердце или яростной судебной драмы. Тербер бесшовно переплетает фантазии Митти, написанные по сценарию голливудских фильмов категории B («— Кто-то должен уничтожить этот склад боеприпасов, — сказал Митти. — Я вылетаю. Немного бренди?»), с банальными сценами из его повседневной жизни («— Не забудь купить калоши, пока я буду причесываться, — сказала она. — Мне не нужны калоши, — сказал Митти»), предоставляя читателю самому отделять одно от другого. Для этого нам приходится расшифровывать, какие из слов Митти основаны на его собственном унылом опыте покупок и вождения, а какие заимствованы из более захватывающего мира, о котором он узнал из газет, книг или фильмов, но которого сам непосредственно не знал. Читатели рассказа без труда справляются с этой задачей. Мы понимаем, что Митти на самом деле не спасал банкира-миллионера с помощью героической операции и не возглавлял отчаянный авианалет на вражеский склад боеприпасов, тогда как полицейский действительно накричал на него за то, что он задремал за рулем, остановившись на светофоре.

Значение языка зависит от его доказательной базы. Если я скажу вам, что невесомость похожа на полет, имеет значение, испытывал ли я сам состояние невесомости или просто повторяю утверждение, которое где-то услышал или прочитал. Если я скажу вам, что верю в привидений, важно, видел ли я на самом деле призрак на чердаке или просто провел слишком много времени в глухих уголках интернета. В некоторых языках доказательная база утверждения встроена прямо в синтаксис. Например, носители турецкого языка используют специальные суффиксы, чтобы отличить информацию, полученную из первых рук, от информации, полученной из вторых рук. Доказательная база важна для интерпретации результатов работы языковых моделей, потому что, в отличие от людей, БЯМ не имеют непосредственного опыта взаимодействия с миром. Это помещает их, подобно Митти, в режим фантазии — в сферу, где все, что они говорят, вторично по отношению к чужому опыту. Неудивительно, что некоторые утверждают, будто БЯМ просто «попугайничают» свои обучающие данные или (менее вежливо) «брешут», ведь когда мы просто вторим чужим заявлениям, наша собственная доказательная база слабеет.

Таким образом, БЯМ могут описывать мир довольно точно, но их описания — это «вещи с чужого плеча», доставшиеся от людей, чьи слова составляют их обучающий корпус. БЯМ подобна неутомимому гостю на званом ужине, который терпеливо слушает истории, рассказываемые за супом и сорбетом, бесконечно пересказывая их другим гостям, но сам никогда не встает из-за стола, чтобы лично соприкоснуться с внешним миром. По мнению некоторых сторонников человеческой исключительности, это полностью исключает возможность того, что результаты работы БЯМ когда-либо смогут иметь «значение». В одной известной статье 2020 года утверждается, что БЯМ усваивают форму языка (то, какие токены сочетаются с какими), но поскольку они так и не учатся связывать эти токены с чем-либо во внешнем мире, они никогда не смогут постичь их значение.[*1]

Итак, если Митти никогда не был пилотом на самом деле, а лишь читал о бомбардировках в газетах или книгах, означает ли это, что язык, который он использует для их описания, полностью лишен значения? Это кажется слишком строгим условием, которое одним махом лишило бы значения многие великие литературные произведения мира, включая всю научную фантастику. Но, конечно (в рамках сюжета рассказа), Митти живет в реальном мире и, в отличие от БЯМ, может задействовать свои глаза и уши, чтобы осмыслить происходящее. Возможно, он не проводил операций на сердце, но наверняка бывал в больнице или встречался с врачом. Поэтому мы можем признать значение его слов, поскольку они отсылают к объектам или событиям, свидетелем которых он так или иначе был. Но с БЯМ все иначе. БЯМ ставят нас перед беспрецедентной загадкой, ведь мы еще никогда не сталкивались с субъектом, способным говорить, ни разу не познав мир с помощью органов чувств. Так можем ли мы приписывать «значение» словам, которые генерирует БЯМ?

Остроумный мысленный эксперимент призван убедить вас в том, что это невозможно. Он предлагает вам представить, что человек, не знающий тайского языка, каким-то образом оказался заперт в одиночестве внутри Национальной библиотеки Таиланда.[*2] Кто-то убрал оттуда все книги, которые могли содержать переводы или картинки, так что вы никогда не сможете связать тайские символы со знакомыми словами на вашем родном языке или с объектами и событиями за пределами четырех уставленных книгами стен библиотеки. К счастью, однако, читатель обеспечен безлимитным запасом вкуснейшего пад-тая и кокосовой воды, так что он может оставаться в библиотеке вечно, перечитывая каждую книгу столько раз, сколько пожелает. Вопрос в следующем: сможет ли он когда-нибудь начать понимать тайский язык так же, как его носитель?

Тайская письменность представляет собой красивую абугиду, состоящую из плавных, округлых знаков,[*3] но если вы не являетесь носителем языка, его расшифровка кажется пугающе трудной задачей, даже если бы у вас в распоряжении была целая вечность. Представьте себя запертым в библиотеке и пытающимся выучить тайский подобно БЯМ: вы целый день закрываете следующее слово в предложении и угадываете, каким оно может быть. Кажется немыслимым, что вы когда-нибудь сможете «понять» тайский язык, сколько бы времени вы ни провели в заточении. Представим, что после десятилетий усердного изучения закономерностей в последовательностях символов вы можете безошибочно предсказать, как продолжится любое тайское предложение. В этот момент дверь наконец открывается, и в комнату въезжает обезьяна на велосипеде. Как бы вы ни были взволнованы этим странным вторжением, вы никак не сможете узнать, что (ling) обозначает обезьяну, а (jakrayan) — велосипед, а не (скажем) наоборот. Тот факт, что часто встречается рядом с колесом (), а — с бананом (kluay), мало чем вам поможет, если поможет вообще. Возможно, это раз и навсегда показывает нам, что языковые модели не способны понимать то, о чем они говорят, — их слова не имеют значения, поскольку они не подкреплены данными извне их обучающего корпуса, где на самом деле существуют реальные обезьяны, велосипеды и бананы.

Мы, люди, постоянно погружены в головокружительные объемы сенсорной информации. Сетчатка каждого глаза обладает разрешением около 120 мегапикселей, что сопоставимо с самыми передовыми современными камерами, а зрительные сигналы передаются по зрительному нерву с миллисекундной точностью. Уши соединены с мозгом посредством 30 000 нервных волокон, каждое из которых способно передавать нейронные сигналы частотой до 1000 Гц. Эти зрительные и слуховые сигналы объединяются с обонятельными и вкусовыми ощущениями, а также с тактильными данными (от кожи), даруя нам удивительное, калейдоскопическое, мультисенсорное восприятие мира. В отличие от БЯМ, вы можете на собственном опыте прочувствовать лазурь летнего неба и тягучую сладость меда, едкий запах горящего пластика или сердитое жужжание шершня за стеклом. Люди, в отличие от БЯМ, учатся связывать слова с этим опытом, а не просто с другими словами. Когда мы слышим слово «шершень», наш мозг предвосхищает звук жужжания, а не просто связанные с ним понятия вроде «жало» и «гнездо». Можно сказать, что человеческое познание является как иконическим, так и символическим: наши ментальные представления о мире принимают форму как образов, так и суждений. Вы, вероятно, можете довольно живо воссоздать описанные выше ощущения мысленным взором, не описывая их себе словами с помощью внутренней речи (или мысленного слуха, или мысленного обоняния, хотя запахи порой представить труднее). Лишь немногие люди с редким состоянием, называемым афантазией, отмечают, что они принципиально не могут произвольно создавать мысленные образы. Можно с уверенностью утверждать, что современные текстовые БЯМ, которые никогда не видели реального мира и, следовательно, не имеют иконических репрезентаций для подкрепления своего обучения, страдают афантазией — они никогда не мыслят картинками. Но означает ли это, что они вообще не способны мыслить или что их слова полностью лишены значения?

Чтобы ответить на этот вопрос, давайте обратимся к истории человека, который рос в условиях крайне ограниченных возможностей чувственного восприятия физического мира.[*4] Хелен Келлер была одной из самых удивительных личностей двадцатого века. Родившись в почтенной семье из Алабамы, в возрасте всего девятнадцати месяцев она перенесла менингит и трагически лишилась как зрения, так и слуха. Следующие несколько лет она провела в попытках осмыслить мир с помощью оставшихся органов чувств, например, узнавая членов семьи по вибрации их шагов. Когда ей было шесть лет, ее мать наняла местную слепую женщину, чтобы та попыталась научить девочку общению, выводя буквы на ее ладони. В своей автобиографии Келлер с глубоким чувством описывает момент внезапного прозрения, когда она осознала, что движения «в-о-д-а» на ее ладони символизируют то чудесное прохладное вещество, что струится по ее руке. Как она сама восторженно писала: «Живое слово пробудило мою душу, вернуло ей свет, надежду и освободило ее!»

История Келлер дает нам уникальную возможность понять, каково человеку расти в сенсорной среде, лишенной зрительных и слуховых ориентиров. На первый взгляд ее история подтверждает идею о том, что слова обретают значение только тогда, когда они связаны с физическим опытом. В конце концов она поняла слово «вода», когда осознала, что оно относится к переживанию в физическом мире — прохладному ощущению жидкости, текущей по ее руке. Келлер словно описывает тот самый миг, когда она покидает Национальную библиотеку Таиланда и впервые получает возможность сопоставить символы с объектами реального мира, позволяя их значению хлынуть безудержным потоком. Напротив, БЯМ (у которых, к сожалению, нет рук и которые не могут почувствовать прохладу воды на своих пальцах) остаются запертыми в этой библиотеке навсегда.

Однако здесь есть подвох. Если определять осмысленность слов только через их соотнесение с конкретными объектами или событиями (например, с настоящей обезьяной, едущей на настоящем велосипеде), мы радикально лишим значения огромные пласты языка. Мы понимаем множество слов, которые не относятся к физическим вещам и которые нельзя увидеть, услышать или иным образом воспринять непосредственно: такие слова, как «квадратный корень», «бессмыслица» и «гамма-излучение». Все мы можем прекрасно рассуждать о вещах, которых не существует (и которые, следовательно, не имеют референта), вроде персика размером с планету или деспотичного кита, правящего Индийским океаном.[*5] Сама Хелен Келлер улавливала значение бесчисленных конкретных понятий, которые она не могла ни увидеть, ни услышать, таких как «облако», «пение птиц» и «красный». Таким образом, слова становятся осмысленными вовсе не исключительно потому, что они относятся к вещам, которые можно увидеть, услышать, потрогать, попробовать на вкус или почувствовать их запах. Они также обретают значение через то, как они соотносятся с другими словами. Более того, утверждение, будто «смысл» и «понимание» возникают только тогда, когда слова связаны с физическими ощущениями, несправедливо подразумевает, что речь людей с ограниченным сенсорным опытом менее осмысленна или что сами они менее способны «понимать» слова, которые произносят. Оба эти утверждения очевидно ложны. Хелен Келлер, которая так и не обрела вновь зрение и слух, но стала признанным ученым, писательницей, политическим активистом и борцом за права людей с инвалидностью, во многом была обязана своей мудростью тому значению, которое язык передает через свои внутренние ассоциативные связи — через то, как слова соотносятся с другими словами.

Таким образом, смысл можно усвоить двумя разными путями. Существует верхний путь лингвистических данных, на котором мы узнаем, что «паук» ассоциируется с «паутиной». И существует нижний путь сенсорных данных, на котором мы замечаем восьминогое насекомое в центре геометрической сетки, сверкающей в утренней росе. Большинство людей могут позволить себе роскошь путешествовать обоими путями и, следовательно, могут научиться связывать слова со словами, объекты с объектами, слова с объектами и объекты со словами. БЯМ, обученные исключительно как чат-боты, напротив, могут двигаться только по верхнему пути — они способны использовать для познания мира только лингвистические данные. Это означает, что любое мышление или рассуждение, на которые они способны, неизбежно будут сильно отличаться от наших собственных. Для размышлений о мире мы можем использовать ментальные репрезентации, сформированные нашим непосредственным опытом восприятия объектов, пространства или музыки, а не полагаться исключительно на суждения на естественном языке. Вот почему у людей мышление и речь не связаны неразрывно. Как отмечается в одной недавней работе, наша «формальная» языковая компетенция (способность строить грамматически правильные предложения) не ограничивает нашу «функциональную» языковую компетенцию (способность логически рассуждать или проявлять здравый смысл).[*6] Явным доказательством этого разделения служат пациенты, перенесшие повреждение отделов мозга, отвечающих за порождение речи. Если вам не повезет перенести инсульт, затронувший левое полушарие мозга, это может привести к нарушению, называемому афазией. Пациенты с афазией обычно испытывают трудности с артикуляцией, неспособность подобрать нужные слова (аномия) или проблемы с построением предложений (аграмматизм). Однако нарушения порождения речи у человека не обязательно идут рука об руку с трудностями мышления, поскольку у больных афазией логические или творческие способности зачастую сохраняются в поразительной степени.

Российский нейропсихолог Александр Лурия описал один такой случай в статье 1965 года.[*7] Профессор В. Г. Шебалин преподавал в Московской консерватории, написал несколько признанных симфоний, а также оперу, которая шла в Большом театре. В 1959 году инсульт повредил левое полушарие его мозга, вызвав у него тяжелую форму афазии. Ему с трудом давался поиск слов и грамматически правильная речь. Одну из попыток заговорить с женой записал его лечащий врач; в оригинале это звучало примерно так: «Экспрессивный… компрессивный… нет… суппре… нет… что за тразом у меня сегодня…» (то есть совершенно непонятно для всех участников диалога). И все же, каким-то чудом, за те четыре года, что он прожил после сосудистой катастрофы, Шебалин сочинил десять крупных оркестровых произведений. Среди них была его Пятая симфония, которую его друг Шостакович назвал «блестящим творческим трудом, наполненным высочайшими эмоциями, оптимистичным и полным жизни». И при афазии сохраняется не только музыкальный талант. Более свежий случай касается пациента С. О., перенесшего инсульт, который вызвал обширное поражение левого полушария мозга.[*8] У него развилась глубокая афазия, он практически не мог ни говорить, ни писать, произнося лишь редкие обиходные слова («пока» или «привет»). Однако этот пациент без труда решал сложные алгебраические выражения вроде 2b + (3b + c) − (4c + 5b) = ? Таким образом, хотя его языковые навыки были уничтожены, математическое мышление пациента уцелело. Существуют также отдельные свидетельства о пациентах с афазией, которые продолжают играть в шахматы на экспертном уровне, несмотря на то что не могут назвать ни одну фигуру на доске. В отличие от БЯМ, наша способность мыслить ясно не зависит от нашей способности строить осмысленные предложения.

Большинство доступных сегодня широкой публике БЯМ — это в первую очередь чат-боты: они принимают текст на входе и выдают текст на выходе (хотя продвинутые модели, такие как GPT-4 и Gemini, теперь могут создавать не только слова, но и изображения, а модели генерации видео по тексту вскоре станут повсеместно доступными). Они обучались на естественном языке, а также на некоторых формальных языках и множестве примеров компьютерного кода. Таким образом, их способность к логике, математике и синтаксису целиком основана на их внутренних репрезентациях этих символических систем, таких как корейский язык или C++. Люди же, напротив, обладают реальным жизненным опытом, который не ограничивается словами. Это означает, что для мышления мы можем использовать другие виды ментальных репрезентаций, такие как приятное созвучие нот, ласкающее слух при прослушивании струнного квартета, геометрическая проекция алгебраического выражения или стратегическое пространственное расположение фигур на шахматной доске при планировании мата. Вот почему при повреждении языковой системы наша способность рассуждать частично сохраняется — мы можем опереться на эти альтернативные субстраты мышления. И в этом заключается еще одно поразительное отличие когнитивной сферы БЯМ от человеческого познания.

На подходе следующее поколение мультимодальных БЯМ — тех, которые принимают на вход не только язык, но также изображения и видео. На момент написания этой книги способность мультимодальных БЯМ снабжать изображения подписями и описывать их или отвечать на вопросы об их содержании все еще ограничена, но быстро совершенствуется. Например, ChatGPT может нарисовать нелепые научные диаграммы и с самым серьезным видом описать их содержание, пребывая в счастливом неведении относительно того, что все это не имеет никакого смысла. Прекрасной иллюстрацией этого стал случай в начале 2024 года, когда исследователи из Цзяотунского университета в Китае опубликовали статью о сперматогониальных стволовых клетках крысы и обратились к ChatGPT за помощью с рисунком 1. ChatGPT с радостью согласился, сгенерировав картинку в стиле учебника, на которой крыса казалась крошечной на фоне своего собственного гигантского эрегированного пениса, услужливо подписанного как «dck» (с тех пор статья была отозвана).[*9] Предпринималось также несколько (пока безуспешных) попыток обучить БЯМ побеждать в конкурсе карикатур журнала New Yorker — задаче, которая требует развитых аналитических способностей, а также изрядной доли светского остроумия и умения смотреть на мир под необычным углом. Но мощные мультимодальные системы уже на подходе. По мере того как БЯМ перерастают рамки простых чат-ботов, их возможности познавать паттерны взаимосвязей в физическом мире — по фотографиям и видео — будут резко возрастать, и благодаря этому их способ мышления станет на шаг ближе к нашему собственному.

В главах этого раздела мы задавались вопросом, умеют ли языковые модели мыслить. Мы узнали, что современные БЯМ определенно мыслят не так, как люди. Нет никаких сомнений в том, что когнитивные возможности БЯМ крайне ограничены по сравнению с нашими собственными. Но дело не в том, что их вычисления происходят на кремниевых чипах, а не в нейронных цепях коры головного мозга. И не в том, что БЯМ просто механически воспроизводят свои обучающие данные, и не в том, что они строят «прогнозы», а не выполняют точные вычисления. БЯМ отличаются от нас во многих отношениях, прежде всего тем, что у них нет биологического императива выживать и размножаться, нет друзей или физического тела, а их опыт познания мира основан исключительно на текстах, а не на данных, полученных с помощью пяти органов чувств, которыми наделено большинство людей. Однако утверждение, будто БЯМ не мыслят вовсе, требует нового и весьма запутанного определения того, что значит «мыслить».

Пропустить примечания

*1 Из этой статьи (Bender and Koller, 2020): «Мы начнем с определения двух ключевых терминов: мы принимаем форму за любое наблюдаемое воплощение языка — знаки на странице, пиксели или байты в цифровом представлении текста либо движения артикуляционного аппарата. Мы принимаем значение за отношение между формой и чем-то внешним по отношению к языку […] Задача языкового моделирования, поскольку в ней в качестве обучающих данных используется только форма, в принципе не может привести к усвоению значения».

*2 https://medium.com/@emilymenonbender/thought-experiment-in-the-national-library-of-thailand-f2bf761a8a83.

*3 Абугида обозначает вид письменности, в которой каждый знак представляет собой согласный со встроенным гласным звуком, который может быть изменен при помощи диакритических знаков.

*4 Сходный аргумент см. в работе Agüera y Arcas, 2022.

*5 Этот аргумент очень четко изложен в работе Piantadosi and Hill, 2022.

*6 Mahowald et al., 2023.

*7 Luria, Tsvetkova, and Futer, 1965.

*8 Klessinger, Szczerbinski, and Varley, 2007.

*9 www.vice.com/en/article/dy3jbz/scientific-journal-frontiers-publishes-ai-generated-rat-with-gigantic-penis-in-worrying-incident.

Предыдущая главаГлава 25 из 52Следующая глава