В главе 4 мы описали сеть, которая отражала многие важные аспекты памяти. В этой главе мы покажем, как сети, построенные на тех же принципах, что и сеть из четвертой главы, позволяют описать многие другие важные аспекты работы нашего разума, включая то, как мы воспринимаем окружающий мир, как думаем о других людях и как испытываем эмоции. Все эти аспекты объединяет то, что они связаны с одной идеей: наши мысли зависят от контекста, в котором они возникают. Например, мы рассмотрим, как один и тот же объект может восприниматься по-разному в зависимости от обстановки, в которой мы его видим; мы разберем, как наше мнение об определенном качестве человека зависит от наших мыслей о других его — возможно, совершенно не связанных с этим — качествах; и наконец, мы исследуем, как одна грань нашей эмоциональной реакции может влиять на другие грани наших эмоций, вызванных тем же самым событием.
Давайте начнем с размышлений о том, как устроено наше восприятие.
Представьте, что вас попросили посмотреть на лицо в левом верхнем углу (панель A) на рисунке 5.1. Возможно, вы без труда разглядите мужчину в круглых очках и с лысиной. Но представьте, что вместо этого вас попросили бы найти на той же картинке мышь. Теперь перед вашими глазами предстанет животное: то, что казалось круглыми очками, превратится в уши, а лысина мужчины — в изогнутую спинку. Этот пример наглядно иллюстрирует, как контекст, заданный инструкцией, влияет на наше восприятие как изображения в целом, так и отдельных его частей.
Рисунок 5.1. Наш опыт и понимание вещей зависят от контекста, в котором мы с ними сталкиваемся.
Рисунок 5.1b послужил ключевым элементом в эксперименте, участникам которого показывали изображения животных фермы и морских обитателей. Для одной половины участников за животных фермы начислялись положительные баллы, а за морских обитателей — отрицательные. Для второй половины всё было наоборот. Участники, набравшие положительные баллы в конце эксперимента, получали вкусный десерт, тогда как набравшим отрицательные баллы приходилось пробовать отвратительное на вид варево. Ставки были вполне реальными, и у участников была сильная мотивация. Эксперимент спланировали так, чтобы на финальном этапе участникам из группы «животных фермы» для получения положительных баллов требовалось увидеть животное фермы, а участникам из группы «морских обитателей» — морского обитателя. И тогда обеим группам показали рисунок, представленный на рис. 5.1b. Как вы думаете, что произошло? Поразительно, но участники из группы «животных фермы» гораздо чаще интерпретировали рисунок как лошадь, а участники из группы «морских обитателей» — как тюленя (при этом они не могли просто заявить, что увидели «животное фермы» или «морского обитателя», им нужно было назвать конкретное животное — например, лошадь или тюленя).
Получается ли у вас уловить оба эти образа? Чтобы увидеть лошадь, нужно воспринять фигуру как голову с двумя торчащими вверх заостренными ушами. Чтобы увидеть тюленя, нужно воспринять фигуру целиком как тело тюленя, морда которого находится в левом нижнем углу, а задние ласты направлены вверх.
Авторы исследования допускали возможность, что участники видели оба животных, но сообщали только о том, за которое полагалась награда. Однако они пришли к выводу, что это объяснение неверно: анализ движений глаз показал, что траектории взгляда у тех, кто сообщил о тюлене, и у тех, кто сообщил о лошади, существенно отличались. По мнению авторов, это открытие лучше всего подтверждает идею о том, что участники действительно видели эти фигуры по-разному.
Люди различаются по тому, какое животное они замечают первым и насколько легко они видят каждое из них (это справедливо и для примера с мужчиной и мышью). Это нисколько не противоречит нашему представлению о работе разума, поскольку то, что видит человек, является результатом взаимодействия множества переменных, а не определяется исключительно внешним стимулом. Например, люди, выросшие на ферме, скорее увидят в фигуре лошадь, в то время как те, кто живет у моря, с большей вероятностью разглядят тюленя. Другие факторы, такие как последствия недавнего опыта, случайный выбор точки на рисунке, куда упал первый взгляд, или даже случайные колебания нейронной активности, могут объяснять, почему одни люди быстрее склоняются к одной интерпретации, а другие — к другой.
На рисунке 5.1c центральный символ считывается как буква B, если мы обращаем внимание на окружающие буквы, и как число 13, если мы ориентируемся на соседние числа. Здесь контекст окружающих элементов — и то, на какие именно из них направлено наше внимание, — влияет на наше восприятие и понимание конфигурации элементов в центре рисунка. Наконец, на рисунке 5.1d наше понимание центрального символа в каждой из двух групп по три буквы формируется словом, частью которого он кажется. В данном случае контекст целого (слово THE или CAT) определяет то, как мы воспринимаем и понимаем центральный знак.
Эти примеры можно отбросить как пустяковые забавы, однако они указывают на важнейший принцип работы разума: наше восприятие и понимание вещей, которые мы видим, зависят от контекста, в котором они появляются, и от нашей интерпретации этого контекста. В примере с мужчиной и мышью решающим контекстом была инструкция (например, «Посмотрите на мужчину»); в примере с животным фермы и морским обитателем — последствия, связанные с тем, какое животное будет опознано; в примере с B/13 — категория объектов, на которые направлено внимание (буквы или цифры); а в примере с THE/CAT — слово, которое можно составить с помощью окружающих букв.
В каждом из этих случаев то, что мы видим, зависит от связей этого объекта с другими вещами и от наших знаний об этих связях.
Ярким примером того, как наше понимание объекта меняется в зависимости от контекста, служит эффект Кулешова. Этот эффект назван в честь Льва Кулешова, советского кинорежиссера, который стремился тонко вызывать эмоции у зрителей. В 1918 году он смонтировал фильм, в котором сначала показал лицо известного в то время актера Ивана Мозжухина, затем переключился на кадр с ребенком в гробу, а после снова показал то же самое лицо Мозжухина. Подразумевалось, что Мозжухин смотрит на мертвого ребенка. Во втором фрагменте фильма он опять показал лицо Мозжухина, но на этот раз перемежал его с изображением красивой женщины, полулежащей на диване (рисунок 5.2).
В 1929 году коллега Кулешова писал, что зрители фильма были «растроганы глубокой скорбью, с которой он [Мозжухин] смотрел на покойного ребенка, и отметили вожделение, с которым он разглядывал женщину». В действительности же кадры с Мозжухиным в обеих сценах были абсолютно одинаковыми — Кулешов просто попросил актера смотреть мимо камеры с совершенно бесстрастным лицом. Зрители воспринимали нейтральное лицо как выражающее эмоции, исходя из контекста, в котором оно появлялось.
Рисунок 5.2: Одно и то же нейтральное лицо воспринималось как скорбное, когда актер смотрел на мертвого ребенка, и как полное вожделения, когда он смотрел на полулежащую женщину.
Примерно через сто лет после того как был впервые продемонстрирован эффект Кулешова, нейробиологи с помощью функциональной магнитно-резонансной томографии (фМРТ) доказали, что одно и то же лицо вызывает различную нейронную активность в зависимости от того, на что оно, по всей видимости, смотрит. Наше понимание и восприятие любого объекта глубоко зависят от его взаимодействия и связей с другими объектами.
Это поразительная мысль. Мы склонны думать, будто наше понимание и восприятие вещей — например, предметов и людей — зависят исключительно от самих этих вещей, и что мы видим их такими, какими они являются на самом деле. Представление о том, что мы понимаем вещи в зависимости от их контекста, противоречит интуитивному ощущению большинства людей, будто мы воспринимаем мир объективно. Но, как мы начали понимать в главе 4, разум не всегда работает так, как нам кажется.
Связи между словами при чтении предложений
Шли 1970-е годы, и когнитивисты живо интересовались тем, как люди читают и понимают предложения. В то время чтение было принято рассматривать как пошаговый процесс — буква за буквой, слово за словом, с извлечением значения каждого слова по мере его прочтения. Однако Дэвид Румельхарт подозревал, что распознавание слов и их значений происходит за счет взаимодействия нескольких слов, работающих сообща. Размышления над этой проблемой привели его к созданию совместно с Джеем Макклелландом модели интерактивной активации восприятия слов, которую мы рассмотрим в этом разделе.
Румельхарт и его научный вклад будут неоднократно упоминаться в последующих главах этой книги. На наш взгляд, он был одним из самых глубоких и оригинальных когнитивистов в истории. Его вклад огромен и фундаментален. Его научный путь начался в 1960-х годах с изучения математической психологии. Вскоре он занялся разработкой вычислительных моделей понимания языка в рамках символьного подхода, популярного в то время. Согласно символьному подходу, человеческое познание основано на манипулировании символами в соответствии с системой правил. Считалось, что эти правила отражают наше понимание мира. Однако к середине 1970-х годов Румельхарт разочаровался в символьных моделях и начал искать альтернативы. В итоге он стал главным архитектором нейросетевого взгляда на разум и алгоритма обучения методом обратного распространения ошибки (о котором пойдет речь в главе 9), ставшего основой современного ИИ.
Когда Румельхарт начал размышлять о том, как контекст влияет на понимание прочитанного, общепринятые психологические модели не могли объяснить подобные эффекты. Популярная в тот период теория описывала процесс чтения следующим образом: после того как знаки на странице (соответствующие буквам) попадали в поле зрения, они, как считалось, сначала обрабатывались детектором шаблонов, который распознавал буквы. Затем эти буквы декодировались в звуковые фрагменты (которые лингвисты называют фонемами). Далее наборы звуковых единиц сопоставлялись со словами в памяти. На следующем, решающем шаге эти слова служили входными данными для некой почти магической системы (в одной из ранних работ ее окрестили «Мерлином»), которая каким-то образом применяла свои знания грамматики и значений слов для определения смысла предложения. В этой модели преобразование происходило как последовательность отдельных шагов — буква за буквой, затем слово за словом — еще до обращения к волшебной системе «Мерлин», которая ведала таинствами смысла. Другие исследователи расширили эту пошаговую теорию на уровни, названные синтаксической структурой и семантической интерпретацией, утверждая, что грамматическая структура предложения сначала определяется набором правил, и лишь затем учитывается семантика, то есть смысл. В этих теориях не предусматривалась возможность параллельной обработки информации или взаимодействия между уровнями. Это крайне беспокоило Румельхарта. Пример за примером убеждали его в том, что результат обработки на этапах, которые обычно считались более ранними, по крайней мере частично зависел от результатов обработки на других уровнях.
Мы можем начать разбираться в аргументации Румельхарта, взглянув на следующее предложение:
Женщина увидела полицейского с биноклем.
Согласно грамматике, фраза вроде «с биноклем» относилась либо к ближайшему существительному «полицейского», либо к глаголу «увидела». Иными словами, бинокль был либо у полицейского, либо у женщины. Было предложено грамматическое правило, согласно которому подобные фразы должны относиться к глаголу. Это указывает на интерпретацию, согласно которой бинокль был у женщины, и она использовала его, чтобы увидеть полицейского. В данном случае это вполне логично — и пока всё идет хорошо. Но теперь рассмотрим такое предложение:
Женщина застрелила полицейского с биноклем.
Здесь это грамматическое правило не работает, поскольку бинокль — это не то, из чего можно кого-то застрелить. Вместо этого нам, по-видимому, следует отнести бинокль к именной группе «полицейского». Простая замена глагола «увидела» в первом предложении на «застрелила» во втором приводит к тому, что грамматическая структура, которую мы должны приписать предложению, очевидно, меняется. И дело не только в замене глаголов. Изменение существительного может дать тот же эффект. Чтобы убедиться в этом, давайте снова вернемся к первому предложению (в котором бинокль был у женщины), но теперь заменим «бинокль» на «револьвер». Вот какое предложение у нас получится:
Женщина увидела полицейского с револьвером.
Теперь снова кажется, что «револьвер» лучше отнести к «полицейскому».
Этот пример бросает серьезный вызов подходу «сначала синтаксис», поскольку одних лишь правил грамматики недостаточно для определения того, какой должна быть грамматическая структура предложения. То, как мы производим синтаксический разбор предложения, зависит от лежащего в его основе смысла, или семантики. И это проблема, поскольку в доминировавшем тогда представлении предполагалось, что грамматическая обработка происходит раньше семантической интерпретации.
Однако для Румельхарта чтение не является поэтапным или последовательным процессом. Напротив, оно задействует несколько различных уровней одновременно. Например, обработка «сверху вниз», связанная со смыслом, работает одновременно и в сочетании с обработкой «снизу вверх», связанной с последовательностью букв, слов и грамматических пометок в тексте. Могут также присутствовать и акустические сигналы, поскольку люди «слышат» фонемы при чтении. Эти и, возможно, другие источники влияния в совокупности определяют, как мы воспринимаем и понимаем то или иное предложение. Румельхарт понимал, что каждый уровень обработки создавал контекст для других уровней. Без системы, способной использовать такие двунаправленные межуровневые связи, чтение было бы не просто трудным, а невозможным.
Чтобы полностью понять, как читают люди, Румельхарт мечтал создать искусственную систему — компьютерную программу, способную обрабатывать язык. Как продвинуться в разработке такой системы? Румельхарт понял, что браться сразу за всю сложность того, как мы строим ментальное представление ситуации, описанной предложением, может оказаться слишком трудной задачей для начала. Поэтому он стал искать более простую проблему, с которой можно было бы начать.
Интерлюдия: ChatGPT небезразличны связи между словами
Август 2023 года. Менло-Пак, Калифорния. Гаурав беседует с ChatGPT. Вопросы Гаурава и ответы ChatGPT приводятся без каких-либо изменений или редактуры.
Гаурав: Ответь на мой вопрос одним предложением. Как тебе кажется, в предложении «Женщина увидела полицейского с биноклем» у кого с большей вероятностью был бинокль — у женщины или у полицейского? Ты должен выбрать один вариант.
ChatGPT: Предложение двусмысленно, но если я должен выбрать один вариант, то бинокль у женщины.
Гаурав: Ответь на мой вопрос одним предложением. Как тебе кажется, в предложении «Женщина застрелила полицейского с биноклем» у кого с большей вероятностью был бинокль — у женщины или у полицейского? Ты должен выбрать один вариант.
ChatGPT: Более вероятно, что бинокль у полицейского. Эта интерпретация согласуется с общими ожиданиями относительно того, кто обычно использует бинокль в контексте работы правоохранительных органов.
(Гаурав разговаривает со своей собакой Сону.)
Гаурав: Эти большие языковые модели используют смысл для разрешения неоднозначностей в синтаксисе. Думаю, Дейв Румельхарт был бы счастлив увидеть их в действии.
Знаковый эксперимент и начало плодотворной дружбы
Дэвид Румельхарт вел курс математической психологии в Калифорнийском университете в Сан-Диего, который был, мягко говоря, нетипичным. Там не было традиционных лекций. Не было обязательных учебников. Он даже не требовал от студентов знания исторических подходов к математической психологии. Вместо этого он просил их приходить на занятия со своими данными. И вот тогда начиналось волшебство. Румельхарт использовал свой опыт, интеллект и целый арсенал приемов, чтобы показать студентам, как их данные можно описать математическим языком, что часто приводило к новым открытиям и открывало новые направления для исследований. Джей, который в то время был начинающим профессором на факультете психологии, записался на курс Румельхарта, и это положило начало их глубокой дружбе. Именно эта дружба в конечном итоге позволила добиться реального прогресса в моделировании эффектов контекста, подобных тем, что мы описали выше.
В ходе бесед они оба пришли к убеждению, что наиболее практичный путь вперед — это моделирование восприятия букв внутри слов (а не слов внутри предложений, например). Их обоих заинтриговал один известный эксперимент с контринтуитивными результатами, который, как им казалось, мог бы стать фокусом их совместных усилий.
Эксперимент, разработанный когнитивистом Джеральдом Райхером, измерял, способны ли участники успешно распознавать целевые буквы, предъявляемые на ничтожно малую долю секунды. Он использовал три типа контекста (рис. 5.3): целевые буквы могли предъявляться внутри слов (например, K в слове WORK), сами по себе, без каких-либо соседних букв (например, K), или же внутри псевдослов (например, K в ORWK). Затем целевая буква и любые соседние буквы маскировались (как показано на рисунке 5.3) путем замены отображаемых символов на знак «#». После этого участникам в случайном порядке предъявлялись две буквы: целевая буква и альтернативный вариант. Участников просили определить, какая из них была целевой.
Рисунок 5.3. Райхер на очень короткое время выводил на экран целевые буквы и измерял способность участников идентифицировать их в трех различных контекстах: когда целевая буква была частью слова, когда она стояла отдельно и когда она была частью псевдослова.
Важно, что когда целевая буква была частью слова, альтернативная буква также подходила к контексту, образуя другое существующее слово. Например, альтернативой целевой букве K при ее предъявлении в слове WORK была D, которая вместе с остальными буквами составляла слово WORD. Или если целевой буквой была B в первой позиции слова BLOT, то альтернативными буквами могли быть P, S или C, поскольку они образуют реальные слова при добавлении к буквам L, O, T. Однако D или F не могли служить допустимыми альтернативами, так как DLOT и FLOT не являются существующими словами.
Райхер принял эти меры для того, чтобы участники не могли просто угадать букву, восприняв другие фрагменты слова. Например, если бы целевая буква D предъявлялась вместе с альтернативой G, то участник, воспринявший первые три буквы контекста W, O и R, с большей вероятностью угадал бы D в качестве целевой буквы по сравнению с G, поскольку WORD — это реальное слово, а WORG — нет.
Итак, как вы думаете, что произошло при таких условиях эксперимента? В каком случае участники точнее всего определяли целевую букву? В условии со словом, в условии с одиночной буквой или в условии с псевдословом?
На первый взгляд можно подумать, что самым точным должно быть распознавание буквы, предъявленной самой по себе. В конце концов, в этом случае нет никаких отвлекающих факторов, которые могли бы помешать воспринять и запомнить целевую букву. Но всё оказалось иначе. Выяснилось, что участники точнее определяли букву, когда она была частью слова. Как мы уже видели, эту повышенную точность нельзя объяснить угадыванием, поскольку в условии со словом и целевая буква, и альтернатива образовывали реальные слова. Нет, похоже, что каким-то образом участники могли лучше идентифицировать букву, когда она содержалась в слове, по сравнению с тем, когда она стояла отдельно или была частью псевдослова.
Как такое возможно?
Дейв и Джей вознамерились это выяснить. Они посчитали, что этот эксперимент предоставляет прекрасную возможность создать нейросеть для изучения влияния контекста на чтение букв; этот контекст был проще, чем чтение целых предложений, о котором Дэвид Румельхарт размышлял ранее. Вместе они решили проверить, смогут ли они построить сетевую модель, которая позволила бы глубже понять механизм, лежащий в основе превосходства слова при чтении букв. Им это удалось, и они создали то, что стало известно как модель интерактивной активации восприятия букв.
После кончины Дэвида Румельхарта в 2011 году Джей писал о времени, когда он и Дэвид Румельхарт работали над этой моделью:
В этот период у меня был академический отпуск длиной в учебный триместр, прилегавший к лету, и мы провели большую часть шести месяцев, работая плечом к плечу над созданием модели, хотя и прерывались частенько на долгие кофе-паузы и походы на теннисный корт. Первоначальный замысел модели принадлежал в основном Дэвиду (его истоки действительно можно проследить в его более ранней статье «Интерактивная модель чтения»), и именно он настаивал на том, чтобы мы продолжали попытки, когда стало казаться, что модель не способна объяснить одно из ключевых явлений, описанных в литературе. Именно Дэвид всегда убеждал нас делать всё как можно проще и откладывать в сторону запутанные вопросы, чтобы сосредоточиться на сути проблемы. Упрощай и держи фокус — этим качествам успешного специалиста по когнитивному моделированию я научился у Дэвида Румельхарта.
В те пьянящие дни совместного страстного стремления к важной цели Джей чувствовал, что «Дэвид был тем старшим братом, о котором я всегда мечтал».
Почему контекст слова дает преимущество?
Модель интерактивной активации состоит из трех уровней (см. рисунок 5.4). Самый верхний уровень — уровень слов — содержит элементы, представляющие целые слова; средний уровень представляет буквы; а уровень признаков представляет собой линии, из которых состоят буквы.
Связи внутри каждого слоя являются тормозными (на рисунке 5.4 они показаны линиями с точками на концах), а связи между согласующимися элементами на разных уровнях — возбуждающими (показаны стрелками).
Уровень слов в сети представляет 1179 четырехбуквенных слов и, следовательно, содержит столько же элементов. Каждый из этих словесных элементов двунаправленно связан со всеми остальными словесными элементами, но эти связи являются тормозными (обозначены линиями с точками на концах). Это означает, что если один словесный элемент активируется, он будет подавлять активацию всех остальных словесных элементов.
Следующий уровень — уровень букв — содержит элементы, представляющие каждую из возможных букв в каждой из четырех позиций в слове. Например, есть двадцать шесть элементов для первой буквы слова, двадцать шесть элементов для второй буквы слова и так далее. Опять же, каждый буквенный элемент имеет тормозные связи с другими буквенными элементами в своей позиции.
Рисунок 5.4. Слева представлены три уровня модели интерактивной активации. Справа показан увеличенный фрагмент модели. Как и прежде, стрелки обозначают возбуждающие связи, а линии с точками на концах — тормозные связи. Связи внутри каждого слоя являются тормозными, а связи между элементами на разных слоях — возбуждающими.
Уровень признаков содержит элементы, представляющие различные линейные признаки, из которых строятся печатные буквы в каждой из четырех возможных позиций. Например, здесь есть элементы для горизонтальных, вертикальных и диагональных линий. На этом уровне тормозные связи отсутствуют.
Элементы букв направляют возбуждающие связи к элементам слов, соответствующим этой букве в данной позиции в слове. Например, элемент буквы, представляющий F в первой позиции, будет иметь возбуждающие связи с элементами слов, представляющих FALL, FAKE, FOWL, FLAT и ряд других. Однако у него нет связи с такими словами, как TAKE, у которых первой буквой не является F. Что важно, эти связи являются двунаправленными (как и в сети «Джетс» и «Шаркс» из главы 4): подобно тому как элемент первой буквы F возбуждает элементы, представляющие слова на букву F, слова, начинающиеся на F, возбуждают элемент первой буквы F.
Элементы признаков также имеют возбуждающие связи с элементами букв, когда их совместное присутствие в определенной позиции совместимо. Например, на рисунке 5.4 элемент признака, представляющий верхнюю горизонтальную линию, совместим с печатными буквами F, E и T, поскольку каждая из них пишется с использованием верхней горизонтальной линии. Однако связь отсутствует, если признак несовместим с буквой. Например, элемент признака, представляющий среднюю горизонтальную линию в F, не связан с элементом буквы T.
Итак, давайте запустим эту сеть. Сначала все элементы находятся на базовом уровне активации или ниже него (чуть меньше нуля). Затем сети предъявляется строка букв, что обеспечивает внешний вход для элементов признаков (внизу слева на рисунке 5.4), соответствующих предъявленным буквам.
Например, представим, что сети было предъявлено входное слово FLAG. Предъявление входа приводит к тому, что соответствующие элементы признаков получают входной сигнал. Таким образом, для первой буквы слова FLAG элементы признаков, соответствующие левой вертикальной линии и двум горизонтальным линиям, получают сигнал. Эти элементы признаков возбуждают элементы букв, содержащие именно эти признаки. Конечно, элемент буквы F быстро начнет активироваться. Другие буквы тоже могут испытывать некоторое возбуждающее влияние, но лишь от части элементов признаков. Например, элемент, соответствующий букве L, получит возбуждение от элементов признаков, соответствующих вертикальной линии в F, но не от элементов признаков, представляющих верхнюю и среднюю горизонтальные линии. Поэтому его активация не будет расти так же быстро (и не достигнет такой же величины), как активация элемента F. Более того, рост активации элемента L будет подавляться тормозным влиянием более сильного элемента F (что согласуется с усилением контраста, описанным в главе 3).
По мере активации элемента F он, в свою очередь, начнет активировать слова, у которых первая буква — F (например, FLAT, FLUE или FILE). Элемент слова FLAG получит самое сильное возбуждение с уровня букв, за ним последует FLAT (три совпадения), затем FLUE (два совпадения) и FILE (одно совпадение). Другие слова, совпадающие с FLAG в нескольких позициях, такие как CLAD, также получат некоторое возбуждение от элементов совпадающих букв. Активация FLAG будет расти быстрее всего, и из-за межсловного тормозного влияния элемент, представляющий FLAG, в конечном итоге окажется наиболее активным, подавив активацию остальных слов.
И вот мы подошли к самой сути дела. Когда элемент слова FLAG начинает активироваться, он начинает возбуждать совместимые с ним элементы букв через нисходящие связи или обратную связь. Возбуждение в элементе слова FLAG на последующих шагах работы сети обеспечит обратную активацию элемента буквы F в первой позиции, буквы L во второй позиции и так далее. Поскольку активации имеют свойство суммироваться, нисходящие обратные активации от элементов слов складываются с восходящими активациями от элементов признаков.
Теперь мы готовы увидеть, как эта модель демонстрирует эффекты контекста, наблюдавшиеся в эксперименте Райхера. Когда FLAG предъявляется в виде слова, где, предположим, целевой буквой является L, элемент, соответствующий букве L, получает восходящую активацию от своих элементов признаков и нисходящую взаимную активацию от элемента слова FLAG — а также, в меньшей степени, от таких элементов слов, как FLOG, FLAP и FLAT. Совместный эффект нисходящей и восходящей активаций приведет к быстрому росту активации элемента L. Напротив, когда элемент L предъявляется отдельно или в составе псевдослова вроде ZLXQ, элемент L получает только восходящую активацию. Ни одно слово не активируется в достаточной мере, чтобы обеспечить нисходящую поддержку (поскольку ни одно четырехбуквенное слово не похоже на строку ZLFQ). Поэтому в ходе рабочих циклов сети (которые соответствуют времени в сети) активация элемента L не растет так быстро и не достигает такого уровня, как в случае, когда буква L предъявляется в составе слова.
В нашей сети активация — это валюта, определяющая результаты. Поскольку элемент L получает больше активации, когда является частью слова, чем когда он предъявляется отдельно или в составе псевдослова, он наиболее точно распознается именно в составе слова. Разумеется, это в равной степени относится к любой букве, а не только к нашему примеру. Это позволяет понять механизм, лежащий в основе эффекта превосходства слова. Здорово!
И последнее: эксперименты показали, что эффект превосходства слова распространяется и на буквы в произносимых псевдословах вроде FLIG.
Понимаете почему? Буквы в FLIG обеспечивают частичную активацию таких слов, как FLAG, FLOG и FLIP. Эта частичная активация обеспечивает некоторую нисходящую поддержку буквам FLIG, что делает их распознавание более точным, чем в тех случаях, когда они предъявляются отдельно или в составе псевдослова. Псевдослова, похожие на реальные слова, активируются совместно с этими словами, которые затем оказывают некоторую нисходящую поддержку буквам псевдослова.
Возможно, вам пришло в голову, что это объяснение на самом деле не зависит от того, является ли FLIG произносимым псевдословом. Джей и Дейв поняли: их модель предполагала, что даже непроизносимое псевдослово вроде FLJG должно обеспечивать нисходящую поддержку для некоторых своих букв, поскольку оно будет активировать элементы слов вроде FLAG и FLOG. Поэтому они решили выяснить, распространяется ли эффект превосходства слова и на буквы в непроизносимых буквосочетаниях вроде FLJG.
И это подтвердилось!
Контекстные эффекты выходят (далеко) за пределы восприятия
До сих пор мы видели, как влияние контекста воздействует на наше восприятие изображений, символов, букв и слов. Однако контекстные эффекты простираются далеко за пределы этих областей. Рассмотрим, к примеру, важнейший вопрос о том, как мы судим о других людях. Оказывается, зачастую очень трудно оценить какое-то одно качество человека без влияния других его качеств — даже если эти другие качества не имеют никакого отношения к выносимому суждению.
Внешность, судя по всему, обладает особой силой в формировании суждений о людях. В частности, эффект ореола наделяет красивых людей своего рода суперсилой. Красивые люди, как правило, получают более высокие оценки в учебе, лучшее обслуживание в ресторанах, более высокооплачиваемую работу, больше чаевых и даже более мягкие судебные приговоры. Окружающие считают их более здоровыми, успешными, вежливыми, высокоморальными и более социально компетентными, чем другие. Людям же менее привлекательным достается обратная сторона медали.
Подобно людям, компании тоже могут извлекать выгоду (или нести убытки) из-за эффекта ореола. В 2001 году компьютеры Apple часто считались неоправданно дорогими и разочаровывающими своей функциональностью. И тут Apple представила iPod — стильный и модный плеер. Практически в одночасье отношение к компьютерам Macintosh от Apple начало улучшаться. Успех iPod словно перекинулся на другие продукты Apple. Но это работает и в обратную сторону. Неудача, получившая широкую огласку, может погубить компанию. Atari была лидером в сегменте видеоигр благодаря таким хитам, как Pong и Space Invaders. Затем она выпустила непродуманную и наспех созданную видеоигру по мотивам фильма «Инопланетянин». Эксперты отрасли считают, что этот единственный неверный шаг послужил толчком к кризису на рынке видеоигр в 1983 году.
Эффект ореола аналогичным образом применим и к товарам. Слово «органический» на упаковке товара заставляет людей верить, что продукт содержит меньше жиров, больше питательных веществ и обладает более выраженным вкусом по сравнению с аналогичными неорганическими продуктами. Но это далеко не всегда так. Точно так же сэндвич из Subway — возможно, потому, что его готовят на прилавке со свежими помидорами и зеленью, — воспринимается как менее калорийный, чем гамбургер из McDonald's. Однако для многих сэндвичей Subway это представление ошибочно.
Как происходит подобная обработка информации с учетом контекста? И что это говорит о нашем разуме? Есть замечательный эксперимент социальных психологов Ричарда Нисбетта и Тимоти Уилсона, который дает нам возможность использовать нейросеть, чтобы начать понимать механизмы, лежащие в основе эффекта ореола.
Нисбетт и Уилсон записали на видео два разных постановочных интервью с профессором колледжа. В одном интервью профессор вел себя тепло и дружелюбно, в другом — холодно и отстраненно. В «теплом» интервью он демонстрировал уважение к интеллекту и мотивам своих студентов, увлеченность своим предметом и гибкость в подходе к преподаванию. В «холодном» же интервью он представал недоверчивым по отношению к студентам, равнодушным к своему предмету и жестким в методах обучения.
Внешность и манера поведения профессора в обоих интервью были схожими. Интересно — и это вскоре станет важным, — что он говорил по-английски с заметным европейским акцентом, который оставался абсолютно одинаковым в обоих случаях.
Участников эксперимента случайным образом разделили на две группы. Одна группа смотрела «теплое» интервью, а другая — «холодное». Затем каждого участника попросили оценить внешность, манеру поведения и акцент профессора. Заметим, что эти оценки никак не должны были зависеть от того, какое именно интервью — «теплое» или «холодное» — смотрел участник.
Но, разумеется, зависели. Участники, смотревшие «теплое» интервью, сочли его внешность, манеры и акцент привлекательными, тогда как те, кто смотрел «холодное» интервью, сочли эти же характеристики раздражающими. Разница была огромной: 70 процентов участников, видевших «теплое» интервью, оценили внешность преподавателя как привлекательную (остальные сочли ее раздражающей), 62 процента сочли привлекательными его манеры (остальные — раздражающими) и 48 процентов назвали привлекательным его акцент (остальные — раздражающим). У участников, смотревших «холодное» интервью, оценки распределились с точностью до наоборот: 68 процентов сочли внешность преподавателя раздражающей, 60 процентов сочли раздражающими его манеры, а 81 процент — его акцент. Такую разницу никак не назовешь незначительной.
Но почему так происходит? Этим вопросом Гаурав постоянно задавался, когда впервые столкнулся с эффектом ореола. Объяснения, которые ему попадались, казались скорее простой констатацией эффекта, нежели его объяснением (например, некоторые авторы приписывали этот эффект когнитивному искажению, не объясняя, почему оно вообще возникает). К счастью, вскоре после того, как Гаурав начал размышлять об эффекте ореола, он познакомился с моделью «Джетс» и «Шаркс» (глава 4). Он почувствовал, что аналогичную структуру сети можно применить для понимания эффекта ореола, и отправился обсудить эту возможность с Джеем. К радости Гаурава, Джей заинтересовался, и эта работа стала первой нейросетью, над которой они трудились вместе.
Основная интуитивная идея этой сети заключается в том, что выражаемые людьми чувства, их манеры, внешность и стиль речи взаимосвязаны. В течение жизни мы встречаем множество самых разных людей. Люди различаются по теплоте выражаемых ими чувств, приятности их манер, характеристикам голоса и физической привлекательности; при этом те, кто выражает позитивные чувства, с большей вероятностью будут обладать более приятными манерами, более приятным акцентом и окажутся более привлекательными, чем те, кто выражает негативные чувства. Чтобы смоделировать эти корреляции, Гаурав создал центральный узел и то, что мы назовем элементами признаков, призванными зафиксировать эти взаимосвязи (рисунок 5.5). Узловые элементы он назвал элементами «Привлекательный человек» и «Непривлекательный человек». Он установил двусторонние возбуждающие связи между элементом «Привлекательный человек» и элементами признаков, которые назвал «Приятные манеры», «Приятный акцент», «Теплый» и «Привлекательный», а также двусторонние возбуждающие связи между элементом «Непривлекательный человек» и элементами признаков, получившими названия «Раздражающие манеры», «Раздражающий акцент», «Холодный» и «Непривлекательный». Как и в сети «Джетс» и «Шаркс», он также ввел тормозные связи (-1) между положительно и отрицательно окрашенными элементами для каждого типа признаков, а также между элементами «Привлекательный человек» и «Непривлекательный человек». В результате получилась сеть, представленная на рисунке 5.5.
Рисунок 5.5: Нейронная сеть для моделирования эксперимента Нисбетта и Уилсона по исследованию эффекта ореола. Характеристики, связанные с восприятием человека, обрабатываются параллельно. Более сильные веса связей показаны более толстыми линиями. Входная активация, поступающая на элемент «Теплый», влияет на активацию других качеств, обычно присущих привлекательным людям.
Теперь, когда сеть готова, давайте опробуем ее в деле. Предположим, мы хотим смоделировать оценки участника, смотревшего «теплое» интервью. Для этого мы подадим сильный внешний сигнал на элемент «Теплый» на рисунке 5.5. Допустим, привлекательность и манеры профессора сами по себе не являются ни привлекательными, ни раздражающими, поэтому ни один из соответствующих элементов не получает входного сигнала (в качестве альтернативы элементы в каждой паре могли бы получать примерно одинаковый внешний сигнал). Исследования акцентов показывают, что большинство иностранных акцентов кажутся людям в какой-то мере раздражающими, поэтому давайте подадим на элемент «Раздражающий акцент» небольшой возбуждающий сигнал. Теперь мы можем запустить эту сеть, используя тот же процесс интерактивной активации и конкуренции, на который мы опирались в модели «Джетс» и «Шаркс».
В ходе этого процесса сильный внешний сигнал, обусловленный выражаемыми на видео чувствами, активирует элемент «Теплый», который, в свою очередь, сильно активирует элемент «Привлекательный человек». Этот элемент оказывает влияние на каждый из элементов положительных характеристик (то есть «Привлекательный», «Приятные манеры» и «Приятный акцент»), а они тормозят соответствующие элементы отрицательных характеристик. Сеть стабилизируется, причем уровни активации элементов положительных признаков оказываются больше 0, а уровни активации элементов отрицательных признаков — меньше 0. Внешний сигнал, поданный на элемент «Холодный», аналогичным образом активирует элементы отрицательных признаков. Конкретные уровни активации элементов признаков зависят от веса связи с центральными узловыми элементами. Паттерн этих активаций соответствует оценкам участников в эксперименте Нисбетта и Уилсона по исследованию эффекта ореола (для таких признаков, как привлекательность, манеры и акцент).
Поразительно, что для моделирования эффекта ореола мы использовали сеть, которая опирается на те же принципы построения, что и сеть «Джетс» и «Шаркс», а также модель интерактивной активации контекстных эффектов при восприятии букв, которую мы рассматривали ранее в этой главе. Да, элементы в каждой из этих сетей имеют разные названия, но эти названия были всего лишь подспорьем для нас, создателей этих сетей. У нейронов в реальном мозге нет названий; они просто участвуют в репрезентации объектов и их характеристик. Мы не считаем это случайностью; нам представляется весьма вероятным, что принципы, заложенные в этих сетях (то есть параллельная обработка, двунаправленная активация, интерактивность и конкуренция), отражают самые общие принципы работы нейронных сетей в нашем мозге.
В пользу того, что эти принципы носят универсальный характер, свидетельствуют данные о том, что они могут применяться даже к развитию эмоций. Обычно мы думаем об эмоции как о наборе реакций на значимую для нас ситуацию. Например, почувствовав запах испорченного молока, мы можем отвернуться и сморщить нос от отвращения; когда нас подрезает грубый водитель, у нас может участиться сердцебиение и мы можем сделать сердитый жест; увидев смешную телепередачу, мы можем широко улыбнуться и поставить ей высокую оценку в социальных сетях. Такое представление об эмоциях соответствует последовательной и однонаправленной (то есть неинтерактивной, недвунаправленной) нейросети, показанной на рисунке 5.6а. Здесь каждая эмоциональная реакция вызвана исходной ситуацией и не зависит от других эмоциональных реакций. Принципы интерактивности и двунаправленности связей позволяют представить эмоциональный эпизод так, как показано на рисунке 5.6б. В такой нейронной сети активация одного из элементов эмоциональной реакции увеличивает активацию центрального узлового элемента, что, в свою очередь, повышает активацию элементов других признаков.
Рисунок 5.6: Две концепции возникновения эмоциональных реакций. Сеть на панели А имеет однонаправленные связи. Она соответствует сценарию, при котором эмоциональные реакции независимы друг от друга и активируются под воздействием сигнала, поступающего на центральный узловой элемент, представляющий вызывающую эмоцию ситуацию. Сеть на панели Б имеет двунаправленные связи. Она соответствует сценарию, при котором эмоциональные реакции взаимодействуют друг с другом.
Примечательно, что существуют данные исследований, подтверждающие интерактивность и двунаправленность эмоциональных реакций. Например, эксперименты показали, что если от участников требуют не улыбаться во время просмотра смешной сцены, они оценивают саму сцену как менее забавную, тогда как возможность улыбаться заставляет их оценивать ту же самую сцену как более смешную. В одном из таких экспериментов участников просили рассматривать карикатуры, держа карандаш во рту горизонтально или зажав его губами вертикально, как сигарету. Держа карандаш горизонтально, можно улыбаться или даже смеяться, но сделать это, когда он зажат вертикально, довольно трудно. Участники, державшие карандаш горизонтально, сочли карикатуры более смешными, чем те, кто рассматривал те же карикатуры с карандашом во рту вертикально.
Экспериментаторы изменили одну переменную реакции (то есть возможность или невозможность улыбнуться для участника), и это привело к изменениям в другой переменной — оценке того, насколько им было смешно. Подобные результаты показывают, что наши эмоциональные реакции взаимодействуют и влияют друг на друга, что согласуется с обсуждаемым нами нейросетевым подходом.
В приведенном выше примере присутствовала исходная ситуация, вызвавшая эмоциональный эпизод (то есть участник, разглядывающий смешную карикатуру). Но может ли одна эмоциональная реакция вызвать другую даже без запускающей ситуации? Да, может. Многие люди отмечают (и лабораторные исследования это подтверждают), что сам по себе акт улыбки заставляет их чувствовать себя счастливее — даже когда для улыбки нет никаких причин. На рисунке 5.6б такой сценарий соответствует активации одного элемента эмоциональной реакции (то есть элемента улыбки), который активирует ранее неактивный центральный элемент ситуации (он неактивен, поскольку мы предполагаем отсутствие ситуации, вызывающей эмоциональные реакции), а тот, в свою очередь, активирует элементы других эмоциональных реакций.
В более широком смысле то, как мы судим и что мы переживаем, зависит от контекста, в котором происходят эти суждения или переживания. В примере с эффектом ореола контекст наших суждений включал в себя (казалось бы, независимые) черты оцениваемого нами человека. В примере с карандашом во рту контекст нашего опыта включал в себя (казалось бы, независимые) возникающие (или не возникающие) эмоциональные реакции. В целом контекст чрезвычайно важен — он задает факторы, которые направляют наше восприятие, интерпретацию и эмоции.
Что важнейшая роль контекста говорит нам о разуме?
Предположим, кто-то захотел разработать основанную на правилах модель эффекта ореола. Как подойти к такой задаче? Первым делом у многих возникнет мысль научить модель определять, привлекателен человек или нет. И затем задать правило, код которого мог бы выглядеть следующим образом:
if (человек привлекателен) {
повысить оценки других качеств;
} else if (человек непривлекателен) {
понизить оценки других качеств;
}
Такое правило не определяет, на сколько именно должна повышаться или понижаться оценка того или иного качества при конкретном уровне привлекательности. Чтобы обойти это ограничение, можно придумать другие правила, вносящие подобные уточнения.
Аналогично, как насчет основанной на правилах модели эффекта превосходства слова (при котором буквы в словах распознаются быстрее, чем отдельные буквы)? Может возникнуть соблазн предоставить модели базу всех четырехбуквенных слов и снабдить ее правилами использования этого репозитория для более точного угадывания целевой буквы. Однако такие правила не объяснят, почему некоторые псевдослова тоже облегчают идентификацию букв, поэтому можно предположить, что для этого существуют еще какие-то правила.
Заманчиво формулировать правила, ведь наш разум часто кажется действующим по правилам. И дело не только во взаимном влиянии взаимосвязанных сущностей. Для многих аспектов человеческого поведения психологи выдвигали наборы правил, которые, по их мнению, были «впаяны» эволюцией в наш мозг. Проблема этого подхода заключается в том, что какие бы правила ни формулировались, всегда обнаруживаются исключения, когда эти правила не соблюдаются. Чтобы обойти подобные исключения, сторонники подхода на основе правил ссылаются на случайный шум, на перечень исключений или на набор доселе не сформулированных дополнительных правил.
Наш взгляд в корне отличается. Для нас эффекты контекста, такие как эффект ореола, эффект карандаша во рту и эффект превосходства слова, представляют собой эмерджентные явления. Они возникают в результате взаимодействия между обрабатывающими элементами сети, а не вследствие следования набору правил. Например, в нашем подходе нет никаких правил для слов и псевдослов, как нет и правил, определяющих, когда эффект превосходства слова должен проявляться, а когда нет. Этот эффект возник благодаря контекстным взаимодействиям между признаками, буквами и словами. Эти взаимодействия разворачивались параллельно и ограничивались накопленными системой знаниями о взаимосвязях между этими тремя слоями обрабатывающих элементов. Данные знания содержались в связях между элементами сети, и ни одна из этих связей не кодировала правила как таковые.
Да, наши сети часто ведут себя так, будто следуют правилам, подобно тому как наш разум часто функционирует так, будто реализует жестко зашитые правила, но делают они это без фактического использования этих самых правил.
Наш разум, похоже, способен бесконечно обрабатывать связи между взаимозависимыми сущностями. Предлагаемый нами подход справляется с таким безграничным разнообразием, поскольку он не основан на конечном наборе правил. Напротив, эта система меняется в ответ на отношения и взаимодействия, составляющие контекст, и благодаря этому способна принимать бесконечное множество конфигураций. В рамках такой системы наше понимание ситуации рождается благодаря тому, что различные ее элементы одновременно влияют друг на друга. Далее мы опишем, как подобная система также позволяет глубже понять совершаемые нами выборы и наши поступки.