Если моя пьеса доведет до сознания общества, что есть на свете такой народ — фонетисты, и что они принадлежат в современной Англии к самым нужным людям, то она сделала свое дело[118].
В 1964 г. я учился в восьмом классе. Наш школьный марширующий оркестр выиграл конкурс в «Империал вэлли» (Imperial Valley, Южная Калифорния). Я играл на баритоне. Играть в оркестре мне очень нравилось. Выиграв конкурс, мы получили возможность отправиться на региональные соревнования более высокого уровня в Лос-Анджелесе, примерно в 210 км к северо-западу от нашего городка Холтвилл, расположенного у самой мексиканской границы.
Во время пребывания в ЛА наш дирижер хотел приобщить нас к высокой культуре, поэтому обратился к школьному совету с просьбой разрешить посещение оперы Моцарта «Дон Жуан». Совет ответил отказом, посчитав такой выбор излишне рискованным для учеников средних классов. У дирижера был запасной вариант — поход в Египетский театр на фильм «Моя прекрасная леди» с Рексом Харрисоном и Одри Хепбёрн. Перед посещением кинотеатра нам рассказали про пьесу Джорджа Бернарда Шоу, на которой основан фильм.
В какой-то момент этот фильм повлиял на мое решение стать лингвистом, поскольку сюжет в нем построен вокруг преобразующей силы человеческой речи, профессора Генри Хиггинса и его нерадивой ученицы Элизы Дулитл. Что такое человеческая речь — то, чем, обладают все люди? Что Бернард Шоу считал ключом к успеху в жизни? Том Вулф в своей книге «Королевство речи» (The Kingdom of Speech) утверждает, что речь — это наиболее важное изобретение в мировой истории. Речь не только позволяет нам говорить друг с другом. Она также мгновенно классифицирует человека по признакам экономического класса, возрастной группы и уровня образования. Если бы эректусы жили и сейчас, люди считали бы их грубыми из-за того, как они говорят. А если удалось бы их одеть в привычную нам одежду и попытаться выдать за современных людей?
Хотя коммуникация — явление древнее, речь, в масштабах эволюции, — предмет относительно новый. Когнитивист и фонетист Филип Либерман утверждает, что речевому аппарату современного Homo sapiens всего около 50 000 лет, то есть даже ранние Homo sapiens не могли говорить так, как это делаем мы сегодня[119]. Это утверждение не следует путать с идеями других авторов насчет того, что язык появился 50 000 лет назад. Речь появилась после языка. Следовательно, если утверждение Либермана про 50 000 лет верно, это будет аргументом против гипотезы о появлении языка как такового 50 000 лет назад. Если эректусы действительно изобрели символы и встали на нелегкий путь прогресса от знаков к языку, то усовершенствованная речь появилась бы много позже. Надо полагать, что первые языки должны были уступать современным. Ни одно изобретение не появляется сразу в наиболее совершенном виде. Все человеческие изобретения со временем совершенствовались. Однако это вовсе не означает, что эректусы говорили на недочеловеческом языке.
Это значит, что у них не было полностью современной речи по физиологическим причинам и что скорость передачи информации была ниже — у них было куда меньше тем для разговоров, чем есть сейчас у нас, да и возможности мозга тоже были скромнее, поэтому они не могли так же быстро обрабатывать и создавать информацию, как современные сапиенсы. Физиологические недостатки эректуса были преодолены благодаря постепенной биологической эволюции. Совершенствование же обработки информации и развитие грамматических способностей происходит в результате культурной эволюции. Сочетание биологической и культурной эволюции на протяжении 60 000 поколений разительным образом улучшило языковые способности людей.
В статье для журнала Американской ассоциации содействия развитию науки, опубликованной в 2016 г., Текумсе Фитч и его коллеги утверждают, что представления Либермана об эволюции речевого тракта ошибочны. Они полагают, что речевой аппарат намного старше 50 000 лет (как утверждает Либерман) — настолько старше, что он есть даже у макак[120]. Работа Фитча и его коллег, несмотря на всю ее занимательность, не особенно полезна для понимания эволюции языка по двум причинам. Во-первых, два крайних положения языка, которые, как они утверждают, схожи у макак и людей, связаны у макак с зеванием. Предположения Фитча и его соавторов, по-видимому, основываются на том, что если удастся заставить макак ставить язык в правильное положение и воспроизводить определенные человеческие гласные при зевке, то макаки смогут их повторить и потом, как будто они говорят. Однако это сомнительное предположение, поскольку зевание никак нельзя считать таким же непринужденным действием, как воспроизведение гласного звука заднего ряда у людей (язык при этом находится в положении, сходном с тем, которое он принимает при зевке). Язык отводится назад с усилием. Маловероятно, что звуки речи могли развиться на основе положения речевого аппарата при зевке. Во-вторых, авторы исследования сравнивают фонетику макак с записанными ранее человеческими звуками. Но авторам следовало бы протестировать человеческую фонетику с использованием тех же методов, которые были применены к макакам, чтобы сделать сравнение более равноценным[121]. Наконец, что наиболее важно, надо учесть тот факт, что для языка не требуется речь в известном нам виде. Языки можно свистеть, мычать или говорить с помощью одного гласного звука и одного согласного, при этом можно обойтись и без последнего. Язык нам обеспечивает сочетание культуры и человеческого мозга. Наша современная речь — приятное и полезное дополнение.
На первый взгляд, человеческая речь проста. В основе гласных и согласных лежат те же принципы, что формируют ноты, выдуваемые из кларнета. Элементарная физика. Воздух поступает из легких или изо рта музыканта и преобразуется, проходя по трубке речевого аппарата или по трубке кларнета. В случае с кларнетом поток воздуха трансформируется с помощью клапанов и трости, которые изменяют его так, что получаются благородные звуки вроде тех, что мы слышим в исполнении Бенни Гудмана, ну или скрежет и визг — у начинающих. До того, как поток воздуха покинет ротовую полость, он преобразуется в речь с помощью гортани, зубов, различных форм и движений, на которые способны элементы нашей глотки, носа и рта, расположенные над гортанью.
Но речь все же сложнее, чем обычное движение воздуха в трубе. Все потому, что движение воздуха по речевому тракту человека управляется сложной физиологией дыхания, которую направляет еще более сложный мозг. Продуцирование речи требует точного контроля более сотни мышц трахеи, дыхательных мышц, диафрагмы и межреберных мышц, а также ротолицевых (орофациальных) мышц. Движение всех этих мышц в процессе речи обладает поразительной сложностью. Чтобы у нас появилась возможность совершать все эти движения, эволюции нужно было изменить строение нашего мозга и физиологию органов дыхательной системы. С другой стороны, ни одна из этих последующих адаптаций для языка не требовалась. Но они сделали речь высокоэффективным способом передачи языка в том виде, в каком она нам сейчас известна. И все же маловероятно, что женщина-эректус смогла бы сыграть Элизу. Ей такую роль было бы не сыграть.
Чтобы мы смогли говорить и петь так, как мы это делаем сегодня, эволюции потребовалось основательно поработать со следующими системами: нижние дыхательные пути (легкие, сердце, диафрагма и межреберные мышцы), верхние дыхательные пути (трахея, глотка, носоглотка, ротоглотка, язык, нёбо, губы, зубы) и, самое главное, мозг.
В среднем человек произносит 135–185 слов в минуту. И тут есть два впечатляющих момента. Первое: поразительно, что люди могут так быстро говорить и считать это нормой. Второе: почти невероятно, что люди могут понимать друг друга на такой скорости. Но, конечно, здоровый человек может делать и то и другое — продуцировать и воспринимать речь — без особых усилий. У речи есть две стороны: продуктивная речь (говорение или пение) и восприятие (слушание и понимание). Чтобы разобраться в эволюции продуктивной речи и восприятия, нужно знать не только историю развития верхних и нижних дыхательных путей, но и то, как мозг контролирует физические элементы речи на такой высокой скорости и с такой точностью.
Чтобы рассказать об истории речи, нужно изучить речевой аппарат и свидетельства наличия речевых способностей у различных представителей рода Homo. Необходимо иметь четкое представление о том, как производятся и воспринимаются звуки и как мозг со всем этим управляется. Но прежде всего, нужно разобраться с нынешним состоянием человеческой речи. Как устроена речь у современных Homo sapiens? Зная ответы на эти вопросы, можно судить о сравнительной эффективности речи сапиенсов и других представителей рода Homo, а также о том, были ли у них вообще речевые способности.
Речь исходит изо рта, проходит по воздуху, достигает ушей слушающего, после чего ее обрабатывает мозг. Каждый из трех этапов — создания, передачи и понимания речи — связан с соответствующим разделом фонетики, науки о звуках. Создание звуков является предметом артикуляционной фонетики. Передачу звуков по воздуху изучает акустическая фонетика. А изучением интерпретации занимается перцептивная фонетика, или фонетика восприятия. Но есть и другие разделы, связанные с иными типами функций. Существуют исследования в области физики и механики восприятия и продуктивной речи. Такие исследования часто объединяют под общим названием «экспериментальная фонетика». Необязательно быть экспертом во всех этих областях, чтобы разобраться в эволюции речи, но хотя бы общее представление будет полезно.
Гортань имеет особое значение для человеческого языка, поскольку обеспечивает людям возможность не только произносить звуки, но и управлять интонацией, чтобы указывать на то, какие аспекты высказывания содержат новую информацию, какие — старую, что в нем особенно важно, а также на вопросительный или утвердительный характер высказывания. Гортань — то место, где поступающий из легких воздух подвергается изменениям, в результате которых происходит фонация (звукообразование), где совместное действие воздуха и мышц формирует звуки нашей речи.
Гортань является небольшим преобразователем, расположенным выше трахеи; над ней находится надгортанник, который может закрываться, предотвращая попадание пищи или жидкости через гортань в легкие. Последнее может быть очень опасно. На основании рис. 21 можно составить представление о сложности устройства речевого аппарата[122].

Рис. 21. Гортань.
Все исследователи эволюции языка сходятся в одном — продуктивная речь развивалась в тандеме с восприятием речи. Как пишет Эдмунд Крелин в своей новаторской работе о строении речевого аппарата, «по-видимому, есть четкое совпадение между диапазоном частот, которые человек может издавать, и тем, который он способен воспринимать». Или «владение членораздельной речью таким образом предполагает, что и продуктивная речь, и восприятие настроены друг на друга, так что параметры, передающие основную часть речевой информации, оптимизированы и для речепроизводства, и для восприятия речи». Другими словами, уши и рот хорошо работают вместе, поскольку они прошли через несколько миллионов лет совместной эволюции.
Речь начинается с воздуха, который может создавать человеческие звуки на вдохе или на выдохе. Первые называют «ингрессивными» (инспираторными), вторые — «эгрессивными» (экспираторными). В английском и других европейских языках в нормальной речи используются исключительно агрессивные звуки. Ингрессивные звуки в этих языках встречаются редко, как правило, только в междометиях («Ах!»). То место, откуда исходит воздух при создании звука, называют «инициатором». Во всех звуках речи в английском языке инициатором являются легкие. Поэтому принято говорить, что все звуки английского языка «пульмонические». Но есть еще два инициатора, используемые во многих языках мира: голосовая щель (небольшая трубка примерно в середине гортани для глоттализованных звуков) и язык (для язычных звуков). Таких звуков в английском тоже нет.
Цитата из моей книги «Language: The Cultural Tool»:
В цельтале, чольском и других языках распространены так называемые «глоттализованные» звуки — имплозивные и эйективные.
В начале моей лингвистической карьеры в середине 1970-х гг. я несколько месяцев прожил среди представителей народности цельталь в штате Чьяпас, Мексика. Одна из моих любимых фраз на их языке — c’uxc’ajc’al, «на улице жарко» — содержит три глоттализованных звука (на письме они отображаются апострофами). Чтобы произнести эти звуки, голосовая щель (пространство между голосовыми связками) должна быть закрыта и не пропускать воздух из легких. Затем с помощью одновременного напряжения гортани, которая смещается вверх, губ или языка создается давление; после этого губы или язык выпускают воздух изо рта, в результате чего формируется взрывной звук. Такой тип звука, как в приведенном выше примере из цельталя, называется «эйектив». Существует также противоположность эйектива — «имплозивный» звук. Чтобы произнести имплозив, гортань смещается вниз, а не вверх, а все остальное остается так же, как и в случае с эйективом. Такое направленное вниз движение гортани приводит к быстрому вдоху и формированию имплозива. В английском языке ничего подобного нет. Я помню, как несколько дней тренировался произносить эйективы и имплозивы, поскольку цельтальцы, с которыми я работал, пользовались и тем и другим. Это интересные звуки — они не только звучат необычно, но и существенно расширяют диапазон речи в сравнении с исключительно легочными звуками европейских языков.
Голосовая щель также может использоваться для формирования других звуков. Еще одна цитата из Language:
Следует упомянуть еще один тип глоттализованных звуков. Произносится такой звук при почти полном смыкании голосовой щели, в результате чего она пропускает лишь очень небольшой поток воздуха. Такой эффект лингвисты называют «скрипучий голос». Часто скрипучий голос появляется непроизвольно, например утром, когда вы только проснулись, в особенности если голосовые связки напряжены из-за того, что накануне вы кричали, выпивали или курили. Но в некоторых языках такие звуки используются как обычные гласные.
А еще существуют звуки, которые называются щелчками. Они формируются блокированием входящего или выходящего потока воздуха с помощью языка, при этом создается давление за голосовой щелью. Как и звуки, инициаторами которых являются легкие или голосовая щель, язычные звуки могут быть ингрессивными или эгрессивными; они формируются в результате перекрывания потока воздуха кончиком языка, при этом корнем языка создается давление, направленное внутрь или наружу. Щелчки встречаются в очень небольшом числе языков, только в Африке, и почти все из них относятся к числу койсанских. Помню, как я впервые услышал щелчки в «щелчковой песне» Мириам Макеба[123]. Родной язык Макеба — коса, который относится к группе банту.
Перечень согласных звуков, инициатором которых являются легкие, приведен в соответствующем разделе Международного фонетического алфавита (рис. 22). Согласные отличаются от гласных по нескольким признакам. В отличие от гласных, согласные создают препятствие на пути потока воздуха (тогда как гласные лишь придают резонатору определенную форму). Международный фонетический алфавит (МФА, IPA) признается всеми учеными как общепринятый способ представления звуков человеческой речи. Колонки в схеме — это способы произношения. В число этих способов входит возможность прохождения потока воздуха через нос; таким образом формируются назальные звуки [m], [n] и [η]. Другой способ, к которому относятся так называемые «взрывные», или «смычные» (поток воздуха полностью блокируется, проходя через рот), — звуки [d], [t], [k] или [g]. Еще есть «фрикативы», или «щелевые», при формировании которых поток воздуха блокируется не полностью, но проход для него существенно сужается, что вызывает возникновение трения, сопровождаемого свистом или шипением, как в звуках [s], [f] и [h].


Рис. 22. Международный фонетический алфавит.
Строки в схеме МФА указывают на место артикуляции. Схема начинается слева, где располагаются звуки, извлекаемые в передней части рта, и по мере движения вправо по схеме место извлечения смещается в сторону глотки. Звуки [m] и [b] называют «билабиальными» или «губно-губными». Они формируются при блокировании потока воздуха губами, при этом верхняя и нижняя губа смыкаются, полностью перекрывая поток. Звук [f] немного смещен назад. Он извлекается при касании нижней губой верхних зубов и частичном, но не полном блокировании потока воздуха. Далее идут звуки [n], [t] и [d], при извлечении которых язык блокирует поток воздуха либо сразу за зубами (как в испанском), либо на альвеолярной дуге твердого нёба рядом с зубами (как в английском).
Теперь мы доходим до задней части ротовой полости, где извлекаются такие звуки, как [k] и [g]; при этом поднимается корень языка, блокируя воздух в области мягкого нёба. В других языках место извлечения звука может располагаться еще дальше. В арабских языках есть фарингальные звуки, формируемые при напряжении надгортанника или движении языка в сторону глотки. Надгортанник — это орган, состоящий из эластичного хряща, который перекрывает гортань, когда мы проглатываем пищу или жидкость. Невозможно нормально говорить с набитым ртом; в этом случае надгортанник не в состоянии выполнять свою функцию, что может иметь фатальные последствия. Люди, за исключением младенцев, — единственные существа, которые не могут одновременно есть и произносить звуки.
Самое важное в схемах МФА — приведенные в них сегменты дают практически исчерпывающий перечень звуков, используемых во всех человеческих языках мира. Представленные в них фонетические элементы достаточно просто произнести любому человеку (по крайней мере, после некоторой тренировки). Но базальные ганглии «любят» привычные действия, поэтому, когда мы уже освоили фонемы родного языка, заставить ганглии воспроизводить новые артикуляционные навыки, необходимые для овладения речью на других языках, может быть довольно сложно.
Однако речь формируется не одними только согласными. Людям также нужны гласные. Например, гласные звуки в моем диалекте английского (южнокалифорнийском) представлены на рис. 23.

Рис. 23. Гласные звуки южнокалифорнийского диалекта.
Как и схема согласных, схема гласных звуков на рис. 23 «иконическая». Столбцы так же указывают на место звука, от передней части ротовой полости к задней. Строки указывают на относительную высоту положения языка при извлечении звука. Трапециевидная форма схемы тоже является иконическим указанием на то, что по мере опускания языка сокращается пространство для продуцирования звука.
Калифорнийские гласные, как все прочие, — это области в ротовой полости, в которые поднимается или спускается язык. При этом, когда язык поднимается или опускается, мышцы языка могут быть напряжены или расслаблены. Губы при этом могут быть округленными или плоскими. Напряженный гласный [i] мы слышим в слове «beet». Ненапряженный гласный [i] — в слове «bit». Другими словами, «bit» и «beet» идентичны во всем, кроме того что мышцы языка при произнесении «beet» напряжены, а в случае «bit» — расслаблены. Еще один способ описания «ненапряженных» и «напряженных» гласных, который многие лингвисты считают предпочтительным, связан с положениями «корень языка поднят» (то есть язык напряжен, сдвинут вперед и вытянут) и «корень языка не поднят» (язык расслаблен, корень языка расположен ближе к задней части ротовой полости). В лингвистической литературе такие положения часто записываются как [+ATR] или [-ATR].
Символом [æ][124] записывается гласный звук в слове «cat». Он низкий, передний и неокругленный. Если двигаться вверх по схеме и по направлению к глотке, то мы доходим до звука [u], гласного звука в слове «boot». Это задний, округленный гласный. «Задний» в данном случае означает, что поднимается задняя часть языка, а не кончик или передняя часть, как происходит в случае с неокругленным гласным [i]. При произнесении звука [u] губы принимают округлую О-образную форму. Округленным может быть любой гласный звук. Так, чтобы произнести французский гласный [у], произнесите английский [i], но попытайтесь при этом округлить губы.
В сущности, различные звуки, встречающиеся во всех языках мира, понять и повторить довольно просто. Сложность не в том, как их классифицировать или анализировать, а в том, чтобы их произносить. Люди могут освоить какие угодно звуки в раннем возрасте, пока базальные ганглии не «вошли в колею». Но по мере взросления ганглиям все сложнее формировать новые связи.
Когда я начинал первый в моей жизни курс по артикуляционной фонетике (чтобы научиться произносить все звуки, встречающиеся в различных языках мира) в Оклахомском университете в 1976 г., преподаватель провел с каждым студентом индивидуальное собеседование, чтобы определить уровень нашей фонетической одаренности (или перцептивных способностей). Я зашел в кабинет, и первое, что мне нужно было проделать, — это произнести слово «hello» на вдохе, а не на выдохе. «Чуднó», — подумал я. Но сделал что просили. Потом мне нужно было повторить несколько слов из языков майя, содержащих глоттализованные эйективы. Это «хлопающие» звуки, при извлечении которых воздух движется наружу, но инициируется выше легких; сначала смыкаются голосовые связки, за ними формируется давление, после чего говорящий выпускает воздух, и звук «извергается» изо рта. Я также попытался скопировать африканские щелкающие звуки. Я знал, что этот курс мне пригодится, поскольку готовился отправиться на Амазонку, чтобы вести там полевые исследования языка, о котором в мире почти ничего не было известно, — языка пираха.
Еще раз отметим, что все языки мира — от абхазского до японского — используют один и тот же набор артикуляционных движений и звуков. Причина в том, что человеческая слуховая система эволюционировала вместе с речевым аппаратом, то есть люди научились лучше всего слышать те звуки, которые сами могут издавать. Конечно, встречаются обособленные группы и до сих пор случаются неожиданные открытия. В действительности лично я во время работы на Амазонке открыл два звука, которые не встречаются в других языках мира (один в чапакурских языках, другой — в пираха).
Лингвист-полевик должен уметь осваивать языки, которые человек способен воспроизводить, и использовать в речи, поскольку ему надо быть готовым приступить к работе сразу по прибытии в пункт назначения, с первой минуты. Ему нужно знать, что он слышит, чтобы начать анализировать речь и язык тех людей, к которым он приехал.
Приведенная краткая справка охватывает лишь одну треть фонетики — артикуляционную фонетику. Но что же происходит со звуками речи, когда они покидают наш рот? Как люди их различают? Слушающие часто не могут смотреть на рот говорящего, так как же мы понимаем, какой звук произносится: [p] или [t], [i] или [а]?
Это предмет акустической фонетики. Первый вопрос насчет восприятия звука: если звук при говорении исходит изо рта, почему слышно только согласные и гласные, а звук самого потока воздуха — нет? Во-первых, гортань изменяет этот поток благодаря вибрации голосовых связок или колебанию других своих частей. В результате изменяется частота звука, он переходит в воспринимаемый человеком диапазон; эволюция сопоставила эти частоты с тем, что может воспринимать ухо. Во-вторых, звук вырывающегося изо рта воздуха был исключен эволюцией, выведен за пределы диапазона, непосредственно воспринимаемого человеческим слухом. И это хорошо. Иначе люди при разговоре звучали бы так, как будто у них постоянная одышка.
Модификацию потока воздуха гортанью называют фонацией, которая формирует для каждого звука то, что известно под названием «частоты основного тона». Частота основного тона — это скорость вибрации голосовых связок во время фонации. Она различается в зависимости от размера, формы и толщины стенок гортани. У невысокого, маленького человека обычно более высокий голос (то есть более высокие основные частоты), чем у крупного. У взрослых более глубокие голоса, более низкие основные частоты, чем у детей; у мужчин голос ниже, чем у женщин; у высоких людей голос часто глубже, чем у низкорослых.
Частота основного тона, которая обычно обозначается как Fo, — это один из способов узнать, с кем вы разговариваете. Мы привыкаем к диапазону частот голосов других людей. Изменение частоты вибрации голосовых связок — основа пения и управления высотой звука в тональных языках, например мандарине или пираха, а также сотнях других языков, в которых тон слога имеет такое же значение для формирования смысла слова, как гласные и согласные звуки. Возможность контролировать частоту звука также важна для продуцирования и восприятия относительной высоты тона в пределах фраз и предложений. Это называется интонацией. Благодаря Fo некоторые языки также применяют свист, используя либо относительную высоту слогов, либо частоты, присущие отдельным звукам речи.
Однако Fo — это еще не все. Помимо основной частоты при извлечении каждого звука речи продуцируются гармонические частоты, или форманты, связанные исключительно с конкретным звуком. Эти форманты позволяют нам различать конкретные гласные и согласные звуки в родном языке. Например, человек непосредственно не воспринимает слог [dad]. Мы слышим форманты и их изменения, связанные с этими звуками. Форманту можно представить визуально. Возьмем камертон, дающий ноту «ми», ударим по нему и поставим на корпус акустической гитары рядом с резонаторным отверстием. Если гитара настроена верно, то струна «ми» той же октавы, что и камертон, тоже начнет вибрировать. Различные гармоники или форманты каждого звука формирует резонанс. Эти форманты видны на спектрограмме, где каждый формант имеет определенную кратность основной частоте звука (рис. 24).

Рис. 24. Спектрограмма гласных звуков.
На этой спектрограмме отражены четыре гласных звука. В нижней ее части расположена частота основного тона, от которой вверх поднимаются темные полосы. Каждая такая полоса, связанная с частотой, указанной в левой части спектрограммы, — это гармонический резонанс, или форманта соответствующего гласного звука. Горизонтальная ось — это время продуцирования звука. Чем темнее полоса, тем больше относительная громкость звука. Именно форманты являются «отпечатками пальцев» для всех звуков речи. Человеческое ухо эволюционировало для восприятия этих звуков, с отбором тех формант, которые отражают физическое строение нашего речевого тракта. Форманты, в порядке возрастания частоты, обозначают как F1, F2, F3 и т. д. Они формируются под воздействием резонаторов, таких как форма языка, округление губ и других механизмов артикуляции звука.
Формантные частоты гласных указаны на спектрограмме в герцах (Гц). Удивительно не то, что мы слышим различия в частоте звуков речи, а что слышим их, совершенно не осознавая этого, хотя продуцируем и воспринимаем эти форманты безошибочно. Это как раз тот вид невыражаемого знания, который часто приводит лингвистов к предположениям о врожденных, а не приобретенных способностях. Некоторые аспекты, безусловно, являются врожденными. Человеческий рот и уши — подобранный комплект. Спасибо естественному отбору.
Для подробного обсуждения физиологической интерпретации звуков ушами и мозгом (фонетика восприятия) у науки пока слишком мало данных. Но акустики и артикуляции звуков вполне достаточно, чтобы начать разговор о ходе эволюции этих способностей.
Если язык предшествовал речи, то следовало бы ожидать, что Homo erectus, хотя он и изобрел символы и язык G1, все же не обладал передовыми человеческими речевыми способностями. Он и не обладал. У него гортань была больше похожа на обезьянью, чем на человеческую. В действительности, несмотря на то, что неандертальцы имели относительно современное строение гортани, эректусы в этом плане остались далеко позади.
Основные различия между речевым аппаратом эректуса и сапиенса: отсутствие гиоидной кости и дочеловеческие рудименты, например воздушные мешки в центре гортани. Текумсе Фитч — один из первых биологов, отметивших, что воздушные мешки имеют отношение к человеческой вокализации. Из-за них многие извлекаемые звуки получаются не такими четкими, как у сапиенсов. Свидетельства того, что у них были воздушные мешки, основаны на удачных находках — окаменелых гиоидных костях эректусов. Гиоидная кость располагается над гортанью и прикрепляется к ней с помощью соединительных и мышечных тканей. Сокращение мышц, соединяющих гортань с гиоидной костью, позволяет людям поднимать и опускать гортань, изменяя Fo и другие параметры речи. А вот у гиоидной кости эректуса, в отличие от более поздних ископаемых видов Homo, мест крепления мышц не обнаружено. И на этом отличия не заканчиваются. Голосовой аппарат у эректусов и сапиенсов отличается настолько, что Крелин делает следующий вывод: «Полагаю, что голосовой тракт [эректуса] практически обезьяний». Другие исследователи пишут:
Авторы описывают тело гиоидной кости, без рогов, приписываемой Homo erectus из Кастель-ди-Гьюдо (Рим, Италия), датируемой примерно 400000 лет до н. э. Тело гиоидной кости имеет брусковидную форму, характерную для Homo, в отличие от булавовидной формы у африканских приматов и австралопитеков. Ее измерения отличаются от снятых с единственного целого образца вымершего вида людей и ранних гоминид (кебарский неандерталец и афарский австралопитек), а также от средних величин, характерных для современных людей. Почти полное отсутствие следов мышц на вентральной поверхности тела кости говорит об относительно слабой способности к поднятию этой гиоидной кости и, соответственно, модуляции длины голосового тракта у Homo erectus. Щитообразная форма, вероятно, небольшой размер больших рогов и данные рентгенограммы указывают на архаичные характеристики; есть ряд сходств с нечеловекообразными, на основании чего можно предположить, что морфологические основы человеческой речи не были заложены у Homo erectus[125].
Следовательно, эректус никак не мог обладать тем же качеством речи, что и современный человек, в плане способности различать такой же спектр звуков речи при ее продуцировании и восприятии. Однако все это не означает, что у эректуса не было языка. У эректусов была достаточно развитая память, чтобы удерживать в ней большое количество символов, не менее нескольких тысяч (собаки, кстати, могут помнить до нескольких сотен). Эректусы могли бы, используя контекст и культуру, различать символы, недостаточно различимые в их формантах вследствие более скромных артикуляционных возможностей. Однако следовало бы ожидать того, что зависимость от языка создала бы эффект Болдуина, то есть естественный отбор действовал бы в пользу потомства с расширенными способностями к продуцированию и восприятию речи в плане развития как голосового аппарата, так и различных центров мозга. Со временем люди дошли от плохо различимой речи эректуса до современной ясной речи.
Каким должен быть набор гласных и согласных, интонаций и жестов, чтобы язык обладал достаточной «емкостью» для передачи всех возможных значений? Язык можно представлять по-разному. Один из вариантов — сопоставление значений с формами и знаниями так, чтобы слушающие могли понимать говорящих.
Если бы удалось достоверно установить, что Homo erectus и Homo neanderthalensis были неспособны продуцировать весь набор звуков, доступных анатомически современному человеку, значило бы это, что у них не могло быть языков, настолько же богатых, как у сапиенсов? Трудно сказать. У сапиенсов речь почти наверняка лучше, чем у эректусов и прочих гоминин. Обладание современным речевым аппаратом дает неисчислимые преимущества. Он делает речь более удобной для понимания. Но «тюнингованный» голосовой тракт сапиенсов не является обязательным условием ни для речи, ни для языка. Он просто очень-очень полезен. Это как иметь дом на колесах и мощный пикап 4×4 вместо фургона, запряженного парой мулов.
В действительности на примере компьютеров мы видим, что язык вполне может обойтись всего лишь двумя символами: 0 и 1. Все компьютеры сообщаются посредством двух символов: «ток вкл.» — 1, «ток выкл.» — 0. Все романы, трактаты, докторские диссертации, любовные письма и все прочее в мировой истории можно перевести в последовательность 0 и 1, хоть и с определенными недостатками, например отсутствием жестов, интонаций и информации об особых аспектах предложений. Так что если эректусы могли произносить лишь несколько звуков, более-менее единообразно, то уже были бы в деле, прямо как сапиенсы. Именно поэтому лингвисты различают язык и речь. Вполне вероятно, что сапиенсы говорят отчетливее, используют звуки, которые легче услышать. Но это означает лишь то, что эректусы, образно говоря, пользовались языком, подобным первому «Форду». А сапиенсы — «Тесле». Но и «Форд», и «Тесла» — автомобили. Первый «Форд» — не «протоавтомобиль».
Хоть это и сложно восстановить на основании палеонтологической летописи, голосовой тракт человека, как и мозг, тоже прошел большой эволюционный путь от первых гоминид до современных сапиенсов. Но чтобы рассказать эту часть истории, нужно немного сдать назад и поговорить о звуках, которые используют в своих языках современные люди. Это конечная точка эволюции и начальная точка для любого обсуждения звуков современной человеческой речи. Вопросы эволюции, лежащие в основании всех полевых лингвистических исследований, следующие: как люди пришли к тому набору звуков, который мы наблюдаем в современных языках, и что это за звуки?
Все звуки, производимые человеческим голосовым аппаратом, состоят из одних и тех же компонентов.
Техническая классификация каждого звука речи говорит нам о том, как он артикулируется. Согласный [p] называется так: «глухой губно-губной смычный с эгрессивной пульмонической инициацией». Это длинное, но исключительно полезное описание речевого звука означает, что, например, второй звук в слове «spa» произносится при расслаблении голосовых связок таким образом, чтобы они не вибрировали. Поэтому звук «глухой». (Звук [b] произносится в точности как [p], но в случае с [b] голосовые связки — также называемые голосовыми складками — напряжены и вибрируют, в результате чего звук [b] становится «звонким».) Выражение «эгрессивная пульмоническая инициация» означает, что воздух выходит через рот или нос (или и то и другое), а источником воздуха являются легкие. Такое уточнение необходимо, поскольку не все звуки речи используют воздух из легких. Термин «смычный» означает, что поток воздуха блокируется полностью, хотя и всего на мгновение. Термин «губно-губной» указывает на одновременное действие верхней и нижней губы. В сочетании с термином «смычный» «губно-губной» означает, что поток воздуха полностью блокируется губами. Если произнести гипотетическое слово [apa], держа при этом указательный палец на «адамовом яблоке» (на самом деле это ваша гортань), то можно почувствовать, как вибрация голосовых связок пропадает при переходе от звука [a] к звуку [p], а потом снова появляется на втором [a]. А если повторить ту же процедуру для гипотетического слова [aba], голосовые связки будут вибрировать постоянно, на всех трех звуках [а], [b] и [а], то есть на протяжении всего слова.
Хотя в более чем 7000 языках мира существуют сотни звуков, все они называются и классифицируются согласно приведенной нами процедуре. Но что еще важнее, этих простых процедур, использующих части тела, которые эволюционировали независимо от языка (зубы, язык, гортань, легкие, носовую полость), достаточно для того, чтобы произнести все, что вообще можно сказать на любом из языков, существующих на планете. Ну не здорово ли?
Конечно, люди могут обойтись без устной речи и общаться с помощью языка жестов или письменно. Способы коммуникации у человека, будь то письменность, язык жестов или разговорный язык, задействуют один или оба из различных каналов — слухо-произносительный или мануально-визуальный. В современных человеческих языках постоянно используется оба канала. Это важно для человеческого языка, в котором жесты, грамматика и значение соединяются в каждом высказывании. Конечно, язык может проявляться иначе. Люди могут общаться с помощью цветных флажков, дымовых сигналов, азбуки Морзе, печатных букв, куриных внутренностей и других визуальных средств. Но, как ни странно, никто не ожидает, что удастся обнаружить сообщество людей, которые общались бы исключительно посредством письменности или дымовых сигналов. Разве что у них у всех был бы какой-то общий физический порок или всему сообществу нужно было постоянно взаимодействовать с кем-то, у кого есть такой порок.
Тут стоит задаться вопросом: есть ли в человеческой речи что-то особенное, или же она просто состоит из удобных для произношения шумов?[126] Другие звуки для общения работали бы так же?
Как отмечает Филип Либерман, одной из альтернатив человеческой речи является азбука Морзе[127]. Самый подготовленный оператор может добиться скорости примерно 50 слов в минуту. Это примерно 250 букв в минуту. Однако операторам при работе на такой скорости нужно часто отдыхать, кроме того, им крайне сложно запомнить то, что они передают. А страдающий похмельем студент без особого труда воспринимает лекцию на скорости 150 слов в минуту! Мы можем говорить со скоростью около 25 звуков в секунду.
Речь также структурирует произносимые нами звуки. Слог — это основной структурный элемент в потоке речи. Слоги используются для организации фонем в группы, следующие друг за другом в определенном порядке, который прослеживается во всех языках мира[128]. Наиболее распространенные варианты группировки следующие: Согласный (C) + Гласный (Г); C+C+Г; C+Г+С; C+C+C+Г+C+C+C и т. д. (три согласных с каждой стороны от гласного — как правило, самый длинный вариант слога, наблюдаемый в известных языках мира). В английском есть примеры такой слоговой структуры, например слово strength, s-t-r-e-n-g-th, где звуки сгруппированы как C+C+C+r+C+C+C (сочетание букв «th» отображает один звук). Но, что интересно, в большинстве языков схема С+Г является либо единственным, либо наиболее распространенным вариантом слога. Благодаря организационной и мнемонической помощи слогов, эволюции нашей нервной системы и суждениям о сочетаемости звуков, сформированным на основе продолжительного воздействия нашего родного языка, мы можем разбирать звуки нашей речи и слова намного быстрее любых других звуков.
Предположим, вы хотите сказать: «Piss off, mate!»[129] Как эти звуки появляются у вас изо рта и отправляются в чьи-то уши? В этих трех словах три слога, пять согласных и три гласных звука, если судить по тому, что произносится, а не по отображению на письме. Технически последовательность звуков следующая: [ph], [i], [s], [ɔ], [f], [m], [еi], [t]. Слоги: [phis], [ɔf] и [meit]. Что не очень характерно для английского, каждое слово в этом ругательстве состоит из одного слога.
Языки жестов тоже могут нас многому научить в области организации нашей нервной церебрально-когнитивной платформы. Носители языка жестов могут общаться с той же скоростью, что и пользователи речевого аппарата. То есть развитие нашего мозга не может быть настолько связано со звуками речи, чтобы все прочие модусы или каналы речи оказались нам недоступны. Маловероятно, что эволюция изначально оснащает каждого человека отдельными нейронными сетями: для языка жестов и для обычного языка. Разумнее предположить, что наш мозг способен обрабатывать сигналы различных модусов, а руки и рот обеспечивают самые простые варианты выражения языка. Кстати, в языках жестов также обнаруживаются слогоподобные группировки жестов, поэтому мы знаем, что у нас есть предрасположенность к такой группировке в том смысле, что наш мозг быстро улавливает слоговые группы, благодаря чему увеличивается скорость обработки знаков. Однако вне зависимости от других модусов звуковая речь остается основным каналом коммуникации для большинства людей — это факт. И это довольно интересно, поскольку он дает нам свидетельство того, что эволюция перестроила физиологию человека под задачи речи.
Человеческие младенцы в плане строения голосового тракта мало отличаются от других новорожденных приматов. Часть голосового тракта ребенка, расположенная выше гортани (супраларингеальный голосовой тракт), выглядит почти так же, как у шимпанзе. Когда новорожденные едят, у них приподнимается гортань, благодаря чему блокируется проход, ведущий к носу (носоглоточный проход). Благодаря этому в трахею не попадает материнское молоко или другая пища. Человеческие детеныши могут одновременно есть и дышать, не опасаясь подавиться, прямо как шимпанзе.
Взрослые такую способность теряют. По мере взросления голосовой тракт удлиняется. Относительные размеры рта уменьшаются, а глотка (отдел горла, расположенный непосредственно за ротовой полостью и выше гортани, трахеи и пищевода) удлиняется. Соответственно, гортань взрослого не поднимается так же высоко относительно рта, а потому в нее может попадать пища. Как мы уже отмечали ранее, если инородное тело попадет в трахею, то человек может задохнуться и умереть. Поэтому, чтобы не подавиться во время еды, при глотании важна точная координация работы языка, гортани, надгортанника и пищеводного сфинктера (круглая мышца в пищеводе). Люди обычно стараются не разговаривать с набитым ртом. Разговор во время еды может привести к гибели или доставить серьезный дискомфорт. Взрослые люди утратили полезную способность, которой обладают шимпанзе и человеческие младенцы.
Но есть и хорошие новости. Хотя весь перечень изменений, которые претерпел человеческий голосовой аппарат, слишком обширен, чтобы приводить его в этой работе, их конечный результат дает нам возможность говорить намного четче, чем Homo erectus. Все потому, что мы можем производить более широкий набор звуков, в особенности гласных, например супергласные «i», «а» и «u», которые встречаются во всех языках мира. Они воспринимаются проще всего. Мы — единственный вид, способный производить все из них. Кроме того, гласный «i» представляет особый интерес. Он позволяет слушающему оценить протяженность голосового тракта говорящего, а, следовательно, определить его относительные размеры и пол, а также «нормализовать» ожидания в процессе распознавания голоса говорящего.
Это эволюционное изменение голосового аппарата открывает доступ к большему набору вариантов продуцирования звуков речи, начинающегося с легких. Для голосового аппарата человеческие легкие — как баллон с гелием для воздушного шарика. Рот — как горлышко шарика. Когда мы выпускаем воздух из шарика, высоту звука можно регулировать, изменяя натяжение материала — делая отверстие, через которое выходит воздух, шире или уже. Также можно периодически перекрывать поток воздуха и «подкачивать» шарик, когда воздух в нем заканчивается, чтобы продолжить извлечение звука.
Однако если нос и рот человека имеют некоторое сходство с горлышком воздушного шара, то различных движущихся частей, изгибов и полостей, через которые проходит воздух, в них намного больше. Поэтому люди могут издавать гораздо больше звуков, чем воздушные шары. А поскольку человеческие органы слуха эволюционировали в паре с голосовым аппаратом, неудивительно, что они развили наибольшую чувствительность к относительно небольшому набору звуков, используемых в речи.
Согласно исследованиям в области эволюционной биологии, у всех сухопутных животных гортань развивалась на основе одного органа — легочного клапана древних рыб, в частности протоптеров, рогозубов и лепидосиренов. Рыбы дали нам речь. Две специальные щели в дыхательном клапане этих древних рыб препятствовали попаданию воды в их легкие. Эволюция добавила к этому простому мышечному механизму хрящи, приделала еще кое-что полезное для дыхания млекопитающих и звукоизвлечения. В результате получились голосовые связки человека — довольно сложный набор мышц. Впервые словом cordes их назвал французский исследователь Антуан Феррейн, который сравнивал голосовой аппарат со скрипкой[130].
Но вот что действительно сложно, так это управление этим инструментом. Люди не играют на своих голосовых аппаратах руками. Они управляют движением сотен мышц, от диафрагмы до языка, и отверстием назофарингеального прохода с помощью мозга. Форма голосового аппарата эволюционировала в течение тысячелетий, чтобы продуцировать более отчетливые звуки, эффективно отражающие нюансы языка говорящих, а мозг развивал новые связи, необходимые для управления голосовым аппаратом.
Для продуцирования речи людям необходимо уметь очень четко контролировать дыхание. Дыхание состоит из вдохов и выдохов. Речь почти всегда осуществляется на выдохе. Для этого требуется контролировать поток воздуха и управлять давлением воздуха, поступающего из легких через голосовые складки. Для речи необходимо уметь продуцировать звук даже после точки «тихого дыхания» (когда воздух не выталкивается из легких при выдохе под действием движения мышц, а вытекает из них в пассивном режиме). Такой контроль позволяет продуцировать длинные предложения, попутно создавая не только отдельные звуки речи, гласные и согласные, но также интонацию, регулировать громкость и продолжительность слогов и фраз.
Очевидно, что мозг тесно связан с продуцированием речи, поскольку электростимуляция определенных областей мозга может приводить к речевым движениям и извлечению некоторых звуков (в особенности гласных). Другие приматы реагируют на такую стимуляцию иначе. Стимуляция области, соответствующей полю Бродмана 44, у них приводит к появлению движений лица, языка и голосовых связок, но фонации, как в случае с людьми, не происходит.
Констатируем очевидное: шимпанзе не умеют говорить. Но так происходит не из-за особенностей их голосового тракта, как считают некоторые. Голосовой тракт шимпанзе определенно в состоянии производить достаточно четкие звуки, чтобы поддерживать язык. Шимпанзе не говорят потому, что у них так устроен мозг — они недостаточно умны, чтобы пользоваться грамматикой наподобие человеческой, а также не могут так точно контролировать голосовой тракт. Либерман считает, что основные контроллеры речи располагаются в базальных ганглиях. Эту часть мозга он сам и еще ряд специалистов называют рептильным мозгом. Еще раз отметим, что базальные ганглии отвечают, в том числе, за осуществление привычных действий. Нарушение нервных контуров, связывающих базальные ганглии с корой, может приводить к различным тяжелым последствиям, среди которых, например, обсессивно-компульсивное расстройство, шизофрения и болезнь Паркинсона, Базальные ганглии связаны с двигательным контролем, познавательной деятельностью, вниманием и другими аспектами человеческого поведения.
Таким образом, в сочетании с эволюционировавшим вариантом гена FOXP2 (который обеспечивает больший контроль над голосовым аппаратом и усовершенствованную работу психики, необходимую для использования современного языка) эволюция связей между базальными ганглиями и увеличившейся корой головного мозга крайне важна для существования человеческой речи (или языка жестов). Понимание этих эволюционных изменений помогает осознать, что человеческие язык и речь — часть процесса, наблюдаемого у нескольких видов животных. Это не значит, что есть особый ген языка или непреодолимый разрыв, который вдруг появился из ниоткуда и дал людям язык и речь. Напротив, на основании эволюционной летописи мы приходим к выводу, что языковой разрыв формировался в течение миллионов лет постепенного развития. Вместе с тем эректус — отличный пример того, как рано был перейден языковой рубеж, как изменения в мозге и интеллект обеспечили формирование человеческого языка даже при речевых способностях обезьяны. Homo erectus — свидетельство того, что обезьяны могли бы говорить, обладай они достаточно крупным мозгом. Эти обезьяны — мы.