Миф о виртуальном говорящем клоне по-прежнему жив. Но сможет ли эмоция пережить голосовое клонирование?
Проблема искусственного голоса занимала умы исследователей XVIII века, оснащавших механические фигуры людей подобием голоса. Это было время наивысшего расцвета часового искусства. Биомеханика создавала андроидов. Каждая деталь требовала многих месяцев, а иногда и лет упорного труда. Результаты же были единичными. Андроид двигался одну-две минуты, приводя в изумление зрителей. В XIX веке самым одаренным среди своего поколения создателей автоматов был, без сомнения, иллюзионист Жан Эжен Робер-Уден. В начале XX века интерес к искусству иллюзионистов упал – в отличие от XVIII века, когда вокруг механических фигур кипели страсти, а барон фон Кемпелен даже представил императрице Екатерине II свой первый говорящий автомат. Страсть барона к автоматам побудила его написать трактат о функционировании человеческого голоса. Он считал, что язычок, используемый во многих музыкальных инструментах, похож на язычок человека. (Язычок бывает простой или двойной: простой, как у кларнета или саксофона, представляет собой камышовую пластинку, насаженную на мундштук; двойной (трость), как у гобоя, – это пара плотно соединенных друг с другом камышовых пластинок, которые насаживаются на штифт; музыкант, упираясь губами в мундштук и дуя в него, заставляет трость вибрировать.) Автомат Кемпелена мог произносить несколько слов, таких как папа, мама, пантомима. Барон предпочитал заставлять свой автомат произносить слова на латыни, французском или итальянском, так как воссоздать немецкий очень трудно. Его говорящее создание состояло из ящика, каучуковой воронки, игравшей роль рта, второй каучуковой воронки, игравшей роль носа, и внутреннего механизма, состоявшего из небольших мехов, которые выполняли функцию легких. Воздух передавался по трубкам до уровня псевдорта, куда барон поместил вибрирующий язычок, создав возможность произвести звук. Третий рычаг изменял резонаторные ящички, расположенные в голове андроида. Дело сделано. У андроида появился «голос».
Известный священнослужитель аббат Микаль, пожелавший выиграть конкурс, объявленный Императорской Академией наук в Санкт-Петербурге, изготовил две говорящие головы, способные произносить фразы вроде «король дарует мир Европе». В конце XVIII столетия, когда знание стало одерживать победу над религией, Лавуазье и Лаплас, присутствовавшие на демонстрации сего научного достижения, были поражены способностями этих голов. Оставив в стороне оценку французских ученых, комиссия посчитала, что из-за двигающихся губ андроиды часто зажевывают слова и у них постоянно хриплый голос. Около 1750 г. инженер из Гренобля Жак де Вокансон попытался осуществить свою мечту – создать говорящего андроида, но безуспешно. Впрочем, он изобрел множество других автоматов, ни один из которых не сохранился.
Бормотание механических голосов свидетельствует, насколько голос завораживает человека. С голосами машин мы встречаемся в многочисленных сочинениях писателей-фантастов, в современных фильмах, в компьютерных играх. Уже в начале XX века люди проявляли огромный интерес к андроидам, созданным, разумеется, по совершенно иной технологии. Робот выражает голосом свои эмоции. Если синтезированное слово отныне находится под контролем, машинный голос робота делает еще только первые шаги. Сегодня ему приходится учитывать богатство словаря, синтаксис и «эмоциональность» голоса, ибо виртуальный мир стремится сравняться с реальным.
Граница между мифологией и фантастикой практически преодолена. Различия между человеком и клонированным андроидом, между Адамом и Големом, размыты. Согласно некоторым мифам, робот по имени Талос, сделанный Гефестом, сыном Зевса и Геры, являл собой инертную массу металла. Слово «робот» вышло из-под пера чешского писателя Карела Чапека. На чешском оно означает «подневольный труд». С давних пор человек пытается контролировать свой собственный клон, создать свое управляемое механическое продолжение, перенести собственное эго на другого. В мифологии наделенные бессмертием боги создают подчиненных им смертных людей. Человек хочет создать своих марионеток, хочет играть в Бога. В 18-й песни «Илиады», созданной за восемь веков до нашей эры, Гефест предстал первым создателем роботов, самыми известными из которых были две служанки из золота, которые умели разговаривать, думать и, соответственно, могли считаться человеческими существами. В самом деле, потребовать от робота, чтобы он заговорил, означает очеловечить его, наделить интеллектом. Иначе говоря, создать живое существо, почти такое же, как мы.
В Библии (Псалтирь, 139:16) слово «голем» употреблено в своем первоначальном значении – «зародыш». Голем, человеческая статуя, несет на лбу надпись Emeth, означающую «Истина». Убрав е, мы получим «смерть». Согласно легенде, в XV веке немого глиняного гиганта оживил великий раввин Лёв из Праги. Сегодня жилище раввина посещают многочисленные туристы. Голем служил своему хозяину. Он не издавал ни звука. История гласит, что Голем неуклонно рос и больше не мог совладать со своей силой. Его разрушение неизбежно. Легенда делает упор на силе слова, на власти голоса по отношению к власти над жизнью. Голем повиновался приказам. Он был всего лишь глиняный раб, чья сила – в его физической массе. Абстракция, слово, мысль для него не существовали. У него не было собственной жизни, потому что не было речи и собственного голоса. Так разве не является Голем предком робота, повелителем которого хочет остаться человек? Не предок ли он также и Пиноккио, ожившего, когда ему было даровано слово?
Чтобы как можно искуснее синтезировать человеческий голос на компьютере, надо знать множество математических формул, с помощью которых можно представить схему мелодии. Нужно знать не только частоты, но и паузы голосовой эмиссии. Отныне с помощью знаний по акустике на кривые, сплошные и пунктирные, проецируют признаки каждого базового элемента голосовой эмиссии. Когда вы произносите а, на спектрографе появляется несколько частот с различными оттенками «серой шкалы», иначе говоря, шкалы интенсивности. Компьютер запрограммирован так, чтобы на каждом уровне интенсивности серого цвета присутствовала специфическая частота, собственная интенсивность и характерный шум. Искусственный голос обладает тремя измерениями.
Речь и пение имеют разную последовательность звуков. В самом деле, буква а в разных позициях произносится по-разному. А компьютер каждый раз воспроизводит одно и то же а. Значит, надо запрограммировать а, введя последовательность различных элементов.
Русский дирижер Павел, которого я встретил в конце 1990-х, начинал работать над созданием электронной музыки. Он рассказал мне о своем удивительном эксперименте. Опираясь на акустико-математический анализ, он синтезировал звуки скрипки, виолончели, аккордеона, гитары и т. д., запрограммировал мелодию и записал ее. Однако прослушивание принесло ему разочарование и ощущение провала. Хотя спектрограмма этой роботизированной музыки вышла великолепной, звуки били по ушам. Но ведь все прекрасно записалось, просто превосходно! Все ля имели частоту 440 Гц, все скрипки – одинаковый тембр. Так слаженно не звучал ни один оркестр, обычно ля либо на 2 Гц ниже, либо выше, в зависимости от исполнительской скрипки и от уровня влажности в студии звукозаписи. Причина крылась в записи, воспроизводящейся как математическая формула, как кривая в геометрии. Это уже не искусство, это фотокопия. В самом деле, когда Павел дирижирует своим оркестром, один инструмент никогда не повторяет дважды совершенно идентичные звуки, ноту, тембр. Благодаря своему таланту Павел понял и почувствовал, что мир синтезированных звуков лишен каких-либо чувств. Совершенство оказалось недостатком! Однако он не опустил руки и снова вернулся к замыслу. К своей виртуальной записи он добавил некий «параметр хаоса», запрограммировал свой компьютер так, чтобы иметь возможность варьировать частоту желаемой ноты в пределах от 2 до 4 Гц. Запись стала человеческой, в ней появились эмоции. Несовершенство позволило сделать синтезированную музыку практически естественной.
Разговорный голос оживляет искусственного персонажа или рисованный мультик. Дубляж дает виртуальному персонажу жизнь.
Актеры, делающие дубляж, просто бесподобны. Они говорят голосами младенцев, Микки-Мауса, Твитти и Сильвестра, Питера Пэна. Их партнером выступает пленка с изображением. Какой сказочной голосовой креативностью надо обладать, чтобы передать верный тон, правильный тембр или многозначительное молчание Короля Льва? Человеческий голос заставляет персонажей испытывать чувства и в результате вызывать симпатию. Для актера дубляж – совершенно особая работа. Например, Люк Амет, дублировавший лукавого кролика Роджера, вибрацией своего голоса придал ему характер и наделил эмоциями.
Искусственный персонаж может иметь искусственный голос. В основе виртуального голоса лежит изучение просодии голоса – гневного, насмешливого, печального и радостного. Виртуальный голос должен учитывать мимику и движение губ персонажа. Основной проблемой при создании звуковой дорожки является синхронизация слова и выражения лица. Губы и мимика лица должны соответствовать мелодии и эмоциональным характеристикам голоса, и наоборот.
Путь от аффективного к виртуальному, еще пятнадцать лет назад казавшийся невозможным, сегодня пройден. Разработчик становится творцом живого виртуального мира. Компьютер сам создает образ и голос персонажа. На своем бинарном языке он создает обертоны, мелодию и ритм разговорного или певческого голоса, добавляет несовершенств, расставляет ударения и паузы, формирует облик и характер персонажа. Просодия зависит от используемого языка, от выговора – например марсельского или парижского, – от слов, которые передают идею. Количество параметров, которые необходимо принять во внимание, поистине умопомрачительно. Этой работой занимается сценарист.
В XX веке применение электронного голоса неуклонно расширяется. Он звучит в анимационных фильмах, в автоматических сообщениях, рассылаемых по телефону или Интернету. Если синтетический голос хочет затронуть нашу эмоциональную сферу, он не должен быть нейтральным. Чтобы определить голос, характерный для мужчины или женщины, недостаточно воспроизвести основную частоту. Существеннейшими составляющими голоса являются его мелодика, его слова, его очарование. Синтезируя голос завтрашнего дня, придется принимать во внимание все эти практически эфемерные параметры.