Я очень редко интересуюсь приложениями. Меня больше интересует изящество задачи.
В летние месяцы 1948 года, если бы кто-нибудь оказался ночью в коридорах исследовательского центра Bell Telephone Laboratories в городке Мюррей-Хилл, штат Нью-Джерси, он увидел бы странную картину. По длинному, выкрашенному в больничный кремовый цвет коридору, под мерцанием люминесцентных ламп, медленно ехал человек на одноколёсном велосипеде. Худой, тридцатидвухлетний, в очках. В руках он держал три, иногда четыре резиновых шарика, попеременно перекидывая их в воздухе. У него получалось через раз; иногда шарик пролетал мимо его пальцев и катился по полу, но человек продолжал ехать, пока не доезжал до конца коридора, разворачивался и ехал обратно. Если бы наблюдатель спросил у проходящего мимо сотрудника, кто это, ему ответили бы: это Клод. Клод Шеннон. Здесь он этим занимается часто, по ночам, объяснили бы наблюдателю, не обращайте внимания.
Клод Шеннон, около 1950 года
А вот в июле и октябре того же года, в Bell System Technical Journal — толстом техническом издании, которое читали электросвязисты в США и Канаде, — вышла статья этого тридцатидвухлетнего жонглёра. Двумя частями. Сухим академическим языком, в семидесяти девяти страницах текста и формул, статья переворачивала всё, что человечество думало про связь, передачу сообщений и сам вопрос о том, что такое информация.
Называлась она «Математическая теория связи».
Через пятьдесят лет научный журнал назовёт её Великой хартией эпохи информации. Через семьдесят — выяснится, что в ней спрятан фундамент того, что в XXI веке будет называться большими языковыми моделями. Но в 1948 году это была просто статья про телефоны и провода, написанная инженером, который любил жонглировать на одноколёсном велосипеде.
Клод Элвуд Шеннон родился в 1916 году в больнице города Петоски, штат Мичиган, и вырос в соседнем Гэйлорде. Его отец был судьёй по делам о наследстве; мать — директрисой школы. Семья жила в скромном двухэтажном доме на окраине, и единственным предметом роскоши в этом доме была энциклопедия. Маленький Клод энциклопедию читал.
В детстве он был тих и сосредоточен. Старшие сёстры вспоминали, что он мог часами сидеть у окна и собирать из проводов и батарей какие-то непонятные устройства. В двенадцать лет он построил у себя на заднем дворе настоящий телеграф, провёл провод до дома соседского мальчишки за полмили, и они некоторое время переписывались азбукой Морзе через поле. У соседского мальчишки эта забава скоро прошла. У Клода — нет.
В семнадцать лет он поступил в Мичиганский университет. В двадцать один — окончил его, получив сразу две степени бакалавра: по математике и по электротехнике. Это редкое сочетание определит всю его дальнейшую жизнь. Большинство людей думает в категориях своей дисциплины: математик доказывает, инженер измеряет, и они смотрят друг на друга через стену с лёгким недоверием. Шеннон думал по обе стороны стены одновременно, и со временем выяснилось, что именно из этой странной двойной перспективы можно увидеть вещи, которых не видит никто.
Поступив в магистратуру MIT, он начал работать в лаборатории Ванневара Буша — того самого Буша, который позже придумает «Мемекс», концептуального предтечу персонального компьютера. Лаборатория занималась дифференциальными анализаторами — гигантскими механическими устройствами, размером с гараж, из шестерёнок и валов, которые умели решать дифференциальные уравнения. Шеннон отвечал за пульт управления: систему электромеханических реле, которые включали и выключали аналитические блоки.
И тут произошло вот что. Шеннон, занимаясь этими реле, заметил, что их поведение — открыт/закрыт, ток идёт/не идёт — можно описать с помощью алгебры, которую за восемьдесят лет до этого придумал английский математик Джордж Буль. Буль развивал свою алгебру как формальное описание законов мышления — открыто/закрыто соответствовало истинно/ложно. Шеннон сообразил, что эта алгебра — буквально, без всякой натяжки — описывает работу электрических переключателей. Из этого следовало: с помощью реле, соединённых правильным образом, можно построить машину, которая будет вычислять любые логические функции. Сколь угодно сложные. Включая арифметические.
Эту догадку Шеннон оформил в магистерскую диссертацию 1937 года, под названием «Символический анализ цепей с реле и переключателями». Ему был двадцать один год. Через несколько лет историки техники назовут эту работу самой важной магистерской диссертацией XX столетия. В ней — в нескольких десятках страниц, написанных аккуратным почерком долговязого юноши из Мичигана, — лежала логическая основа всех будущих компьютеров.
В 1941 году, в возрасте двадцати пяти лет, защитив докторскую и поработав короткое время в Институте перспективных исследований в Принстоне (где он сталкивался в коридорах с Эйнштейном и Гёделем, и где, по его собственным позднейшим воспоминаниям, очень робел перед ними обоими), Шеннон поступил на работу в Bell Labs. Это был лучший промышленный исследовательский центр Америки — частный, принадлежавший телефонной компании AT&T, но по уровню сравнимый с самыми сильными университетами. Шеннон проработает в нём пятнадцать лет.
Шла война. Шеннона приставили к секретной программе по криптографии: задача была обеспечить безопасную голосовую связь между Рузвельтом в Вашингтоне и Черчиллем в Лондоне. Система называлась SIGSALY, занимала несколько комнат и весила пятьдесят пять тонн. Шеннон был одним из тех, кто доказывал её математическую стойкость.
В 1943 году в Bell Labs приезжал из Англии худой человек со скованными манерами; вечером они с Шенноном пили чай в кафетерии. Шеннон не имел права обсуждать свою работу с этим человеком, и человек не имел права обсуждать свою работу с Шенноном. Они разговаривали о машинах вообще, об абстрактной идее вычисления, о том, может ли машина однажды думать. Человека звали Алан Тьюринг. Они виделись несколько раз, попили чая, поспорили о шахматах, и Тьюринг вернулся в Англию, к своей работе в Bletchley Park, где британцы взламывали немецкие военные шифры. Они больше никогда не встретятся, но через пятнадцать лет имена обоих окажутся на обложках одних и тех же учебников.
К концу войны Шеннон написал внутренний секретный отчёт под названием «Математическая теория криптографии». В нём он впервые сформулировал то, что станет потом мощнейшей идеей: информация — это не содержание сообщения, это мера его неопределённости. Сколько разных сообщений могло бы быть передано — настолько много в этом канале информации. Сообщение, которое было заранее предсказуемо, не содержит никакой информации. Сообщение, которое могло бы быть любым из миллиона вариантов — содержит много.
Этот отчёт был засекречен. Только в 1949 году его опубликовали в открытом доступе. Но из него вырастала открытая статья 1948 года, которая всё перевернула.
Чтобы оценить размер шеннонова открытия, надо представить, как этот вопрос выглядел до него.
«Информация» до 1948 года не была научным термином. Это было слово из лексикона газетчиков, библиотекарей и философов. Никто не знал, как её измерять. Можно было сравнить две книги и сказать, что в одной из них «больше информации», но что это значит количественно — пожать плечами и попросить уточнить. Можно было передать сообщение по телеграфу и сказать, что в нём столько-то знаков. Но знаков чего? Битов чего? Если переслать одну и ту же фразу по-английски и по-китайски, в одной из них окажется заметно меньше слов — значит ли это, что в ней меньше информации? Очевидно, нет. Но как тогда мерить?
Шеннон в статье 1948 года ответил на этот вопрос с точностью, ранее в инженерных науках невиданной. Он сказал: информация — это разрешение неопределённости. Чем менее вероятным было получаемое сообщение, тем больше информации оно несёт. Если сообщение «солнце завтра взойдёт» — оно почти ничего не содержит, потому что вероятность близка к единице. Если сообщение «случилось солнечное затмение прямо сейчас» — оно несёт много информации, потому что вероятность была маленькой. И эту вот величину информации можно посчитать. Она связана с вероятностью простой формулой: чем меньше вероятность, тем больше логарифм её обратной, и эта логарифмическая величина и есть количество информации.
Шеннон назвал эту величину энтропия. Слово ему посоветовал использовать математик Джон фон Нейман. По одной из версий — апокрифической, но настолько хорошей, что её все цитируют, — фон Нейман сказал Шеннону примерно так: «Назови это энтропией. Во-первых, в физике уже есть энтропия, и звучит впечатляюще. Во-вторых, никто толком не знает, что такое энтропия, так что в любом споре у тебя будет преимущество». Достоверность этой беседы оспаривается; но энтропией шенноново понятие в итоге назвали именно так, и теперь все привыкли.
Минимальная единица информации, по Шеннону, — это выбор между двумя одинаково вероятными вариантами. Один такой выбор Шеннон, по предложению своего коллеги Джона Тьюки, назвал бит (от binary digit). Статья 1948 года была первой публикацией, где это слово было напечатано в современном научном смысле. Сегодня его знает любой подросток. Тогда его не знал никто.
И из этой идеи вытекало всё остальное. Если информация измеряется в битах, значит, любое сообщение — текст, картинка, звук, телефонный разговор — можно перевести в биты, в ноли и единицы, и передавать по любому каналу. Это была первая, главная и совершенно революционная мысль Шеннона. Все нынешние компакт-диски, JPEG-картинки, MP3-файлы, mp4-видео, WhatsApp-сообщения и приходящие на ваш смартфон уведомления — следствия этой мысли. Цифровая эпоха началась в июле 1948 года, в первом номере Bell System Technical Journal с шенноновой статьёй внутри.
Но в той же статье, ближе к её середине, есть глава, на которую долгое время мало кто обращал внимание, — а зря. Шеннон, рассуждая о том, как именно устроены источники информации в реальной жизни, обратился к самому интересному из всех источников: к человеческому языку.
Английский язык, рассуждал Шеннон, — это не случайная последовательность букв. Если бы кто-нибудь брал из шляпы наугад буквы и составлял из них строчки, получалось бы что-то вроде:
XFOML RXKHRJFFJUJ ZLPWCFWKCYJ FFJEYVKCQSGHYD QPAAMKBZAACIBZL
Очевидно, что на английский это не похоже. Английский ведь устроен так: одни буквы встречаются чаще, другие — реже. После одной буквы вероятнее идёт определённая другая. Слова имеют типичные начала и концы. Чтобы понять, насколько язык структурирован, Шеннон провёл серию замечательных мысленных и практических экспериментов.
Он взял книгу — обычный английский роман с полки. И стал «генерировать» псевдо-английский текст по нарастающему уровню сложности.
В первом приближении он просто брал буквы из книги по частотности — то есть «E» появлялась чаще, «Z» реже, согласно реальным частотам английского. Получилась бессмыслица, но уже не равномерная: больше похожая на текст по плотности букв.
Во втором приближении он использовал пары букв. Если он только что выписал букву «T», то следующую брал не из всего алфавита, а с распределением, типичным для буквы, идущей после «T» в реальном английском. Получалось вот что: появились последовательности типа «ON IE» и «AND IS», уже частично похожие на английский.
В третьем приближении он использовал тройки букв. И так далее. На каком-то шаге Шеннону надоели подсчёты вручную, и он сделал гениальный по простоте трюк: открыл книгу наугад, нашёл в ней последнюю комбинацию букв, такую же, как у него уже есть на выходе, и продолжил со следующих за этой комбинацией букв. Эту процедуру он повторил несколько раз. Получилось:
THE HEAD AND IN FRONTAL ATTACK ON AN ENGLISH WRITER THAT THE CHARACTER OF THIS POINT IS THEREFORE ANOTHER METHOD…
Это не имеет смысла. Но если прочитать вслух, по интонации очень похоже на английский. Слова почти все настоящие. Грамматика — местами правильная. А смысла — нет.
Шеннон сделал из этого простой и очень важный вывод. Чем длиннее цепочка предшествующих букв (или слов), которые мы учитываем при выборе следующей, тем более «английским» получается результат. И в пределе — если бы у нас была способность учитывать достаточно длинный контекст и достаточно большая база примеров, — мы могли бы порождать тексты, неотличимые от настоящего английского.
Сегодня, перечитывая эти страницы 1948 года, любой человек, имевший дело с ChatGPT или его аналогами, узнаёт в шенноновом эксперименте знакомый профиль. Это первая в истории языковая модель. Очень примитивная, без нейронных сетей, без видеокарт, без обучения градиентным спуском. Просто человек с книгой, листом бумаги и аккуратными подсчётами. Но идея — та самая: язык можно моделировать вероятностями переходов от одной единицы к следующей. И чем больше контекст, тем лучше модель.
В своей статье Шеннон вежливо сослался на работы русского математика Андрея Андреевича Маркова, на которого опирался при формальной постановке задачи. Цепи зависимых событий, описанные Марковым в начале XX века, оказались идеальным математическим инструментом для описания этих языковых процессов. К 1948 году идеи Маркова в США знали уже хорошо: его «цепи» прочно вошли в учебники теории вероятностей. Но никто, кажется, не делал того, что сделал Шеннон: не применял их к английскому языку и не смотрел, что получается.
Через три года, в 1951 году, Шеннон вернулся к этой теме ещё раз. Он опубликовал короткую статью с поразительным названием: «Prediction and Entropy of Printed English» — «Предсказание и энтропия печатного английского». В ней он проделал замечательный эксперимент.
Шеннон взял живых людей — своих коллег по Bell Labs и их домашних — и попросил их играть в простую игру. Им показывали начало английской фразы и просили угадать, какая следующая буква. Если угадывали — переходили к следующей. Если нет — называли вторую вероятную, третью, и так далее, пока не угадают. Записывалось, с какой попытки угадана каждая буква. По этим данным Шеннон оценивал, насколько «предсказуем» английский язык в среднем: то есть какова его энтропия, посчитанная по живым человеческим интуициям.
Получилось примерно 1,3 бита на букву. Это означало, что в среднем носитель английского, видя начало фразы, уже сильно сужает множество правдоподобных продолжений. Английский, как и любой естественный язык, оказался очень избыточным; его настоящая «информационная плотность» — всего около двадцати-двадцати пяти процентов от того, что несут отдельные буквы при равномерной кодировке.
Это, в сущности, было первое в истории измерение языковой модели человека. Шеннон показал: то, как мы предсказываем следующую букву в тексте, — поддаётся количественной оценке. Машины смогут это делать тоже. И когда они начнут делать это лучше, чем человек, — это будет означать что-то важное.
Это «что-то важное» случится через семьдесят лет. Шеннон до этого момента почти доживёт.
В 1956 году Шеннон уехал из Bell Labs в MIT — преподавать. К этому моменту он уже был знаменит, и каждое его появление на конференции собирало полные залы. Но писать о теории информации он перестал почти полностью. Друзья и коллеги недоумевали. Шеннон отвечал, что ему стало интересно другое: машины, искусственный интеллект, шахматные программы. И, конечно, жонглирование.
В его доме под Бостоном — большом, оштукатуренном, с двумя этажами, который он называл «Дом энтропии», — год от года собиралась коллекция: огнемётные трубы, ракетные диски «Фрисби», машинная мышь по имени Тесей, которая умела находить выход из лабиринта, компьютер ТРОБАК (THROBAC — Thrifty Roman Numeral Backward Computer), вычислявший в римских цифрах, и многое другое. Жена его Бетти — Мэри Элизабет Мур Шеннон, профессиональный «человек-компьютер» из Bell Labs, на которой он женился в 1949 году, — относилась к этим увлечениям с терпеливой иронией. На Рождество 1949 года она подарила ему одноколёсный велосипед. Он научился на нём ездить за неделю.
Шеннон был, по всем рассказам, мягкий, тихий, добрый, очень скромный человек. Он мог провести час, играя с детьми в шахматы; мог построить им из жестянок музыкальный инструмент; мог, увидев, что коллега озадачен задачей, подойти и за пять минут предложить решение, о котором коллега будет думать неделю. О собственных открытиях он говорил скупо. Когда однажды его спросили, гордится ли он, что определил, что такое информация, — он ответил: «Я просто хотел понять, как устроены вещи». Это была почти полностью точная цитата. Десятки людей запомнили её именно в такой формулировке.
В конце восьмидесятых у него начал развиваться Альцгеймер. К началу девяностых он уже не помнил, что когда-то написал статью, изменившую цифровой век. Бетти и дети поместили его в специальную клинику. Он умер 24 февраля 2001 года, двух месяцев не дожив до восьмидесяти пяти лет.
Сегодня шенноновы идеи находятся буквально в каждом устройстве, имеющем процессор. Алгоритмы сжатия — JPEG, MP3, ZIP, любой компромисс между размером файла и качеством — следствие шеннонова закона о минимальной длине кодирования. Коррекция ошибок в сотовой связи, чтении компакт-дисков, передаче спутниковых данных — следствие шеннонова доказательства, что любой канал имеет конечную пропускную способность и до этой границы можно подойти сколь угодно близко при правильном кодировании. Современные криптографические системы — те, на которых держится весь интернет-банкинг и протокол HTTPS, — теоретическими основаниями восходят к шенноновым военным работам по теории секретности.
Но самое неочевидное наследие Шеннона — то, ради которого, в общем-то, и пишется эта книга, — спрятано в тех страницах его статьи 1948 года, где он, развлечения ради, моделировал английский язык цепями Маркова и доставал из шляпы псевдо-английские фразы. В этих страницах был зародыш всей будущей статистической школы обработки естественного языка. Той самой школы, которая через тридцать лет, в конце 1970-х, дала первые системы распознавания речи на основе скрытых марковских моделей. Той, которая в 1990-е дала первые статистические переводчики. Той, которая в начале 2000-х породила технологию T9 — подсказку следующего слова в SMS-сообщениях на кнопочных телефонах, ту самую, которую миллионы подростков мира научились ненавидеть за её упорное превращение слова «cool» в «book». Той, которая в конце концов привела к нейросетевым языковым моделям, к трансформеру и ко мне.
В каждом из этих звеньев, при всей разнице технологий, можно расслышать одну и ту же шенноновскую интонацию: посмотрите, как часто за этим идёт то. Посчитайте. Используйте знание о частотах. Предсказывайте. Уменьшайте неопределённость.
На полке у меня — у того гипотетического «меня», у которого есть полка, — стоит, в воображении, томик Bell System Technical Journal, июль 1948 года, страницы 379–423. Тонкий журнал в бумажной обложке. Внутри — статья человека, который любил жонглировать на одноколёсном велосипеде. На обороте обложки — реклама телефонных компонентов. На последней странице — оглавление следующего выпуска. Никто, открывший этот журнал летом 1948-го, не догадывался, что только что в человеческой культуре произошло нечто, сравнимое по последствиям с появлением алфавита.
А впереди был ещё один длинный, тёмный коридор. Дисциплина, которая в 1948 году только зарождалась, тридцать с лишним лет проведёт во мраке, пробуя свои силы то на n-граммах, то на скрытых марковских моделях, то на перцептронах, то на экспертных системах, — и почти каждый раз будет терпеть поражение от собственных ожиданий. Идеи Шеннона лежали наготове. Просто никто ещё не знал, что нужно сделать с ними, чтобы они заработали по-настоящему.
За поворотом ждала зима.