Ноам Хомский ошибался насчет природы вычислений, необходимых для освоения языка. Но в других отношениях он был прав. Во-первых, он утверждал, что языковое моделирование требует весьма специфических алгоритмических операций. Здесь он высказывает эту мысль в своем неподражаемом стиле, критикуя LLM за то, что они представляют собой универсальные инструменты статистического моделирования: «Нельзя прийти на физическую конференцию и сказать: "У меня есть отличная теория. Она объясняет всё и настолько проста, что укладывается в два слова: "Всё сойдет""»[*1].
Ноам Хомский высмеивает то, что кажется ему банальностью машинного обучения. Алгоритмы, лежащие в основе современного NLP, утверждает он, интеллектуально неинтересны в качестве языковых теорий — это просто массивные инструменты «грубой силы», которые бездумно перемалывают данные, что ни в коей мере не напоминает работу человеческого мозга. Вместо этого, по его мнению, нам нужны более тонко проработанные алгоритмические инструменты, адаптированные под конкретную задачу.
Независимо от того, справедлива ли его критика глубокого обучения, Ноам Хомский абсолютно прав в том, что далеко не все статистические модели, какими бы большими и мощными они ни были, способны порождать грамматически правильные предложения. История исследований в области NLP пестрит ложными стартами, и ученые лишь постепенно совершенствовали набор канонических вычислений, необходимых для корректного генерирования предложений. При переходе от n-граммных моделей (которые заучивали пары или тройки слов) к глубоким сетям исследователи отказались от линейных преобразований в пользу нелинейных. Важнейшую роль играет снижение размерности, о чем свидетельствует успех моделей с плотными векторами признаков (где скрипка и виолончель более похожи друг на друга), а не разреженных one-hot кодов размерностью 50 000. За последнее десятилетие модели seq2seq и трансформеры научили нас тому, что внимание жизненно необходимо для учета относительной важности предшествующего контекста предложения. Генерация естественного языка, подобного человеческому, судя по всему, возможна лишь с помощью весьма специфических вычислений. Вероятно, именно поэтому исследователям ИИ потребовалась большая часть семи десятилетий — от самых ранних символьных моделей 1950-х годов до гигантских моделей GPT 2020-х годов, — чтобы понять, как его генерировать.
Во-вторых, Ноам Хомский утверждал, что человеческие младенцы рождаются с врожденной способностью к освоению языка, которой их наделяет легендарное «устройство усвоения языка». Хотя он никогда подробно не описывал, как именно работает это устройство, Ноам Хомский приводит веские аргументы в пользу врожденного характера усвоения языка у людей. С одной стороны, только люди способны выучить язык, в то время как Коко и Ним так и не продвинулись дальше стадии «дай апельсин». С другой стороны, наше стремление говорить предложениями невероятно сильно, и оно побуждает каждого ребенка осваивать структурированные формы общения, даже если (как те близнецы в Уэльсе) они сами придумывают синтаксис.
К этому Ноам Хомский добавляет третий аргумент, который особенно актуален при сравнении человеческого обучения языку с обучением LLM: человеческие дети осваивают язык с непревзойденной эффективностью. Он называет это аргументом о «бедности стимула».
Человеческие дети действительно, по всей видимости, усваивают родной язык с минимальными усилиями. Что еще более примечательно, скорость их обучения практически не зависит от объема воспринимаемой ими речи[*2]. Например, американцев из среднего класса всячески побуждают обеспечивать своим детям хороший старт в жизни, постоянно разговаривая с ними, даже если те в ответ лишь гулят, кричат или срыгивают, и поэтому дети специалистов со Среднего Запада слышат в среднем более 2000 слов в час. Напротив, индейцы чимане — доиндустриальное общество охотников-собирателей и земледельцев в низменностях Боливии — вообще редко утруждают себя разговорами с детьми, в результате чего те слышат лишь несколько минут речи в час, и почти ни одно слово не обращено непосредственно к ним. Тем не менее дети со Среднего Запада и дети чимане осваивают язык примерно с одинаковой скоростью и через несколько лет достигают сопоставимого уровня владения им. Таким образом, развитием речи у человека, похоже, движет что-то иное, нежели просто объем услышанного.
Можно ли сравнить объем языкового опыта, получаемого человеческими детьми и моделями LLM? К десяти годам средний ребенок успевает услышать несколько миллионов слов — а те, кто растет рядом с настоящими болтунами, могут услышать до 100 миллионов. В этом возрасте они допускают очень мало ошибок в своем родном языке (за исключением, судя по всему, датского, который настолько труден для изучения, что даже коренные датчане с трудом им овладевают[*3]). Цифра может показаться огромной, но это как минимум в 2000 раз меньше объема слов, на котором обучалась GPT-3. Фактически, сегодняшние LLM получили такой языковой опыт, какой человек приобрел бы, если бы непрерывно жил в течение 25 000 лет — с пика последнего ледникового периода до наших дней, — и услышал обсуждение любой темы на свете на множестве разных языков. Даже GPT-2, устаревшая языковая модель, склонная к вопиющим синтаксическим ошибкам, «услышала» на порядок больше слов, чем средний человеческий ребенок. Если ограничить обучающие данные языковых моделей 100 миллионами токенов, LLM значительно уступят людям практически по всем мыслимым показателям языковой компетенции. Следовательно, люди осваивают язык гораздо эффективнее, чем LLM. Как мы можем это объяснить?
В том, что касается изучения языка, у детей есть множество естественных преимуществ перед LLM. Самое важное из них заключается в том, что у них есть доступ к другим сенсорным данным, которые помогают им понимать мир и говорить о нем. Люди воспринимают мир не только через слова; у большинства есть глаза, уши и руки, которые говорят нам, как он выглядит, звучит и ощущается. Семантическая память человека формируется под влиянием зрительных и слуховых соответствий (понятия скрипки и виолончели семантически связаны, потому что скрипки и виолончели похожи внешне и звучат похоже — по крайней мере, по сравнению со скрипкой и туманным горном). Даже устная речь содержит информацию о смысле, которая отсутствует в обычном тексте, — например, ритм, интонацию и ударение. В части 3 мы обсудим аргументы в пользу того, что понимание языка невозможно без такого «заземления» на реальные сенсорные сигналы. Еще одним ускорителем для человеческого языка служит то, что, в отличие от LLM, мы сильно мотивированы социальными факторами — такими как потребность заводить друзей, побеждать в споре или обсуждать последние сплетни. LLM (пока еще) не используют язык явно инструментальным образом, чтобы целенаправленно убеждать других в своих взглядах или достигать конкретных целей. Вместо этого их обучение полностью пассивно: они полагаются на статистические закономерности в своем обучающем корпусе, чтобы научиться правильно выстраивать последовательности токенов.
Тем не менее, весьма вероятно, что Ноам Хомский был прав, утверждая, что генетическое наследие играет важнейшую роль в том, как люди осваивают язык. Человеческий мозг не инициализируется случайным образом, как веса в LLM. Напротив, мы рождаемся с готовыми паттернами нейронных связей, которые помогают нам учиться полезным вещам с головокружительной быстротой — например, избегать волосатых пауков, уплетать шоколад при любой возможности, обращать внимание на лица и внимательно слушать, когда кто-то говорит. Мы не знаем точно, какие именно преимущества дает нам эта врожденная схема связей для освоения языка. Она вполне может помогать нам настраиваться на социальное взаимодействие, наиболее интересные формы которого обычно включают слова. И она может, как предполагал Ноам Хомский, таинственным образом формировать нейронные контуры, облегчающие понимание предложений. Как бы то ни было, суть в том, что мы не можем всерьез сравнивать обучение LLM с освоением языка в процессе развития (у отдельного индивида, скажем, от рождения до свободного владения речью), поскольку человеческие дети учатся не как tabula rasa, а получают мощную фору от эволюции.
Но столь же несправедливо сравнивать обучение LLM с полной эволюцией человеческого языка — с совокупным языковым опытом тысяч поколений Homo sapiens, накопленным с тех пор, как люди впервые начали делиться мыслями, структурированно задействуя свой голосовой аппарат. Дело в том, что, как нам известно еще со времен Дарвина, биологическая эволюция не работает путем передачи опыта от поколения к поколению: мы наследуем признаки наших родителей, но не знания, приобретенные ими в течение жизни. Таким образом, каждый ребенок рождается, не зная значений конкретных слов (что позволяет ему учить языки, на которых не говорят его родители), но с непреодолимой жаждой познания. Напротив, обучение LLM напоминает опровергнутую эволюционную теорию XIX века, известную как ламаркизм, поскольку каждый цикл обучения наследует от своих предшественников как вычисления общего назначения (такие как отслеживание паттернов согласования слов в предложении), так и конкретные знания (например, совместную встречаемость слов птица и перья в данном языке). Поэтому провести прямое сравнение траекторий обучения LLM и человека попросту невозможно. Это все равно что спрашивать, кто летает лучше — альбатрос или аэробус: все зависит от того, цените ли вы маневренность в воздухе или хотите долететь до Нью-Йорка.
Один из способов поставить этот вопрос — спросить, выполняют ли модели LLM, овладевшие языком, вычисления, похожие на те, что происходят в человеческом мозге. В отличие от трансформационных правил, которые предложил Ноам Хомский (они связывают предложения с примерно одинаковым значением путем перестановки слов в соответствии с законами синтаксиса), вычисления, применяемые в LLM, носят универсальный характер (и не ограничиваются английским языком). Вычислительные приемы, которые мы обсуждали выше, — нелинейное преобразование, сжатие, рекуррентная память и внимание — повсеместно используются в исследованиях ИИ. Они уже доказали свою эффективность во многих неязыковых областях, помогая глубоким сетям распознавать лица, генерировать видео и играть в настольные игры на профессиональном уровне. Более того, эти же принципы лежат в основе наших излюбленных моделей работы мозга. Базовый принцип работы нейросети — при котором информация многократно нелинейно преобразуется для сопоставления входных данных с выходными — представляет собой обобщенное описание того, как происходят вычисления в биологическом мозге. Внимание (в трансформере) и краткосрочная память (в рекуррентных сетях или LSTM), возможно, сейчас и являются важнейшими инструментами глубокого обучения, но в нейробиологии и когнитивных науках они также давно служат для описания функций человеческого мозга. Таким образом, может существовать по крайней мере некоторое соответствие между вычислительными принципами, используемыми для освоения языка в трансформерах и в неокортексе человека.
Удивительно то, что хотя трансформеры потенциально являются универсальными инструментами, операции, которые они учатся выполнять в процессе языкового моделирования, могут оказаться знакомы классическим лингвистам, таким как Ноам Хомский. Исследователи ИИ могут покопаться в «разуме» нейросети, используя подходы, аналогичные тем, что нейробиологи применяют для изучения биологического мозга, и это дает подсказки о том, как творят свое волшебство все эти миллионы параметров. Мы уже видели, что модели seq2seq представляют информацию способами, подчиняющимися синтаксическим правилам, — например, когда они кодируют фразы «Джон-любит-Мэри» и «Мэри-любит-Джона» в виде противоположных паттернов активности. Но если покопаться внутри LLM, действительно можно увидеть следы тех самых трансформаций, которые изначально предложил Ноам Хомский.
Один из способов сделать это — визуализировать веса самовнимания в трансформере, которые, по сути, сообщают нам о предположениях сети насчет того, какие слова сочетаются друг с другом. Большинство трансформеров содержат множество модулей (или «голов») с различными весами самовнимания, и оказывается, что после обучения на естественном языке отдельные «головы» специализируются на разных синтаксических правилах, включая те, что известны нам из классической лингвистики. Например, веса внимания одной «головы» могут указывать на то, что она отслеживает согласование глагола с дополнением, другая отвечает за притяжательные местоимения, а третья берет на себя вспомогательные глаголы пассивного залога. Мы также можем обнаружить «головы», в которых расстояние в паттернах активности, вызываемых словами, отражает их расстояние в дереве синтаксического разбора — то есть иерархическом представлении предложения в виде NP и VP. Это означает, что сеть неявно знает, где именно в синтаксической иерархии находится каждое слово, просто на основе чтения огромного количества предложений.
Иными словами, по иронии судьбы, те самые «правила трансформации», на кропотливое формулирование которых вручную лингвисты потратили столько лет, на самом деле можно обнаружить с помощью статистического анализа больших текстовых корпусов — если только использовать настолько астрономические объемы данных, что ни один человек не смог бы уловить в них паттерны (или, как называет это Ноам Хомский, «бульдозер»). Таким образом, приближения ко многим правилам, предложенным лингвистами для объяснения того, как человек усваивает язык, действительно могут возникать в LLM и оставаться скрытыми в почти бесконечной сложности миллиардов их обучаемых весов. По иронии судьбы, название «трансформер», похоже, было дано по счастливой случайности исключительно точно: он с нуля учится выполнять некоторые из тех самых трансформаций, которые, по первоначальному предположению Ноама Хомского, необходимо знать каждому, кто осваивает язык.
Пропустить примечания
*1 https://garymarcus.substack.com/p/noam-chomsky-and-gpt-3.
*2 Cristia et al., 2019.
*3 Bleses, Basbøll, and Vach, 2011.