К книге
Измерять и навязывать. Социальная история искусственного интеллектаЧасть 2 Информационный век. 7. Автоматизация распознавания образов. Споры о восприятии гештальта
65%
Часть 2 Информационный век. 7. Автоматизация распознавания образов. Споры о восприятии гештальта
41

В основе интуиции, проложившей путь к искусственным нейронным сетям, лежит длительный спор: представляет ли собой человеческое восприятие акт познания, который может быть представлен аналитически и, следовательно, механизирован. Дискуссия по этому вопросу разгорелась в 1940‑х годах на конференциях фонда Мэйси. Кибернетиками утверждали, что поле восприятия можно вычислить с помощью машин, например простых электрических релейных устройств. Представители гештальт-школы, напротив, полагали, что машина никогда не сможет эмулировать сложные синтетические способности человеческого разума[373]. Эти дебаты стали новой главой полемики, зародившейся в Европе; главными участниками теперь стали не философы, психологи и неврологи, а изгнанные из нацистской Германии в США математики и инженеры[374]. В результате именно этих дебатов термин «гештальт-восприятие» (Gestalt perception) постепенно был заменен в военных отчетах и академических публикациях на более знакомое нам «распознавание образов», и именно они дали толчок экспериментам с искусственными нейронными сетями[375].

Кибернетики, в частности Уоррен Мак-Каллок и Уолтер Питтс, предложили драматически упрощенное понимание восприятия – такое, которое отверг бы любой историк искусства. Однако их исследование спровоцировало прорыв в «автоматизации восприятия», который полвека спустя привел к хорошо известным достижениям глубокого обучения[376]. Прежде чем кибернетики свели способность восприятия к простому двоичному акту классификации (принадлежит изображение к этому классу или нет), ученые-гештальтисты, в частности Макс Вертхаймер, Курт Коффка и Вольфганг Кёлер, разработали более сложную теорию, которая основывалась на том, что человек воспринимает целое прежде, чем части. Например, мелодия остается различимой, даже когда проигрывается в другом строе и с другими звуками. Эта теория указывала на разнообразные явления, связанные с феноменом замыкания образа, такие как подсознательное восприятие конфигурации в ее целостности, независимо от ограниченной информации об элементах (например, восприятие треугольника в абстрактном отношении трех отдельных элементов). В конечном итоге эта теория формализована в принципе Prägnanz (близость, подобие, непрерывность, связанность и т. д.) и воплощена в известном выражении «Целое есть нечто иное, нежели сумма своих частей».

Учебники по машинному обучению повторяют стандартную версию, согласно которой изобретение искусственных нейронных сетей Мак-Каллоком и Питтсом вдохновлено нейрофизиологией мозга, но упускают из виду более широкий интеллектуальный контекст, включающий конфронтацию изобретателей с гештальт-школой. Хотя искусственные нейронные сети можно рассматривать как блестящее решение проблемы автоматизации, именно гештальт-школа возвела восприятие визуальной формы в ранг ключевого вопроса. Конкретной задачей, которую гештальт-теория призывала кибернетиков решить с помощью вычислительной архитектуры, было распознавание паттерна, в частности, зрительного образа. Эквивалентно ли распознавание образа логическому мышлению? Мак-Каллок и Питтс, отвечая на этот вопрос утвердительно, заявляли, что любой зрительный паттерн (даже сложный, нечеткий и неполный) можно полностью определить, вычислив отношение его элементов, находящихся в поле зрения. По их мнению, задача распознавания (или классификация) паттерна решается с помощью алгоритма преобразования больших входных данных в простой двоичный вывод (0 или 1) и таким образом переформулируется в простой двоичный вопрос: «Принадлежит ли образ к этому классу или нет»?

После коротких стычек на конференциях фонда Мэйси полемика о гештальте привела к организации Хиксоновского симпозиума «Церебральные механизмы и поведение», который состоялся в Калифорнийском технологическом институте в Пасадене в 1948 году. Участие в симпозиуме приняли фон Нейман, Кёлер, а также знаменитые психологи Генрих Клювер и Карл Лешли[377]. Хиксоновский симпозиум стал переломным событием в истории вычислений: Джон Маккарти, в частности, признал, что придумал меткий термин «искусственный интеллект» (предложен на Дартмутской конференции в 1956 году), благодаря присутствию на этом симпозиуме еще в качестве аспиранта-математика[378].

Тогда ни один из противоборствующих лагерей не одержал победу. Как заметил физик и историк науки Стив Хеймс, «в некотором смысле они оба были романтиками – Кёлер в своем холизме и Мак-Каллок в своем механицизме»[379]. Именно фон Нейман предложил синтез гештальт-теорий и вычислительной логики, который в итоге способствовал прогрессу в этой области и вдохновил Розенблатта на создание перцептрона, где жесткую логику Мак-Каллока и Питтса заменил статистический расчет. В этой главе я пересматриваю влияние гештальт-теории на историю ИИ и, в частности, подчеркиваю превращение искусственных нейронных сетей из средств логического умозаключения в инструменты распознавания паттернов. Спор о гештальте и Хиксоновский симпозиум, таким образом, рассматривается как часть альтернативной истории ИИ, которая не реабилитирует (провальное) предприятие символического ИИ и его амбиции по механизации дедуктивной логики, а переносит фокус на генеалогическую линию коннекционизма и автоматизацию индуктивной логики.

Споры о гештальте – это когнитивная окаменелость нерешенных проблем, которая сегодня покоится в самом основании глубокого обучения, и ее изучение помогает понять логическую форму и ограничения, которые унаследовал ИИ XXI века[380]. Эти споры также указывают, что в современном машинном обучении, где за последние десятилетия метод распознавания распространился с визуальных наборов данных на невизуальные, продолжает работать оптическое бессознательное. По воле странного поворота судьбы именно механизация восприятия как распознавания образов стала продаваться как механизация познания или искусственный интеллект. Хотя работа современных искусственных нейронных сетей и современного глубокого обучения происходит от автоматизации зрения, ее описывают антропоморфными метафорами восприятия, что вводит заблуждение. Часто повторяют, что машинное зрение «ничего не видит»: алгоритм «видит» (рассчитывает) топологические отношения между числовыми значениями двумерной матрицы. В конечном счете, прорыв искусственных нейронных сетей носит не столько биоморфный, сколько топологический характер. Иными словами, речь идет не столько об имитации структуры нейронных сетей глаза, сколько, по сути, о разработке техник самоорганизации информации для считывания зрительной (визуальной) матрицы.

Предыдущая главаГлава 41 из 63Следующая глава