К книге
Измерять и навязывать. Социальная история искусственного интеллектаЧасть 2 Информационный век. 7. Автоматизация распознавания образов. Изобретение искусственных нейронных сетей
67%
Часть 2 Информационный век. 7. Автоматизация распознавания образов. Изобретение искусственных нейронных сетей
42

Как отмечалось в предыдущей главе, изобретение искусственных нейронных сетей канонизировано в эпохальной статье Мак-Каллока и Питтса «Логическое исчисление идей, относящихся к нервной активности» (1943). За ней последовал еще один ключевой текст, ставший прямым ответом на полемику вокруг гештальта: «Как мы познаем универсалии» (1947)[381]. Первый текст представил идею сети искусственных нейронов для автоматизации логических умозаключений, а второй расширил применение сети на «восприятие слуховых и визуальных форм» (см. рис. 7.1). Переход от первого ко второму знаменует логический разрыв. В статье 1943 года нейронные сети предлагались в качестве дедуктивных машин для исчисления высказываний, а в статье 1947 года уже говорилось об индуктивных машинах для автоматического распознавания образов. Стоит иметь в виду, что в статье Мак-Каллока и Питтса 1943 года цифровые вычислительные машины не упоминались, потому что в то время еще не были устоявшейся технологией[382].

Рис. 7.1. Диаграмма верхнего двухолмия среднего мозга (McCulloch W. and Pitts W. How We Know Universals: The Perception of Auditory and Visual Forms // Bulletin of Mathematical Biophysics 9, no. 3 (1947): 141)

Чтобы представить историю ИИ в перспективе, на этом этапе важно прояснить разницу между дедуктивной и индуктивной логикой. Начиная с идеи calculus ratiocinator Лейбница, современный проект поиска машинного интеллекта основывался на постулате о том, что человеческую логику можно выразить через логику высказываний («если х, значит y истинно/ложно»), эквивалентную булевой логике (операторы И, ИЛИ и НЕ). Высказывание, выраженное в соответствии с такой формальной логикой, можно легко закодировать в механизме, который состоит из вращающихся шестерен, электрических реле или электронных затворов, таких как вентили или транзисторы. При ближайшем рассмотрении этот тип логики следует линейной форме рациональности, которая воспроизводит линейность письменного языка и манипуляции символами в соответствии с правилами дедуктивного вывода. Подход воплощает машина Тьюринга, выполняющая инструкции с одномерной ленты. Символический ИИ, экспертные системы и механизмы логического вывода – все это примеры генеалогической линии дедуктивных машин, которая продолжалась до 1980‑х годов. В свою очередь искусственные нейронные сети – наряду со всеми алгоритмами машинного обучения – служат примерами индуктивных машин. Если дедуктивная логика представляет собой применение правила, рассуждение от общего к частному, то индуктивная логика подразумевает рассуждения от частного к общему, и тем самым формируются правила классификации. Каноническим примером служит переход от утверждения, что «жизнь каждого человеческого существа заканчивается смертью», к формулировке правила, согласно которому «все люди смертны». Противопоставление дедуктивной и индуктивной логик обладает ключевым значением для понимания не только спора о гештальте, но и подъема машинного обучения.

По словам Хеймса, готовясь к появлению гештальтиста Кёлера на конференции фонда Мэйси в Нью-Йорке, Генрих Клювер поставил перед собравшимися учеными задачу: сформулировать теорию о том, «как автомат может воспринимать гештальты». Вызов Клювера приняли Мак-Каллок и Питтс. При финансовой поддержке фондов Мэйси и Рокфеллера они стремились пойти дальше доказательства 1943 года, согласно которому конечная сеть упрощенных модельных нейронов способна вычислить все, что можно однозначно выразить словами. На этот раз их целью стала разработка нейронных механизмов для специальных функций мозга, например восприятия, в идеале с точностью, достаточной для экспериментальной проверки[383].

В результате обсуждений в 1947 году Мак-Каллок и Питтс опубликовали статью «Как мы познаем универсалии: восприятие слуховых и визуальных форм»[384]. По сравнению с предыдущей статьей 1943 года, здесь речь идет уже не о вычислении высказываний в соответствии с линейной логикой, а о распознавании паттерна двумерной матрицы. Мак-Каллок и Питтс разработали «устройство», с помощью которого «многочисленные сети, воплощенные в специальных нервных структурах, служат для классификации информации в соответствии с полезными общими признаками»[385]. Как должно было выглядеть это «устройство»? В условиях технического развития в конце 1940‑х годов оно могло, например, состоять из фоторецепторов, способных преобразовать визуальный ввод в цифровое изображение, то есть в сетку пикселей, которые измерены числовыми значениями. Не вдаваясь в цветовые подробности, допустим, что такая сетка кодировалась двоичной цифровой записью: значение 1 для черных пикселей и 0 для белых. Таким образом, устройство Мак-Каллока и Питтса для распознавания образов представляло бы собой вычислительную сеть, которая преобразовывает сетку двоичных цифр в двоичный вывод 1 (истина), если образец распознан, или 0 (ложь), если не распознан.

С математической точки зрения, устройство для распознавания образов – это алгоритм, вычисляющий один и тот же вывод для любых входных данных, которые человек затем классифицирует как принадлежащие к одному и тому же типу паттернов. С помощью своего математического устройства Мак-Каллок и Питтс хотели бросить вызов вере гештальт-школы в уникальность человеческого познания и продемонстрировать, что восприятие можно алгоритмически описать и автоматизировать. Их описание искусственной нейронной сети для распознавания образов гласит:

Многочисленные сети, воплощенные в специальных нервных структурах, служат для классификации информации на основе полезных общих характеристик. В зрительном восприятии они обнаруживают эквивалентность явлений, связанных по схожести и согласованности, как в случае одного и того же физического объекта, увиденного с разных точек. В слуховом восприятии они распознают тембр и аккорд, независимо от высоты тона. Эквивалентные явления во всех случаях имеют общую фигуру и тип преобразований, которые переводят эквиваленты друг в друга, сохраняя фигуру инвариантной. Так, например, серия переводов перемещает квадрат из одного места в другое, в то время как фигура квадрата остается неизменной. Эти фигуры, по сути, – геометрические объекты Картана и Вейля, гештальты Вертхаймера и Кёлера. Мы ищем общие методы проектирования нервных сетей, которые распознают фигуры таким образом, чтобы производить один и тот же выходной сигнал для каждого входного сигнала, принадлежащего определенной фигуре[386].

Согласно Мак-Каллоку и Питтсу, вычислить принципы гештальт-распознавания возможно, даже если в них задействованы глубокие силы абстракции, как в случае с феноменом замыкания фигуры (если использовать упомянутый пример, речь идет о способности восстановить треугольник, имея лишь рваные линии и несоединенные точки). Это может показаться редукционистским решением, но на самом деле Мак-Каллок и Питтс предложили сложный диморфизм измерения – между восприятием и познанием. Теоретики гештальта утверждали, что восприятие и познание существуют в непрерывном изоморфизме: пространственные отношения объекта изоморфны его восприятию и, следовательно, мысленному образу. Мак-Каллок и Питтс представили идею, как преобразовать двумерные отношения изображения в виде одномерного представления (по сути, в код или логическое высказывание), не искажая содержание и не снижая качество информации.

Это важный момент в истории коннекционизма и ИИ: Мак-Каллок и Питтс утверждали, что нет необходимости в изоморфизме между изображением и его логическим представлением. Например, форму треугольника не нужно запоминать в виде изоморфного треугольника, который хранится где-то в мозгу. Ее можно распределить по разным измерениям (совершив топологическое преобразование, именуемое в глубоком обучении «внутренним представлением»)[387]. По мнению этих ученых, выступивших против гештальт-школы, все многообразие визуального можно вычислить линейной информационной машиной, например машиной Тьюринга:

Этот пункт в особенности направлен против гештальт-психологов, которые считают, что фигура распознана, только если в мозаике нейронов сложилось ее топографическое изображение, а также против неврологов школы Хьюлингса Джексона, которые уверены, что следует скормить фигуру специализированному нейрону, чья задача состоит в том, чтобы считывать, скажем, квадраты. Гомункулус, всегда находящийся по ту сторону неполного анализа сенсорных механизмов и предшествующий анализу моторных механизмов, получает информацию на языке, который не должен и не может строиться по плану языков, используемых людьми для общения друг с другом[388].

Парадигма восприятия и познания, предложенная Мак-Каллоком и Питтсом, была одновременно атомистической и многомерной: биологическая или искусственная нейронная сеть способна «воспринять и понять», если расчленить двумерное многообразие и спроецировать его в пространство измерений, отличных от исходных. Провидческим образом они бросили вызов известному изречению гештальт-теории: «Целое не нечто иное, нежели сумма своих частей»[389]. Они стремились заменить холистическую сложность гештальт-теории другим, чисто математическим видом многомерности.

Предыдущая главаГлава 42 из 63Следующая глава