На Хиксоновском симпозиуме Кёлер был единственным делегатом, представлявшим гештальт-школу. Он приехал не защищать мистическую силу разума, а представить физические измерения активности мозга в процессе зрительного восприятия, а именно «записи электрических токов, снятые с кожи головы в условиях образного зрения»[390]. Исследование Кёлера показало, что гештальт-теоретики не противились поиску нейронных коррелятов восприятия, но в отличие от кибернетиков не предавались мышлению по аналогии, а следовали традиционному методу научного эксперимента. Хеймс отмечает:
Гештальт-психологи не капитулировали перед мистицизмом, политической реакцией и витализмом, которых вызвала к жизни жажда целостности. Выступая против атомистического и механистического анализа мира, они настаивали на эмпирическом изучении феноменов и искали фундаментальные законы, которые бы описывали структурные характеристики опыта[391].
Объясняя феномен визуального восприятия, возникающего между глазом и мозгом, Кёлер опирался на модель силовых полей, которая была заимствована из физики и на которую его вдохновил, в частности, близкий друг Макс Планк.
На Хиксоновском симпозиуме физическая гипотеза силовых полей, лежащих в основе гештальт-восприятия, столкнулась с вычислительной аналогией мозга как автомата с конечным числом состояний. Кёлер критиковал редукционистский подход Мак-Каллока к мозгу, указывая, что нервные импульсы, которые регистрирует и измеряет гистолог или нейрофизиолог, представляют собой… импульсы, а не логические высказывания![392] Отрицая кибернетическое представление о мозге как «машинной конфигурации», Кёлер выдвинул теорию силовых полей, которая объясняла структурную преемственность формы (изоморфизм) между стимулом, его нейронными коррелятами и высшими способностями познания (например, способностью одномоментно проникать в суть, осуществлять инсайт)[393]:
Непрерывность – структурная особенность поля зрения. В него вписаны частные перцепты, обособленные в виде пятен, фигур и вещей, – и это структурный факт. В обоих случаях мы обнаружили, что макроскопически кортикальные процессы напоминают зрительный опыт. Таким образом, в этом отношении зрение и его кортикальный коррелят изоморфны[394].
Осторожность Кёлера в отношении собственных открытий ничуть не похожа на горячий энтузиазм кибернетиков по поводу сходства нейронных коррелятов и логических операторов[395]. Более того, вопреки тому, что предполагает сам термин, «изоморфизм» в гештальт-школе учитывал принципы пластичности – в широком смысле самоорганизацию и самовосстановление[396]. Гештальтисты считали, что невозможно описать высшие способности разума к синтезу и абстракции посредством самоорганизации, основываясь на идее о разуме, представляющем собой автомат с конечным числом состояний.
В другом лагере самым громким и яростным антигештальтистом был Норберт Винер, который называл холизм «псевдонаучным привидением». Винер утверждал, что, «если явление можно понять только как целое и невозможно подвергнуть анализу, то нет и подходящего материала для научного описания, поскольку целое никогда не бывает полностью в нашем распоряжении»[397]. Винер, не колеблясь, по идеологическим причинам разделял вычислительный подход Мак-Каллока и Питтса к разуму:
Достойно внимания, что нервные системы человека и животных, способные, как известно, совершать такие же действия, как и вычислительная система, содержат элементы, идеально приспособленные для работы в качестве реле. Речь идет о так называемых нейронах, или нервных клетках[398].
Идея искусственных нейронов и проект автоматизации восприятия гештальта уже становились предметом обсуждения в 1948 году, когда Винер опубликовал «Кибернетику» – первую сумму цифровых вычислений и теорий информации. В 1951‑м, через несколько лет после Хиксоновского симпозиума, Кёлер написал резкую рецензию на книгу Винера и конкретно на главу «Гештальт и универсалии»: машины, конечно, умеют считать лучше людей, но подобные расчеты не образуют мышления и тем более способности проникнуть в суть (Einsicht)[399] задачи:
В отношениях людей и вычислительных машин мышление в собственном смысле слова, по-видимому, остается задачей первых. Превосходные инженеры и математики встраивают в инструменты механические способы работы, которые могут надежно выполнять определенные количественные операции человеческого разума, например сложение и умножение. По скорости такие операции, выполняемые машинами, намного превосходят все, на что способен человеческий мозг, и в этом нет ничего удивительного. В то же время они отличаются от операций, которые совершает человек, решающий математическую задачу… Машины не обладают знанием, поскольку в их функциях нет ничего, что могло бы сравниться с постижением самой сути задачи[400].
В середине 1950‑х годов нейрофизиолог Джером Леттвин и биолог Умберто Матурана пригласили Мак-Каллока и Питтса принять участие в исследовании нейронов глаза лягушки. Результаты были опубликованы в 1959 году в знаменитой статье «Что лягушачий глаз сообщает мозгу лягушки», которую многие сочли гвоздем в крышку гроба споров о гештальте[401].
Их исследования строились на простом наблюдении, что зрительный нерв высших животных состоит из меньшего числа волокон, чем есть клеток в сетчатке. Это говорит о том, что стимул должен подвергнуться сжатию, прежде чем попасть в мозг. Возникает вопрос: что именно происходит со стимулом по пути от сетчатки через зрительный нерв к зрительной коре? В качестве модельного организма ученые взяли лягушку и начали измерять активацию зрительного нерва с помощью электрода, выставляя перед глазом животного высококонтрастные формы. В результате исследователи зафиксировали четыре вида нейронного поведения (или типа операций): «детектор контраста», «детектор выпуклости», «детектор движущегося края» и «детектор затемнения»[402].
В качестве иллюстрации рассмотрим вторую операцию – детекцию выпуклых краев, которая наиболее понятна интуитивно. Речь идет о восприятии небольшого объекта, который перемещается в поле зрения, например летающего насекомого (это играет важнейшую роль для поиска пищи и выживания лягушки). На научном языке такую способность часто называют «детекцией жуков».
Противопоставляя себя приверженцам гештальт-теории, постулирующим первичность функций мозга, авторы этого исследования утверждали, что глаз выполняет основные задачи познания, например, распознаёт образы, и, посылая в мозг сигналы, отправляет не перцепты, а уже оформленные концепты. Таким образом, глаз – не просто медиум ощущений. Он уже использует язык «сложных абстракций». Ученые пришли к выводу, что «глаз не передает мозгу более или менее точную копию распределения света по рецепторам сетчатки. В мозг поступают уже раскодированные сообщения, выраженные высокоорганизованным языком»[403]. То, что глаз посылает в мозг, – не форма, аналогичная перцепту (что позволило бы сохранить пропорции Gestalt), а скорее семантическое высказывание, то есть информация, которая интерпретирует паттерн, содержащийся в перцепте. В коллективную статью также вошли выводы из работы Мак-Каллока и Питтса 1947 года, в том числе утверждение, что изображение можно логически определить и «воспринять», рассчитав отношения между его элементами в соответствии с пространственной логикой.
Таким образом, изображение преобразуется из дискретного ряда отдельных точек в слитный участок, каждая точка которого эквивалентно описывается сочетанием частных качеств ее окружения. Это позволяет представить изображение в виде распределений комбинаций этих качеств. Короче говоря, каждая точка видна в некотором контексте. Характер этих контекстов определяется генетически и представляет собой физиологическое, синтетическое a priori[404].
Цифровое изображение состоит не просто из отдельных точек, а из пространственных отношений, которые можно описать как «распределения комбинаций». Авторы, похоже, предполагают, что «физиологическое синтетическое априори» не принадлежит нейронной сети как таковой, а скорее относится к пространственной логике, которую сеть вычисляет.
Биоморфизм ранних искусственных нейронных сетей (имитацию биологических нейронных сетей) по прошествии времени следует поставить под вопрос. Органом, который Мак-Каллок и Питтс больше всего исследовали и представляли как сеть логических операторов, был глаз, а не мозг; и в том, что касается глаза, их искусственные нейронные сети неявно унаследовали определенную иерархию поведения. В эссе 1947 года Мак-Каллок и Питтс предполагали, что взаимодействие между узлами искусственной нейронной сети должно решить задачи по комбинаторной геометрии поля зрения (а не задачи, связанные с силлогизмами и логикой высказываний, как в их публикации 1943 года). Таким образом, в спорах о гештальте нельзя найти подлежащую механизации модель познания, но можно обнаружить несколько моделей восприятия, поскольку в вычислительных терминах представлялись именно элементы поля восприятия, а не ментальные состояния. Развитие искусственных нейронных сетей продолжалось в основном благодаря изучению глазных, а не мозговых нейронов. От лягушек Леттвина до кошек Дэвида Хьюбела и Торстена Визеля (это вдохновило создателей сверточных нейронных сетей, например AlexNet) – коннекционистский ИИ своей историей обязан опытам с животными и их органами зрения[405].
С математической точки зрения спор о гештальте касался, с одной стороны, преобразования образа в логическую конструкцию, а с другой – того факта, что логическая конструкция человеческих умозаключений может иметь общие вероятностные черты с восприятием образа[406]. Если читать между строк, можно увидеть, что спор о гештальте уже тогда указывал на логическую форму, которую примет машинное обучение XXI века: идею пространственного и статистического измерения информации за пределами линейной модальности машины Тьюринга. Логические затворы и поля восприятия (основные понятия кибернетики и гештальт-школы соответственно) выступали поляризованными идеалами, которые эволюция ИИ в итоге преодолела и синтезировала во все более и более абстрактные конструкции. Сегодня внутренняя логика машинного обучения описывается, например, через многомерные векторы, скрытые пространства и статистические распределения. Визуальная матрица (а вместе с ней и плоскость изображения современной иконологии) также расширилась в сторону продвинутых логических форм – обширных ответвлений статистического вывода, которые еще предстоит полностью понять.