К книге
Рациональность: от ИИ до зомби161. Нейронные категории.
49%
161. Нейронные категории.
172

В «Замаскированных вопросах» я рассказывал о задаче классификации «блэггов» и «рубов». Типичный блэгг — синий, яйцевидный, покрытый шерстью, гибкий, непрозрачный, светится в темноте и содержит ванадий. Типичный руб — красный, кубический, гладкий, твердый, полупрозрачный, не светится и содержит палладий. Для простоты давайте забудем о таких характеристиках, как гибкость/твердость и непрозрачность/полупрозрачность. Это оставляет нам пять измерений в пространстве вещей: цвет, форма, текстура, свечение и содержимое.

Предположим, я хочу создать искусственную нейронную сеть (ИНС), чтобы предсказывать ненаблюдаемые характеристики блэгга по его наблюдаемым характеристикам. И предположим, что я довольно наивен в области ИНС: я читал восторженные научно-популярные книги о том, что нейронные сети являются распределенными, эмерджентными и параллельными — совсем как человеческий мозг!! — но не могу вывести дифференциальные уравнения для градиентного спуска в нерекуррентной многослойной сети с сигмоидными элементами (что на самом деле гораздо проще, чем кажется).

В таком случае я мог бы спроектировать нейросеть, похожую на рисунок 161.1.

Рисунок 161.1. Сеть 1

Сеть 1 предназначена для классификации блэггов и рубов. Но поскольку «блэгг» — понятие незнакомое и искусственное, на рисунке 161.2 я также привел аналогичную Сеть 1b для различения людей и Космических Монстров, с входными данными от Аристотеля («Все люди смертны») и Платоновской академии («Двуногое без перьев с плоскими ногтями»).

Рисунок 161.2. Сеть 1b

Нейронной сети нужно правило обучения. Очевидная идея заключается в том, что когда два узла часто активны одновременно, мы должны усиливать связь между ними — это одно из самых первых правил, когда-либо предложенных для обучения нейронных сетей, известное как правило Хебба.

Таким образом, если вы часто видели вещи, которые были одновременно синими и покрытыми шерстью — тем самым одновременно активируя узел «цвет» в состоянии «+» и узел «текстура» в состоянии «+», — связь между цветом и текстурой крепла бы, так что «+»-цвета активировали бы «+»-текстуры, и наоборот. Если бы вы видели вещи, которые были синими, яйцевидными и содержащими ванадий, это укрепило бы взаимные положительные связи между цветом, формой и содержимым.

Допустим, вы уже видели множество блэггов и рубов, сходящих с конвейера. Но теперь вы видите нечто покрытое шерстью, яйцевидное и — о ужас! — красновато-пурпурное (что мы смоделируем как уровень активации «цвета», равный -2/3). Вы еще не проверили ни свечение, ни содержимое. Что же предсказать, что предсказать?

В результате уровни активации в Сети 1 начинают немного колебаться. Положительная активация перетекает к свечению от формы, отрицательная активация — к содержимому от цвета, отрицательная активация — от содержимого к свечению... Разумеется, все эти сообщения передаются параллельно!! и асинхронно!! — совсем как в человеческом мозге...

Наконец Сеть 1 приходит в стабильное состояние, в котором наблюдается высокая положительная активация для «свечения» и «содержимого». Можно сказать, что сеть «ожидает» (хотя еще и не видела этого), что объект будет светиться в темноте и содержать ванадий.

И надо же, Сеть 1 демонстрирует такое поведение, хотя в ней нет явного узла, который определял бы, является объект блэггом или нет. Это суждение неявно присутствует во всей сети!! Блэгговость — это аттрактор!!, который возникает в результате эмерджентного поведения!!, порожденного распределенным!! правилом обучения.

В реальной жизни подобная архитектура сети — какой бы модной она ни казалась — сталкивается со всевозможными проблемами. Рекуррентные сети не всегда стабилизируются сразу: они могут осциллировать, вести себя хаотично или просто очень долго приходить в устойчивое состояние. А это Плохая Штука, когда вы видите нечто большое, желтое и полосатое, и вам приходится ждать пять минут, пока ваша распределенная нейросеть стабилизируется в аттракторе «тигр». Может, она и асинхронна, и параллельна, но это далеко не режим реального времени.

Есть и другие проблемы — например, двойной учет свидетельств, когда сообщения циркулируют туда-сюда: если вы подозреваете, что объект светится в темноте, ваше подозрение активирует убеждение, что объект содержит ванадий, что, в свою очередь, активирует убеждение, что объект светится в темноте.

К тому же, если попытаться масштабировать архитектуру Сети 1, потребуется O(N2) связей, где N — общее число наблюдаемых признаков.

Какая же архитектура нейросети могла бы быть более реалистичной?

Рисунок 161.3. Сеть 2

В Сети 2 на рисунке 161.3 волна активации сходится к центральному узлу от любых зафиксированных (наблюдаемых) узлов, а затем устремляется обратно ко всем незафиксированным (ненаблюдаемым) узлам. Это значит, что мы можем вычислить ответ за один шаг, а не ждать стабилизации сети — важное требование в биологии, где нейроны работают на частоте всего 20 Гц. И архитектура такой сети масштабируется как O(N), а не O(N2).

Надо признать, что некоторые вещи проще заметить при первой архитектуре сети, чем при второй. В Сети 1 есть прямая связь между каждыми двумя узлами. Так что если красные объекты никогда не светятся в темноте, но красные шерстистые объекты обычно обладают остальными признаками блэгга, вроде яйцевидности и ванадия, Сеть 1 может легко это представить: для этого достаточно очень сильной прямой отрицательной связи от цвета к свечению, но при этом более мощных положительных связей от текстуры ко всем остальным узлам, кроме свечения.

И это не какое-то «особое исключение» из общего правила, что блэгги светятся — помните, в Сети 1 нет элемента, представляющего блэгговость; блэгговость возникает как аттрактор в распределенной сети.

Так что да, эти O(N2) связей действительно приносили некоторую пользу. Но не так уж много. Сеть 1 не полезнее в большинстве реальных задач, где вы редко встретите животное, застрявшее на полпути между кошкой и собакой.

(Существуют также факты, которые не так-то просто представить в Сети 1 или Сети 2. Скажем, цвет морской волны и сферическая форма, встречаясь вместе, всегда указывают на присутствие палладия; но по отдельности каждый из них служит очень сильным свидетельством в пользу ванадия. Это трудно представить в любой из архитектур без дополнительных узлов. Как Сеть 1, так и Сеть 2 воплощают в себе неявные предположения о том, какая структура среды наиболее вероятна; способность считывать эти предположения — вот что отличает взрослых от младенцев в машинном обучении.)

Не заблуждайтесь: ни Сеть 1, ни Сеть 2 не являются биологически реалистичными. Но всё же кажется разумным предположить, что, как бы ни работал мозг на самом деле, в каком-то смысле он ближе к Сети 2, чем к Сети 1. Быстро, дешево, масштабируемо, хорошо помогает отличать собак от кошек: естественный отбор выбирает подобные решения так же неизбежно, как вода стекает по ландшафту приспособленности.

Кажется вполне обычной задачей классифицировать объекты как блэгги или рубы, раскладывая их по соответствующим корзинам. Но заметили бы вы, если бы объекты цвета морской волны никогда не светились в темноте?

Возможно, если бы вам предъявили двадцать объектов, похожих друг на друга только цветом морской волны, а затем выключили свет, и ни один из объектов не засветился бы. Иными словами, если бы вас ткнули в это носом. Возможно, если показать вам все эти объекты цвета морской волны одной группой, ваш мозг формирует новую подкатегорию и может обнаружить признак «не светится» внутри этой подкатегории. Но вы, скорее всего, не заметили бы этого, будь эти объекты цвета морской волны рассеяны среди сотни других блэггов и рубов. Заметить это было бы далеко не так просто или интуитивно, как легко и естественно мы отличаем кошек от собак.

Или: «Сократ — человек; все люди смертны; следовательно, Сократ смертен». Откуда Аристотель знал, что Сократ — человек? Что ж, у Сократа не было перьев, ногти у него были широкими, ходил он прямо, говорил по-гречески и, в общем, формой тела и поведением походил на человека. И вот мозг раз и навсегда решает, что Сократ — человек, а отсюда делает вывод, что Сократ смертен, как и все другие люди, которых до сих пор наблюдали. Вряд ли нам покажется простым или естественным спросить себя, насколько ношение одежды — в отличие от владения речью — связано со смертностью. Просто: «существа, которые носят одежду и пользуются языком, — люди», а «люди смертны».

Существуют ли когнитивные искажения, связанные с попыткой классифицировать вещи по категориям раз и навсегда? Конечно, существуют. См., например, статью «Сектантское контрсектантство».

*

Предыдущая главаГлава 172 из 354Следующая глава