К книге
Рождение разума: Как интеллект зарождается в людях и нейросетяхЧасть III Знание и обучение – все это в связях. Глава 9 Когда мы учимся, мы изменяем связи. Важность скрытых элементов
78%
Часть III Знание и обучение – все это в связях. Глава 9 Когда мы учимся, мы изменяем связи. Важность скрытых элементов
80

До сих пор все рассмотренные в этой главе сети состояли только из входного и выходного слоев. Однако во многих случаях для изучения зависимостей между входами и выходами сети необходим промежуточный скрытый слой.

Чтобы понять, почему это так, вернемся к примеру с вином. Напомним, мы рассматриваем вина с четырьмя характеристиками: это либо каберне, либо вионье, со сливовым либо абрикосовым вкусом. Теперь представим, что цены на вина подчиняются определенной закономерности: каберне со сливовыми нотами обычно стоят дорого, а с абрикосовыми – дешево; вионье, напротив, с абрикосовым вкусом стоят дорого, а со сливовым – дешево. Такая закономерность вполне естественна. Можно представить, что плотная насыщенность каберне хорошо сочетается со сливовыми тонами, но не с абрикосовыми, тогда как легкая воздушность вионье гармонирует с абрикосовым вкусом, но не со сливовым.

Сможет ли двухслойная сеть с рисунка 9.2 снизить ошибку, если цены на вина следуют такой закономерности: сливовые каберне и абрикосовые вионье – дорогие, а абрикосовые каберне и сливовые вионье – дешевые?

В нашем примере, встретив дорогое сливовое каберне, сеть обычно увеличивает веса w1 и w3, чтобы получить высокую оценку цены и снизить ошибку. Но когда попадается абрикосовое каберне, она обычно уменьшает w1 и w4 для получения низкой оценки цены и снижения ошибки. В этой паре примеров вес w1 сначала растет, потом падает. В результате его изменение будет незначительным или вообще нулевым. По той же логике каждый из весов w2, w3 и w4 будет то увеличиваться, то уменьшаться. Если обучающая выборка содержит равное количество всех четырех типов вина (сливовое каберне, абрикосовое каберне, сливовое вионье и абрикосовое вионье – по 50 бутылок каждого типа, всего 200), веса останутся неизменными, поскольку будут корректироваться вверх и вниз одинаковое число раз. Даже при несбалансированной выборке такая сеть не сможет выявить закономерность, при которой сливовые каберне и абрикосовые вионье дороги, а остальные типы – нет.

Рисунок 9.3. Сеть со скрытыми элементами может выявить ценовую закономерность, при которой сливовые каберне и абрикосовые вионье дороги, а абрикосовые каберне и сливовые вионье дешевы. Сеть с рисунка 9.2 не способна уловить эту закономерность

Однако сеть на рисунке 9.3 легко справляется с этой задачей. Обратите внимание: на рисунке четыре скрытых элемента. Представьте, что после обучения формируются сильные связи от входных элементов «Каберне» и «Сливовый» к элементу «Скрытый 1» и слабые (или нулевые) связи к нему же от элементов «Вионье» и «Абрикосовый». Этот скрытый элемент будет максимально активироваться, когда оба элемента – «Каберне» и «Сливовый» – получают входной сигнал. Аналогичная логика применима к остальным трем элементам. По сути, в сети будет четыре скрытых элемента, каждый из которых максимально активируется для одного из четырех типов вина.

Дальше все просто. Нужны лишь сильные веса от соответствующих скрытых элементов к выходному элементу, представляющему цену. А именно: сильные веса связи от скрытых элементов, которые максимально активируются при сливовых каберне и абрикосовых вионье, к элементу «Цена» обеспечат высокие прогнозы цен для этих вин. И наоборот, слабые веса от скрытых элементов, максимально активируемых абрикосовыми каберне и сливовыми вионье, к элементу «Цена» дадут низкие прогнозы цен для этих вин.

Этот простой пример показывает, что скрытые элементы необходимы для распознавания определенных закономерностей. Более того, любой нейронной сети, которая учится делать прогнозы на основе сочетаний входных значений, потребуются скрытые элементы. Как и в нашем примере с вином, ситуации, где прогнозы зависят от сочетаний признаков, встречаются повсеместно.

Можем ли мы применить дельта-правило в сетях со скрытыми элементами?

Нет, не можем. Понимаете почему?

Дельта-правило нельзя напрямую применить к сетям со скрытыми слоями, поскольку оно требует знания «правильного ответа» (реальной цены в примере с вином) для вычисления ошибки, которую мы затем используем для корректировки весов связей, входящих в данный элемент. Для скрытого элемента мы не знаем правильного ответа, поэтому дельта-правило применить невозможно.

Осознав эту проблему, Дэвид Румельхарт задался вопросом: как же уменьшить ошибку в сетях со скрытыми элементами? Его решение, независимо найденное и другими исследователями, привело к созданию алгоритма обратного распространения ошибки.

Предыдущая главаГлава 80 из 102Следующая глава