Обратное распространение эффективно находит веса связей, которые обеспечивают успешное обучение во многих сферах. Метод успешно применяется в моделях человеческих когнитивных способностей, включая модели усвоения и утраты понятий (глава 7). Этот алгоритм также лежит в основе обучения современных языковых моделей (глава 8) и других сложных систем искусственного интеллекта. Особенности современных моделей ИИ усложняют вычисления, но в основе их работы лежат те самые принципы, которые мы здесь описали.
Однако у обратного распространения есть существенные ограничения. Во-первых, настоящие нейронные сети в мозге не могут передавать сигналы ошибки назад по тем же связям, по которым идет прямое распространение активации, а именно это требуется, чтобы получить правильные величины ошибок скрытых элементов. Исследователи предложили более биологически правдоподобные алгоритмы, которые с некоторым успехом распространяют сигналы ошибки без использования одинаковых весов связей в обоих направлениях, но в системах ИИ они не применяются, поскольку работают хуже обратного распространения.
Во-вторых, обратное распространение и родственные алгоритмы коррекции ошибок требуют огромного объема обучающих данных, чтобы хорошо работать на новых примерах. Самые мощные языковые модели, как мы отметили в главе 8, используют в 100 000 раз больше обучающих данных, чем человек может встретить за всю жизнь. Иными словами, обратное распространение может быть мощным инструментом и способно воспроизводить многие аспекты наших когнитивных способностей, но учится оно намного менее эффективно, чем наш биологический мозг.
Почему же обратное распространение настолько неэффективно? Ключевая проблема в том, что оно не фокусируется на тех весах связей, изменение которых принесло бы максимальную пользу. Рассмотрим пример применения обратного распространения в языковой модели, где мы предсказываем каждое слово в предложении на основе всех предыдущих слов. Допустим, вы слышите предложение: «Джон пьет кофе со сливками и медом». Вы ожидали услышать сахар, но получили другое слово, что создает большую ошибку. При обратном распространении произойдет следующее: будут скорректированы связи во всех путях прямого распространения через сеть от всех слов входной последовательности. В результате мы станем реже предсказывать сахар и чаще предсказывать мед всякий раз, когда встретим любое предложение о продукте, который кто-то добавляет в кофе. Более совершенная процедура смогла бы определить, что, возможно, стоит запомнить: именно Джон пьет кофе с медом, и тогда можно было бы целенаправленно корректировать веса, связанные с влиянием персоны Джона на предсказание. Но обратное распространение научится приписывать «заслугу» предсказания меда в предложениях про Джона только после постепенного обучения, когда такие предложения будут чередоваться с предложениями о других людях, которые предпочитают сахар.