К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 2 Агенты. 4. Подкрепление. Загадочный дофамин
42%
Часть 2 Агенты. 4. Подкрепление. Загадочный дофамин
35

Если людей и животных можно считать стремящимися к максимальным «гетеростатическим» вознаграждениям, само собой разумеется, что эти вознаграждения каким‐то образом управляют некими механизмами мозга. Если действительно существует какая‐либо уникальная скалярная «награда», ради увеличения которой и созданы люди и животные, то может ли она быть такой простой, как, например, электрическая схема в мозгу? В 1950‐х годах двое ученых из университета Макгилл в Монреале Джеймс Олдс и Питер Милнер, были убеждены, что нашли место, где происходит этот процесс.

Олдс и Милнер проводили эксперименты, помещая электроды в мозг крыс и давая животным возможность нажимать на рычаг, после чего происходила электрическая стимуляция определенной части мозга. Ученые обнаружили, что воздействие на некоторые зоны не оказало никакого эффекта на поведение крыс. Но при воздействии на другие участки крысы начинали обходить рычаг как можно дальше, только чтобы случайно его не нажать. Но были и такие зоны – в частности, так называемая область перегородки, – при стимуляции которых крысы хотели лишь нажимать рычаг, подающий ток в этот участок мозга. Они нажимали его по 5000 раз за час, 24 часа в сутки без остановки [330]. «Это вознаграждение полностью захватывает контроль над поведением животного, – писали Олдс и Милнер, – возможно, превосходя любое другое вознаграждение, которое когда‐либо использовалось в экспериментах с животными» [331]. Так было положено начало исследованиям не только поведения человека и животных через призму максимизации, но и существующих молекулярных механизмов самого вознаграждения.

Вначале эти области назвали структурами подкрепления, но вскоре Олдс начал говорить о них как о центрах удовольствия [332]. Последующие исследования доказали, что не только крысы, но и люди способны свернуть со своего пути, чтобы получить удар электрическим током в те же части мозга.

Со временем исследования определили, что те участки мозга, где электрическая стимуляция оказывается наиболее эффективной, – это области, в которых задействованы нейроны, производящие нейромедиатор 3,4‐дигидроксифенетиламин, больше известный под сокращенным названием дофамин [333]. Такие клетки встречаются редко – менее 1 % клеток мозга – и сосредоточены в особых зонах [334]. Одна дофаминовая клетка может в некоторых случаях соединяться с миллионами других нейронов, охватывая большой участок мозга [335]. Они обладают уникально широкой сетью связей, общая длина которых для отдельных клеток достигает четырех с половиной метров [336]. В то же время они достаточно ограничены в диапазоне и сложности выходных сигналов. Специалист по нейронауке из Нью-Йоркского университета Пол Глимчер заключил: «Они мало что могут сказать всему головному мозгу, но то, что они говорят, должно быть слышно повсюду» [337].

Другими словами, эти клетки во многом напоминают «шкалу вознаграждений», что‐то вроде очков на табло головного мозга – предельно простые, но широко распространенные и чрезвычайно важные.

За 1980‐е электрофизиология продвинулась до того, чтобы наблюдать за отдельными дофаминовыми нейронами в реальном времени. Немецкий нейрофизиолог Вольфрам Шульц в лаборатории во Фрибуре, Швейцария, начал изучать поведение дофаминовых нейронов у обезьян, когда они добирались до коробки, которая то была пустой, то содержала маленькие кусочки фруктов или выпечки. Само собой, «всплеск импульсов происходил, когда рука обезьяны касалась кусочка еды внутри коробки» [338]. Казалось, это подтверждало, что ученые в самом деле нашли химическую природу вознаграждения.

Но было и кое-что странное.

Если существовал визуальный или звуковой сигнал о том, что еда в коробке появится, это вызывало всплеск дофаминовой активности. Обезьяны бросались вперед и хватали еду, а Шульц скрупулезно отслеживал показания приборов – и ничего не происходило. Спокойный фон нормальных показателей деятельности. Никаких пиков. Дофаминовые нейроны, писал он, «выстреливали во время всплеска импульсов в ответ на [сигнал], но отказывались реагировать на прикосновение к пище» [339].

Что же происходило?

«Мы не могли понять, чем это обусловлено», – говорил Шульц [340]. Он рассмотрел одну за другой несколько гипотез. Может быть, обезьяны просто объелись и действительно не хотели больше. Он попытался не кормить их. Не сработало. Они жадно набрасывались на еду. Но дофаминового всплеска не было.

В конце 1980‐х и начале 1990‐х Шульц и его коллеги пытались правдоподобно объяснить то, что они наблюдали [341]. Раз за разом дофаминовый всплеск смещался с пищи на сигнал, но что же это значило? Если еда каким‐то образом переставала «вознаграждать», тогда почему обезьяны всегда бросались к ней и быстро съедали? Это не имело никакого смысла, значит, дофамин не мог представлять непосредственно вознаграждение. Ученые исключили связь с кратковременной памятью. Они исключили связь с движением и прикосновением.

«Мы ни с чем не могли это связать, – рассказывал Шульц. – Мы пытались найти связь с побуждением, мотивацией, реакцией на стимул, который заставляет двигаться… Так мы думали вначале, но потом обнаружили, что явление слишком неопределенно». Его лаборатория начала работать над гипотезой о том, что этот процесс как‐то связан с удивлением или непредсказуемостью. Идея пришла из психологии и называлась моделью Рескорла-Вагнера, предполагающей, что обучение тесно связано с неожиданностью [342]. Дофамин мог иметь отношение к этой связи, возможно, он каким‐то образом представлял либо удивление от неожиданности, либо процесс обучения, который порождался удивлением. Это бы объяснило, почему еда дает всплеск дофамина, когда появляется неожиданно, но не когда есть сигналы ее появления. И почему в том случае, когда есть неожиданный сигнал, он вызывает выброс дофамина. «Все бы хорошо, – рассказывал Шульц, – но это не объясняло некоторые имеющиеся у нас данные» [343].

В особенности это никак не вязалось с появившимся позднее явлением, которое наблюдал Шульц и которое было даже более таинственным, чем первое. Ученый продолжал исследования, используя похожую схему, но на этот раз вместо коробок с пищей были рычаги и сок. Когда обезьяны усвоили, что сигнал означает появление сока, Шульц попробовал кое-что новое: он подавал ложную тревогу. Он включал сигнал, дофаминовая активность обезьян взлетала выше нормального для нейронов уровня. Обезьяны жали на рычаг и не получали сока. Их дофаминовые нейроны затихали – быстро и однозначно. «Тогда я подумал, что это совершенно не похоже на удивление» [344].

Дофамин так и оставался загадкой. Поначалу он казался таким понятным – своеобразной валютой мозга для вознаграждений. Он явно что‐то измерял. Не вознаграждение, не внимание, не новизну, не удивление – но что?

Предыдущая главаГлава 35 из 83Следующая глава