К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 2 Агенты. 4. Подкрепление. Гедонистический нейрон
40%
Часть 2 Агенты. 4. Подкрепление. Гедонистический нейрон
33

Борьба нервных клеток за свое существование зеркально отражает нашу борьбу за получение удовлетворения.

В 1972 году Гарри Клопф – исследователь, работавший на военно-воздушные силы США на базе ВВС Райт-Паттерсон в Дейтоне, штат Огайо, – опубликовал провокационный доклад, озаглавленный «Функции мозга и адаптивные системы: гетеростатическая теория». Клопф заявлял о том, что «нейрон является гедонистическим», то есть работает, чтобы довести до максимума некое относительное, возникающее в определенном месте «удовольствие» и свести к минимуму «боль». По мнению Клопфа, вся сложность поведения людей и животных возникает в результате активности этих отдельных клеточных «гедонистов», соединенных в системы с возрастающей сложностью.

Поколение исследователей до Клопфа, так называемое кибернетическое движение, просуществовавшее с 1940‐х до 1960‐х годов, описывало интеллектуальное поведение как «отрицательную обратную связь». Они утверждали, что по большей части организм мотивирует стремление к гомеостазу или равновесию. Он стремится поддерживать комфортную температуру. Он питается, чтобы бороться с голодом. Он находит пару, чтобы удовлетворить свои желания. Он спит, чтобы победить усталость. Казалось, все стремится вернуться к исходным рубежам.

В самом деле, в 1943 году судьбоносная статья по кибернетике «Поведение, цель и целеполагание», где термин «обратная связь» был использован в ныне привычном смысле – «информация, использованная при приспособлении», – разграничила целенаправленное и бесцельное (случайное) поведение [317]. Для кибернетиков цель была равносильна месту назначения, где можно отдохнуть. Основоположник кибернетики Норберт Винер считал одной из канонических машин, «по самой своей природе обладающей целью», термостат: когда температура слишком низкая, он нагревается, а когда слишком высокая – выключается. Так же он думал о регуляторе числа оборотов двигателей (governor). Едва ли только по воле случая этот термин имеет этимологическую связь со словом «кибернетика», имея общее происхождения от одного и того же греческого корня kybernetes (управлять) [318]. («Кибернетика» при всем экзотическом научно-фантастическом звучании могла бы иметь куда более мягкую и бюрократическую форму «governetics» и первоначально появилась как наука об управлении государством.) Механический «регулятор» открывает клапаны, когда двигатель вращается слишком быстро, и закрывает их, когда движение слишком замедляется, тем самым помогая поддерживать равновесие. «Заметим, что обратная связь стремится противодействовать тому, что делает система; следовательно, является отрицательной», – писал Винер [319]. С точки зрения кибернетики, это было основной частью любой целенаправленной системы. «Любое целенаправленное поведение, – писали ее последователи, – может рассматриваться как требующее отрицательной обратной связи» [320].

Клопф начисто отвергал такую точку зрения. Для него организмы стремились к максимуму, а не к минимуму. Жизнь связана с ростом, воспроизведением, бесконечным, безграничным и неутолимым движением вперед в любом смысле этого слова. Для Клопфа цель – не гомеостаз, а полная его противоположность. «Живые приспосабливающиеся системы в качестве своей основной цели ищут максимальное состояние (гетеростаз), а не стабильное состояние (гомеостаз)». Если говорить более поэтично, Клопф проповедовал о достоинствах положительной, а не отрицательной обратной связи: «И положительная, и отрицательная обратная связь критически важна для процессов жизнедеятельности. Тем не менее, доминирует положительная: именно она дает „искру жизни“». Эта идея проходит весь путь от отдельных клеток до организмов и общественных структур. Клопф не скромничал, когда речь шла о том, что считать практическим приложением его идеи. «Кажется, это первая теория, способная обеспечить единую унифицированную структуру, внутри которой можно понять нейрофизиологические, психологические и социологические характеристики живых приспосабливающихся систем, – писал он. – Нейроны, нервные системы и нации являются гетеростатическими» [321].

Нейроны неутолимо стремятся к максимуму? И это объясняет поведение наций? Идея была амбициозной, неортодоксальной и, вполне возможно, абсурдной. Военно-воздушные силы предложили ученому финансирование, чтобы найти лабораторию или приспособить уже существующую для этой задачи. Команду себе Клопф подобрал в Массачусетском университете в Амхерсте. Там он нанял получившего докторскую степень исследователя по имени Эндрю Барто, чтобы, как говорил последний, найти «научное значение этой идеи: сумасшедшая она и эксцентричная или может принести какую‐то научную пользу? [322]»

Может показаться необычным, но Клопф переписывался с гениальным студентом, получавшим в Стэнфорде образование по психологии. Когда к команде присоединился Барто, Клопф предложил: «Это действительно очень умный парень, вам стоит взять его в проект» [323]. Умного парня звали Ричард Саттон, он был еще подростком, когда присоединился к Барто в Амхерсте и стал его первым аспирантом.

Я спросил Барто, были ли какие‐то предзнаменования того, что должно было произойти. «Мы ни о чем и понятия не имели, – ответил он. – Мы даже не подозревали». На средства, полученные Клопфом от военно-воздушных сил, Саттон и Барто начали сотрудничество, продлившееся сорок пять лет и, в сущности, породившее новую отрасль на пересечении нейрофизиологии, бихевиоризма, программирования и математики. Ее назвали обучением с подкреплением, а их имена оказались навсегда связаны вместе в библиографических списках работ по искусственному интеллекту – «Барто и Саттон», «Саттон и Барто» – и стали ассоциироваться с хрестоматийными учебниками отрасли, соавторами которых они были. Даже можно сказать, что эти имена превратились в кодовое слово для обозначения самого обучения с подкреплением [324].

Я встретился с Барто в кампусе Массачусетского университета, почетным профессором которого он сейчас является. «Счастливо ушел на пенсию, – сказал он. – Честно говоря, я рад, что не нахожусь в центре той бури слухов и восторгов по поводу искусственного интеллекта и подкрепления».

Я сказал Барто, что буду очень рад поговорить об истории обучения с подкреплением (RL, как его часто называют) как отрасли и конкретно о его применении для безопасности, принятия решений и моделирования когнитивных способностей человека.

– Так сколько времени у вас есть? – прервал он меня.

– Почти целый день, – ответил я.

Столько мы и проговорили.

Предыдущая главаГлава 33 из 83Следующая глава