Природа поставила человечество под управление двух верховных властителей: страдания и удовольствия. Им одним предоставлено определять, что мы можем делать, и указывать, что мы должны делать.
Проектные решения функций вознаграждения обсуждают не слишком часто, хотя это, возможно, самый сложный аспект настройки системы обучения с подкреплением.
В 1943 году Б. Ф. Скиннер работал над секретным проектом военного времени, который первоначально финансировала корпорация General Mills, производящая продукты питания. General Mills отдала Скиннеру под лабораторию верхний этаж своего мукомольного комбината Gold Medal в Миннеаполисе. Проект можно считать одним из самых дерзких начинаний своего времени: Скиннер и его сотрудники предложили использовать голубей для наведения ракет. Они приучали их клевать в одну точку, дабы открыть кормушку. Затем вместо кнопки птице показывали силуэт вражеского корабля. Картинку начинали смещать, а голубь яростно клевал экран в определенную точку, возвращая силуэт на место и получая в награду пищу. «Мы с коллегами знали, – говорил Скиннер, – что в глазах всего мира выглядим сумасшедшими» [387].
Скиннер сознавал, что многие посчитают проект не только безумным, но и жестоким. Во-первых, отмечал он, люди давно используют органы чувств животных (часто превосходящие человеческие) в своих целях: собаки-поводыри, свиньи, которые ищут трюфели, и так далее. Во-вторых, возражал ученый, «этический вопрос о том, имеем ли мы право превращать низшее существо в героя против его воли – это роскошь мирного времени» [388].
Ученый давно работал над исследованиями обучения с подкреплением, и его знаменитые «ящики Скиннера» действовали как усовершенствованная версия ящиков-головоломок Торндайка. Их лампочки, рычаги и механические устройства для подачи пищи были зачастую заимствованы из торговых автоматов и позволяли проводить точные количественные исследования обучения с подкреплением. В будущем их использовали целые поколения исследователей, не последним среди которых был и вышеупомянутый Вольфрам Шульц, изучавший дофамин обезьян. Имея в своем распоряжении подобные инструменты, в 1950‐х годах Скиннер начал изучать, как животные учатся увеличивать свою награду (обычно в форме пищи) при ряде различных условий. Он проверял разные типы «режима подкрепления» (по его собственному определению) и наблюдал результаты. Например, он сравнивал подкрепление по «коэффициенту» (вознаграждается определенное количество правильных действий) и подкрепление по «интервалу» (правильное действие вознаграждается через определенное время). Также он проверял «фиксированное» и «переменное» подкрепления, где количество действий или протяженность временного интервала остаются постоянными или изменяются. Скиннер выяснил, что наиболее активное, цикличное или навязчивое поведение появляется при переменном подкреплении по коэффициенту, то есть когда награда выдается за определенное количество действий, которое может меняться [389].
Как бы то ни было, в секретной лаборатории перед Скиннером стояла другая задача. Он сосредоточился не на том, чтобы понять, какой режим подкрепления глубже укореняет в сознании простые действия, а на том, как вызвать достаточно сложное поведение, используя только контролируемое вознаграждение. Труднее всего было, когда они с коллегами попытались научить голубя играть в боулинг. Исследователи сделали миниатюрную дорожку с игрушечными кеглями и собирались наградить птицу, как только она впервые прокатит по дорожке деревянный мячик. К несчастью, этого так и не случилось. Голубь не собирался делать ничего подобного. Экспериментаторы ждали и ждали, пока их терпение наконец не истощилось.
Тогда они попробовали другой подход. Скиннер вспоминал:
«Мы решили подкреплять любое действие, которое хоть как‐то связано с мячом – хотя бы взгляд в его сторону, – а потом выбирать наиболее близкие к удару по нему. Результат нас поразил. Через несколько минут мяч отскакивал от стенок коробки, как будто голубь был чемпионом по сквошу».
Результат был настолько поразительным и даже шокирующим, что двое исследователей из группы Скиннера – супруги Мариан и Келлер Бреланд – решили бросить работу в области академической психологии и основать компанию по дрессировке животных. «Мы хотели попытаться заработать себе на жизнь, – говорила Мариан, – используя принципы контроля поведения Скиннера» [390]. (Их друг Пол Мил, о котором мы кратко упоминали в главе 3, поставил десять долларов на то, что дело провалится. Это пари он проиграл, и Келлеры с гордостью вставили в рамку пришедший от него чек.) [391] Их компания Animal Behavior Enterprises стала крупнейшей в мире в своей сфере. Они дрессировали все виды животных для участия в телепрограммах, фильмах, рекламных роликах и для работы в тематических парках вроде SeaWorld. Супруги не просто заработали себе на жизнь, они создали целую империю [392].
В секретной лаборатории на мукомольном комбинате Скиннер думал о миниатюрной дорожке для боулинга как об озарении, изменившем ход его карьеры. Критическим моментом оказалось «постепенное формирование поведения с помощью поощрения грубого приближения к окончательному результату, не дожидаясь полной реакции» [393].
И все же проект «Голубь» был успешным только отчасти. Птицы работали великолепно. Настолько, что потрясли комиссию из управления научных исследований и разработок. Скиннер писал: «Голубь, выполняющий задания, – неважно, насколько приятным было это зрелище, – напомнил комиссии о том, каким фантастическим было наше предложение» [394]. В то время Скиннер об этом не знал, но правительство было заинтересовано в работе над Манхэттенским проектом – бомбой, радиус поражения которой был столь велик, что, по словам ученого, «казалось, что потребность в точной бомбардировке исчезнет раз и навсегда». Как бы то ни было, проект «Голубь» в конце концов оказался под крышей Лаборатории военно-морских исследований США под названием ORCON – сокращение от «органический контроль», – где исследования продолжались до послевоенных 1950‐х.
Скиннер гордился тем, что его концепция показала себя работоспособной, и в конце 1950‐х годов писал: «Можно сказать, что использование живых организмов в управляемых ракетах больше не кажется сумасшедшей идеей» [395]. Его доказательство, несмотря на красоту, оказалось совершенно неактуальным.
Главное, что ученые открыли формирование умений и навыков – метод, прививающий сложное поведение через простые вознаграждения, которые выдаются за ряд успешных приближений к необходимому действию. «Благодаря этому, – писал Скиннер, – возможно формировать поведение животного почти так же, как скульптор формирует комок глины» [396]. Эти мысль и термин стали критически важными в жизни и работе Скиннера [397]. Они получили применение и в бизнесе, и в повседневной жизни, что ученый предвидел с самого начала.
Он писал: «Некоторые из этих режимов подкрепления соответствуют практикам, установленным в промышленности при поденной оплате или сдельных ставках. Другие напоминают незаметные, но влиятельные стратегии в игре на автоматах, которые скандально известны своей способностью подчинять волю и поведение» [398]. Также он видел значительные возможности применения этого изобретения для родителей: «Научный анализ поможет лучше понимать межличностные отношения. Мы почти всегда осознанно или неосознанно тем или иным образом подкрепляем поведение других людей». Скиннер отмечал, что внимание родителей – мощный подкрепляющий стимул, и если они медленно реагируют на вежливые просьбы, то могут, сами того не желая, сделать детей назойливыми и нахальными. (Чтобы избежать этого, говорил он, надо с большей готовностью реагировать на приемлемое выражение требований и с меньшей – на громкое и невежливое.) [399]
Еще более пророческим было заявление Скиннера о том, что принципы, родившиеся в его работе, обучение в самом широком смысле слова (как людей, так и животных) могут стать серьезной предметной отраслью, где могут и будут происходить скачки вперед. «Часто говорят, что обучение – это искусство, – подытоживает он, – но у нас все больше причин надеяться на то, что в конце концов оно может стать наукой» [400].
Возможно, Скиннер оказался даже более прав, чем мог ожидать. В XXI веке говорить о «формировании» с большой вероятностью означает быть исследователем машинного обучения, думающим как психолог. Изучение вознаграждений и управления ими для получения необходимого результата в самом деле стало строгой наукой, использующей количественные определения, пусть даже обучаются и не органические организмы, как это представлял себе Скиннер.