К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Заключение. Логический вывод
99%
Заключение. Логический вывод
82

По мере того как агенты ИИ становятся все более изощренными, им нужны улучшенные модели человеческого поведения, чтобы понять, как устроен мир и как им следует (и не следует) действовать. Если они моделируют людей исключительно как неукротимых и безошибочных «максимизаторов вознаграждений», это чревато серьезными последствиями. Представьте: кто‐то искренне старается вам помочь, но при этом совершенно не понимает, чего вы хотите – сейчас или в жизни вообще. Результат может оказаться хуже, чем если бы вам вовсе не пытались помочь. А если этот заблуждающийся помощник обладает сверхчеловеческим умом и силой, последствия станут еще более разрушительными.

В дискуссиях о системах, которые выводят человеческие ценности и мотивации из наблюдаемого поведения, есть ряд ключевых допущений. Остановимся на одном из них.

Оно состоит в том, что человек (или эксперт) демонстрируют «оптимальное» поведение. В реальности это почти никогда не соответствует действительности [817]. Более продвинутые системы ослабляют это допущение и используют конкретные формальные модели «частичной оптимальности» человеческого поведения. Например, они считают, что мы ведем себя вероятностно: вероятность того или иного действия пропорциональна вознаграждению. На практике такая модель порой работает неплохо, но остается открытым вопрос: действительно ли это лучшая модель человеческого поведения? Этот вопрос актуален для психологов, когнитивистов, специалистов по поведенческой экономике и информатике [818].

Даже с учетом допущений о возможных ошибках, частичной оптимальности или иррациональности, модели обычно предполагают, что человек – не ученик, а знаток: это походка взрослого, а не ребенка, который учится ходить; это профессиональный пилот вертолета, а не новичок у пульта управления. Модели полагают, что человеческое поведение сводится к набору лучших методов, что люди знают максимум возможного или достигли предельного уровня мастерства. В этом контексте термин обратное обучение с подкреплением не вполне точен. Мы делаем выводы о целях и ценностях человека, не на основе процесса обучения с подкреплением, а на основе итогового поведенческого результат («выученной политики»). Мы оцениваем демонстратора не по тому, как он осваивал навыки, а по тому, как действует после достижения цели. Эта мысль прозвучала еще в первой статье по IRL в 1998 году [819]. Спустя 20 лет системы IRL набирают обороты, но принципиальный вопрос остается малоизученным [820].

Типичное обратное обучение с подкреплением предполагает, что человек-эксперт действует, не осознавая, что с него берут пример. Совместное обратное обучение с подкреплением предполагает обратное: человек выступает в роли педагога, открыто обучая машину, а не просто «занимается своим делом». В реальности наше поведение в присутствии других находится между этими двумя полюсами. Крайние допущения могут привести к неверной интерпретации, если условия изменятся [821].

Еще одна, – и, возможно, самая серьезная – проблема: типичные системы обратного обучения с подкреплением считают, что моделируются предпочтения только одного человека. Как адаптировать их к системам, которые служат двум или более «хозяевам»?

По словам Стефано Эрмона, специалиста по информатике из Стэнфорда, выравнивание ИИ с человеческими ценностями – «вещь, с которой согласилось бы большинство людей. Но проблема в том, чтобы определить, что это за ценности. У людей разные культуры, происхождение, социоэкономический статус – и поэтому разные представления о ценностях. Это действительно сложная задача» [822].

Специалист по информатике из университета Луисвилла Роман Ямпольски соглашается, подчеркивая: «Мы как человечество не можем выработать общие ценности. Даже те, по которым мы согласны, со временем меняются» [823].

Имеют значение и технические нюансы: если половина пользователей поворачивает налево, а половина – направо, «среднее» решение (например, столкновение с разделителем) не будет правильным.

Кроме того, машинное обучение сталкивается с парадоксами, когда взаимодействует с давними проблемами других дисциплин: политической философией, политологией, теорией голосования и социального выбора [824].

Чтобы завершить раздел предположений, немного расширить взгляд на него, скажем, что любая архитектура машинного обучения неявно опирается на перенос навыков на нескольких уровнях. Система предполагает, что реальные ситуации в среднем похожи на те, с которыми она сталкивалась при обучении. Из этого допущения возникают классические проблемы, например переобученность.

Одно из простейших нарушений – постоянное изменение мира.

Один специалист по компьютерной лингвистике жаловался, что не может добиться от своей модели такой же точности, какая была годом или двумя ранее. Проверка не выявила ошибок. Что же они делали не так?

Как выяснилось, ничего. Причина оказалась в данных для обучения: они были набраны в 2016 году, английский в 2017 году уже немного отличался, а в 2018‐м отличия стали еще заметнее. Это пример «сдвига в распределении». Модели, обученные на старых данных, постепенно теряют точность по мере изменения мира [825].

* * *

Можно составить длинный перечень случаев, напоминающих о том, что «карта – это еще не территория». Как писал Бруно Латур: «Мы принимали науку за реалистичную картину, воображая, что это точная копия мира. Наука, как и картины, делает нечто иное: она соединяет нас с выровненным, преобразованным, умозрительно выведенным миром» [826]. Такой мир выравнивается лишь при удаче, осторожности и мудрости.

Это сводится к предостережению на будущее. Существует опасность того, что контроль над миром захватит не ИИ и не машины, а модели – формальные, часто численные спецификации всего, что существует, и всего, чего мы хотим [827].

Как заметил художник Роберт Ирвин: «Человеческие существа, живущие в структурах и с помощью структур, становятся структурами, живущими в человеческих существах и с их помощью». Это звучит как предупреждение.

Хотя я рассказываю об истории прогресса, не стоит думать, что мы близки к ее завершению. Одна из самых опасных вещей в машинном обучении – найти достаточно хорошую модель, объявить о победе и начать путать карту с территорией.

Коллективная память человечества коротка (в лучшем случае – столетие). Каждое поколение считает, что мир всегда был таким.

Даже если специалисты по ИИ и этике избегут очевидных катастроф, им предстоит бороться с нарастающим формализмом. При этом сами люди – их жизни, воображение, тела – будут формироваться этими моделями.

Это обратная сторона знаменитого манифеста робототехники Родни Брукса: «Мир – лучшая модель самого себя». Сегодня это становится правдой, но не так, как предполагал Брукс: лучшая модель мира замещает сам мир и угрожает реальности.

Мы должны позаботиться о том, чтобы не игнорировать то, что непросто представить в количественной форме или превратить в модели. Перефразируя Ханну Арендт [828]: проблема не в том, что наши модели фальшивы, а в том, что они могут стать истиной.

В естественных науках это не так критично: механика Ньютона не «убрала» перигелий Меркурия, который позже объяснил Эйнштейн. Но в человеческих делах такая опасность реальна.

В 2018 году беспилотный автомобиль Uber сбил Элейн Херцберг в Темпе (Аризона). Расследование показало, что система не распознала ее как пешехода, потому что она переходила улицу не по переходу [829]. Система не учитывала такой сценарий. Мы должны избежать мира, где системы не позволяют нам делать то, что не укладывается в их модели.

Возможно, именно по этой причине нам так нравится проводить время на природе [830]. Хотя естественная среда во многом сформирована под влиянием человека, она постоянно «расстраивает» наши классификации и модели. Как писал Герберт Рид: «Только людям, побывавшим в учениках у природы, можно доверить машины» [831].

Коллективное и институциональные решения все чаще опираются на формальные показатели. Для взаимодействия с системами требуется формальная модель поведения – либо усредненная, либо индивидуальная.

В этой книге мы видели мощь таких моделей, видели, как они ошибаются и как мы пытаемся выравнивать их с нашими интересами.

* * *

Несмотря на поводы для беспокойства, финал книги не должен быть мрачным.

Волнения об этике и безопасности в машинном обучении получили широкую поддержку. Выделяются средства, пересматриваются табу, периферийные вопросы выходят на первый план, возникают новые институты, формируется сообщество вдумчивых ученых. Сигналы тревоги услышаны, первые борцы с рисками уже действуют.

Проект выравнивания ИИ, несмотря на свои риски, внушает надежду. По мере развития систем, которые понимают не только явные команды, но и наши намерения и предпочтения, жесткие процедурные модели будут терять доминирование. Невыразимое больше не будет неизменно уступать явному. Будущие технологии усилят некоторые проблемы, но смягчат другие.

Мы говорили, что проект выравнивания может стать уникальным инструментов личного и общественного самопознания. Несправедливые модели (например, для досудебного заключения) высвечивают неравенство. Пристрастные языковые модели помогают измерить состояние нашей системы понятий и задать ориентиры для улучшений.

Прозрачные и объяснимые системы, обученные в реальном мире, позволяют увидеть и осмыслить то, что остается в тени. Изучая, как ИИ классифицирует мир и реагирует на него, мы узнаем новое о мире и о себе.

Перспектива создания общего искусственного интеллекта (ОИИ) дает шанс увидеть себя в зеркале. Возможно, изучая ОИИ, мы поймем, какие аспекты интеллекта универсальны, а какие уникальны для человека. Это пугает и вдохновляет, но лучше знать правду, чем придумывать ее.

Выравнивание принесет в мир сумятицу, но иначе и быть не может. Его история станет нашей историей – к лучшему или худшему.

* * *

14 января 1952 года BBC выпустила в эфир радиопрограмму с участием четырех знаменитых ученых: Алана Тьюринга (основателя информатики, автора легендарной статьи 1950 года), Ричарда Брейтуэйта (специалиста по философии науки), Джеффри Джефферсона (нейрохирурга) и Макса Ньюмана (математика и криптографа). Темой разговора был вопрос: «Могут ли автоматические вычислительные машины считаться думающими?»

Круглый стол начался с обсуждения того, как машины могут учиться и как люди могут их научить:

– Когда ребенок учится, родители и учителя постоянно корректируют его действия. Это не менее важно при обучении машины. Я провел эксперименты: чтобы достичь результатов, требовалось множество вмешательств. Машины учатся очень медленно, – сказал Тьюринг [832].

– Но кто же учится: вы или компьютер? – спросил Джефферсон.

– Ну… – протянул Тьюринг. – Сдается мне, что мы оба.

Предыдущая главаГлава 82 из 83Следующая глава