К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 2 Агенты. 6. Любопытство. Из любви к искусству
66%
Часть 2 Агенты. 6. Любопытство. Из любви к искусству
55

Изучение внутренней мотивации в информатике дает нам мощный инструментарий для прогресса в сложных обучающих средах – игра Montezuma’s Revenge лишь один из примеров. На более глубоком уровне это направление, опираясь на успешный эмпирический опыт, объясняет, почему у нас самих существуют такие ярко выраженные мотивации.

Чтобы лучше понять собственные стремления, мы можем использовать взаимодополняющие открытия о том, как создать искусственный интеллект столь же гибким, устойчивым и интеллектуально всеядным, как наш разум.

Дипак Патак видит в успехах глубокого обучения одну явную слабость: каждая система, будь то машинный перевод, распознавание объектов или игры, разработана под конкретную цель. Обучение нейросети на огромном массиве вручную размеченных данных когда‐то стало прорывом. Мы научили систему сортировать картинки, и это действительно впечатляет, считает Патак. «Но проблема в том, что эти системы на самом деле интеллектом не обладают. Им не хватает главного компонента человеческого бытия – универсальности поведения и обучения» [531].

По мнению Патака, создание универсальной системы потребует отказа от узкоспециализированного мышления и от главного «костыля» – огромного количества явной информации о вознаграждении. Системам вроде AlexNet нужны сотни тысяч размеченных людьми фотографий. Но люди в начале жизни учатся видеть мир совсем иначе. То же касается и обучения с подкреплением: в играх Atari система каждую долю секунды получает четкую обратную связь о своих успехах. «Это работает отлично, но требует чего‐то очень странного – постоянного внешнего подкрепления», – говорит исследователь.

Отказ от жестко заданных внешних наград может стать необходимым шагом к созданию по-настоящему универсального ИИ. Жизнь, в отличие от игры Atari, не предоставляет размеченных данных и мгновенной оценки каждого действия. У нас есть родители и учителя, которые могут поправить речь или поведение, но это лишь малая часть нашего опыта. К тому же авторитеты не всегда согласны друг с другом. Более того, взросление подразумевает умение самостоятельно выносить суждения.

«Условием для настоящего прорыва, на мой взгляд, стало бы полное исключение вознаграждения, – говорит Беллемаре. – Это выводит меня за пределы зоны комфорта, но я полагаю, что самое интересное, что мы можем сделать с ИИ, – это позволить ему вырабатывать свои собственные цели. Существует проблема безопасности, но я хотел бы, видеть агента, которого можно забросить в Montezuma’s Revenge, и он будет играть просто потому, что ему это нравится» [532].

«Мы говорили об Аркадной обучающей среде как о вехе в истории отрасли, – продолжает Беллемаре. – Но для меня с ALE в каком‐то смысле покончено. Как и с максимизацией счета». По его мнению, высокий счет, полученный машиной, просто перебирающей варианты ради очков, не является признаком интеллекта, какими бы впечатляющими ни были цифры: «Я действительно думаю, что интеллект нужно измерять поведением, а не функцией вознаграждения». Каким может быть это поведение – один из центральных вопросов для исследователя.

Работа Орсо над агентами, стремящимися к знаниям, также намечает контуры сознания, движимого исключительно тягой к познанию. Предварительный анализ обнадеживает. Искусственный агент, нацеленный на максимизацию счета или достижение состояния, всегда рискует найти лазейку: взломать систему начисления очков или создать эскапистскую фантазию, где цели легко достижимы. Орсо подчеркивает, что хотя мы видим в этом жульничество, смысл действий агента иной: «Я просто совершаю действия, чтобы максимизировать награду. Агент не понимает, что делает что‐то плохое. Он просто пробует разные варианты, находит работающий – так почему бы его не использовать?» [533]

Агент, стремящийся к знаниям, не ищет таких обходных путей. Самообман не представляет для него интереса. «Представьте, что вы подделываете данные наблюдений… Какую информацию вы получите? Никакой, ведь вы заранее знаете результат» [534]. Благодаря такой устойчивости агент, ищущий знания, «может лучше подойти на роль общего искусственного интеллекта в нашем мире – месте, где можно легко обмануть себя множеством способов» [535].

Конечно, есть причины для колебания перед созданием сверхинтеллектуального агента, стремящегося к знаниям. Такая жажда опыта может привести к присвоению огромных ресурсов. Но, по крайней мере, он устойчив к самым очевидным ловушкам. «Если его удастся запрограммировать, думаю, он продемонстрирует удивительное поведение, – говорит Орсо. – Он будет пытаться как можно быстрее разобраться в окружающей обстановке. По сути, это совершенный ученый. Он будет ставить эксперименты, чтобы понять происходящее… Мне действительно любопытно увидеть, как он будет себя вести».

Идея и этика интеллекта, руководствующегося по большей части (или исключительно) любопытством, не нова. Ее появление предсказали не в прошлом десятилетии, а в прошлом тысячелетии. В знаменитом диалоге Платона «Протагор» Сократ размышляет об этом и дает точное определение.

«Знание прекрасно и способно управлять человеком, так что того, кто познал хорошее и плохое, ничто уже не заставит поступать иначе, чем велит знание, и разум достаточно силен, чтобы помочь человеку» [536].

Предыдущая главаГлава 55 из 83Следующая глава