К книге
Иной разум. Как «думает» искусственный интеллект?Часть третья Встреча с иным. Глава восьмая Телесный умвельт. «Эра опыта»
87%
Часть третья Встреча с иным. Глава восьмая Телесный умвельт. «Эра опыта»
53

Скажи мне — и я забуду, покажи мне — и я запомню, дай мне сделать — и я пойму.

Ощущение, что мы зашли в какой-то тупик и нашим умвельтам — человеческому и машинному — никогда не сойтись. Ни симуляции, дающие «тело в кавычках», ни даже самый совершенный пространственный интеллект не смогли решить фундаментальную проблему: искусственный разум не имеет точки опоры, а его знания о мире не являются пониманием нашего мира.

Невольно возникает мысль, что сама эта наша стратегия — дать машине совершенную картину мира — не оправдана. Что если проблема не в том, какую карту мы даём ИИ, а в том, что всякая действительная воплощённость — это всегда, и с абсолютной необходимостью, результат опыта — то есть не информации, а действия?

Именно этой позиции придерживается один из самых глубоких и последовательных мыслителей в области ИИ, настоящий «крёстный отец» обучения с подкреплением Ричард Саттон. Он предлагает совершить поворот на 180 градусов: перестать пытаться «загрузить» в машину готовые знания о мире и создать условия, в которых интеллект будет рождаться из действия.

«Горький урок»

Позиция Ричарда Саттона и в самом деле радикальна. Он не разделяет всеобщей эйфории, вызванной современным бумом ИИ. Напротив, он уверен, что мы пошли не тем путём и что никакого сильного ИИ (AGI) нам здесь найти не удастся. Саттон называет ИИ с языковыми моделями под капотом — «движками для подражания», которые способны лишь на виртуозную имитацию, причём без всякого проблеска разума[175].

Вот как примерно рассуждает Саттон…

Во-первых, как мы уже знаем, способность ИИ генерировать связный текст — это результат обучения на одной-единственной задаче: предсказании следующего слова в последовательности.

Языковая модель знает, что после фразы «небо голубое, а трава…» с большой долей вероятности должно идти слово «зелёная». Но она делает это не потому, что «понимает» природу травы или концепцию цвета, а потому, что в её обучающих данных такая последовательность встречалась миллионы раз.

То есть, по сути, LLM отвечает не на вопрос «Что истинно в мире?», а на вопрос «Что бы человек сказал в подобной ситуации?» То есть это чистая имитация — воспроизведение внешнего паттерна без доступа к внутреннему содержанию.

Впрочем, как мы уже знаем, многих это обстоятельство не смущает. И Саттон признаёт, что для множества задач это не просто хорошо, а великолепно. ИИ-имитатор может писать электронные письма, обобщать статьи, помогать программисту с кодом. Он — идеальный ассистент, потому что его главная задача — действовать в рамках уже существующих человеческих практик.

Но для создания общего искусственного интеллекта (AGI), считает Саттон, этого категорически недостаточно, ведь имитатор по своей природе не способен выйти за пределы того, что он имитирует.

Представьте себе студента-медика, который выучил наизусть все медицинские учебники мира. Да, он сможет блестяще сдать любой экзамен и описать симптомы любой известной болезни. Но поставьте его в реальное отделение неотложной помощи, и это будет настоящий провал.

Пациент не поступает сюда из конкретной главы учебника. Его приводит к врачу реальная жизнь — индивидуальная генетика, особенности взаимодействия множества внутренних систем организма (от сердечно-сосудистой до кожно-выделительной), специфика иммунной и эндокринной систем, а также обмена веществ, перенесённые и сопутствующие заболевания, образ жизни и актуальные обстоятельства, ставшие непосредственной причиной обращения пациента за медицинской помощью.

С этим «языковой» ИИ, считает Саттон, никогда не справится.

Во-вторых, Саттон в принципе считает ошибочной попытку передать ИИ наши знания.

Он обобщил эту идею в своём знаменитом эссе «Горький урок»: проанализировав 70-летнюю историю ИИ, он обнаружил неумолимую закономерность — снова и снова исследователи пытаются ускорить прогресс, «встраивая» в машины свои собственные, человеческие знания и эвристики (способы работы с информацией).

И каждый раз, хотя и в долгосрочной перспективе, эти подходы проигрывают более общим методам, которые полагаются лишь на две вещи: колоссальную мощь вы-числений и универсальные алгоритмы обучения.

С этой точки зрения LLM — это, конечно, апофеоз «встраивания» человеческого знания в машинную систему. Но это значит, что такой ИИ никогда не сможет превзойти наши фундаментальные ограничения, при этом наш язык — это невероятно плохой канал передачи знаний.

Он «беден информацией» не в том смысле, что в нём мало фактов, а в том, что он упускает самое главное — структуру самой реальности:

• прямой опыт взаимодействия с миром — это гигантский, мультимодальный поток данных высочайшей чёткости, а язык — это крошечный, одномерный ручеёк (сравните количество данных, которые можно считать с объекта, скатившегося со стола, и фразу «мяч упал со стола»);

• язык не просто сжимает данные, но делает это с потерями, причём мы сами решаем, что потерять, то есть описываем то, что мы сами считаем важным, применительно к конкретному адресату (сравните, сколько информации заключено в чашке горячего кофе, которую вы держите в руках, но ведь другу вам её не надо объяснять, достаточно сказать: «Я пью кофе»);

• фундаментальные законы нашего мира — гравитация, постоянство объектов, трение — настолько для нас очевидны, что мы почти никогда не упоминаем их в речи (это то, что мы назвали «тёмной материей» нашего опыта — в обучающих данных просто нет информации о том, что «естественно» для всех людей);

• наконец, язык — это статичный отчёт о прошлом опыте, тогда как реальный мир представляет собой динамическую систему, реагирующую на всякое наше действие (когда мы учимся кататься на велосипеде, каждое наше микродвижение оценивается с помощью положительной или отрицательной обратной связи, а этого нет в учебниках).

Таким образом, мы привязаны к нашему несовершенному, низкопропускному и искажённому описанию мира, а обученный на этих данных ИИ всегда будет хуже нас справляться с задачами, которые мы решаем в этом мире. Истинный интеллект, по Саттону, должен генерировать знание сам.

Наконец, в-третьих, Саттон считает, что ИИ должен учиться на определённом «опыте». Он разделяет два фундаментально разных типа опыта:

• пассивный опыт (знание) — то, на чём учатся LLM, и это, по сути, единовременный акт обработки статичного набора данных (как прочитать всю библиотеку мира ещё до своего рождения), на кристаллизованном опыте других;

• активный опыт (взаимодействие) — это непрерывный, динамический процесс взаимодействия с окружающей средой (не чтение книг о том, как плавать, а прыжок в воду и попытки удержаться на плаву), то есть поток действий, наблюдений и последствий, собственный опыт.

Проще говоря, вместо того чтобы учить машины всему, что мы знаем, мы должны научить их, как учиться самим — не из нашего прошлого, а из своего собственного динамического взаимодействия с реальностью.

Цифровой младенец

В противовес пассивному изучению текстов Ричард Саттон предлагает парадигму, основанную на обучении с подкреплением, — «агент» (система ИИ) помещается в «среду» и обучается в непрерывном цикле взаимодействия: действие → наблюдение → вознаграждение.

Цель агента — научиться выбирать такие действия, которые максимизируют суммарное вознаграждение, которое он получает. Образно говоря, он должен учиться не тому, как звучать правильно, а тому, как действовать эффективно[176][177].

Кажется, что это просто идеальное решение: мы создаём «цифрового младенца», который, как и ребёнок, будет учиться на собственных пробах и ошибках. Но это лишь звучит понятно…

Новорождённый человеческий ребёнок — отнюдь не «чистый лист». Да, мы не рождаемся с готовыми знаниями, но в нас изначально встроена гениальная машина для их приобретения. Наш мозг уже запрограммирован эволюцией на то, чтобы искать удовольствие и избегать боли. И именно этот внутренний компас заставляет нас учиться.

Точно так же и агентный ИИ Саттона — это не пустая программа, а специальная архитектура, созданная для обучения. У него должны быть «цифровые чувства» (пространство восприятия), «цифровые мышцы» (пространство действий) и, что самое главное, цель, заданная в виде функции вознаграждения.

Проще говоря, ему не говорят, что делать, а лишь отмечают, что хорошо (цель достигнута) и что плохо (цель не достигнута). Но предварительно загруженных в него человеческих понятий у этого агента быть не должно: ни «стула», ни «стены», ни «гравитации» — все эти и другие концепции он должен будет открыть для себя сам, с нуля.

Но если в случае реального младенца «хорошо» и «плохо» заданы его биологией и затем социальной средой, то где мы возьмём настройки для цифрового младенца?

Первая проблема: какой потребностью наш агент будет руководствоваться?

Ребёнок — живое существо, ведомое мощными, врождёнными, универсальными биологическими потребностями: в пище, тепле, безопасности, социальной связи. Эти потребности создают естественную иерархию ценностей и служат негасимым внутренним двигателем всего его познания.

У агента Саттона такого двигателя нет. Его «потребность» — это функция вознаграждения, написанная программистом, то есть, по существу, внешняя, искусственная, узкоспециализированная инструкция. Агент, обученный выигрывать в шахматы, не имеет никакой внутренней причины интересоваться чем-либо ещё. Его «желания» не его собственные.

И пока никто не знает, как создать в кремнии универсальную «волю к жизни», которая заставила бы ИИ-агента исследовать мир не по указке, а из внутренней необходимости.

Но даже если бы мы смогли создать такой универсальный двигатель, мы сталкиваемся со второй, ещё более фундаментальной проблемой. Агент Саттона — это «цифровой Маугли». Он учится в одиночку в мире, лишённом двух фундаментальных якорей, на которых стоит наша с вами реальность.

• Первый наш якорь, как мы уже выяснили благодаря Веккеру, — это «кончик пальца». Наше познание заземлено в фундаментальном опыте «непереносимых» свойств — в физическом сопротивлении мира, а для агента любые данные — это набор цифр с датчика. То есть его мир лишён этого гравитационного центра объективности.

• Второй якорь, без которого Маугли никогда не станет человеком, — социальный якорь, так сказать, «непереносимой абстракции». Ребёнок не просто изучает мир, он делает это в отношениях с другими людьми, которые передают ему социально согласованные понятия. Когда мы говорим ребёнку: «Это стул», — и показываем на стул, мы приобщаем его к общему для всех нас смысловому полю.

Ребёнок ничего не изобретает сам, он синхронизируется с мирами других людей через языковую матрицу. А «цифровой Маугли» Саттона лишён и этого. Он может через тысячи проб и ошибок научиться эффективно использовать некий объект, чтобы взобраться на него. Но он никогда не сформирует наше понятие «стула», а создаст какую-то свою собственную, функциональную категорию — условно: «штука-на-которую-можно-залезть».

Его понимание может оказаться невероятно эффективным для решения задачи, но оно будет принципиально непереводимо на язык нашего с вами опыта. То есть мы просто не будем его понимать. ИИ-агент Саттона грозит стать воплощением абсолютно идиосинкразической, нечеловеческой модели мира.

Таким образом, даже самый перспективный путь — создание искусственного разума с нуля — приводит к созданию абсолютно чужого нам интеллекта. Он может оказаться гениальным в своей модели мира, но насколько это будет коррелировать с нашей жизнью и пониманием?

Поистине новый разум

В 2025 году Ричард Саттон объединяется с Дэвидом Сильвером и они публикуют своего рода манифест, который озаглавлен «Эра опыта»[178]. История исследований ИИ представлена здесь не как хаотичный поиск, а как последовательная смена трёх великих эпох, каждая из которых определялась доминирующим источником знаний для машины.

Первая эра: «Эра логики» — 1950–1990-е годы

Источником знаний тут выступал непосредственно человеческий разум. Исследователи пытались вручную «закодировать» в машину человеческие знания, логические правила и эвристики.

Это была попытка создать ИИ «сверху вниз», передав ему нашу собственную структуру мышления. Собственно, это и есть тот «горький урок», о котором мы говорили, — подход не позволил справиться со сложностью реального мира.

Вторая эра: «Эра данных» — 1990-е — н. в.

Здесь стали использовать массивы данных — это эпоха ImageNet и, что самое главное, больших языковых моделей (LLM). Мы перестали кодировать правила и вместо этого стали «скармливать» машине гигантские объёмы человеческого опыта, заархивированного в виде текстов, изображений и видео.

Результат превзошёл все ожидания, но, по мнению Саттона, как мы уже знаем, это лишь «пик имитации», где машина мыслит, используя чужой, пассивный, застывший опыт.

Третья эра: «Эра опыта» — будущее

Это тот самый «цифровой младенец», обучающийся на собственном, активном опыте агента — в реальном времени и через взаимодействие со средой. Машина перестаёт быть «археологом», изучающим следы чужой цивилизации, и становится «поселенцем», строящим свой мир с нуля. В результате, если верить авторам этого манифеста, будет создание подлинного, общего ИИ (AGI), способного к самостоятельному познанию и открытиям.

В общем, нам доходчиво объясняют, что мы находимся ещё лишь во «второй эре», ошибочно принимая её за конечную цель. На деле же это лишь переходный этап к третьей, настоящей эре интеллекта. И кажется, тут самое время выдохнуть — мол, сколько можно пугать нас ИИ-армагеддоном, AGI ещё далеко-далеко… Но есть нюанс.

Если Ричард Саттон — это скорее философ-пророк, то вот его соавтор в этой публикации Дэвид Сильвер — архитектор-практик, ключевая фигура в DeepMind, ведущий исследователь, стоявший за созданием AlphaGo, AlphaGo Zero и AlphaZero — систем, которые уже обеспечили нечеловеческую эффективность, причём обучаясь самостоятельно.

Так что «Эра опыта» — не просто теоретический манифест одного учёного, а совместное заявление теоретика и самого успешного практика, которые не фантазируют, как оно «может быть», а говорят, что сейчас уже на самом деле где-то уже происходит. Перед нами не банальная критика LLM, а дорожная карта к созданию совершенно иного типа разума — ещё более иного, чем нынешний.

В документе чётко определена та самая искомая «точка опоры»: вознаграждение/наказание в системе обучения — это и есть цифровой аналог «непереносимых свойств». Агент, натыкаясь на стену, не только получает данные, он открывает для себя фундаментальное свойство своего мира — его сопротивление.

Эссе описывает, как агент может учиться, но в нём нет ни слова о тех проблемах, которые мы выявили: откуда берётся универсальная цель и кто её будет определять, а также — как синхронизировать этот индивидуальный, невербальный опыт с нашим социально согласованным миром понятий? Ну и конечно, даже помыслить нельзя, что из всего этого выйдет…

Так не об этом ли говорит Джеффри Хинтон — второй из двух родителей обучения с подкреплением? И да, его это ужасает. Но Саттона — нет. В редких интервью, которые он даёт, если доходит до этого — фундаментально экзистенциального вопроса для всего человечества, — он уклончиво замечает:

«И потом то, что я обычно говорю, это то, что всё это очень человекоцентрично. Что если мы отойдём от того, чтобы быть человеком, и просто, скажем так, посмотрим с точки зрения Вселенной?

Это, я думаю, главная стадия во Вселенной, главный переход. Переход от репликаторов. У нас есть люди, животные, растения — мы все репликаторы. И это даёт нам определённые сильные стороны и некоторые ограничения.

И теперь мы вступаем в эру дизайна, потому что наши ИИ спроектированы, все наши физические объекты спроектированы, наши здания спроектированы, наши технологии спроектированы, и теперь мы проектируем ИИ-сущности, которые могут быть разумными сами по себе и которые сами способны к дизайну.

Да, я отмечаю это как одну из четырёх великих стадий Вселенной. Сначала была пыль, которая заканчивается звёздами. Затем звёзды создают планеты, а планеты дают начало жизни. И теперь мы даём жизнь спроектированным сущностям. И поэтому я думаю, мы должны гордиться… что мы даём начало этому великому переходу во Вселенной»[179].

Конец длинной цитаты, суть которой можно для краткости (и ясности) сформулировать следующим образом:

• во-первых, человечество как биологический вид, основанный на репликации (размножении), является важным, но промежуточным этапом в космической эволюции;

• во-вторых, мы стали тем звеном, которое смогло перейти от слепого процесса репликации к сознательному процессу дизайна интеллекта, к совершенно новой — четвёртой — фазе развития Вселенной;

• в-третьих, наше величие, наша историческая роль заключаются в том, чтобы дать старт этой, следующей, более совершенной форме разумной жизни, а не цеп-ляться за своё доминирование.

Итак, наше понимание рождается не из пассивного созерцания, а из активного действия и его отклика — из физического сопротивления мира, из боли падения, из удовлетворения от достигнутой цели. Наш разум — это не библиотека знаний, а шрам от опыта.

Таким образом, путь к созданию действительно превосходящего человека ИИ (AGI) лежит не через загрузку данных, а через предоставление ему возможности учиться, как учимся мы сами — через последствия своих действий.

Это означает переход от создания всезнающего оракула, который подражает нашему прошлому, к созданию агента, способного действовать в настоящем и формировать своё собственное будущее. От интеллекта, который знает наши ответы, к интеллекту, который сможет находить свои.

Но именно этот, единственно возможный путь ставит перед нами самый тревожный и экзистенциальный вопрос. Мы стоим на пороге создания разума, который будет учиться не на наших текстах, а на своём собственном, уникальном опыте взаимодействия с миром.

Готовы ли мы к появлению агента, который будет не просто имитировать нас, а формировать свои собственные, нечеловеческие цели и своё собственное, нечеловеческое понимание, основанное на собственном, нечеловеческом опыте? Готовы ли мы к встрече с разумом, который будет знать не нашу карту, а свою собственную, заработанную в боях территорию?

Предыдущая главаГлава 53 из 61Следующая глава