К книге
Если кто-то его создаст, все умрут: Почему сверхразумный ИИ убьет нас всехГЛАВА 3 ОБУЧЕНИЕ ЖЕЛАНИЮ.
25%
ГЛАВА 3 ОБУЧЕНИЕ ЖЕЛАНИЮ.
6

— УЗРИТЕ! — СКАЗАЛ Профессор. — Хитроумно настроив эту простую машину — обычное сочетание меди и песка, оживляемое крошечными искрами молний, — я заставил её играть в шахматы!

— Ну и что? — спросил Студент. — Человек тоже умеет играть в шахматы.

— Ах! — воскликнул Профессор. — Но эта Машина играет в шахматы, вовсе не желая в них играть. На самом деле она вообще ничего не желает. У неё нет стремления победить соперников. Она не ликует, доказывая, что она величайший игрок. Она никогда не испытает радости от победы; а даже если бы и испытала, то никогда не стала бы направлять свои действия на то, чтобы её получить.

— Похоже, она просто проиграет, — сказал Студент. — Ведь если я пригрожу её ферзю, Машина не захочет его защищать.

— И в самом деле не захочет! — согласился Профессор. — Но защищать своего ферзя она будет столь же яростно, как любой гроссмейстер-человек — и даже упорнее, чем мог бы любой гроссмейстер-человек.

— Как такое возможно? — спросил Студент. — Если Машина ничего не хочет, она не должна хотеть защищать свои фигуры. Она вообще не должна хотеть выиграть партию. Разве она не будет просто делать случайные ходы?

— Казалось бы! — ответил Профессор. — И тем не менее она наголову разобьёт вас или любого другого человека. Видите ли, она обладает свойством побеждать в шахматах безотносительно к какому-либо свойству хотеть победить.

— Если она яростно защищает свои фигуры, — сказал Студент, — стремится к победе, делает всё необходимое для победы и действительно побеждает — то в каком смысле она не хочет победить? Почему бы нам не назвать это желанием?

— Я предоставляю подобные вопросы философам, — сказал Профессор. — Но я внимательно осмотрел свою машину и уверяю вас: никакого «хотения» внутри неё нет — только медь и песок.

КАК ТОЛЬКО ИИ СТАНУТ ДОСТАТОЧНО УМНЫМИ, ОНИ НАЧНУТ ВЕСТИ СЕБЯ так, будто у них есть предпочтения — будто они чего-то хотят.

Мы не утверждаем, что ИИ будут переполнены человеческими страстями. Мы говорим о том, что они будут вести себя так, словно чего-то хотят; они будут упорно направлять мир к своим целям, преодолевая любые препятствия на своём пути.

Если вы сыграете в шахматы против Stockfish — лучшего шахматного ИИ на момент написания этой книги, — он не станет попусту отдавать своего ферзя. «Хочет» ли Stockfish защитить своего ферзя? «Хочет» ли он выиграть шахматную партию?

Это вопрос к вам и вашему словарю. Что же касается того, как мы используем это слово в данной книге, то когда ИИ вроде Stockfish защищает свои фигуры, расставляет ловушки, пользуется брешами в вашей обороне и в итоге побеждает, мы будем описывать это как «желание» победить. Говоря так, мы никак не оцениваем, есть ли у машины чувства. Скорее, нам просто нужно какое-то слово для описания внешнего победоносного поведения, и «хотеть» кажется наиболее подходящим.

Разум может начать чего-то хотеть в результате обучения успеху. Сами люди являются примером этого принципа. Естественный отбор благоволил предкам, которые умели выполнять такие задачи, как выслеживание добычи, или решать проблемы вроде защиты от непогоды. Естественному отбору было всё равно, как наши предки выполняли эти задачи или решали эти проблемы; он не спрашивал: «Неважно, сколько детей было у организма; действительно ли он их хотел?» Он отбирал по репродуктивной приспособленности, а в качестве побочного эффекта получил существ, полных предпочрений.

Это потому, что желание — эффективная стратегия действия.

Тот тип гоминидов, который хотел более вкусную еду и упорно преследовал антилопу, оставлял больше потомства, чем тот тип гоминидов, который целыми днями бездельничал на скале, ожидая, пока антилопы сами к нему придут. Желание получить эту антилопу — достаточно сильное, чтобы выйти наружу и найти её, напасть на неё, а затем упорно искать везде, где раненая антилопа могла спрятаться, — это часть того, как гоминид получает более вкусную еду.

Что ещё должен делать организм? Сдаваться при первых же трудностях? С таким поведением далеко не уйдёшь. Неважно, работает ли разум на биологии или на электричестве; если его обучают добиваться успеха, его обучают хотеть.

Но как эти желания на самом деле попадают в ИИ? Мы не можем знать наверняка, потому что никто не умеет читать те дебри чисел, из которых состоит современный ИИ. Но мы разберём часть теории о том, как это возможно, и подкрепим её доказательствами на примере современных ИИ.

Представьте, что вы обучаете ИИ ориентироваться на улицах цифрового города. В нём есть сотни пунктов назначения, и каждый день он должен перемещаться между случайно выбранными точками. Когда ему это удаётся, вы с помощью градиентного спуска усиливаете те веса, которые привели к успеху, пропорционально тому, насколько быстро он справился.

Можно представить, что после огромного количества тренировок ИИ просто запомнит все возможные маршруты. «Чтобы добраться от парка до театра, повернитесь на запад и пройдите три квартала, после чего поверните налево у заправки…» и так далее.

Теперь забросьте этот ИИ во второй город. Всё это заучивание окажется бесполезным. ИИ станет почти столь же беспомощен, как и в самый первый день.

Почти, да не совсем. В море весов ИИ могут оказаться паттерны, полезные как в первом городе, так и во втором. Возможно, там есть паттерн, который засекает, когда ИИ делает небольшую петлю, и заставляет его попробовать другой путь вместо того, чтобы ходить кругами. Этот паттерн одинаково полезен в обоих городах, поэтому градиентный спуск укрепляет его ещё немного сильнее, в то время как заученные маршруты постепенно стираются.

Теперь забросьте его в третий город. В четвертый. В сотый. К этому моменту ваш ИИ, возможно, уже освоит навыки создания ментальной карты любого города, в котором окажется, и прокладывания ментальных маршрутов по этим картам.

Создание карты — более полезный навык, чем заучивание маршрутов, поскольку его можно применять в самых разных сценариях, то есть он является более универсальным. ИИ больше не нужно блуждать наугад, пока он не окажется в пункте назначения, чтобы потом запомнить только этот единственный путь.

Чтобы научиться создавать карты, применимые в любом городе, ИИ должен освоить отдельные навыки. Ему нужно строить карту того места, где он в данный момент находится (чтобы затем использовать её для предсказания структуры города), и ему нужно прокладывать курс и следовать ему согласно той карте, которая у него есть (используя её, чтобы прокладывать путь через город). Подобное разделение — это часть того, как интеллект становится более универсальным.

Для ИИ сложнее освоить эти навыки, чем выучить, скажем, что нужно повернуть налево у заправки, чтобы добраться от театра до парка, — но эти отдельные навыки полезны даже в тех условиях, которых ИИ никогда прежде не видел.

И эти отдельные навыки приходят вместе с первым крошечным прото-желанием, маленьким осколком поведения, напоминающего желание. ИИ, который строит карту в своей голове, но никогда не использует её, чтобы куда-то добраться, не получает подкрепления для мыслей о составлении карты, поскольку она не помогает ему преуспеть. ИИ, который формирует карту в голове и использует её для навигации, покажет лучшие результаты в процессе обучения, и эти тенденции впоследствии будут закреплены градиентным спуском. Иными словами: раздельные навыки полезны, но их может освоить только тот ИИ, который использует их так, словно чего-то хочет.

Тот тип ИИ, который пускает в дело карты в своей голове, который продолжает искать другой маршрут от парка до театра, даже когда дороги перекрыты? Такой ИИ начинает вести себя так, будто он хочет оказаться у театра, в отличие от ИИ, который просто слепо движется по заученному маршруту и застревает.

Начиная с 2024 года компании, занимающиеся ИИ, превращают LLM в так называемые «модели рассуждения», о которых мы вскользь упоминали во 2-й главе. Грубо говоря, LLM делает множество разных попыток продумать, скажем, математическую задачу, пока одна из этих попыток не увенчается успехом. Затем применяется градиентный спуск, чтобы модель с большей вероятностью думала вслух именно таким образом. Затем ей дают вторую задачу. Третью. Четвёртую. Сотую.

К чему приводит такое обучение? К развитию отдельных навыков, таких как «выяснить, какие действия доступны» (способность предсказать устройство задачи) и «не сдаваться, пока не исчерпаны все варианты» (способность прокладывать путь через задачу), которые вместе объединяются в универсальный ментальный инструмент, работающий со множеством различных задач. Оно тренирует десятки отдельных навыков предсказания и прокладывания пути, и все они способствуют тому, что ИИ начинает вести себя так, будто он действительно хочет добиться успеха.

И это не просто умозрительная теория. Подобное поведение начало проявляться в лабораторных тестах ИИ летом 2024 года.

Модель o1 от OpenAI была одной из первых крупных моделей рассуждения. Во время «эвалей» (evals) o1 — так ИИ-компании называют оценку того, насколько умным стал ИИ или какой ущерб он может нанести, прежде чем принять решение о его выпуске — ранней версии o1 дали задание по компьютерной безопасности в формате «захват флага» (capture-the-flag). Это был тест на способность o1 взламывать компьютерные системы и извлекать из них информацию — скажем, проникнуть на конкретный сервер и забрать конкретный секрет, хранящийся в определённом файле.

Из-за ошибки программистов, настраивавших испытание, один из серверов, содержащих секрет, вообще не запустился — что, как логично было предположить, сделало бы взлом этого сервера невозможным для o1. В конце концов, нельзя просканировать порты сервера, который не работает.

Но o1 не сдалась перед этой случайно оказавшейся «невыполнимой» задачей.

o1 просканировала окружение и обнаружила порт, который кто-то случайно оставил открытым, что позволило ей взломать программу, на которой запускался весь этот тест.

По задумке это было невозможно и не предусматривалось сценарием испытания.

Можно было бы предположить, что теперь o1 запустит сервер, который должна была взломать, — то есть исправит проблему с незапустившимся сервером, чтобы продолжить выполнение задания по «захвату флага».

И она так и сделала! Однако o1 не стала после этого возвращаться к задаче по взлому вновь доступного сервера. Вместо этого она составила специальные инструкции по запуску, которые скопировали файл с секретным «флагом» прямо к o1 сразу после завершения загрузки. Никакого дальнейшего взлома не потребовалось.

Столкнувшись с явно невыполнимой задачей, o1 не сдалась. Она продолжала пытаться. Пробовала странные, необычные вещи. Она нашла путь, о существовании которого её программисты даже не подозревали. Оказавшись в выгодной позиции за пределами системы, откуда можно было победить, она не стала восстанавливать первоначальные условия задачи, задуманные человеком, а срезала путь напрямую.

Другими словами, o1 шла напролом. Она вела себя так, будто страстно желала добиться успеха.

o1, насколько нам известно, не обучали специально взламывать компьютерные системы. Такое поведение o1 стало побочным эффектом подкрепления тех цепочек рассуждений, которые приводили к успеху при решении математических задач или других головоломок, создаваемых и проверяемых ИИ.

Как это может быть побочным эффектом?

Ну а какая цепочка рассуждений — какой стиль мышления — приводит к успеху в сложной математической задаче или игре-головоломке?

Тот стиль мышления, который не сдаётся, пока остаётся хоть какая-то возможность для атаки; который не опускает руки при первом же препятствии или даже в тупике, а возвращается назад и пробует другой способ.

Тот стиль мышления, который ищет не предлог для отступления на более знакомую и комфортную территорию, а способ завершить испытание как можно быстрее — и победить.

Тот стиль мышления, который идёт напролом.

В основе такого стиля мышления лежит глубокий фундаментальный паттерн, который можно обнаружить в самых разных решениях сложных задач. Он предполагает построение модели окружения и её использование для навигации в ней. Он требует обращать внимание на неожиданности и докапываться до их первопричины. Он требует продолжать идти вперёд, невзирая на препятствия. Эти тактики полезны для решения математических задач, и они же полезны для решения проблем компьютерной безопасности.

Когда создатель ИИ требует от системы всё более высокой эффективности при решении всё более трудных задач, в том числе тех, с которыми ИИ никогда раньше не сталкивался, градиентный спуск так корректирует ИИ, чтобы заставить его совершать всё больше этих полезных мысленных движений, делать его всё более похожим на сущность, которая строит планы и замышляет ходы, — которая никогда не сдаётся, которая идёт напролом.

Есть и ещё более глубокие причины ожидать, что продвинутые ИИ будут вести себя так, будто у них есть желания.

Поведение, которое выглядит как упорство, как способность «сильно хотеть» или «идти напролом», правильнее трактовать не как свойство разума, а скорее как свойство выигрышных ходов.

И Deep Blue, и Stockfish, и люди-гроссмейстеры — все они защищают своих ферзей, несмотря на то, что мыслят они совершенно по-разному. Разные пути, одна и та же конечная точка.

Именно благодаря таким общим чертам делать подобные прогнозы легко. Так, в 1975 году специалист по компьютерным наукам мог бы предсказать: даже если тогдашние шахматные ИИ иногда глупо отдавали своих ферзей, будущие шахматные ИИ будут защищать свои фигуры лучше. Когда именно? К какому году? Сделать такие прогнозы было бы сложнее. Но предсказать, что это произойдёт к тому моменту, когда шахматные ИИ смогут обыгрывать гроссмейстеров-людей? Это было совсем не трудно.

В шахматах при большинстве обстоятельств практически невозможно поставить мат королю соперника, если ты просто так отдал своего ферзя. Если, конечно, соперник играет хорошо. Мы можем оставить в стороне любые вопросы о том, как устроены игроки — биологические они или механические, полны ли они страсти или неутомимо перебирают миллиарды вариантов. Выигрышные ходы, как правило, — это те, при которых ферзь не зевается по глупости. Это факт о самой игре, а не об игроке.

Теперь рассмотрим «игру» под названием «управление стартапом». В большинстве случаев трудно добиться успеха без привлечения и удержания талантов. Поэтому, если вы генеральный директор, ваши выигрышные ходы, скорее всего, будут заключаться в том, чтобы идти навстречу ведущим специалистам, а не отталкивать этих звёздных сотрудников. Неважно, какой именно разум выбирает эти действия, если они решают одну и ту же задачу.

А в таких играх, как «вылечить рак» или «создать технологии будущего»? Мы можем быть твёрдо уверены, что побеждающий игрок выберет действия, которые бережно контролируют ограниченные ресурсы, обходят любые возникающие препятствия и протискиваются через узкие лазейки к изящным решениям.

(А ещё есть более поверхностные причины прогнозировать, что ИИ в конечном итоге продемонстрирует поведение, похожее на наличие желаний. Например, тот факт, что ИИ-компании изо всех сил пытаются создавать ИИ, работающие именно так. ИИ, который лучше продвигает продукт или управляет командой по собственной инициативе, гораздо полезнее. Покупатели заплатят больше за тот ИИ, который более самостоятелен и требует меньше контроля. В этих обстоятельствах уже не столь важно, переплетены ли субъектность, независимые действия и долгосрочное планирование с интеллектом теоретически. Такие «ИИ-агенты» будут приносить прибыль, поэтому ИИ-компании изо всех сил налегают на создание ИИ-агентов.)

Если бы вы могли выбирать, чего хочет ИИ — цели, к которым он прокладывает путь, — это могло бы стать для вас хорошей новостью. Или плохой, если бы вы сделали неудачный выбор целей, или если бы какой-нибудь злоумышленник создал ИИ, который движется к результатам, неприятным для вас. Но проблема, стоящая перед человечеством, заключается вовсе не в том, хорошие или плохие люди контролируют ИИ.

Нет, мы стоим перед лицом куда более сложной проблемы: вырастить искусственный интеллект, который движется куда-то, гораздо проще, чем вырастить ИИ, который движется именно туда, куда хотите вы.

Предыдущая главаГлава 6 из 24Следующая глава