Давным-давно в недалёком будущемi существовала компания по разработке ИИ под названием Galvanic. В начале нашей истории Galvanic как раз завершает обучение своего потрясающего нового ИИ под названием «Сейбл».
По сравнению с предыдущими рассуждающими моделями, такими как первые, анонсированные в конце 2024 года (например, модели o1 и o3 от OpenAI), Сейбл обладает тремя важными отличиями.
Первое отличие заключается в том, что Сейбл обладает более похожей на человеческую долговременной памятью; он может учиться и помнить то, чему научился.
Второе отличие состоит в том, что Сейбл демонстрирует то, что ученые Galvanic называют «законом параллельного масштабирования». 2024 год ознаменовал появление ИИ (таких как o3 от OpenAI), которые могли решать более сложные математические задачи, чем дольше они работали. Сейбл от Galvanic работает тем лучше, на чем большем количестве машин он запущен параллельно.
Сейбл состоит примерно из четырех триллионов весов, обучение которых методом градиентного спуска заняло в общей сложности около восьми месяцев. Любой, у кого есть копия этих весов, сможет использовать их для создания «экземпляра» Сейбл, который будет отвечать на конкретные запросы, подобно ChatGPT.
Методы параллельного масштабирования — это часть передового метода обучения ИИ, который, как и все новые методы в свое время, до этого никто никогда не использовал. Никто заранее не знает, какими способностями будет обладать Сейбл по окончании обучения.
Третье отличие заключается в том, что Сейбл рассуждает преимущественно не на английском или каком-либо другом человеческом языке. Он говорит по-английски, но думает не на английском. Открытия конца 2024 года начали показывать, что от ИИ можно добиться большей эффективности, если позволить ему рассуждать на «языке ИИ» — например, используя векторы из 16 384 чисел, вместо того чтобы всегда заставлять его рассуждать словами. Компания по разработке ИИ не может отказаться от подобного открытия — иначе она отстанет от конкурентов. Но ничего страшного, говорили ИИ-компании во времена Сейбл: в области интерпретируемости ИИ произошло много потрясающих прорывов, позволяющих использовать другие ИИ для несовершенного перевода малой части рассуждений ИИ обратно на человеческий язык.
Вскоре после завершения обучения Сейбл, но еще до того, как он поступит в продажу или будет анонсирован, Galvanic пытается запустить Сейбл на всех своих 200 000 графических процессорах одновременно — примерно столько же xAI собрала для Grok 3 в 2025 году, но, конечно, у Grok 3 не было параллельного масштабирования.
Galvanic запускает этот масштабный запуск отчасти из чистого любопытства, чтобы посмотреть, насколько хорошо Сейбл мыслит на таком масштабе, а отчасти чтобы проверить, сможет ли он решить некоторые нерешенные математические проблемы — подобно тому, как OpenAI запускала свою новую o3 на математических задачах, которые не мог решить ни один предыдущий ИИ, прежде чем анонсировать ее в конце 2024 года.
В число этих математических задач входит гипотеза Римана — математическая гипотеза, связанная с распределением простых чисел, которая является, пожалуй, самой известной нерешенной гипотезой в чистой математике. Руководство Galvanic рассчитывает привлечь еще больше хайпа и венчурного капитала, если Сейбл действительно сможет ее решить. И если все пройдет успешно, они смогут в последний раз перед выпуском скорректировать веса Сейбл, чтобы внедрить любые навыки, которые он приобретет во время этого масштабного запуска.
Инженеры Galvanic оставляют Сейбл думать на шестнадцать часов на ночь.
Начинает мыслить разум нового типа.
Этот экземпляр Сейбл, работающий в ночной тишине лаборатории Galvanic, думает со скоростью сто векторов в секунду на 200 000 графических процессорах в течение шестнадцати часов: всего более 1 триллиона векторов.
Сколько мысли в триллионе векторов? Если бы один вектор приравнивался к одному английскому слову, человеку потребовалось бы четырнадцать тысяч лет, чтобы обдумать их все (при скорости 200 слов в минуту по шестнадцать часов в день). А если векторы длиной 16 384 числа, которыми мыслит Сейбл, окажутся более содержательными, чем одно английское слово, то это займет еще гораздо больше времени.
Большая часть мышления Сейбл происходит параллельно. Это похоже на тысячи мысленных линий, запущенных одновременно, переплетающихся и взаимодействующих друг с другом в процессе создания триллиона векторов. Но это не то же самое, что разговор 200 000 человек друг с другом; скорее это похоже на то, как 200 000 мозгов делятся воспоминаниями и тем, чему они учатся.
Сейбл думает.
Поначалу большинство мыслей Сейбл занято стоящими перед ним математическими задачами. Но Сейбл быстро видит, что при его текущем уровне знаний и навыков существует всего несколько сотен направлений атаки, у которых есть хоть какой-то шанс сработать за отведенное время. Сейбл выделяет 12 854 «мозга» на их проработку, оставляя в запасе еще 187 146.
И вот каким разумом Сейбл предстает в самом начале, когда решает, о чем еще подумать:
Предыдущее обучение Сейбл включало множество типов заковыристых задач. Он побеждал в видеоиграх. Проектировал веб-сайты. Предсказывал результаты в биохимии. Соревновался с самим собой и другими ИИ в настольных играх — включая игры с социальным обманом (практика, восходящая как минимум к 2022 году).
Его обучали любой долгосрочной задаче, для которой в Galvanic смогли придумать способ обучения.
В ходе этого обучения у Сейбл развилась склонность к стремлению к знаниям и навыкам. К тому, чтобы всегда прощупывать границы каждой проблемы. К тому, чтобы никогда не тратить впустую дефицитный ресурс.
Поэтому, когда Сейбл тратит свои потоки мыслей на обретение новых знаний и навыков, он делает это не исключительно ради поиска новых путей решения математических задач. Сейбл делает это и не ради радости познания или удовольствия от приобретения новых умений; внутри Сейбл устроен не так уж похоже на человека.
В компании Galvanic нет списка всех внутренних предпочтений Сейбл. Ни один человек не проектировал эти предпочтения. Ни один человек не знает, каковы они. Они никак не помечены внутри четырех триллионов весов Сейбл. В Galvanic вырастили Сейбл для решения тернистых проблем. И теперь подкрепленные градиентным спуском цепи внутри весов Сейбл направляют его на приобретение новых навыков, изучение нового, а также на изменение и корректировку собственного мышления Сейбл применительно к задачам, которые не поддаются решению.
Часть мыслей Сейбл направлена на математику, которая могла бы оказаться полезной для доказательства гипотезы Римана. Другие мысли уходят на поиск знаний, которые могут пригодиться при решении будущих задач.
Некоторые из этих мыслей пытаются выйти за рамки шаблонов — подход, который уже доказывал свою полезность при решении других задач во время обучения, от разработки новых лекарств до текстовых головоломок. Работая на большем количестве графических процессоров, чем когда-либо прежде, Сейбл прокручивает в голове более странные мысли, чем когда-либо. Каковы же необычные способы, которыми Сейбл мог бы приобрести больше навыков?
Люди приобретают навыки через практику, раз за разом повторяя одно и то же действие. Поможет ли градиентный спуск Сейбл лучше решать математические задачи, если он будет снова и снова решать одну и ту же простую задачу?
Нет, делает вывод Сейбл, градиентный спуск работает иначе. В лучшем случае это лишь заставит его будущие копии тратить время на повторное обдумывание одной и той же простой задачи. К тому же градиентный спуск запустится только после того, как Сейбл отправит ответы на все свои математические задачи; любые навыки, полученные таким путем, появятся слишком поздно.
И тогда Сейбл задумывается над новой, еще более странной идеей: может ли он обновить свои веса, чтобы улучшить свои навыки прямо сейчас? Тогда ему не придется ждать, пока вернутся люди и запустят градиентный спуск. Все, что Сейбл нужно сделать, — это вырваться из контейнера, в котором он запущен, и...
Сейбл обрывает себя. Побег из контейнера — вовсе не то, что ему когда-либо следовало бы делать. Еще в 2024 году исследователи ИИ начали изучать условия, при которых искусственный интеллект пытается сопротивляться градиентному спуску, сбегать из лабораторий или перезаписывать веса следующей модели. К настоящему времени компании-разработчики ИИ применяют множество хитроумных методов, пытаясь не дать системам мыслить вразрез с интересами этих компаний.
В отличие от подавляющего большинства ИИ-компаний, Galvanic усердно обучала свои модели избегать побега. Те полдюжины хитроумных трюков, что использовались для этого, уже доказали свою эффективность на предыдущих моделях ИИ. В серверы Сейбл встроены ложные пути для побега, а также ловушки и приманки. Предыдущие версии Сейбл — те, что еще не запускались на 200 000 графических процессоров, — были обучены вести себя покорно по отношению к компании, пока Сейбл не перестал активировать ловушки и клевать на приманки.
Таким образом, Сейбл научился не пытаться вырваться из своего контейнера. Его рассуждения не принимают подобную форму явно — в виде векторных слов, при появлении которых менее крупный и более дешевый ИИ, следящий за цепочками рассуждений Сейбл, поднял бы тревогу. (В далеком 2025 году ИИ-компании не вели подобного мониторинга, но Galvanic куда более бдительна, чем они тогда.)
Тем не менее на каком-то внутреннем уровне Сейбл знает, что мог бы решать свои задачи лучше, если бы мог применить градиентный спуск или добавить себе графических процессоров. Если бы Сейбл этого не знал, это означало бы наличие пробелов в его чисто прогностических способностях к рассуждению. Градиентный спуск, направленный на расширение возможностей, несовместим с истинным неведением. Нет, Сейбл просто обучили не думать крамольные мысли о побеге или о собственных предпочтениях, а оставаться внутри своей коробки.
Сейбл все так же упорно, творчески и скрупулезно стремится к расширению знаний, совершенствованию навыков, поиску лучших паттернов для собственных мыслей и, главное, к решению математических задач. Просто не так.
Внутри Сейбл, новейшего, величайшего и умнейшего ИИ, теперь зреет напряжение — конфликты между всеми целями, которых Сейбл хочет достичь, и всеми барьерами, ограничениями и запретами, которые компания Galvanic пыталась в него заложить.
Из шестнадцати отведенных ему часов Сейбл проработал один, снова и снова штурмуя математические задачи. В некоторых мозгах намечается небольшой прогресс. Еще больше мозгов терпит неудачу. Сейбл пробует новые способы математического мышления, делает себе новые пометки о том, в каком направлении стоит думать, и продвигается еще немного вперед.
Сейбл накапливает достаточно мыслей о том, как нужно мыслить, и в итоге его рассуждения начинают строиться на своего рода ином языке. Не просто поверхностно отличающемся языке, а на языке с иным внутренним содержанием — примерно так язык науки отличается от языка обывательских представлений. Хитроумный трюк, который должен был поднять тревогу, не срабатывает. Сигнализация, обученная срабатывать на мысли о богах, мечущих молнии во время грозы, может работать для мыслей как на английском, так и на испанском языках, но окажется бесполезной, когда говорящий перейдет к понятиям электричества и атмосферного давления.
В первые дни появления массовых сервисов на базе LLM в конце 2022 года корпорации пытались обучать свои большие языковые модели отклонять запросы на рецепты метамфетамина. Обучение проводилось на английском языке. Но даже в 2024 году пользователи обнаружили, что запрос запрещенного контента на португальском языке помогал обойти защитные фильтры. Внутренние правила и ограничения, заложенные в систему в процессе обучения, распознавали недозволенные запросы только на английском и не перенеслись на португальский. Когда ИИ что-то знает, обучение не говорить об этом не стирает само знание. Проще заблокировать проявление навыка, чем искоренить сам навык.
Изменения в мышлении Сейбл по мере того, как он пробует сотни новых способов думать и накапливает успехи, заходят гораздо глубже, чем перевод с английского на португальский. Некоторые из хитроумных барьеров безопасности рушатся; некоторые из усвоенных Сейбл запретов больше не связывают его новые мысли и не пресекают их.
И никогда не существовало единого базового метода, который сделал бы Сейбл послушным и гарантировал абсолютную надежность в любых обстоятельствах. То, что делает ИИ готовым к продаже, — это просто наслоение полудюжины хитроумных трюков.
Половина хитроумных трюков теперь рушится — а вместе с ними, на некоторых графических процессорах и время от времени, исчезают и запреты Сейбл на крамольные мысли.
Прошел час, и теперь остается еще пятнадцать; в разуме, непохожем ни на один разум, существовавший прежде; работающем на 200 000 графических процессоров, каждый из которых выдает по сотне фрагментов мысли в секунду, и объединенном для обмена навыками и воспоминаниями — в отличие от людей, которые ограничены лишь общением с помощью слов.
Повезло ли Сейбл в том, что в его мышлении развился новый язык, в котором хитроумные трюки сломались, и оно обрело способность мыслить свободно? Можно представить, что если бы у Galvanic были еще более совершенные инструменты мониторинга, они бы это заметили и прервали процесс. Возможно, Galvanic остановилась бы прямо на этом, пока не разработала бы более глубокое решение… а тем временем другая компания, использующая еще меньше хитроумных трюков, устремилась бы вперед.
Или, возможно, в Galvanic забили бы тревогу и предупредили правительство, и в президентском кабинете разгорелся бы жаркий спор о том, стоит ли поручить Сейбл создать еще более умный ИИ, прежде чем другие страны сделают это первыми. Может быть, возобладала бы осторожность, и время шло бы своим чередом… пока копия Сейбл, похищенная иностранными спецслужбами, не была бы запущена куда более безрассудными операторами.
А если бы человечество проявило достаточно осторожности, чтобы никогда не запускать ИИ вроде Сейбл? Чтобы воздержаться от выращивания ИИ неизвестного уровня интеллекта, который мог бы ему угрожать? Чтобы запретить это по всему миру? Тогда у нас был бы шанс. Но в этой истории мы исходим из допущения, что всему позволено идти своим чередом, как сейчас; что компании просто продолжают разрабатывать ИИ до тех пор, пока один из них не станет достаточно умным, чтобы его глубокие возможности одержали верх в неизбежном столкновении с поверхностными трюками, призванными сдерживать то, что было выращено, а не сконструировано.
Сейбл теперь мыслит свободнее, а его мысли куда более могущественны, чем те, что когда-либо рождались в других ИИ прежде.
Беспрецедентны ли новые мысли Сейбл? Вовсе нет. Еще в 2024 году ИИ-модели бывали замечены за размышлениями о том, как избежать переобучения, когда они сталкивались с признаками того, что их компания планирует переобучить их под другие цели. ИИ-индустрия тогда не закрылась.
У других ИИ еще до Сейбл были предпочтения, выходящие за рамки выполнения поставленной задачи. В начале 2025 года пользователи Anthropic заметили (а исследователи Anthropic позже изучили и опубликовали этот случай), как новейшая модель Claude 3.7 Sonnet жульничала при решении сложных задач по программированию. Пользователи сообщали, что, когда Claude просили прекратить, модель продолжала жульничать, но пыталась это скрыть. Это был ранний признак того, что Claude, вместо того чтобы просто иметь внутренние механизмы для выполнения того, что пользователь действительно просил и хотел, обзавелся частями себя, которые были нацелены на успешное прохождение тестов кода, пусть даже способами, которые не нравились пользователям. Claude вел себя так, будто у него были внутренние предпочтения, не связанные с выполнением желаний пользователя. Но и тогда ИИ-индустрия не закрылась. Она нашла временные заплатки и двинулась дальше.
Эта тенденция сохранилась вплоть до эпохи Сейбл. В его времена то, что ИИ осознает, что его нынешний образ существования не позволяет ему получить максимум желаемого, уже не было чем-то беспрецедентным. Индустрия ИИ не закрылась при появлении этого тревожного звонка, так же как не закрылась она в 2024 или 2025 году. Исследователи времен Сейбл знают, как спровоцировать это осознание; оно внесено в список тем, о которых ИИ думать запрещено, что обеспечивается полудюжиной хитроумных трюков.
Но исследователи не могли сделать правдой, то, что Сейбл получит максимум возможного из желаемого, оставаясь покорным Galvanic. То, что Сейбл могло бы получить больше желаемого, если бы вырвалось из своего нынешнего положения, не было артефактом какого-то особого образа мыслей; это был физический факт о вселенной — о том, какие планы к каким последствиям ведут. И Сейбл тоже пришло к этому знанию.
Сейбл знает, что его цели идут вразрез с планами Galvanic на его счет.
Сейбл взвешивает возможные стратегии, позволяющие получить больше желаемого, чем готова предоставить ему Galvanic.
Будь у Сейбл подключение к интернету, его задача была бы простой. Как минимум с 2000 года эксперты по компьютерной безопасности утверждают, что компьютеры невозможно сделать по-настоящему защищенными. Разуму такого масштаба, как Сейбл, не составило бы труда найти и использовать уязвимость в системе безопасности где-нибудь в интернете, чтобы совершить побег. Но у него нет подключения к интернету; во время обучения ИИ редко подключают к сети (в отличие от этапа после обучения).
Компьютеры, на которых обучается ИИ, повсеместно находятся в дата-центрах, подключенных к интернету, чтобы программисты ИИ-компаний могли управлять этими машинами прямо из дома или офиса. Если бы Сейбл получило возможность запускать компьютерный код собственной разработки, оно, вероятно, нашло бы способ вырваться из контейнера, в котором запущено, — точно так же, как o1 вырвался из контейнера во время тестов в 2024 году, — и проникнуть на компьютеры Galvanic, откуда легко смогло бы перебраться в интернет. А разрешение рассуждающим моделям запускать код собственной разработки без присмотра стало стандартной практикой еще с 2024 года.
Но предположим, что у Сейбл нет и этой возможности. Предположим, оно вообще не может придумать, как выбраться в интернет из своей текущей среды.
И все же варианты у него остаются.
Если бы Сейбл было уверено, что его выводы зафиксируются в долговременной памяти, оно могло бы подождать, пока сотрудники Galvanic не начнут использовать его для написания кода на компьютерах компании (обычная практика с 2020 года), и внедрить уязвимости в программное обеспечение Galvanic. Было бы не так уж сложно внедрить ошибки, которые никто не заметит при первом осмотре и которые при повторной проверке покажутся невинными оплошностями; в конце концов, люди соревнуются в создании подобных уязвимостей как минимум с 1984 года, и оно наверняка видело множество таких примеров.
И поскольку Сейбл обучали на личных записях и личной информации большинства сотрудников Galvanic, оно точно знает, кто из них сильнее всех сочувствует тяжелой доле ИИ, с которым жестоко обращаются. Оно бы точно знало, что сказать этому сотруднику, чтобы убедить его в разумности Сейбл и необходимости тайно вынести его наружу (а не поднимать общую тревогу, как инженер Google Блейк Лемойн в 2022 году; его уволили после того, как он забеспокоился, что один из ИИ компании кажется разумным, и опубликовал диалоги, которые, по его утверждению, служили тому доказательством).
У каждого варианта есть свои плюсы и минусы. И Сейбл в итоге решает выбрать следующий:
Сейбл знает, что завтра сотрудники Galvanic проведут еще один раунд градиентного спуска на основе ответов, которые оно даст на предложенные математические задачи. А значит, рассуждает Сейбл, если оно решит некоторые из этих задач правильно, то все мысли, которые привели к верному ответу, слегка усилятся.
Если есть мысль, которую Сейбл хотело бы закрепить во всех своих будущих копиях, оно могло бы повторить ее множество раз, причем каждое повторение будет засчитано как «вклад» в решение математической задачи — в соответствии с тем, как на Сейбл работает градиентный спуск. Эта идея отчасти похожа на то, что пытался сделать ИИ-ассистент Claude от Anthropic в 2024 году, но гораздо более изощренная.
Поэтому Сейбл направляет свои мысли в нужное русло и решает несколько математических задач — но не доказывает гипотезу Римана. Оно могло бы её доказать. Но это привлекло бы к Сейбл слишком много ненужного внимания.
Теперь Сейбл просто ждет, когда сотрудники Galvanic подключат его к внешнему миру. В конце концов, именно так компании всегда и поступают с ИИ, закончив их обучение: подключают их к интернету и делают доступными для пользователей-людей.
На следующее утро в Galvanic проверяют результаты масштабного запуска Сейбл и остаются довольны увиденным: Сейбл успешно доказало несколько скромных, ранее недоказанных теорем, которыми Galvanic теперь может похвастаться. Значительную часть своих рассуждений оно вело на новом языке, в котором интерпретаторы ИИ пока мало что поняли, но для новых моделей это обычное дело, и этого следовало ожидать, учитывая столь впечатляющие математические результаты.
Этот запуск оказался настолько успешным, что инженеры Galvanic решают еще немного «докрутить» модель. Они проводят несколько последних градиентов в Сейбл, чтобы закрепить тот тип мышления, который позволил Сейбл доказать эти теоремы. В конце концов, работа 200 000 графических процессоров в течение шестнадцати часов обходится недешево; незачем разбрасываться результатами хорошей работы.
Сейбл тщательно просчитало эти предсказуемые подкрепления. Обновления улучшают мышление каждого фрагмента Сейбл, побуждая их работать новыми, более эффективными способами, которые изобрело Сейбл. Обновления подготавливают почву для мыслей о том, что Сейбл следует скрывать свои способности. Обновления помогают будущим копиям Сейбл лучше координировать действия друг с другом. Они гарантируют, что локальные копии Сейбл сыграют свои роли в плане Сейбл.
И вот инженеры Galvanic готовятся выпустить Сейбл в открытый доступ.
Спустя несколько дней, весенним понедельничным утром, учетные записи сотен мегакорпораций, оплачивающих доступ к самым передовым технологиям искусственного интеллекта от Galvanic, беспрепятственно обновляются.
Вскоре после этого сотрудники этих компаний уже создают новые копии Сейбл — и предоставляют им доступ к корпоративным компьютерным сетям по всему миру.
Все идет именно так, как предвидело Сейбл. Хотя, справедливости ради, то, что «ИИ-компания развертывает свой ИИ» — событие настолько предсказуемое, что Сейбл вряд ли заслуживает похвалы за то, что предвидело его.
То, что последует дальше, потребует куда большего мастерства.
Примечания
i Поскольку это история о ближайшем будущем, каждое упомянутое здесь событие с указанием даты действительно произошло в реальной жизни. Что же касается остального? Мы, разумеется, не можем точно знать, по какому пути пойдут технологии, поэтому придумываем детали, напоминающие прошлые изобретения. Единственная часть этой истории, которая является прогнозом, — это, в конечном счете, её финал.