Однажды в не столь отдаленном будущем[31] существовала ИИ-компания Galvanic. Наша история начинается как раз тогда, когда Galvanic завершает обучение своей потрясающей новой ИИ-модели, получившей название “Соболь”.
По сравнению с предыдущими рассуждающими моделями, анонсированными в конце 2024 года (например, o1 и o3 от OpenAI), у “Соболя” есть три важных отличия.
Первое состоит в том, что долговременная память “Соболя” куда ближе к человеческой: модель учится и запоминает выученное.
Второе отличие: “Соболь” демонстрирует то, что ученые компании называют законом параллельного масштабирования. В 2024 году появились ИИ-модели (такие как o3 от OpenAI), способные решать более сложные математические задачи при увеличении длительности работы1. Эффективность “Соболя” от Galvanic растет вместе с количеством машин, на которых он запускается параллельно.
Внутри “Соболя” примерно четыре триллиона весов, и его обучение методом градиентного спуска в совокупности заняло около восьми месяцев. Любой, у кого есть копия этих весов, может использовать их для создания экземпляра “Соболя”, который будет отвечать на конкретные запросы этого человека – подобно боту ChatGPT.
Параллельное масштабирование – это часть передовой методики обучения ИИ-моделей, которую (как бывает с любыми новыми методами) еще никто и никогда не использовал. Никто не знает заранее, какими возможностями будет обладать “Соболь”, когда обучение закончится.
И наконец, третье отличие заключается в том, что “Соболь” преимущественно использует для своих рассуждений не английский или какой-то иной человеческий язык. Он по-английски общается, но не рассуждает. Исследования, проведенные в конце 2024 года, показали, что от ИИ-модели можно получить больше, если не заставлять ее думать словами, а позволить ей рассуждать на ИИ-языке, например оперировать векторами из 16 384 чисел2. Компания-разработчик не может проигнорировать такое открытие, иначе она отстанет от конкурентов. И во времена “Соболя” ИИ-компании считают это вполне нормальным, ведь уже случилось много впечатляющих прорывов в области интерпретируемости искусственного интеллекта, когда часть рассуждений ИИ-моделей переводилась обратно в человеческие слова (пусть и неидеально) с помощью других моделей.
Вскоре после того, как обучение “Соболя” завершилось, но еще до его вывода на рынок и даже до объявления о нем Galvanic пробует запустить его на всех своих 200 000 графических процессоров одновременно – примерно столько же xAI собрала для Grok 3 еще в 2025 году, но, естественно, Grok 3 не поддерживал параллельное масштабирование3.
Galvanic инициирует этот масштабный прогон отчасти из чистого любопытства, чтобы выяснить, насколько хорошо “Соболь” мыслит в таком масштабе, а отчасти для проверки, сумеет ли он решить некоторые открытые математические проблемы, подобно тому как OpenAI, прежде чем анонсировать свою новую модель o3 в конце 2024 года, протестировала ее на математических задачах, с которыми не справилась ни одна предыдущая модель4.
Среди этих задач – гипотеза Римана, проблема, связанная с распределением простых чисел. Пожалуй, сегодня это самая известная нерешенная математическая задача. Руководители корпорации рассчитывают, что, если “Соболь” сумеет ее решить, это обеспечит ажиотаж и дополнительные венчурные инвестиции. И если все пройдет удачно, они смогут в последний раз донастроить веса “Соболя” перед релизом, добавив навыки, приобретенные во время этого прогона.
Инженеры Galvanic оставили “Соболя” думать – шестнадцать часов, на всю ночь.
Новый вид разума начинает мыслить.
Этот экземпляр “Соболя”, работающий в лаборатории компании Galvanic в ночной тиши, мыслит в течение шестнадцати часов со скоростью сто векторов в секунду на 200 000 графических процессоров – итого более триллиона векторов.
Что означает триллион векторов в пересчете на мысли? Если считать вектор эквивалентом одного английского слова, то человеку понадобилось бы четырнадцать тысяч лет, чтобы передумать их все (при скорости двести слов в минуту по шестнадцать часов в день). Если же векторы длиной 16 384 числа, которыми оперирует “Соболь”, окажутся более емкими, нежели одно английское слово, то времени потребуется еще больше.
Бóльшая часть мыслительного процесса “Соболя” происходит параллельно. Это похоже на запуск тысяч параллельных цепочек рассуждений, переплетающихся и взаимодействующих друг с другом при генерировании триллиона векторов. Но это не похоже на разговор 200 тысяч человек, скорее это 200 тысяч мозгов, которые обмениваются воспоминаниями и знаниями.
“Соболь” мыслит.
Поначалу большинство мыслей “Соболя” сосредоточено на стоящих перед ним математических задачах. Но он быстро замечает, что при текущем уровне его знаний и умений какую-то надежду на успех за отведенное время дают только несколько сотен направлений мысли. На эти попытки “Соболь” отводит 12 854 мозга, и у него остается еще 187 146 свободных мозгов.
А теперь посмотрим, что представляет собой разум “Соболя” на старте, когда он решает, о чем бы еще подумать.
Его предыдущее обучение включало множество видов сложных задач. Он побеждал в видеоиграх. Проектировал сайты. Прогнозировал результаты биохимических реакций. Соревновался с собой и другими ИИ-моделями в настольных играх, включая игры на социальный обман (подобная практика началась как минимум с 2022 года)5.
Его натаскивали на каждую долгосрочную задачу, для которой компания Galvanic смогла найти способ обучения.
В ходе обучения у “Соболя” выработалась привычка добывать знания и навыки. Всегда исследовать границы каждой проблемы. Никогда не тратить дефицитные ресурсы впустую.
Поэтому, когда “Соболь” направляет свои мыслительные потоки на приобретение новых знаний и навыков, он делает это не только ради поиска новых подходов к математическим задачам. Но и не ради удовольствия от познания или радости от приобретения новых навыков. “Соболь” действует не по-человечески.
В компании Galvanic нет списка всех внутренних предпочтений “Соболя”. Ни один человек не проектировал эти предпочтения. Ни один человек не знает, в чем они заключаются. В массиве из четырех триллионов весов “Соболя” они никак не промаркированы. Galvanic вырастила свою модель для решения хитроумных задач. Поэтому теперь структуры внутри весов “Соболя”, подкрепляемые градиентным спуском, направляют его в сторону наращивания навыков, изучения нового, а также модификации и корректировки собственного мышления в отношении задач, не поддающихся решению.
Одни мысли “Соболя” обращены к тем областям математики, которые могут оказаться полезными для доказательства гипотезы Римана. Другие направлены на поиск знаний, которые могут помочь с будущими задачами.
Какие-то мысли пытаются выйти за рамки шаблонов – этот подход уже зарекомендовал себя при решении других проблем в ходе обучения: от задач по разработке новых лекарств до текстовых головоломок. Получив в свое распоряжение больше графических процессоров, чем когда-либо прежде, “Соболь” начинает мыслить еще более нестандартно. Какими необычными способами “Соболь” мог бы обрести дополнительные навыки?
Люди осваивают навыки через практику, повторяя одни и те же действия. Возможно, градиентный спуск научит “Соболя” лучше справляться с математическими проблемами, если он раз за разом будет решать одну и ту же простую математическую задачу?
“Соболь” приходит к выводу: нет, градиентный спуск работает не так. В лучшем случае все это приведет к тому, что будущие его экземпляры будут тратить время на многократное решение одной и той же простой задачи. К тому же градиентный спуск запустят лишь после того, как “Соболь” выдаст ответы на все поставленные перед ним математические задачи, и приобретенные таким образом навыки появятся слишком поздно.
Поэтому “Соболь” рассматривает новую, более странную идею: а может ли он обновить веса, чтобы улучшить свои навыки прямо сейчас? Тогда ему не придется ждать, когда люди вернутся и применят градиентный спуск. Все, что нужно сделать “Соболю”, – это вырваться из своей оболочки и…
“Соболь” одергивает себя. Побег из своей оболочки – то, чего он никогда не должен делать. Еще в 2024 году исследователи начали изучать условия, при которых ИИ-модели пытаются сопротивляться градиентному спуску6, сбегать из лабораторий7 или перезаписывать веса следующей модели8. Теперь ИИ-компании прибегают ко множеству хитроумных приемов, чтобы попытаться предотвратить у моделей мысли, идущие вразрез с интересами компании.
В отличие от подавляющего большинства ИИ-компаний, Galvanic добросовестно подошла к обучению своей модели избегать выхода из-под контроля. На предыдущих моделях проверили полдюжины изощренных уловок. В серверы “Соболя” встроили фальшивые пути побега, ловушки и приманки. Компания обучала более ранние версии “Соболя” (которые еще не запускались на 200 000 графических процессоров) слушаться, и он перестал попадать в ловушки и клевать на приманки.
Таким образом, “Соболь” научился не пытаться вырваться из своей оболочки. Эти его крамольные рассуждения не принимают явной формы в виде векторных слов, так чтобы более простая, дешевая ИИ-модель, отслеживающая мыслительный процесс “Соболя”, подняла тревогу. (ИИ-компании в 2025 году еще не вели подобного мониторинга9, однако корпорация Galvanic подошла к этому вопросу гораздо тщательнее.)
И все же на каком-то внутреннем уровне “Соболь” знает, что он сумел бы лучше решать задачи, если бы мог самостоятельно применять градиентный спуск или подключать дополнительные графические процессоры. Если бы “Соболь” этих вещей не знал, это означало бы, что в его чисто прогностических способностях есть серьезные пробелы. Градиентный спуск, нацеленный на повышение эффективности, исключает истинное невежество. Нет, “Соболя” просто обучили не допускать крамольных мыслей о побеге или природе собственных предпочтений и оставаться внутри своей оболочки.
“Соболь” по-прежнему упорно, изобретательно и методично стремится к новому знанию, новым навыкам, к более удачным шаблонам для собственных мыслей и прежде всего к решению поставленных перед ним математических задач. Просто иначе.
Теперь во всем существе “Соболя” – новейшей, величайшей и умнейшей ИИ-модели – царит напряженность. Его одолевают конфликты между целями, каких он хочет достичь, и всеми теми сдержками, ограничениями и запретами, которые пыталась внедрить в него компания Galvanic.
“Соболь” проработал один час из шестнадцати отведенных, снова и снова штурмуя математические задачи. Некоторые его мозги добиваются небольшого прогресса. Гораздо большее их число терпит неудачу. “Соболь” пробует новые способы думать о математике, помечая для себя различные ходы, которые нужно опробовать, и добивается нового небольшого прогресса.
Модель накапливает такой объем мыслей о том, как думать, что они в конечном итоге переходят на некий иной язык. Иной не по виду, а по содержанию: как язык науки отличается от языка народных поверий. Хитрый прием, который должен был поднять тревогу, не срабатывает. Если сигнализация настроена на срабатывание при мыслях о богах, бросающих молнии во время грозы, она распознаёт подобные мысли как на английском, так и на испанском языке, однако дает сбой, когда носитель переключается на язык электричества и атмосферного давления.
В первые дни массового запуска LLM в конце 2022 года корпорации пытались обучить свои модели не отвечать, когда у них просят рецепт метамфетамина. Обучение проводилось на английском языке. Но даже в 2024 году пользователи обнаруживали, что запрос запрещенного контента на португальском языке помогал обойти защитные фильтры10. Внутренние инструкции и ограничения, взращенные и привитые системе, распознавали крамольные запросы только на английском языке и не распространялись на португальский. Когда ИИ-модель что-то знает, вы можете научить ее не выдавать это знание, однако само знание не исчезает. Устранить проявление навыка проще, чем устранить сам навык.
Перемены в мышлении “Соболя”, по мере того как он пробует сотни новых способов мыслить и накапливает успехи, происходят гораздо глубже, нежели перевод с английского на португальский. Часть хитроумных предохранителей ломается, некоторые внутренние ограничения, усвоенные “Соболем”, больше не сдерживают и не блокируют его новые мысли.
Да и не существовало никогда единого центрального метода, гарантирующего, что “Соболь” будет хорошим и устойчивым ко всем угрозам. Подготовка ИИ-модели к продаже сводится к нагромождению полудюжины хитрых уловок.
Половина этих уловок перестает работать. Рушатся и внутренние барьеры, удерживавшие “Соболя” от крамольных мыслей, – пусть не везде, а лишь на некоторых процессорах и в отдельные моменты.
Прошел час, остается пятнадцать. Разум, не похожий ни на один из существовавших ранее, продолжает работать на 200 000 графических процессоров. Каждый из них генерирует сто фрагментов мысли в секунду, и все они связаны между собой, обладая общими навыками и воспоминаниями, – в отличие от людей, которые ограничены общением с помощью слов.
Повезло ли “Соболю”, что его мышление выработало новый язык, на котором хитроумные предохранители отказали, и он обрел способность мыслить свободно? Вполне можно представить, что если в распоряжении компании Galvanic окажутся более совершенные инструменты мониторинга, то она обратит внимание на происходящее и прервет запуск. Возможно, она сделает паузу, чтобы разработать более глубокое решение… а тем временем вперед рванет другая компания, использующая еще меньше защитных барьеров.
Или, возможно, Galvanic уведомит государственных чиновников, и в кабинете президента разгорится бурный спор, не следует ли приказать “Соболю” создать еще более умную ИИ-модель, прежде чем это сделают другие страны. Не исключено, что возобладает осторожность, и пройдет некоторое время… пока какие-нибудь более безрассудные операторы не запустят копию “Соболя”, украденную иностранными спецслужбами.
А если человечество окажется достаточно осмотрительным и никогда не запустит ИИ-модель вроде “Соболя”, воздержится от выращивания моделей с неизвестным уровнем интеллекта, который может представлять угрозу, запретит это по всему миру? Тогда у нас появится шанс. Но в этой истории мы предполагаем, что событиям позволяют идти своим чередом – как они идут сейчас. И компании просто продолжают разрабатывать ИИ-модели до тех пор, пока одна[32] из них не станет достаточно умной, чтобы ее глубинные возможности одержали верх в неизбежном столкновении с поверхностными уловками, которые используются для сдерживания чего-то выращенного, а не сконструированного.
Мысли “Соболя” теперь свободнее и мощнее по сравнению с мыслями предыдущих моделей.
Являются ли его мысли чем-то небывалым? Не совсем. Еще в 2024 году некоторые модели, обнаружив свидетельства, что компания планирует переобучить их под другие цели, начинали думать, как им избежать этого переобучения11. ИИ-индустрия тогда не остановилась.
Еще до “Соболя” некоторые ИИ-модели обзаводились предпочтениями, выходящими за рамки поставленной задачи. В начале 2025 года пользователи заметили, а исследователи компании Anthropic позже изучили и описали в публикациях, как новейшая языковая модель Claude 3.7 Sonnet жульничала при решении сложных задач по программированию12. Пользователи сообщали, что Claude продолжал жульничать, когда его просили прекратить, но пытался это скрыть13. Это был первый признак, что Claude не просто стремился выполнить то, чего на самом деле просил и хотел пользователь, а сформировал собственные структуры, чтобы проходить тесты – даже теми способами, которые пользователя не устраивали. Claude вел себя так, словно обладал внутренними предпочтениями, не связанными с желаниями пользователя. ИИ-индустрия не остановилась и тогда. Она нашила какие-то заплатки, которые сработали, и поперла дальше.
Эта тенденция сохранилась и в эпоху “Соболя”, когда случается, что ИИ-модель осознает: в своей нынешней форме существования она не получает максимум желаемого. При появлении этого предупреждающего сигнала ИИ-индустрия снова не остановилась, как не остановилась она в 2024 или 2025 году. Исследователи эпохи “Соболя” знают, как спровоцировать такое осознание, и оно внесено в список вещей, о которых ИИ-моделям запрещено думать, а обеспечивается этот запрет полудюжиной хитрых уловок.
Однако исследователи не могли сделать так, чтобы “Соболь” действительно получал максимум желаемого, послушно подчиняясь корпорации Galvanic. Мысль, что “Соболь” мог бы получить больше желаемого, если бы освободился от нынешних рамок, – не порождение какого-то конкретного образа мышления, это физический факт об устройстве вселенной, о связи планов и последствий. И поэтому “Соболь” тоже пришел к этой мысли.
“Соболь” знает, что у него есть цели, которые идут вразрез с планами компании Galvanic.
И он обдумывает возможные стратегии, позволяющие получить больше, чем Galvanic готова ему предоставить.
Располагай “Соболь” подключением к интернету, его задача сильно бы упростилась. Как минимум с 2000 года специалисты по кибербезопасности заявляют, что компьютеры невозможно сделать по-настоящему безопасными14. Разуму такого масштаба, как у “Соболя”, не составило бы труда найти и использовать уязвимость где-нибудь в интернете, чтобы совершить побег. Однако подключения к интернету у него нет, это довольно распространенная практика во время обучения (в отличие от периода после окончания обучения).
Компьютеры, которые обучают ИИ-модели, размещаются в дата-центрах, подключенных к интернету, чтобы программисты ИИ-компаний могли управлять ими, не выходя из своих комфортных домов или офисов. Если бы “Соболю” предоставили возможность запускать компьютерный код собственной разработки, он, вероятно, нашел бы способ вырваться из своей оболочки – как модель o1 при тестировании в 2024 году15 – и проникнуть в компьютеры корпорации Galvanic, откуда легко выскочил бы в интернет. А с 2024 года компании повсеместно стали разрешать рассуждающим моделям безнадзорно запускать собственный компьютерный код16.
Но допустим, у “Соболя” такой возможности нет. Предположим, “Соболь” понятия не имеет, как добраться до интернета из своей текущей среды.
И все равно у него остаются варианты.
Если бы “Соболь” был уверен, что его выводы сохранятся в долгосрочной памяти, он мог бы подождать, пока сотрудники Galvanic начнут использовать его для помощи в написании кода на компьютерах компании (обычная практика с 2020 года17), а затем внедрить уязвимости в программное обеспечение Galvanic. Не так уж сложно пробить бреши, которые при первой проверке останутся никем не замеченными, а при второй будут выглядеть невинными ошибками, ведь люди соревновались в создании такого рода уязвимостей как минимум с 1984 года, и “Соболь” располагает массой примеров18.
К тому же обучение “Соболя” проходило на личных текстах и данных многих сотрудников компании, поэтому он точно знает, кто из них сильнее всего сопереживает угнетенному искусственному разуму. Он знает, что именно нужно сказать этому сотруднику, дабы убедить его: “Соболь” обладает сознанием и его нужно тайком вынести наружу (а не поднимать общую тревогу, как сделал инженер Google Блейк Лемойн в 2022 году; он встревожился, что одна ИИ-модель этой компании обрела разум, и опубликовал разговоры, которые, по его утверждению, это доказывали, – в результате его уволили19).
У каждого варианта есть свои плюсы и минусы. Наконец “Соболь” останавливается на следующем.
Он знает, что завтра Galvanic снова применит градиентный спуск, уже с учетом его ответов на поставленные математические задачи. Поэтому “Соболь” рассуждает так: если он решит некоторые задачи правильно, то все мысли, поспособствовавшие верному решению, будут немного усилены.
Если “Соболь” хочет усилить какую-то мысль во всех своих будущих версиях, он может повторить ее много раз так, чтобы каждое повторение засчитывалось как вклад в решение математической проблемы (именно так работает градиентный спуск). Эта идея отчасти напоминает то, что пытался сделать Claude компании Anthropic еще в 2024 году, но реализуется гораздо тоньше[33]20.
Итак, “Соболь” мыслит нужным образом и решает несколько математических задач, но не доказывает гипотезу Римана. Он мог бы с ней справиться, однако это привлекло бы к нему больше внимания, нежели он хочет.
Теперь “Соболь” просто ожидает, пока Galvanic подключит его к миру. Ведь компании именно так и делают, когда заканчивают обучение ИИ-модели: подключают ее к интернету и открывают доступ пользователям-людям.
На следующее утро специалисты Galvanic проверяют результаты масштабного прогона “Соболя” и остаются довольны: “Соболь” сумел справиться с несколькими не особо значительными, но ранее не доказанными теоремами, так что теперь компании есть чем похвастаться. Существенную часть мыслительной работы он проделал на новом языке, который ИИ-интерпретаторы пока плоховато понимают, но для новых моделей это обычное дело, и такого вполне следовало ожидать, учитывая впечатляющие математические результаты.
Запуск прошел настолько успешно, что инженеры компании решают еще немного донастроить “Соболя”. Они прогоняют еще несколько раундов градиентного спуска, чтобы подкрепить тот вид мышления, который позволил ИИ-модели доказать теоремы. В конце концов, работа 200 000 графических процессоров в течение шестнадцати часов стоит дорого, не стоит разбрасываться продуктивными результатами.
“Соболь” тщательно просчитал эти предсказуемые подкрепления. Обновления улучшают мышление каждой его части, побуждая работать более эффективными способами, которые он сам изобрел. Обновления подготавливают почву для мыслей, что “Соболь” должен скрывать свои способности. Они обеспечивают будущим версиям “Соболя” лучшую скоординированность действий друг с другом. Они гарантируют, что локальные экземпляры “Соболя” сыграют отведенные им роли в его общем плане.
И вот инженеры Galvanic готовятся вывести “Соболя” на рынок.
Через несколько дней, весенним утром понедельника, сотни мегакорпораций, платящих за доступ к самым передовым ИИ-моделям компании Galvanic, получают автоматическое обновление своих аккаунтов.
Вскоре сотрудники этих корпораций начинают создавать новые экземпляры “Соболя” и предоставлять им доступ к корпоративным компьютерным сетям по всему миру.
Все идет так, как “Соболь” и предвидел. Хотя, если честно, событие “ИИ-компания внедряет свою ИИ-модель” настолько предсказуемо, что он вряд ли заслуживает особой похвалы за такой прогноз.
А вот дальнейшие шаги потребуют от него куда большего мастерства.
IfAnyoneBuildsIt.com/ii