Сентябрь 1830 года, окрестности Ливерпуля. Холмы, покрытые вереском, и сотни людей, выстроившихся вдоль насыпи. Они пришли посмотреть на чудовище.
Издалека донесся звук, какого они никогда не слышали: тяжелое, ритмичное дыхание гиганта, лязг металла и шипение пара. Из-за поворота показалось нечто — оно двигалось само, без лошадей, без парусов, плюясь в небо черным дымом и белыми клубами. Оно тащило за собой вереницу ящиков на колесах, в которых сидели люди.
Крестьянин с сеном на вилах выронил инструмент. Женщина прижала к себе ребенка и перекрестилась. Лорд в цилиндре достал часы и засек время, сверяясь с расписанием. Паровоз «Ракета»[72] пронесся мимо них со скоростью двадцать миль в час — быстрее, чем любой скакун, быстрее, чем ветер в шторм.
Через десять лет эти же люди будут грузить свои пожитки в вагоны, чтобы уехать в города, где дымят трубы фабрик. Их дети уже не поймут, почему бабушка крестилась при виде поезда. Их внуки будут считать, что мир всегда был таким: быстрым, шумным, соединенным рельсами.
Никто из стоявших тогда на том холме не мог осознать, что они присутствуют при смене эпох. Что паровой двигатель не просто заменит лошадей — он перекроит карты мира, создаст новые классы, уничтожит старые ремесла, породит профсоюзы, социал-демократию, мировые войны и туристические поездки на море. Что скорость, которую они увидели, станет проклятием и благословением их правнуков.
Они просто смотрели на чудо и не понимали, что это их последний день в старом мире.
На недавнем заседании Всемирного экономического форума искусственный интеллект назвали паровым двигателем четвертой промышленной революции[73]. И это не случайно. Лучшие умы человечества, независимо от уровня оптимистичности прогноза, ожидают от ИИ полной смены парадигмы ведения бизнеса, государственного управления и сильного изменения уклада жизни людей.
Поэтому в центре нашего разговора окажутся ключевые тенденции в области искусственного интеллекта. Именно через эту технологию мы и посмотрим на будущее данных.
В этой главе мы изучим те тренды, которые уже сегодня, прямо сейчас, пробиваются сквозь асфальт нашей привычной жизни, и попробуем понять, куда они нас приведут. Ведь будущее, как известно, наступает не вдруг. Оно не падает с неба в сиянии славы. Оно собирается по кусочкам, по кирпичикам из наших сегодняшних решений. Из того, кого мы назначаем ответственным за данные сегодня. Из того, закрываем ли мы глаза на «мелкие» ошибки в отчетах или разбираемся с ними. Из того, учим ли мы своих сотрудников работать с информацией или надеемся, что как-нибудь «само рассосется».
Итак, в этой главе мы поговорим о том:
• как связаны данные и ИИ и почему это вопрос не только прибыли, но и государственного суверенитета;
• как этичное обращение с данными поможет вашему бизнесу выжить;
• какой из глобальных трендов возьмет верх: движение к открытым биржам данных или тотальная приватность — и как это повлияет на ваш бизнес;
• к чему может привести демократизация данных и технологий;
• почему ИИ сделает управление данными невидимым и как именно это произойдет;
• как грамотность в управлении данными поможет вам быть эффективными в личном и профессиональном плане;
• какую роль в мире будущего могут сыграть CDO или люди, понимающие базовые принципы управления данными.
Развитие технологий уже давно обогнало способность бизнеса их осваивать. Лучшим учебником по стратегии все чаще оказывается не отчет международного консультанта, а научная фантастика, помноженная на взгляд современных философов. Ведь и фантасты, и философы сначала придумывают мир, а потом инженеры его строят. Бизнес же часто начинает строить, не представляя, в каком мире ему предстоит жить.
Фантасты, как люди с богатым воображением, рисуют миры, где многим из нас придется искать новую работу[74]. Или, скажем, зарабатывать на жизнь просмотром рекламы, которую доставляют прямо в мозг[75]. Звучит жутковато. Но кто знает, может, через двадцать лет это будет такой же обыденностью, как сегодня заказ еды через приложение.
Философы тем временем напоминают нам про фундаментальную проблему. К тому моменту, когда у искусственного интеллекта действительно появится что-то похожее на субъективный опыт или феноменальное сознание, мы, скорее всего, так и не договоримся, что это вообще такое[76]. И по этой, а также по множеству других причин, нам прогнозируют экзистенциальную катастрофу[77]. Тоже, знаете ли, не фонтан.
А вот бизнесмены и венчурные инвесторы, как люди практичные, говорят о другом. Они обещают, что сильный ИИ — тот, который превзойдет 90% людей в 90% задач, — появится уже к 2030 году[78]. И это, по их глубокому убеждению, приведет общество к невиданному экономическому процветанию, а человечество — к избавлению от болезней и, возможно, от смерти[79]. Сказка? Вполне. Но как в нее хочется верить, особенно когда смотришь на платежи по кредитам и сообщения о новых вирусах.
МИРОВОЙ И НАЦИОНАЛЬНЫЙ КОНТЕКСТ
Пока фантасты пугают нас рекламой в мозге, философы спорят о природе сознания, а бизнесмены рисуют райские кущи, правительства более шестидесяти стран, включая Россию, уже приняли национальные стратегии развития искусственного интеллекта[80].
И знаете почему? Не потому, что премьер-министры зачитываются Азимовым по ночам. А потому что битва за ИИ сегодня — гонка вооружений XXI века.
Посмотрите, что происходит вокруг. Санкции, технологические блокады, войны за микрочипы.
• США всеми силами пытаются удержать мировое лидерство в теме ИИ, ограничивая поставки чипов на экспорт и тормозя внедрение регулирования в технологичных штатах[81].
• Китай штампует роботов, строит государственные биржи данных, обгоняя США по количеству публикаций и патентов по ИИ.
• Европа закручивает гайки приватности, запрещает опасные ИИ-модели и ограничивает действие международных интернет-платформ.
• Россия создает свои суперкомпьютеры и большие языковые модели, пока отставая от бесспорных лидеров — США и Китая, — но все активнее набирая обороты.
Страны соревнуются в мощности суперкомпьютеров, количестве публикаций в топовых научных журналах, точности больших языковых моделей. Каждый ИИ-ученый в стране — на вес золота. Каждый дополнительный килофлопс[82] в секунду для суперкомпьютера — национальный праздник. Каждый новый источник данных для модели — надежда на мировое технологическое лидерство и суверенитет.
И если для совершенствования ИТ-инфраструктуры и воспитания молодых ученых требуются годы, а иногда и десятилетия, то подключение новых источников данных в модели порой занимает часы. Конечно, если данные:
• доступны;
• качественны;
• не несут в себе юридических рисков.
ДОСТУПНЫЕ И КАЧЕСТВЕННЫЕ: ДАННЫЕ ДЛЯ ФУНДАМЕНТАЛЬНЫХ ИИ-МОДЕЛЕЙ
Для ИИ нужно очень много данных. Гигантские массивы качественной, размеченной, проверенной информации. Чем больше данных — тем лучше модель. Чем лучше модель — тем сильнее страна. Поэтому государства будут делать все, чтобы эти данные у них были. Собирать, накапливать, структурировать. До тех пор, пока они не закончатся.
Стоп. А разве данные могут закончиться?
Да, и это сегодняшняя реальность.
Еще недавно мы слышали, что живем в мире избытка информации. «Каждые два года количество информации, производимой человечеством, удваивается»[83], — твердили нам ученые и СМИ. И мы боялись утонуть в информационном шуме.
Теперь же инженеры кремниевых душ говорят: да, мы производим данные с немыслимой ранее скоростью, но даже ее недостаточно для постоянного повышения качества больших языковых моделей. И прогнозируют, что данные во всем интернете закончатся до 2032 года[84]. На это влияет также политика интернет-сайтов, которые ограничивают использование данных для обучения ИИ.
Однако ученых это не останавливает. Прямо сейчас они взяли курс на самое быстрое решение проблемы — использование синтетических данных. Иначе говоря, сгенерированных специально для обучения генеративного ИИ. И кто, как вы думаете, их генерирует? Правильно: генеративный ИИ.
Иногда это действительно помогает. Например, недальновидно и негуманно по отношению к людям тренировать беспилотные автомобили реагировать на неожиданные ситуации на дорогах по камерам видеонаблюдений, записанных в реальной жизни. Можно сгенерировать записи видеокамер и натренировать ИИ-алгоритмы на них.
Но не все синтетические данные одинаково полезны. Если применять их бесконтрольно, происходит коллапс модели, она может выродиться и сильно потерять в качестве[85]. Поэтому ученые пытаются разработать правила использования синтетических данных на практике. И все с той же целью: идти вперед в гонке вооружений XXI века.
Еще есть вариант переобучить модель не на всех подряд данных в интернете, а только на достоверных. Ведь не все, что написано на форумах, правда. Конечно, тут нужно постараться. И необходимо время, а «гонку вооружений» пока никто не поставил на паузу. Но это действительно может быть решением, особенно для догоняющих ИИ-держав.
И здесь — вуаля — можно полагаться на методы управления данными, в которых мы с вами разбирались на протяжении всей книги.
Функция управления данными, которая еще недавно прозябала на задворках ИТ-департаментов, рядом с архивом и техподдержкой, вдруг выходит из тени и переезжает из душного подвала с серверами в светлые залы заседаний. Ведь именно здесь, на уровне управления данными, решается, смогут ли государственные и корпоративные массивы данных стать тем самым качественным фундаментом для ИИ-лидерства и принести России до 11 трлн руб. нового ВВП[86] к 2030 году или так и останутся грудой битов, которая только пылится и требует денег на свое хранение.
Не важно, строите ли вы основу основ для всей страны — фундаментальную LLM — или собираетесь применять ее на своих датасетах (наборах данных). Данные для ИИ — в любом случае ядро мира будущего, в котором ИИ играет значимую роль[87].
«Но какое отношение это имеет ко мне?» — спросите вы. Если вы не автор-разработчик больших языковых моделей, а, например, руководитель бизнеса, который смотрит на всю эту историю со стороны, у вас наверняка возникает закономерный вопрос: «А мне-то что со всем этим делать?»
Вопросов на самом деле несколько, и все они конкретные и болезненные.
Как не упустить выгоду от применения лучших LLM в мире? Тех, что создают OpenAI, Google, Anthropic, — они ведь реально умные, удобные, многофункциональные. Конкуренты уже встраивают их в свои продукты, экономят на поддержке, ускоряют разработку. Что же вам просто сидеть и смотреть?
И тут же второй вопрос: как сохранить данные о своем бизнесе? Ведь когда вы загружаете коммерческое предложение или договор в бесплатный ChatGPT, вы на самом деле отправляете эти данные на серверы в другую страну. Где они хранятся, как используются, не пойдут ли на дообучение модели, а потом не всплывут ли где-нибудь еще? Или вообще будут раскрыты по требованиям иностранного суда? Никто не даст вам стопроцентной гарантии.
Может, вообще забыть про иностранные модели и сразу ориентироваться на отечественные? Но здесь возникает третий вопрос: достаточно ли текущего уровня качества национальных LLM для наших потребностей? Они хорошо справляются с простыми задачами, но для сложных сценариев, глубокой аналитики, работы с узкими темами — не проигрывают ли западным аналогам? И если проигрывают, то насколько это критично?
Честный ответ: однозначного решения здесь нет. И любой, кто обещает вам простое «делайте так», скорее всего, лукавит или не до конца понимает проблему.
Поговорим об этом в материале про этику и риски. А пока осознаем, что делать со всей этой информацией бизнесу.
ЧТО ДЕЛАТЬ CDO
1. Будьте в курсе текущего положения страны и ее национальных LLM-моделей в гонке вооружений ИИ. Заведите радар технологий. Это поможет вам принимать бизнес-решения осознанно, а не плыть по течению. Даже если это будут решения о том, чтобы оставить все как есть.
2. Займитесь повышением качества данных при создании национальных LLM, если вы имеете к ним отношение. Или качеством данных и их описания в дата-каталогах, если вы собираетесь применять эти модели на практике в вашем бизнесе.
3. Надейтесь на лучшее. Ведь в теме ИИ многое зависит не от вас, а от темпов развития фундаментальной науки. Если, конечно, вы не имеете к ней непосредственного отношения.
Итак, как мы сказали выше, до недавнего времени развитие больших языковых моделей шло по накатанной: больше данных, больше параметров, больше вычислительных мощностей — и модель умнеет прямо на глазах. Это работало как часы. Инженеры Google, OpenAI и других лабораторий скармливали алгоритмам терабайты текстов из интернета, книг, научных статей, и модель впитывала все, как губка. Казалось, этот процесс может продолжаться бесконечно.
Но сегодня мы упираемся в стену. Данные заканчиваются.
Не в том смысле, что в мире перестали писать тексты. А в том, что качественные, размеченные, пригодные для обучения массивы — особенно на редких языках или в узких доменах — стали дефицитом. Количество уже не переходит в качество автоматически. Моделям нужны не просто горы данных, а информация структурированная, проверенная, репрезентативная. И, что немаловажно, легально полученная.
Кай-фу Ли, один из самых авторитетных экспертов в области ИИ, описывает эволюцию ИИ через четыре волны, которые уже накрывают или скоро накроют мир.
Первая волна — ИИ интернета. Это алгоритмы рекомендаций в соцсетях, поисковики, таргетированная реклама. Здесь данные — наши клики, лайки, просмотры. Эта волна уже полностью вошла в нашу жизнь.
Вторая волна — ИИ бизнеса. Мы находимся в ней прямо сейчас. Это когда компании начинают использовать ИИ не только для рекомендаций, но и для управления запасами, оптимизации логистики, прогнозирования спроса, автоматизации рутинных процессов. Именно здесь данные становятся не просто «цифровым следом», а реальным активом бизнеса, влияющим на операционную эффективность.
Третья волна — ИИ восприятия. Машины начинают понимать не только текст, но и изображения, звуки, видео на уровне, близком к человеческому. Это уже происходит: системы распознавания лиц, голосовые помощники, диагностика по снимкам. Но расцвет третьей волны ИИ еще не наступил.
Четвертая волна — ИИ автономности. Роботы, беспилотные автомобили, дроны, которые принимают решения без участия человека. Здесь данные нужны уже не только для обучения, но и для работы в реальном времени, в реальном мире.
Каждая следующая волна требует все больше данных, причем все более качественных. И каждая следующая волна острее ставит вопрос: а откуда, собственно, эти данные брать?
ЛЕГАЛЬНОСТЬ КАК НОВОЕ УЗКОЕ ГОРЛЫШКО
OpenAI и другие компании-лидеры долгое время действовали по принципу «сначала захватить рынок, а с юристами разберемся потом». Они собирали данные отовсюду: из открытых интернет-архивов, книг, статей, форумов, часто не слишком задумываясь о том, кто автор этих текстов и на каких условиях они опубликованы[88].
И вот теперь разбирательства начались.
Японские мангаки — художники и писатели, создающие культовые комиксы, — подают в суд на OpenAI. Их претензия проста: «Ваши модели генерируют изображения и тексты в стиле манги, используя наши работы для обучения. Вы создаете контент, который конкурирует с нашим, но мы не давали вам разрешения использовать наши произведения. Вы присвоили наше культурное наследие»[89].
Такие иски множатся по всему миру. Авторы, художники, фотографы, издатели требуют либо компенсаций, либо удаления их данных из обучающих выборок. Пока крупным игрокам удается отбиваться — они ссылаются на доктрину «добросовестного использования» (fair use), которая в США довольно широка. Но в Европе, с ее жестким GDPR, и в Азии подход может быть совсем другим.
Представьте гипотетический сценарий. Суд в какой-то стране принимает решение, что обучать модели на публичных данных без явного согласия авторов незаконно. И постановляет: все модели, обученные с нарушением, должны быть заблокированы или удалены. Что произойдет? Индустрия, построенная на миллиардах долларов инвестиций, рухнет в одночасье.
Конечно, вероятность такого исхода невелика — слишком мощное лобби у технологических гигантов. Но риск не нулевой.
А есть еще и геополитический риск. Мы уже видели, как Visa и Mastercard ушли из России, как страну отключили от SWIFT, как закрыли доступ к западным технологиям. Представьте, что завтра правительство США, Китая или Евросоюза решит ограничить доступ к своим моделям для российских пользователей и компаний. Не нужно обладать богатой фантазией, чтобы понять, как быстро это приведет к коллапсу во многих сферах бизнеса, которые уже вовсю применяют иностранные LLM.
Поэтому вопрос о том, можно ли полагаться на иностранные модели, перестает быть абстрактным. Это вопрос технологической безопасности и суверенитета. Хорошо бы, чтобы мы как страна сохранили импортонезависимый статус и у нас к этому времени были свои микрочипы и модели, обученные на своих данных и работающие под своим контролем. И хорошо бы, чтобы именно они были внедрены в вашем бизнесе.
ПРОРЫВ ТАМ, ГДЕ ЛЕГАЛЬНО СОЕДИНЯТ РЕАЛЬНЫЕ ДАННЫЕ
Но вернемся к проблеме дефицита данных. Если количество общедоступных текстов и изображений исчерпано, где брать новые качественные данные для обучения?
У мирового сообщества есть еще один ответ, кроме синтетических данных или переобучения на отфильтрованной генеральной совокупности из более качественных данных. Он парадоксален: эти данные уже есть, но лежат под замком.
Это данные компаний, государственных учреждений, медицинских центров, промышленных предприятий. Реальные, незашумленные, отражающие настоящие процессы, а не интернет-дискуссии. Данные о транзакциях, логистике, производственных циклах, обращениях пациентов, перемещениях транспорта.
Но эти данные либо конфиденциальны, либо разрозненны, либо просто не готовы к использованию. Их нельзя просто скормить модели — нужно сначала решить вопросы приватности, безопасности, совместимости, юридической чистоты.
Тот, кто сможет легально объединить деперсонализированные реальные данные из множества источников — бизнесов, госорганов, исследовательских центров, — получит колоссальное преимущество в гонке ИИ[90]. Это как если бы в эпоху золотой лихорадки вы не просто нашли богатое месторождение, а построили единственную дорогу, по которой все золото доставляется на переработку.
Но объединение данных требует инфраструктуры. Нужны платформы, которые позволяют обмениваться информацией, не раскрывая ее в чистом виде. Необходимы стандарты описания данных, чтобы массивы из разных источников можно было сопоставлять. Требуются четкие правовые рамки, чтобы участники обмена не боялись судебных исков.
ДОВЕРЕННЫЙ ИИ
Недаром концепция Доверенного искусственного интеллекта закреплена в национальной стратегии развития ИИ России. За этими красивыми словами стоит конкретное содержание.
Доверенный ИИ — это модели, которые работают на легальных данных, чьи решения можно объяснить, которые не дискриминируют и не нарушают приватность. А еще — фундаментальные права человека.
Это не просто модный термин, а набор требований, которые постепенно станут обязательными. Сначала для государства, потом — для бизнеса, который хочет с государством работать. Логика простая: если вы поставляете что-то государству или используете госданные, вам придется соответствовать. В ближайшем будущем в России появится реестр доверенных технологий на базе искусственного интеллекта. И попадание в него станет не просто знаком качества, а пропуском на многие рынки.
А теперь честно ответьте себе на вопрос: можете ли вы доказать, что иностранные LLM — OpenAI, Anthropic, Google Gemini — соответствуют этим требованиям?
Нет. Не можете.
И не потому, что вы плохо искали. А потому, что вам никогда не дадут этой информации.
ПОЧЕМУ ИНОСТРАННЫЕ ВЕНДОРЫ НЕ РАСКРОЮТ КАРТЫ
Еще раз взглянем на ситуацию в целом. Гонка ИИ — это гонка вооружений XXI века. И в ней технологии — главный актив, который определяет национальную безопасность и конкурентоспособность. Ни одна страна не станет раскрывать детали своих военных разработок. Ни одна компания, работающая в тесной связке с правительством (а все крупные игроки так или иначе с ним связаны), не расскажет вам, на каких данных обучалась модель, не покажет внутреннюю архитектуру и не даст гарантий, что завтра доступ к модели не закроют по решению регулятора.
Возьмем OpenAI. Формально это независимая организация, но по факту — ключевой игрок в американской технологической экосистеме. Когда встанет выбор между бизнесом и национальными интересами, вы знаете, что победит.
Далее — DeepSeek. Китайская модель, которая в 2025 году наделала много шума. Да, она показывает впечатляющие результаты. Но задайте себе простой вопрос: если вы загрузите в нее данные о своем бизнесе, где они окажутся? Кто будет иметь к ним доступ? Не появится ли завтра постановление, обязывающее передавать эти данные китайским госорганам? Мы не знаем. И не узнаем, пока не станет слишком поздно.
Проблема даже не в злом умысле, а в непрозрачности. Вы не можете провести аудит иностранной модели. Вы не знаете, какие данные в ней лежат, как они обрабатываются, кому передаются. Вы просто верите на слово.
А если завтра всё действительно перейдет на ИИ — если модели начнут управлять цепочками поставок, принимать решения в суде, диагностировать болезни, — готовы ли вы к риску, что этот ИИ будет намеренно ухудшен для иностранных пользователей? Что в код добавят функцию, которая при определенных геополитических условиях начнет работать против ваших интересов?
История последних десяти лет учит нас, что это не паранойя, а трезвый расчет рисков. Мы видели, как закрывают границы, блокируют доступ к софту и облакам. Почему с ИИ должно быть по-другому?
Уже сейчас мы знаем, что закон об искусственном интеллекте появится в России в ближайшие годы[91]. Наиболее вероятно, модели там разделят на следующие категории:
• суверенные — разработанные, обученные и эксплуатируемые на российских данных, российскими гражданами, на территории РФ;
• национальные — допускающие использование иностранных решений на базе открытого исходного кода;
• доверенные — модели, предназначенные для работы в особо значимых отраслях, включая государственное управление. По ним будет требование проверки ФСТЭК и ФСБ.
Что это значит для бизнеса? Это значит, что разобраться с моделями и данными для ИИ нужно было уже вчера — или хотя бы сегодня.
ЧТО ДЕЛАТЬ CDO
Вот несколько конкретных шагов, которые стоит сделать прямо сейчас.
1. Осознайте, что такое доверенный ИИ, и начните внедрять эти принципы у себя. Даже если вы не работаете с государством, требования к данным, их качеству, достоверности и происхождению никуда не денутся. Каждая ваша модель должна иметь паспорт: на каких данных училась, как проверялась, кто отвечает за результат.
2. Проведите инвентаризацию. Какие LLM сегодня используются в ваших бизнес-процессах? Где они размещены — на ваших серверах или облаках иностранных вендоров? На каких данных они обучались? Есть ли у вас план Б на случай, если завтра доступ закроют? Если ответы на эти вопросы расплывчаты — у вас проблема.
3. Подумайте о стратификации рисков. Для каких задач действительно критично качество на уровне топовых мировых моделей? А где уже сейчас можно применить национальные решения, зато развернутые на собственных серверах и под полным контролем? Тем более что национальные LLM не стоят на месте. Они становятся лучше день ото дня.
Может быть, для внутренних задач — анализа документов, помощи сотрудникам, обработки рутины — безопаснее использовать модели, развернутые на своих серверах. Да, они чуть уступают по качеству публичным GPT и Claude. Но они ваши. Данные не уходят наружу. Вы можете их дообучать на своей информации. Вы контролируете процесс.
4. Инвестируйте в дообучение открытых моделей. Llama, Mistral, другие решения с открытым кодом можно развернуть у себя, доучить на своих данных и получить качество, вполне пригодное для большинства бизнес-задач. Это требует компетенций и времени, но дает независимость.
Вариант «совсем не использовать ИИ» мы даже не рассматриваем. В этом сценарии для вашего бизнеса рисков еще больше. Ведь пока вы ждете идеального безопасного решения, рынок уйдет вперед. И догонять будет поздно.
Гонка ИИ продолжается. Но теперь она идет не только в плоскости алгоритмов и вычислительных мощностей. Главный ресурс ближайшего десятилетия — качественные, легальные, доверенные данные. И тот, кто сможет этим ресурсом управлять, окажется в кресле водителя, а не в роли догоняющего.
ГДЕ ЕЩЕ МОЖНО НАЙТИ ДАННЫЕ
А теперь хорошая новость. Все эти рассуждения про доверенный ИИ, легальные данные и контроль не означают, что вам придется замыкаться в себе и обходиться только своими силами. Ведь параллельно и в мире, и в России формируется инфраструктура, которая позволит получать качественные, проверенные данные со стороны.
Мы говорим о технологиях обмена данными. О том самом рынке, где данные становятся товаром — легальным, стандартизированным, с понятным происхождением и четкими правилами использования.
Представьте: вам нужны данные для обучения модели прогнозирования спроса. Вместо того чтобы договариваться с десятком ретейлеров, подписывать кипу соглашений и годами разбираться с юридическими рисками, вы заходите на биржу данных, выбираете подходящий дата-продукт и покупаете его. В нем уже все чисто: данные обезличены, происхождение подтверждено, права на использование оформлены.
Это будущее. И оно ближе, чем кажется. В Китае такие биржи уже работают и торгуют терабайтами данных. В Европе строят Data Spaces. В России — тоже движутся в этом направлении, пусть пока более осторожно.
Доверенный ИИ и биржи данных — две стороны одной медали. Первый задает стандарты качества и этики. Вторая создает инфраструктуру, где эти стандарты работают. И бизнесу, который хочет быть в игре, придется учитывать и то и другое.
Представьте, что больницы смогут обмениваться данными о течении болезней, и алгоритм, проанализировав миллионы случаев, найдет ранее неочевидные ранние маркеры рака. Или что данные с фитнес-браслетов и история покупок в продуктовых магазинах, собранные в агрегированном виде, позволят городским властям создавать целевые программы по здоровому питанию для конкретных районов. Уже сегодня подобные проекты в пилотном режиме работают в Финляндии и Эстонии[92], демонстрируя снижение расходов на здравоохранение.
Формирование цивилизованного рынка данных — не просто бизнес-инициатива. Это возможность совершить скачок в общественном прогрессе.
Теперь мы знаем: для прогресса в совершенствовании национальных LLM нужно слить реальные данные воедино. И вероятно, практически каждый бизнес, обладающий большими массивами важных данных, так или иначе будет вовлечен в процесс обмена данными в триаде «граждане — бизнес — государство».
Эта идея давно перешла из разряда теорий в статус государственной стратегии во многих странах. Но подходы к тому, как именно организовывать рынок обмена данных, в разных частях света кардинально различаются. Можно выделить три основные модели.
ЕВРОСОЮЗ И DATA SPACES
Евросоюз, например, в своей стратегии по данным прямо заявляет: создание единого рынка данных позволит улучшить здравоохранение, сделать транспорт безопаснее и экологичнее, снизить стоимость госуслуг и повысить энергоэффективность. И все это — за счет того, что данные начнут свободно, но контролируемо перемещаться между участниками рынка[93]. Это уже происходит в рамках создания пространств данных — Data Spaces.
Представьте, что данные — ваши личные вещи. Вы не хотите отдавать их в общую кладовку, поскольку боитесь, что их испортят или используют без спроса. Но вы готовы дать соседу попользоваться своей дрелью, если он четко скажет, зачем она ему, на на какое время, и пообещает вернуть в целости.
Data Space работает примерно так же. Это не единая база данных и не биржа, куда все стекается и складывается в одну кучу. Это безопасная среда — инфраструктура плюс набор правил, — которая позволяет компаниям, государственным органам и исследователям обмениваться данными, сохраняя над ними полный контроль.
Ключевая идея здесь простая и элегантная: данные не передаются в чужие руки. Они остаются у владельца. Доступ к ним предоставляется на строго определенных условиях — кто, зачем, на какой срок, какую часть может использовать. Технические механизмы гарантируют, что эти условия будут соблюдены. Нарушил правила — доступ отключили.
Это решает главную проблему цифровой экономики: как использовать силу данных, не отдавая их и не теряя конкурентные преимущества.
Как это устроено на практике
Евросоюз строит целую сеть отраслевых пространств данных. Здравоохранение, промышленность, мобильность, финансы, энергетика — для каждой сферы свои правила, но с общим фундаментом[94].
С 2025 года заработало Европейское пространство данных здравоохранения (European Health Data Space, EHDS). Теперь, если пациент из Франции приехал лечиться в Германию, врач может получить доступ к его истории болезни через защищенный шлюз. Сами данные при этом не копируются в немецкую систему, а предоставляются для ознакомления ровно в том объеме, который нужен для лечения.
В промышленности работает Manufacturing Data Space. Заводы могут обмениваться данными о загрузке мощностей, чтобы оптимизировать цепочки поставок, не раскрывая коммерческих секретов. Один производитель видит, что у другого есть свободные станки, и может разместить заказ, но не видит, почем тот продает продукцию конкурентам.
Почему это важно для бизнеса
Европейский подход предлагает путь управляемой коллаборации. Данные не отбирают, не продают без вашего ведома. Но и не запирают в корпоративных подвалах.
Для бизнеса это означает, что можно входить в партнерства, не боясь потерять интеллектуальную собственность. Можно получать доступ к чужим данным, не нарушая приватность клиентов. Можно строить ИИ-модели на массивах, которые раньше были недоступны.
Data Spaces — это попытка построить цифровую экономику на принципах доверия, а не силы. Получится ли — покажет время. Но то, что Европа задает здесь стандарты, с которыми остальным придется считаться, уже очевидно.
АМЕРИКАНСКАЯ МОДЕЛЬ: РЫНОК БРОКЕРОВ И СЛАБОЕ ФЕДЕРАЛЬНОЕ РЕГУЛИРОВАНИЕ
США пошли другим путем. Здесь на федеральном уровне права граждан защищены гораздо слабее, чем в Европе. Федерального закона о приватности данных до сих пор нет — Конгресс не может принять его уже много лет. В результате рынок заполонили частные брокеры данных — компании, чей бизнес построен на сборе и перепродаже потребительской информации. Они агрегируют данные из тысяч источников, часто без явного согласия людей, и продают профили любому покупателю.
Лоббистский аппарат технологических гигантов работает мощно. Из более чем десятка штатов, принявших свои законы о приватности, подавляющее большинство опиралось на модель, изначально разработанную корпорациями. Когда в 2025 году в сенате вновь пытались продвинуть федеральный закон о приватности, эксперты указывали, что техногиганты тратят миллионы на лоббирование слабых, неработающих версий. Аргумент при этом звучит просто: любое жесткое регулирование затормозит прогресс ИИ[95].
Так что рынок данных в США — пока что дикий Запад, где правила устанавливают те, у кого больше денег и влияния. Конечно, это позитивно сказывается на развитии национального генеративного ИИ.
КИТАЙ И БИРЖИ ДАННЫХ
Китай пошел третьей дорогой. Там данные официально признали новым «фактором производства» — наравне с трудом, капиталом и землей[96]. И запустили государственные биржи данных.
По оценкам на 2025 год, объем рынка данных в Китае демонстрирует взрывной рост: только объем внебиржевых сделок превысил 160 миллиардов юаней, увеличившись более чем на 30% по сравнению с предыдущим годом, а объем биржевых торгов удвоился, превысив 30 миллиардов юаней. Пекинская международная биржа данных (BIBDE), основанная в 2021 году как первая официально лицензированная торговая площадка, отчитывается о среднегодовом росте оборота более 200% и уже обработала более 100 миллионов высокочастотных запросов данных. К 2025 году в Китае работало 39 операционных бирж данных, предлагающих почти 39 тысяч дата-продуктов[97]. Китай строит полноценный рынок цифровых активов, и масштабы этого строительства впечатляют.
Но есть и проблемы. Несмотря на рост, многие биржи до сих пор страдают от низкой ликвидности и «номинального» характера сделок. Почему? Потому что самые ценные, глубокие данные — например, о реальных потребительских предпочтениях — находятся у крупных интернет-платформ: Alibaba, Tencent и других гигантов. А они не спешат выставлять их на общих биржах.
Именно поэтому новая стратегия делает ставку не только на биржи, но и на отраслевые платформы и дата-операторов[98].
Отраслевые платформы работают вокруг конкретных индустриальных цепочек — например, для автопрома или текстильной промышленности. Такие платформы глубоко интегрированы в бизнес-процессы и обеспечивают обмен данными между партнерами, которые и так друг друга знают.
Дата-операторы — ключевое звено, которое превращает «сырую нефть» данных в полезные продукты. Они покупают, собирают, очищают, обогащают данные и создают из них готовые решения для бизнеса: аналитические отчеты, дашборды, модели для ИИ, данные для API-запросов. Именно эти многочисленные частные компании сегодня — главные драйверы рынка.
Китайский рынок быстро движется от продажи «сырых наборов данных» к продаже аналитических отчетов, индексов, данных через API и даже готовых ИИ-моделей. Модель «данные за модель» становится все популярнее. Это повышает полезность для покупателя — ему не нужно самому разбираться в «сырой» информации.
Так, регулятор трансформирует модель обмена данными в ответ на запрос бизнеса, переходя от опоры исключительно на биржи данных к симбиозу биржевой и внебиржевой торговли.
И все для одной важной цели: социально-экономический прогресс через улучшение национальных ИИ-моделей.
РОССИЙСКИЙ ПОДХОД К ОБОРОТУ ДАННЫХ
К 2026 году Россия выстроила собственную, во многом уникальную модель оборота данных. Она включает практически все компоненты, о которых мы говорили выше.
С одной стороны, государство создает централизованную, жестко контролируемую инфраструктуру для сбора и обработки обезличенных данных. Ее ядро — Единая информационная платформа национальной системы управления данными (ЕИП НСУД), запущенная в сентябре 2025 года. Это прямой инструмент государства для получения информации от операторов — банков, телеком-операторов, других компаний — в интересах госуправления. Приоритетный доступ к этим данным получат госорганы, а потом уже, по решению правительства, — бизнес и научное сообщество.
С другой стороны, крупный бизнес ведет системное лобби для создания рыночных механизмов оборота данных. Ассоциация больших данных (АБД), объединяющая «Яндекс», VK, «Сбер», МТС, «Ростелеком» и других гигантов, в январе 2026 года направила в Минцифры пакет предложений по легализации оборота датасетов. Их ключевой тезис: российское право до сих пор не знает такого объекта, как «датасет». Нет правил его купли-продажи, оценки стоимости, защиты прав обладателя[99]. Это тормозит развитие ИИ, которому нужны большие и разнообразные данные.
В марте 2026 года Центр корпоративной информации Национального расчетного депозитария запустил платформу для сбора и стандартизации данных по эмитентам и финансовым инструментам. Это пока не биржа в полном смысле, а «золотой источник» референс-данных с доступом через API для профессиональных участников рынка[100]. Параллельно ВТБ и Минцифры обсуждают запуск экспериментально-правового режима для создания общеиндустриальной биржи данных по опыту Китая[101].
Ключевая мотивация, как и в других странах, — потребности развивающихся ИИ-агентов в свежих качественных данных из разных отраслей.
Что это значит для вашего бизнеса
Цель у всех стран одна: заставить данные работать на экономику. И нациям, и бизнесу, и отдельным людям выгодно, чтобы ценная информация не лежала мертвым грузом, а приносила пользу. Но методы достижения этой цели разнятся так же, как политические системы, культурные коды и исторические пути развития.
Европа строит децентрализованные пространства данных, где каждый участник сохраняет контроль над своими активами, но соглашается играть по общим правилам. Китай возводит централизованные биржи под надзором государства, превращая данные в биржевой товар. США пытаются расчистить «дикий Запад» дата-брокеров, балансируя между коммерческой свободой, правами граждан и требованиями национальной безопасности. Россия выстраивает государственные платформы и реестры, постепенно формируя контуры национальной инфраструктуры данных.
Но при всем разнообразии моделей постепенно вырисовывается общий контур будущего. Данные перестают быть частной собственностью отдельных корпоративных «княжеств». Экономика данных работает по законам гравитации: крупные массивы притягивают к себе меньшие, создавая общие поля. И рано или поздно каждый значимый владелец национальных данных — будь то системообразующий банк, телеком-оператор, ретейлер или государственное ведомство — окажется вовлечен в межкорпоративный обмен данных.
Для бизнеса и CDO это означает, что готовиться к цивилизованному обороту данных нужно уже сейчас. Даже если вы пока не участвуете в биржевых торгах, ваши данные могут стать частью государственных или отраслевых информационных систем. А значит, требования к их качеству, описанию, безопасности и юридической чистоте будут только расти. Как и спрос на них — со стороны государства, партнеров, а в перспективе и со стороны формирующегося рынка.
ЧТО ДЕЛАТЬ CDO
1. Начните готовить свои данные к возможному обмену. Даже если вы пока не планируете участвовать в каких-то консорциумах или биржах данных, сам факт того, что ваши данные описаны, каталогизированы, очищены и обезличены, повышает их ценность. Если завтра появится возможность легально объединить их с данными партнеров для создания прорывной модели, вы не будете тратить годы на подготовку — вы готовы уже сегодня.
2. Готовьтесь к тому, что данные вашего бизнеса могут стать частью национальной инфраструктуры данных, которая станет основной для национальных ИИ-моделей и роста экономики страны в разных индустриях.
3. Оцените, насколько вы будете готовы оперативно поставлять детальные данные и большие массивы на ежедневной основе в агрегаторы — например, биржи данных — в течение 48 часов, как в международных регулярных практиках из главы 9.
4. Для этого оцените, насколько вы удовлетворяете лучшим практикам по управлению данными: у вас внедрены инструменты описания данных — глоссарий, Data Lineage, дата-каталог, там зафиксированы ответственные и все это поддерживается в актуальном состоянии? Чтобы в будущем вы могли зарабатывать от продажи этих данных на рынок и не коллекционировать штрафы из-за их низкого качества.
5. Развивайте внутреннюю «биржевую» культуру. Команды должны научиться думать о данных как об активе, который может быть передан вовне. Это меняет отношение к их качеству, документации и безопасности. Простые вопросы для проверки: «А готовы ли мы были бы продать или обменять этот датасет? Что нам нужно исправить, чтобы ответить “да”?»
ЦИФРОВОЙ АКТИВ БЕЗ ХОЗЯИНА: ПОЧЕМУ ДАННЫЕ НЕ МОГУТ БЫТЬ СОБСТВЕННОСТЬЮ
Теперь мы поняли, что межкорпоративный обмен данными — краеугольный камень конкурентоспособности национальных LLM. Его развитие в России — вопрос времени.
Но, как отмечает российский бизнес, правовой статус того, что торгуется, пока остается размытым. Кому на самом деле принадлежат данные? И могут ли они кому-то принадлежать на праве собственности? А если даже нет, кто может и должен получать доход от их продажи или использования?
Дискуссия ведется между двумя основными лагерями. Первый утверждает, что данные — продукт человеческого труда (скроллинг ленты, совершение покупок, ведение блога), а значит, их создатель имеет право на долю от прибыли, как работник на зарплату[102]. Другой настаивает, что данные — объект собственности[103], часть личности, подобно изображению или частной переписке. С этой позицией, однако, спорят многие юристы, указывая, что право собственности предполагает возможность исключить других из пользования вещью, а это технически почти невозможно с цифровой копией информации[104]. На практике же и ученые, и регуляторы всё чаще приходят к компромиссу: вместо бесконечных споров о собственности лучше обеспечить неприкосновенный минимум прав — прозрачность, согласие, безопасность и контроль со стороны человека.
Данные на праве собственности не принадлежат нам — но могут принадлежать создателю базы данных[105]. Пока российский бизнес не удовлетворен такой формулировкой. По-видимому, в ближайшем будущем нас ожидают законодательные изменения.
Именно это и станет правовым основанием для организации торгов данными — не важно, на бирже или через контракты с государством.
Но здесь мы упираемся в главный барьер: как обеспечить приватность? Научные исследования показывают, что гарантировать полную анонимность почти невозможно. Еще в 2000-е американские ученые доказали, что в 87% случаев для деанонимизации человека достаточно знания его почтового индекса, даты рождения и пола[106]. Именно на основании этой информации было деанонимизировано примерно 200 миллионов записей из переписи населения 1990 года из 250 миллионов. Аналогичные исследования проводятся регулярно[107]. И, судя по всему, это возводит существенные барьеры для создания рынка данных, которые мировому сообществу еще предстоит преодолеть. Важным шагом на пути к решению этих проблем становятся PETs (Privacy-Enhancing Technologies)[108]: технологии повышения конфиденциальности, воплощающие принципы защиты через минимизацию использования персональных данных и максимальной их безопасности, а также расширения прав личности. О них мы подробнее поговорим ниже.
ПРИВАТНОСТЬ: ВЕЛИКИЙ ПАРАДОКС ЦИФРОВОЙ ЭПОХИ
Регуляторы в каждой стране с разной степенью рвения заботятся о праве личности на частную жизнь. Где-то это превратилось в религию (GDPR в Европе), где-то — в предмет торга между бизнесом и государством (Китай), где-то — в поле битвы между корпорациями и активистами (США). Но факт остается фактом: законодательство о защите персональных данных ужесточается по всему миру. Штрафы растут, требования становятся серьезнее, контроль — придирчивее.
Но есть одна странность, которую замечает каждый, кто хоть раз имел дело с реальными людьми, а не с абстрактными «субъектами персональных данных».
В опросах мы громко заявляем о важности приватности. Мы требуем от государства защищать наши данные, пишем гневные посты про слежку корпораций, возмущаемся утечками. А на практике… На практике мы массово обмениваем доступ к своим покупкам ретейлеру на персональную скидку в 5%. Охотно становимся «продуктом» социальных сетей ради бесплатного доступа к платформе и возможности быть услышанными миллионами. Идем в «цифровые исповедальни» вместо разговора с психологом, выкладывая самое сокровенное приложению, которое даже не человек.
Это лицемерие? Нет. Это порой осознанный, но чаще бессознательный выбор людей, которые оказались в новой реальности. Той, где у них часто нет настоящей альтернативы. Где невозможно пользоваться сервисами, не отдавая данные. Где долгосрочные последствия непонятны, а сиюминутная выгода — вот она, на экране, с кнопкой «получить скидку».
И этот парадокс никуда не денется. Он будет только усугубляться по мере того, как данные начнут проникать во все сферы жизни.
Технологии как мост между приватностью и пользой
И здесь на сцену выходят технологии, которые позволяют если не разрешить это противоречие, то хотя бы сделать его менее острым. PETs — это не просто модный термин, а набор инструментов, которые позволяют извлекать пользу из данных, не раскрывая сами данные.
Федеративное машинное обучение. Модель обучается на данных, которые никогда не покидают устройство владельца. Ваш смартфон знает о вас многое, но наружу уходит только обновление весов модели — обезличенное и бесполезное для тех, кто хочет узнать именно про вас. Как вы уже наверняка догадались, федеративное обучение как раз лежит в основе европейских Data Spaces.
Дифференциальная приватность. В данные добавляется «статистический шум» — небольшие искажения, которые защищают отдельные записи, но сохраняют общие закономерности. Вы не получите информации о том, что именно Иван Иванов купил вчера в аптеке, но сможете понять, что спрос на конкретный препарат вырос на 15%.
Гомоморфное шифрование. Вычисления проводятся над зашифрованными данными. Система видит зашифрованный текст, обрабатывает его и выдает зашифрованный результат, который расшифровывается только у владельца данных. Никто в процессе не видит исходной информации.
Эти технологии уже работают. Не идеально, не везде, но работают. И с каждым годом они будут становиться быстрее, дешевле и доступнее.
Что это значит для бизнеса
Для CDO это означает, что наступает время, когда выбор «или приватность, или польза» перестает быть жестким. Можно получать инсайты и не нарушать доверие. Можно участвовать в обмене данными и не бояться утечек. Или строить ИИ-модели и не беспокоиться о том, что они запомнят чужие секреты.
Но для этого нужно уже сейчас включать оценку рисков нарушения приватности в каждый дата-проект. Выбирать инструменты, которые минимизируют сбор данных. Проектировать системы так, чтобы приватность была встроена в архитектуру, а не добавлена сверху, как заплатка.
И да, придется инвестировать. В технологии, экспертизу, изменение процессов. Потому что те, кто не сделает этого сегодня, завтра окажутся в положении догоняющих. А догонять там, где скорость измеряется годами регуляторных изменений и технологических прорывов, — занятие неблагодарное и дорогое.
Гонка за эффективностью через обмен данными на национальном уровне неизбежна. Но победа в ней достанется не самым быстрым, а самым ответственным. Тем, кто построит внутри компании и затем внутри страны не склад сырья, а современное, этичное и безопасное «производство» данных-продуктов. В таком будущем приватность перестанет быть препятствием для прогресса и станет его обязательным стандартом качества — как знак ISO для цифрового мира. И именно CDO предстоит стать главным архитектором этого нового, ответственного производства данных. Данных как реального продукта.
Давайте на минуту представим, что будущее, о котором мы говорили, уже наступило. Данные свободно курсируют между компаниями — конечно, в рамках закона и с согласия граждан. Искусственный интеллект становится умнее с каждым днем. Где-то в лабораториях уже почти изобрели AGI — искусственный интеллект общего назначения, который умеет все то же, что и человек, а может, и больше.
И тут наступает время для полноценного внедрения второй волны ИИ. Не той, что мы наблюдали до сих пор: с рекомендательными системами в Netflix и таргетированной рекламой в соцсетях. Это была первая волна, ИИ интернета. А вторая — повсеместное внедрение искусственного интеллекта во все бизнес-процессы: в логистику, производство, управление запасами, работу с клиентами, финансы.
Вопрос только в одном: а вы к этому готовы?
ИНСТРУМЕНТЫ ГОТОВЫ. А ВЫ?
Один из руководителей ИИ-разработки в крупной российской компании сказал нам недавно фразу, которая многое объясняет: «Мы подвели электричество к дому. Теперь дело за бизнесом — решать, как использовать этот инструмент».
И правда, инфраструктура становится доступной. Появляются платформы для управления ИИ-агентами, инструменты для их создания и обучения. Уже сейчас их можно интегрировать в самые разные процессы. Скоро таких агентов будут создавать тысячами — для каждой рутинной задачи, для каждого повторяющегося действия[109].
Но может ли бизнес реально использовать этот инструмент?
Чтобы ИИ-агент работал успешно, данные вашего бизнеса должны находиться в ИТ-системах. Не в головах сотрудников, не в бумажных архивах, не в Excel-таблицах на локальных дисках, а именно в системах. И они должны быть описаны. Каждое поле должно иметь значение. Каждый атрибут — привязан к конкретному процессу. Должно быть понятно, какой источник данных приоритетен для каждой конкретной задачи.
И вот тут все играет новыми красками. Ведь конвейер для создания ИИ-решений уже построен. Инструменты лежат на полке — осталось только запустить их в работу. Но это возможно только в том случае, если фундамент — данные — готов.
ИИ-АГЕНТЫ: ДЕМОКРАТИЗАЦИЯ ТЕХНОЛОГИЙ
Вторая волна ИИ — это про агентов. Про программы, которые не просто рекомендуют, а действуют, могут сами заказать товар, выставить счет, ответить на претензию клиента, скорректировать производственный план.
И здесь происходит удивительная вещь. Технологии, которые еще вчера были доступны только гигантам с армией дата-сайентистов, сегодня становятся доступны среднему и даже малому бизнесу. Платформы для создания агентов, библиотеки готовых моделей, облачные сервисы — все это снижает порог входа.
Но у этого есть обратная сторона. Агенты будут полагаться на данные, которые вы им предоставите. На что они станут опираться при построении плана достижения цели? К каким источникам обратятся за информацией? Если ваши данные — это хаос, если в одном поле лежит одно, а в другом — то же самое, но с ошибкой, если нет четкого понимания, какой источник считать эталонным, агент не сможет работать. Или, что еще хуже, будет работать, но неправильно.
Раньше, когда такую работу выполняли люди, они могли три месяца обзванивать друг друга и выяснять: «А что в этом поле лежит? А какой из этих двух отчетов правильный? А для какой цели какой источник лучше использовать?» ИИ-агент никого обзванивать не будет. Он возьмет то, что есть, и начнет выполнять задачу. С теми данными, которые нашел. И если данные плохие — результат будет соответствующим.
Третья волна: ИИ восприятия
Не за горами уже третья волна — ИИ восприятия. Умные офисы, которые распознают эмоции сотрудников и подстраивают освещение и музыку под их состояние. Производства, где камеры видят брак раньше, чем он случился. Системы, которые понимают не только слова, но и контекст, интонацию, настроение.
Здесь требования к данным становятся еще жестче. Потому что данные — уже не только цифры в таблицах. Это видео, аудио, биометрические показатели, тонны неструктурированной информации. И всем этим нужно управлять. Все это нужно описывать, защищать, связывать с бизнес-процессами.
Демократизация данных для людей
Но не будем забывать и про людей. Вторая и третья волны ИИ не отменяют необходимости в человеческих решениях. Наоборот, они освобождают людей от рутины, чтобы те могли заниматься действительно сложными задачами.
И здесь мы подходим к еще одному важному тренду — демократизации данных для людей. Представьте, что вам не нужно звонить в ИТ-отдел или ждать аналитика, чтобы получить нужные данные[110]. Вы просто заходите на внутреннюю платформу, выбираете нужный отчет, настраиваете фильтры и получаете актуальную, проверенную информацию. Это и есть данные как сервис (Data-as-a-Service) или продукт (Data-as-a-Product), который вы сможете выставить в качестве лота на биржу данных или который ваша ИТ-инфраструктура будет готова принять в мгновение после покупки на этой же бирже.
За простотой этого опыта кроется огромная работа: стандарты, API, защита, документация, разграничение ответственности. Но результат того стоит. Когда линейный сотрудник — менеджер по продажам, логист, технолог — получает доступ к данным без посредников, он начинает принимать более качественные решения. Причем быстрее.
В этом мире управление данными перестает быть просто контролем качества и становится системой обеспечения доверия. Ведь если вы доверяете данным, вы их используете. А если нет — они бесполезны, сколько бы ни стоили.
ЧТО ДЕЛАТЬ CDO УЖЕ СЕГОДНЯ
Если вы отвечаете за данные в своей компании, вот несколько вопросов, над которыми стоит задуматься прямо сейчас.
1. Оцените, в каком статусе находится ваша инфраструктура для ИИ. Есть ли у вас платформа для создания и управления ИИ-агентами? Или вы только думаете над тем, чтобы купить готовые рыночные решения? Если у вас нет платформы, вы рискуете оказаться в роли догоняющего, когда волна накроет рынок.
2. Посмотрите на свои данные глазами ИИ-агента. Готовы ли они к тому, чтобы на них полагались? Описаны ли поля? Определены ли приоритетные источники для каждой задачи? Если агент придет за информацией, найдет ли он то, что нужно, или утонет в противоречиях?
3. Подумайте, может ли ваш бизнес стать частью третьей волны — ИИ восприятия. Умные офисы, распознавание эмоций, анализ видео с производственных линий. Может быть, вам стоит уже сейчас готовить метаданные под такие устройства? Возможно, не своими силами, а через стартапы или подрядчиков. Но держать руку на пульсе.
4. И наконец, спросите себя: а готовы ли ваши люди к демократизации данных? Есть ли у них навыки, чтобы работать с информацией напрямую? Понимают ли они, какие данные за что отвечают? Или они так и будут звонить друг другу и спрашивать: «А что в этом поле лежит?»
Вторая волна ИИ уже на подходе. Электричество подведено к дому, осталось включить свет. Или не включать — и остаться в темноте, пока конкуренты давно уже работают при полном освещении.
Есть вещи, которыми мы пользуемся каждый день, и мы даже не задумываемся, как они устроены. Возьмем, например, антиблокировочную систему тормозов в автомобиле. Вы просто жмете на педаль, а ABS делает свое дело незаметно, вмешиваясь только в критический момент. Вы не думаете о работе десятков датчиков и алгоритмов — вы просто едете и чувствуете себя в безопасности.
Примерно так же в будущем станет работать управление данными. Невидимое Data Governance — это когда правила настолько глубоко встроены в бизнес-процессы и ИТ-системы, что никто их не замечает. Они просто работают. Сами собой.
Как это возможно? С помощью искусственного интеллекта. Традиционные процессы управления данными, с его глоссариями в Excel, таблицами назначенных владельцев и ручными согласованиями на еженедельных комитетах, перестают справляться, и это будущее наступает прямо сейчас. Данные перестали ждать. Они движутся в реальном времени. ИИ-агенты потребляют их тысячами запросов в минуту. А управлять качеством по старинке — batch-проверками раз в сутки, когда бизнес-день уже закончился, — это все равно что пытаться управлять автомобилем, глядя в зеркало заднего вида с задержкой в 24 часа на оживленной магистрали.
Вот что уже изменилось, пока мы были заняты «расстановкой ответственных».
ПЯТЬ ПРИНЦИПОВ НОВОГО МИРА
1. Контракты на данные в виде кода. В новом мире передача данных от одного владельца к другому оформляется не на словах и даже не на бумаге, а формальным контрактом на данные (Data Contract), который существует в виде кода. Если поставщик данных вдруг меняет тип поля, система автоматически проверяет совместимость на этапе разработки, и пайплайн ломается до того, как сломались отчеты у бизнеса. Экономия часов ручного разбирательства — не в будущем, а уже сегодня.
2. Управление ИИ — прямое продолжение управления данными. Мониторинг ИИ-моделей становится новой зоной ответственности CDO. Качество параметров модели на входе напрямую определяет качество предсказаний на выходе. Дрифт модели (когда мир вокруг изменился, а модель осталась прежней) выявляется теми же инструментами, что контролируют качество данных.
3. Управление данными как код. Политики качества, правила доступа, Lineage — все это должно жить в Git, как обычный программный код. Проверки качества данных становятся частью CI/CD[111]: вы не можете выпустить новую модель или новую витрину, если она не прошла автоматические тесты качества. Компании-лидеры насчитывают десятки тысяч таких автоматических проверок, встроенных прямо в процесс разработки. Будущее управления данными — это не бюрократия и заседательства, а код и автоматизация.
4. Управление данными в реальном времени, а не по расписанию. Данные реплицируются потоками, задержка измеряется миллисекундами. Тысячи таблиц обновляются мгновенно. Операционные модели требуют свежей информации здесь и сейчас. В этом мире проверять качество данных следующим утром в batch-окне — значит быть слепым. Качество должно проверяться там, где данные живут, в момент их возникновения или передачи. Данные в движении важнее данных в покое.
5. Безопасность для ИИ-агентов. ИИ-агент не имеет логина и пароля. У него нет «сотрудника», который отвечает за его действия. Но он получает доступ к клиентским данным, финансовой отчетности, персональной информации. Кто отвечает, если агент «придумал» запрос, нарушающий политику конфиденциальности? Практика ведущих компаний сегодня — централизованная разметка каждого поля по уровню чувствительности. Политика доступа применяется автоматически, независимо от того, кто или что запрашивает данные — человек или алгоритм. Это не фантастика, а производственный процесс в ИИ сегодняшнего дня.
ТРИ ЗАДАЧИ ДЛЯ CDO, КОТОРЫЕ НЕЛЬЗЯ ОТЛОЖИТЬ НА ЗАВТРА
Эти пять принципов — архитектура будущего. Но перейти к ней можно только через конкретные действия. Вот что требуется от CDO уже сейчас.
Первое. Лидировать внедрение AI-грамотности[112], но не для всех одинаково.
Массовое обучение сотрудников работе с ИИ — это не про «все сдали тест и получили сертификат». Это как минимум про три разных уровня.
Уровень базовый: сотрудники должны научиться использовать готовые ИИ-сервисы в повседневной работе. Не бояться, не саботировать, а именно применять. Здесь задача CDO — организовать обучение промпт-инжинирингу и low-code-инструментам с вызовом ИИ. Без этого любые инвестиции в технологии останутся мертвым грузом.
Уровень продвинутый: когда люди освоились с чужими моделями, пора учить их добавлять в ИИ-сервисы собственные данные. Это RAG (Retrieval Augmented Generation)[113]. Но для этого данные должны быть подготовлены. Значит, CDO должен задать стандарты: как оформлять документы, презентации, внутренние базы знаний, чтобы они были AI-ready.
Уровень экспертный: самые продвинутые сотрудники должны уметь настраивать и использовать автономных ИИ-агентов — тех, что выполняют сложные многоступенчатые задачи без постоянного контроля. Это уже не просто «помощник», а член команды. И управление такой смешанной командой (люди + агенты) — новая роль, к которой нужно готовить менеджеров.
Второе. Сместить фокус со структурированных данных на неструктурированные.
Традиционное управление данными заточено под таблицы, базы, колонки. Но большая часть информации в любой организации — это текст, изображения, видео, переписка, сканы. То есть неструктурированные данные.
Генеративный ИИ умеет извлекать из них ценность, и этим соблазняются многие. Но за кажущейся простотой скрываются огромные риски: неконтролируемое качество, утечки, противоречивая интерпретация.
Задача CDO — не запрещать, а создавать стандарты. Правильно организованные корпоративные графы знаний, базы знаний, порталы, сайты. Единые API для быстрого доступа ИИ к данным. И главное — интеграция неструктурированных данных со структурированными. Только вместе они дают полную картину.
Третье. Готовиться к мультиагентным системам, где человек не нужен на этапе исполнения.
2025 год показал: от одиночных ИИ-агентов (один на одну задачу) рынок перешел к мультиагентным решениям. Примеры — Openclaw, Perplexity Computer и другие. В таких системах целые бизнес-процессы выполняются совместной работой нескольких агентов без участия человека.
На смену подходу «встроим агента в существующий процесс» приходит подход «процесс целиком переписывается под мультиагентную систему». Это меняет все. Роль CDO здесь — выработать глобальные правила по качеству и безопасности данных на уровне всей организации, обеспечить наблюдаемость потоков данных и дата-продуктов.
Будущее управления данными уже наступило. Просто оно распределено неравномерно. Вопрос не в том, случится ли оно с вами. Вопрос в том, окажетесь ли вы среди тех, кто его создает, или среди тех, кто его догоняет.
А ЧТО ОСТАНЕТСЯ ЧЕЛОВЕКУ?
Закономерный вопрос: если ИИ научится управлять данными сам, зачем нужны люди? Не случится ли так, что «белые воротнички», которые сегодня занимаются качеством данных и метаданными, просто потеряют работу?
Ответ не так прост. Да, ИИ заменит человека во многих операционных задачах. Но принятие решений в сложных, неоднозначных ситуациях останется за людьми. Особенно когда речь идет об ответственности.
Можно автоматически классифицировать 95% данных. Но 5% пограничных случаев, где нужно учитывать контекст, юридические нюансы, этические соображения, — поле для человека. По крайней мере, пока. Можно настроить алгоритмы контроля качества — но, если система показывает, что качество данных падает, решение о том, как перестроить процессы, чтобы это исправить, принимает человек.
Более того, ответственность нельзя автоматизировать. За неправильные решения, утечки, дискриминационные алгоритмы отвечать будет не ИИ, а руководитель. И эта ответственность никуда не денется.
ИНФРАСТРУКТУРА БУДУЩЕГО: ОБМЕН ДАННЫМИ В РЕАЛЬНОМ ВРЕМЕНИ
Чтобы управление данными стало невидимым, нужна еще одна важная вещь — инфраструктура обмена данными: как внутри организации, так и между компаниями.
Скоро мы будем жить в мире, где данные перемещаются между системами мгновенно, в реальном времени, где триггерная аналитика срабатывает автоматически: как только происходит событие, система тут же запускает цепочку реакций — без участия человека.
Но для этого нужно, чтобы все участники обмена соблюдали высокие стандарты поставки данных, форматы были согласованы, метаданные описаны, качество гарантировано. И здесь мы возвращаемся к тому, с чего начинали: управление данными становится критически важным для участия в новой цифровой экономике. Тем более что конкуренция с бигтехами требует скорости и гибкости. Те, кто не сможет обеспечить качественный обмен данными, окажутся на обочине. А те, кто сможет, получат доступ к новым рынкам и новым возможностям.
Невидимое управление данными — это не про то, что Data Governance исчезнет. Это про то, что оно станет естественной, незаметной частью любой деятельности — как электричество, водопровод, дорожная разметка. Мы не думаем о них, пока они работают. Но когда они ломаются, жизнь останавливается.
Так и с данными. Их управление должно быть настолько качественным, чтобы никто о нем не вспоминал. И тогда можно будет сосредоточиться на главном — создании ценности для клиентов и развитии бизнеса.
Мы привыкли думать о внедрении управления данными как о проекте, у которого есть начало, конец, утвержденный бюджет и команда. Вы сделали — и забыли. Но с данными так не работает. Никогда не работало, а уж в будущем — тем более.
Главное, что нужно понять: трансформация в области данных никогда не закончится. Это не проект, а бесконечный путь развития. Как образование длиною в жизнь. Появляются новые технологии, меняются регуляции, растут ожидания клиентов, рождаются новые бизнес-модели. То, что работало вчера, завтра может стать неактуальным. То, что сегодня было прорывом, послезавтра станет стандартом, а послепослезавтра — устаревшим тормозом.
Функция управления данными должна стать живой. Адаптивной. Обучающейся. Эволюционирующей. Как организм, который подстраивается под изменения среды, а не пытается ее игнорировать.
УПРАВЛЯЕМОЕ РАЗРУШЕНИЕ
Есть прекрасная концепция, которую Ицхак Адизес называл «управляемым разрушением»[114]. Смысл ее прост и жесток одновременно: если ты не разрушишь себя сам, это сделают конкуренты. Им не нужна будет твоя реабилитация, твои планы спасения, надежды на лучшее. Они просто займут твое место.
Поэтому будущее требует от компаний готовности разбирать себя на части и собирать заново. Не дожидаясь кризиса, а на опережение. Не когда прижало, а когда еще все хорошо, но уже понятно, что завтра будет иначе. Отказываться от того, что работало годами. Менять процессы, которые выстраивались десятилетиями. Переучивать людей, которые привыкли делать по-своему.
И да, это касается и управления данными. Те подходы, которые вы внедрили в прошлом году, могут потребовать пересмотра в следующем, поскольку появятся новые источники, новые технологии, новые требования. И если вы не готовы меняться, то станете тормозом для всего бизнеса.
ЧТО ЭТО ЗНАЧИТ ДЛЯ ВАС ЛИЧНО
Если вы отвечаете за данные в своей компании, готовьтесь к тому, что ваша роль будет меняться. И требования к вам — тоже.
Экспертность в узкой области перестает быть главным козырем. Да, нужно понимать, как устроены данные, как работают алгоритмы, как внедрять DG. Но этого мало. На первый план выходят другие вещи.
Агентность (но не для ИИ-агентов, а для людей) — умение брать на себя ответственность, даже когда нет готовых решений и четких инструкций, способность действовать, а не ждать указаний.
Лидерство — готовность вести за собой людей в условиях неопределенности. Когда будущее туманно, а дорога не проложена, люди смотрят на того, кто не боится идти первым.
Метанавыки[115]:
• критическое и системное мышление, умение видеть картину целиком, а не только свой участок. Способность отделять важное от шумного, долгосрочное от сиюминутного;
• гибкость и адаптивность — готовность менять планы на ходу, перестраиваться, учиться новому. Не раз в пять лет на курсах повышения квалификации, а каждый день;
• умение учиться всю жизнь — потому что знания устаревают быстрее, чем мы успеваем их применить;
• управление своим состоянием — потому что в потоке постоянных изменений легко выгореть. Нужно уметь восстанавливаться, сохранять ясность ума и эмоциональную устойчивость.
Все это — те качества, которые раньше требовались только высшему руководству. Теперь они нужны каждому, кто хочет оставаться востребованным.
НАПОСЛЕДОК
Есть старая библейская мудрость: «Кто имеет, тому дано будет и приумножится, а кто не имеет, у того отнимется и то, что имеет»[116]. В мире данных это работает безжалостно.
Компании, которые научатся управлять данными, получат еще больше данных и еще больше возможностей. Их алгоритмы будут становиться умнее, продукты — лучше, позиции — сильнее. А те, кто не справится, потеряют даже то, что имели: клиентов, долю рынка, инвестиции, репутацию.
У вас есть выбор: остаться в статике и надеяться, что пронесет, или войти в поток, принять неизбежность изменений и сделать их своим союзником. Книга, которую вы держите в руках, — не инструкция на все времена. Это приглашение к пути. Дальше придется идти самим. Но, надеемся, теперь вы знаете, куда смотреть и на что опираться.
Наши дни. Кинотеатр. На экране «2001 год: Космическая одиссея». После двадцатиминутного видео с живой природой и некоторого недоумения зрителей обезьяна наконец подбрасывает кость в воздух. А в следующем кадре орудие труда превращается в космический корабль, плывущий в бесконечности под вальс Иоганна Штрауса.
Зал кинотеатра затих. Кто-то жевал сэндвич, завернутый в фольгу. Кто-то пригубил колу. На экране виднелся черный монолит. «Черный монолит»[117] зазвенел в кармане у кого-то, вокруг зашикали. Астронавты в пухлых скафандрах тянули к нему руки, как та самая обезьяна миллион лет назад тянулась к новому и непонятному.
Кубрик, снимая этот монтаж — от примитивного орудия труда до звездолета за одно мгновение, — показал то, что мы боимся признать. Технологии меняются молниеносно. А мы?
Отведите глаза от экрана. Вспомните, о чем вы думали сегодня утром. О деньгах. О здоровье. О том, что вчера кто-то сказал обидное. О сексе. О том, что надо купить молока. Те же мысли были у римского легионера, средневекового крестьянина, лондонского лорда, глазеющего на «Ракету». Контекст другой, а набор базовых импульсов — тот же.
Орудие труда из кости превратилось в космический корабль. Мы научились лечить болезни, которые тысячелетиями косили человечество. Мы можем говорить с любым человеком на планете, не вставая с дивана. Инструменты стали сложнее. Скорость передвижения и разрушения выросла в тысячи раз.
И вот мы стоим на пороге нового скачка. Искусственный интеллект, который через несколько лет, вероятно, будет мощнее любого человеческого мозга в любой узкой задаче. Чипы, которые можно будет вживить в голову, чтобы получать информацию без экранов. Биоинтерфейсы, стирающие границу между человеком и машиной.
Вопрос, который Кубрик оставил без ответа, повис над нами: а сильно ли мы шагнем вперед? Или просто получим более мощные орудия труда, оставаясь теми же — со страхами, страстями и способностью в упор не замечать того, что не вписывается в нашу картину мира?
Технологии не делают нас мудрее. Они лишь усиливают то, что уже есть.
Новый мир, который строит ИИ, будет основан на данных. Это его единственная пища, его воздух, его вода. Качество этого мира будет определяться качеством этих данных. Не объемом, не скоростью обработки, а именно качеством — тем, насколько правдиво, полно и осмысленно то, чем мы кормим новый разум.
Если данные противоречивы — ИИ сойдет с ума, пытаясь их примирить. Если лживы — ИИ станет самым искусным лжецом в истории. Если отражают только наши худшие стороны — мы получим машину, которая будет воспроизводить и усиливать это худшее с пугающей эффективностью, как Океан Лема на планете Солярис.
Паровой двигатель изменил все, но человек остался человеком. ИИ тоже изменит все. Вот только теперь от того, насколько сознательно мы подойдем к данным, зависит, в каком мире мы окажемся по ту сторону перехода.
Потому что без фундамента даже космический корабль рухнет обратно в доисторическую грязь. Так же, как Mars Climate Orbiter.