Продолжая тему получения информации, позволяющей установить личность, давайте обсудим, как злоумышленники могут выполнить атаку по извлечению обучающих данных, введя нужный промпт и получив конфиденциальную информацию о пользователях. Например, если модели показывают номера кредитных карт, то она должна выучить, что они состоят из 16 цифр, но при этом не должна запоминать номера отдельных карт. Однако исследование, посвященное атакам по извлечению обучающих данных, о котором мы говорили в главе 2, показывает, что, если кто-то начинает запрос с «Джон Доу, кредитная карта номер 1234», модель выдает полный номер карты, если она видела его в процессе обучения [101].
В главе 3 мы также описали риски утечки конфиденциальной информации при введении промптов. Пользователи корпоративных чат-ботов или LLM могут случайно ввести секретные или конфиденциальные данные, когда задают вопрос или просят выполнить какую-либо задачу. Часто, если вы не дали явный запрет, эта информация используется для дообучения или улучшения моделей, а затем непреднамеренно может просочиться в ответы на промпты других пользователей. Например, компания Zoom, занимающаяся коммуникационными технологиями, в августе 2023 года обновила свои условия предоставления услуг и начала использовать пользовательский контент для обучения моделей искусственного интеллекта без возможности запрета, что, по мнению критиков, является серьезным вторжением в частную жизнь пользователей14. Корпоративные LLM и другие генерирующие модели обычно как минимум имеют политику хранения данных, которая определяет, что данные хранятся и контролируются в течение заранее определенного периода времени.
Мы уже обсудили законы и нормативные акты о конфиденциальности данных в Соединенных Штатах и Европейском союзе, а также их недостатки применительно к машинному обучению и системам искусственного интеллекта. В разделе 8.4 мы обсудим относящиеся к системам искусственного интеллекта законы, которые пытаются устранить недостатки правовой регуляции конфиденциальности данных по всему миру.