К книге
Генеративный искусственный интеллект. Как ИИ меняет нашу жизнь и работу8 Что ждет ИИ и LLM в будущем?. 8.3. Лучшие практики ответственного использования LLM. 8.3.2. Защита конфиденциальности данных
80%
8 Что ждет ИИ и LLM в будущем?. 8.3. Лучшие практики ответственного использования LLM. 8.3.2. Защита конфиденциальности данных
108

В вопросе конфиденциальности данных в генеративных моделях важна роль каждого: и разработчиков, и пользователей, и политиков, и широкой общественности. Разработчики больших языковых моделей должны приложить разумные усилия, чтобы исключить из процесса обучения те источники, которые явно содержат значительное количество персональных данных. Например, системы блокировки спама десятилетиями обучались на базах данных электронных писем – модель училась предсказывать, является ли конкретное письмо спамом. В случае с LLM риски при использовании датасетов электронных писем намного выше. Существует вероятность того, что модель сгенерирует текст, который видела при обучении, и в него может просочиться секретная или конфиденциальная информация, как это было в примере из главы 2, когда LLM, обученная на корпоративных письмах, в точности сгенерировала номера кредитных карт и социального страхования. Компания Google, которая обслуживает миллионы пользователей по всему миру, предлагая офисное ПО, например Gmail и Docs, заявила, что не использует эти данные для обучения генеративных моделей без разрешения пользователя21. Однако в отсутствие каких-либо юридических ограничений нетрудно представить, что технологическая компания с огромными массивами пользовательских данных захочет использовать их в качестве конкурентного преимущества, например для создания персонализированной электронной почты на основе сообщений самого же пользователя, несмотря на угрозы для конфиденциальности.

Мы знаем точно, что Google действительно использует анонимизированные данные для таких функций, как проверка орфографии и Smart Compose – разновидности автозаполнения в Docs. Анонимизация данных снижает риск, связанный с попаданием конфиденциальных данных в обучающий набор, но методы повышения конфиденциальности (privacy-enhancing technologies, PETs), например дифференциальную приватность, довольно сложно реализовать. Более простые методы, такие как обнаружение персональной информации, ее обфускация и маскировка, тоже имеют свои недостатки: выявить все данные, по которым можно установить личность, сложно, а маскировка этих данных во время обучения LLM может иметь непредвиденные последствия при генерации ответов, поскольку при этом не сохраняются статистические свойства текста. Мы надеемся, что согласованные усилия ученых в области методов повышения конфиденциальности приведут к усовершенствованиям, которые с готовностью примут поставщики LLM.

Пока же компании должны четко формулировать свои политики и методы в отношении защиты данных и соответствующим образом регулировать ожидания пользователей. Как минимум они должны описать, какие данные собирают, как их используют, а также разработать механизм, позволяющий пользователям отказываться от использования данных или удалять их. При использовании LLM, особенно в профессиональной области, люди должны ознакомиться с этими политиками и дважды подумать, перед тем как вводить какую-либо личную информацию. Несколько крупных работодателей, включая Samsung и Amazon, уже ограничили использование ChatGPT для своих сотрудников в рабочем процессе из-за угрозы нарушения конфиденциальности данных.

Хотя опасения по поводу конфиденциальности данных в контексте LLM являются относительно новыми, они далеко не уникальны. Сбор, обмен и продажа персональных данных были главными проблемами на протяжении всего существования интернет-экономики. И хотя нормативно-правовое регулирование в этой сфере должно было постепенно развиваться, основным регулирующим документом остается Общий регламент по защите персональных данных, принятый Европейским союзом в 2018 году. После принятия этого закона использование персональных данных в алгоритмах машинного обучения стало объектом пристального внимания и останется важным элементом в более широком контексте законодательного регулирования ИИ.

Предыдущая главаГлава 108 из 135Следующая глава