К книге
Генеративный искусственный интеллект. Как ИИ меняет нашу жизнь и работу6 Повышаем производительность: ИИ как помощник. 6.5. Выявляем машинно-сгенерированный текст
62%
6 Повышаем производительность: ИИ как помощник. 6.5. Выявляем машинно-сгенерированный текст
84

В главах 4 и 5 мы обсудили несколько способов обнаружения контента, созданного машиной, и некоторым из них преподаватели уже нашли применение, выявляя домашние задания, полностью написанные ИИ. Несмотря на многообещающие результаты в разработке методов обнаружения, идеальное решение пока не придумано – это чрезвычайно сложная задача, и с развитием генеративных моделей она становится все сложнее. Стоит также отметить, что условия этой задачи не так хорошо сформулированы, как может показаться. Если мы изменим одно или два слова, то должен ли текст по-прежнему считаться сгенерированным с помощью ИИ? Нечеткая постановка задачи только усложняет разработку надежных методов обнаружения. В этом разделе мы более подробно рассмотрим методы обнаружения текста, сгенерированного с помощью ИИ.

К традиционным подходам обнаружения машинного текста относятся статистические методы обнаружения выбросов, такие как GLTR (обсуждается в разделе 5.2). В основе GLTR лежит предположение, что модель склонна подбирать наиболее вероятные слова для каждой позиции в предложении, тогда как в естественном написании чаще встречаются слова, неожиданные для текущего контекста34. Чтобы отличить тексты, написанные машиной и человеком, здесь используются базовые статистические методы, например распределение вероятностей слов в тексте. Другой статистический подход, DetectGPT, для определения того, сгенерирован ли текст с помощью LLM, также использует склонность моделей генерировать наиболее вероятные последовательности35. Например, если в предложении, написанном машиной, произвести перестановку слов, то новое предложение, как правило, будет оценено самой моделью как менее вероятное (действительно, ведь она выбрала наиболее вероятный вариант для ответа). А вот в предложении, написанном человеком, это может не соблюдаться – после перестановки слов предложение может оказаться как более, так и менее вероятным с точки зрения модели.

Как обсуждалось в предыдущих главах, для обнаружения машинного текста часто используются обучаемые классификаторы. Классификатор – алгоритм, который обучен определять, к какому классу или группе принадлежат объекты, которые ему показали. В январе 2023 года OpenAI выпустила «несовершенный» классификатор, позволяющий определять, написан текст искусственным интеллектом или человеком. Это стало примером того, как классификатор можно использовать для этой задачи. OpenAI признавала, что невозможно надежно выявлять любой созданный с помощью ИИ текст, но предлагала задействовать ее классификатор в качестве дополнения к другим методам обнаружения таких текстов, а не как основной инструмент принятия решения (но, как отмечалось в главе 4, классификатор OpenAI был удален через пять месяцев после выпуска из-за проблем с точностью)36. Хотя хорошие классификаторы играют свою роль в обнаружении машинно-сгенерированного текста, важно знать об их ограничениях (как и в случае с другими техническими решениями этой задачи) и понимать, что они не являются гарантированным средством идентификации текста, написанного с помощью ИИ. Стоит также отметить, что классификаторы могут быть хорошо знакомы только с особенностями конкретной генеративной модели. Другими словами, классификатор, предназначенный для обнаружения текста из GPT‐4, будет не так хорошо выявлять текст, сгенерированный другими чат-ботами, такими как Bard или Bing Chat. Тем не менее они показали свою перспективность как мера предотвращения ненадлежащего использования машинно-сгенерированного текста, особенно в сочетании с другими социальными и техническими методами определения источника фрагмента контента.

Учитывая растущую сложность в надежном определении контента, сгенерированного с помощью ИИ, исследователи разрабатывают новые методы маркировки контента, которые иногда называют нанесением водяных знаков. Исторически маркировка в виде водяных знаков использовалась на изображениях и видео, защищенных авторскими правами, чтобы предотвратить кражу интеллектуальной собственности. Используя инновационный подход, исследователи предложили, как можно встроить маркировку в текст, сгенерированный LLM, чтобы его было легче выявлять37. Маркировка текста производится путем изменения порядка отбора слов в генерируемом тексте, то есть меняется вероятность определенных специальных слов, после чего природу текста можно идентифицировать именно по этим словам. Давайте проиллюстрируем эту идею (см. рис. 6.9). Представьте, что словарь модели случайным образом разделен пополам на зеленый и красный списки. Идея маркировки состоит в следующем: когда LLM, например ChatGPT, генерирует текст, мы можем попросить ее использовать слова из зеленого списка чаще, чем обычно. Таким образом, частота зеленых слов будет индикатором искусственного происхождения: чем больше слов из зеленого списка, тем более вероятно, что текст был сгенерирован машиной. В то время как текст, написанный человеком, представлял бы собой более случайное сочетание слов.

МАРКИРОВКА текста искусственного происхождения осуществляется путем изменения порядка отбора слов в генерируемом тексте, то есть меняется вероятность появления определенных специальных слов, после чего легче идентифицировать текст.

Рис. 6.9. Схема создания маркировки в тексте, который генерирует чат-бот

Предполагается, что такую маркировку не должен замечать человек – если кто-то попытается обойти защиту, редактируя текст, он не должен знать, какие слова нужно заменить. Хотя этот подход оказался более перспективным, чем статистические методы или классификаторы, у него тоже есть свои ограничения. Во-первых, этот механизм должен быть внедрен в LLM с самого начала. Во-вторых, сохранение качества текста, генерируемого LLM, будет непростой задачей. И наконец, чтобы маркировка стала действительно рабочим методом, необходимо, чтобы все крупные игроки, создающие генеративные языковые модели, единогласно согласились включить ее в свои системы ИИ. Это может оказаться сложной задачей или даже невыполнимой (по крайней мере, без государственного регулирования). Для рядовых пользователей, которые решат воспользоваться технологией маркировки (например, преподаватели, которые пытаются определить, создано ли эссе студента с помощью ИИ), может оказаться довольно неудобно проверять текст с помощью нескольких инструментов, однако этого можно избежать, если все компании по разработке ИИ примут отраслевой стандарт, что, опять же, представляет собой труднодостижимую задачу. При этом публикация технологии в открытом доступе также не поможет, поскольку любой желающий сможет понять принципы маркировки, а значит, и воспроизвести ее, что сделает ее бессмысленной. OpenAI объявила, что они работают над маркировкой текста в числе прочих технологий для определения происхождения38. Возможно, наиболее близким к отраслевому стандарту решением может стать повсеместное использование технологии маркировки OpenAI. С другой стороны, это наделило бы OpenAI огромным влиянием, плохо поддающимся контролю.

Но даже если отраслевой стандарт будет внедрен успешно, люди все равно смогут догадаться, какую часть текста нужно изменить, чтобы обходить методы обнаружения. Как это ни прискорбно, это проблема любого инструмента обнаружения – он сам же упрощает задачу обхода своей цели. Работает это так: люди могут многократно изменять машинно-сгенерированный текст и проверять его инструментами до тех пор, пока происхождение не перестанет обнаруживаться. Широкое распространение инструментов обнаружения дает некоторые основания для беспокойства, поскольку злоумышленники могут научиться «обманывать» их или обходить. Однако, чтобы выдать машинно-сгенерированный текст за свой собственный, потребуется несколько циклов изменение-проверка, для чего нужно довольно много времени, и это ограничивает подобное поведение.

Хотя в этом разделе мы обсудили несколько значимых технических решений, стоит еще раз подчеркнуть, что панацеи быть не может – из-за сложности задачи не существует единого решения, которое каждый раз надежно выявляло бы все фрагменты машинно-сгенерированного контента. Вероятно, у нас так никогда и не появится идеальный инструмент, который надежно обнаруживает машинно-сгенерированный контент. По мере разработки методов обнаружения машинно-сгенерированного контента будет параллельно улучшаться качество искусственных текстов, приближаясь к уровню написанных человеком. Вот почему необходимо внедрить комплексную систему выявления ненадлежащего использования контента, созданного с помощью ИИ, которая не ограничивается исключительно техническими решениями, а включает в себя также изучение искусственного интеллекта в школах и на рабочих местах, чтобы мы могли лучше разбираться в связанных с ним рисках и ограничениях и научились использовать его для улучшения своей жизни.

Предыдущая главаГлава 84 из 135Следующая глава