К книге
Генеративный искусственный интеллект. Как ИИ меняет нашу жизнь и работу8 Что ждет ИИ и LLM в будущем?. 8.3. Лучшие практики ответственного использования LLM. 8.3.5. Усовершенствование методов обнаружения
82%
8 Что ждет ИИ и LLM в будущем?. 8.3. Лучшие практики ответственного использования LLM. 8.3.5. Усовершенствование методов обнаружения
111

Синтетические медиа, созданные с помощью ИИ, включая текст, изображения, аудиозаписи и видео, потенциально могут серьезно нарушить нашу информационную экосистему. Как мы уже отмечали, люди могут злоупотреблять генеративным ИИ, чтобы создавать дипфейки, дезинформацию или пропаганду в широком масштабе.

Обнаружение текстов, написанных LLM, оказалось более сложной задачей для моделей, чем генерация самого текста. В статье о классификаторе от OpenAI от 2023 года говорится:

«В январе компания OpenAI, специализирующаяся на разработке ИИ, объявила о выпуске инструмента, который может спасти мир – или, по крайней мере, сохранить душевное равновесие профессоров и преподавателей, – поскольку может определять, был ли написан фрагмент текста с помощью инструментов генеративного ИИ, таких как их собственный ChatGPT. Полгода спустя этот инструмент умер, поскольку не справлялся с теми задачами, для решения которых был создан»25.

Инструмент показывал низкую точность в обнаружении машинно-сгенерированного контента с самого начала, но в то время OpenAI надеялась, что он будет хоть как-то полезен в качестве отправной точки. Поскольку LLM становились все более совершенными, стало уже почти невозможно выявить сгенерированный ими текст. Синтетический контент, созданный с помощью моделей для генерации изображений, аудио и видео в некоторых случаях все еще можно обнаружить с помощью методов, описанных в главе 4, но даже в этих областях возможности быстро сокращаются.

Сейчас активно изучается, как можно внедрить признаки машинной генерации в синтетические медиа, чтобы люди могли определять происхождение контента. В главе 6 мы познакомили вас с идеей маркировки выходных данных LLM, которые помогают отличить машинно-сгенерированный текст от написанного человеком.

К сожалению, нанесение такой маркировки на машинный текст вряд ли когда-либо станет идеальным решением. Чтобы маркировка работала эффективно, ее должны внедрить по всей отрасли и сделать доступной общественности для проверки фрагментов контента. Но если такое решение для проверки станет общедоступным, то люди смогут использовать его для собственных машинных текстов и незначительно их корректировать – возможно, меняя всего лишь несколько слов за раз, – до тех пор, пока текст не пройдет тест на отсутствие маркировки. Помимо этого недостатка, компании могут вообще не захотеть использовать маркировку, поскольку модель создает текст, предсказывая следующее наиболее вероятное слово, а маркировка будет изменять эти вероятности, отдавая предпочтение другим словам. Таким образом, создание текста с маркировкой может означать, что LLM будет давать менее точные и качественные ответы.

Нанесение маркировки на синтетические изображения, видео и другие медиа сопряжено с другими ограничениями. DALLE-E, модель для преобразования текста в изображение от OpenAI, использует видимый водяной знак, но в блогах люди уже написали бесчисленное множество постов с рекомендациями, как удалить его с изображений. Руководитель научно-исследовательских работ некоммерческой организации Witness Сэм Грегори сказал журналу Wired: «Всегда найдутся способы убрать водяной знак», – отметив, что от некоторых видов визуальной маркировки можно избавиться, если просто изменить размер изображения или обрезать его. Еще одна проблема с водяными знаками заключается в том, что злоумышленники могут имитировать их, размещая на реальном контенте, чтобы он казался поддельным. «Дивиденды лжеца» процветают: Грегори сказал, что в большинстве случаев, которые компания Witness находила в социальных медиа, использовались не дипфейки, а реальные видео, которые объявлялись сгенерированными с помощью ИИ26.

Коалиция по вопросам происхождения и подлинности контента (Coalition for Content Provenance and Authenticity, или C2PA), упомянутая в главе 5, стремится создать «открытый технический стандарт, который позволит издателям, авторам и потребителям отследить происхождение различных типов медиа» (см. https://c2pa.org/). Согласно спецификации C2PA, необходимо записывать информацию о происхождении, такую как дата, географическое местоположение и устройство, с помощью которого была сделана фотография или видеозапись, а также данные о последующем редактировании. Эта информация защищается с помощью цифровой подписи – криптографического метода, который используется для онлайн-договоров и других защищенных транзакций. Широкое использование стандарта C2PA позволило бы пользователям проверять происхождение и историю любого медиа, встреченного в интернете, но его внедрение все еще затруднительно. Применить эту процедуру к синтетическим медиа технически было бы возможно, но при условии, что разработчики генеративного ИИ интегрируют криптографические методы в свои системы. Как и в случае с другими мерами безопасности, многие крупнейшие разработчики ИИ, несомненно, будут включать маркировку в синтетический контент, создаваемый их моделями, и семь компаний, включая OpenAI, Google, Microsoft и Anthropic, уже заявили об этом, – но эти методы не позволят однозначно определить происхождение всего контента.

Предыдущая главаГлава 111 из 135Следующая глава