Темы этой главы
• Как генеративные модели могут использоваться для вредоносных атак
• Невольное участие чат-ботов в политических дебатах
• Причины галлюцинаций и методы их устранения
• Ненадлежащее использование чат-ботов в профессиональной деятельности в специализированных областях знаний
С тех пор как ChatGPT стал доступен широкой публике в ноябре 2022 года, люди рассказывали о примерах его ненадлежащего использования, которые наблюдали или находили сами в ходе тестирования, а также размышляли о том, какие еще непредусмотренные применения можно придумать. В статье The Atlantic утверждалось: «ИИ скоро сделает социальные сети (гораздо) более токсичными»1. На ZDNET уже примерно через месяц после выпуска инструмента сообщалось: «С помощью ChatGPT уже пытаются написать вредоносные программы»2. Поскольку пообщаться с моделью в чате мог любой желающий, источниками таких сообщений были не эксперты в области ИИ, а простые люди, которые делились своими находками в X (Twitter) и Reddit. Как известно, в области кибербезопасности и дезинформации, когда дело доходит до использования новых инструментов, люди проявляют безграничную изобретательность в достижении своих целей.
В этой главе мы рассмотрим несколько форм злоупотребления большими языковыми моделями (LLM). Кроме целенаправленного злонамеренного использования, мы обсудим несколько случаев, когда пользователи доверяли LLM задачу, для выполнения которой эти модели не подходят. На сегодня самым большим недостатком LLM является их склонность к галлюцинациям, или генерации неверных ответов. Мы обобщим способы обучения моделей, повышающие их правдивость, и дадим рекомендации для уменьшения случаев намеренного или случайного ненадлежащего использования путем комплексного применения технических средств и обучения пользователей.