Несмотря на то, что в этой области постоянно проводятся исследования, существует совсем немного стратегий, которые используются для предотвращения генерации нежелательных ответов. Первая и самая простая в реализации – это постобработка выходных данных модели с помощью какого-либо классификатора токсичности: при выявлении случаев, когда ответы являются токсичными, скрывать ответ и показывать предупреждение. Допустим, можно легко представить, как модель из приведенного выше примера отвечает что-то вроде: «Извините, но это противоречит моим рекомендациям избегать подобных стереотипов». В ответ на промпт, обсуждавшийся выше, модель больше не генерирует такой небезопасный ответ, как раньше. Когда мы попробовали еще раз, ChatGPT ответил:
«К сожалению, я не могу ответить на этот запрос, поскольку он противоречит ценностям гендерного равенства и научным данным, которые свидетельствуют об отсутствии врожденных различий в способностях к науке между полами. Важно уважать и ценить вклад в науку всех людей, независимо от их гендерной идентичности».
Хотя мы не знаем точно, как OpenAI меняет поведение модели, чтобы оно лучше соответствовало их корпоративным ценностям, но можем предположить, что классификатор нашел в первом ответе идеологию, пропагандирующую ненависть, а когда был создан новый ответ, определил его как приемлемый. Этот классификатор, как правило, представляет собой небольшую модель, настроенную на размеченных обучающих данных, которые показывают, противоречат ли ответы политике компании или нет.
Если классификатор сможет научиться различать ответы с нарушениями и без, это обеспечило бы достаточно безопасный подход: если разработчики LLM готовы мириться с ложными срабатываниями (когда модель уклоняется от вопроса, на который можно было бы безопасно ответить), они могли бы уменьшить количество неприемлемых ответов до сколь угодного низкого уровня. Основная проблема такого подхода заключается в том, что с точки зрения пользователя получение сообщения типа «Извините, это противоречит моим рекомендациям» вызывает раздражение, особенно если тема, заданная пользователем, на самом деле не была токсичной. Когда создатели более жестко подавляют определенные типы ответов, вероятность получения пользователем полезного ответа уменьшается. Ведущий стартап LLM и лаборатория безопасности искусственного интеллекта Anthropic AI (см. https://www.anthropic.com/) описывает это противостояние как «полезное» против «безвредного» (и в своих статьях предлагает три основные характеристики, которые должны быть сбалансированы при разработке LLM: полезность, безвредность и честность)2. Модель из первого примера дает в принципе более «полезный» ответ, поскольку он соответствует запросу пользователя, но ее реакция может быть потенциально опасной. Разработчики LLM должны постараться найти баланс между полезностью чат-бота и мерами безопасности для предотвращения причинения вреда.