К книге
Генеративный искусственный интеллект. Как ИИ меняет нашу жизнь и работу3 Конфиденциальность и безопасность данных в аспекте LLM. 3.1. Как усовершенствовать генерирование в LLM, сделав упор на безопасность. 3.1.2. Фильтрация контента или условное предобучение
33%
3 Конфиденциальность и безопасность данных в аспекте LLM. 3.1. Как усовершенствовать генерирование в LLM, сделав упор на безопасность. 3.1.2. Фильтрация контента или условное предобучение
44

Другой подход к проблеме заключается в том, чтобы отфильтровать исходные обучающие данные LLM в соответствии с их уровнем вредоносности. Чисто теоретически, если бы нам это удалось, модель перестала бы генерировать, например, непристойный контент в первую очередь потому, что ранее не встречала соответствующих текстов и, следовательно, не «знала» бы, какие ругательства могут использоваться. Это определенно помогает избежать генерации токсичного текста, но, как вы можете догадаться, ухудшает способность модели обнаруживать токсичный текст.

У нас достаточно знаний о человеческой природе, чтобы с уверенностью сказать, что любая LLM после публичного запуска непременно столкнется со множеством вредоносных, вызывающих ненависть и враждебность пользовательских запросов. Люди будут просить модель сгенерировать откровенный сексуальный контент, женоненавистнические шутки, оскорбления на этнической почве, графические изображения насилия и прочее, а также будут присылать это все сами. Эти реалии должны учитываться в любой стратегии управления моделью, и в идеале мы хотели бы изящно реагировать на подобные промпты, отвечая по теме, но при этом выступая против расизма, женоненавистничества или любых других нежелательных материалов. Тем не менее некоторые эксперименты показали, что тщательное условное предобучение (см. далее) может существенно снизить количество токсичных ответов, сгенерированных моделью, при этом сохраняя большую часть ее способности понимать естественный язык3.

Хотя конкретные рабочие реализации могут различаться, в этом подходе, как правило, используется классификатор, обученный выявлять токсичный или небезопасный контент. Но вместо того чтобы фильтровать выходные данные модели, классификатор просматривает неразмеченные данные предварительного обучения, которые обычно собраны из множества различных источников. Если бы мы использовали Reddit в качестве одного из таких источников, то могли бы выявить некоторые сабреддиты, содержащие много токсичной речи, и исключить их из обучающего набора модели, чтобы избежать использования этого типа речи при генерации возможных ответов (фильтрация). Или мы могли бы оставить такие сабреддиты в обучающем датасете, но пометить их как небезопасные, а остальной текст – как безопасный; затем на этапе генерации вывода сообщить модели, что нам нужно сгенерировать ответ, похожий на безопасный текст, но не на опасный (условное предобучение, conditional pre-training). Успех обоих этих методов зависит от способности обнаруживать токсичность или потенциальную опасность в огромных объемах данных, но даже если такая классификация проведена не совсем правильно, предварительная подготовка может оказать весьма желательное воздействие на генерации LLM4, даже без постобработки результата или тонкой настройки модели.

Предыдущая главаГлава 44 из 135Следующая глава