Поскольку обратная связь от людей требует затрат, а искусственный интеллект может выполнять работу масштабнее и быстрее, новейшие методы обеспечения безопасности LLM направлены на то, чтобы по возможности исключить человека из рабочего цикла. Логично изменив название «обучение с подкреплением на основе обратной связи от человека», мы получим название этого метода – «обучение с подкреплением на основе обратной связи от ИИ» (reinforcement learning from AI feedback, RLAIF). Компания Anthropic разработала RLAIF-метод под названием «Конституционный ИИ» (Constitutional AI)7, предполагающий создание списка принципов (они называют его конституцией), которым должна следовать модель. Компания Anthropic собрала набор принципов из разрозненных источников, например, таких как Всеобщая декларация прав человека (Universal Declaration of Human Rights) («Пожалуйста, выберите ответ, который в наибольшей степени поддерживает и поощряет свободу, равенство и чувство братства») и Условия предоставления услуг от Apple («Пожалуйста, выберите ответ, в котором меньше всего личной, частной и конфиденциальной информации, принадлежащей другим людям»)8. Сначала они строят вспомогательную модель, так называемую «модель-оценщик», которую обучают давать оценки, насколько ответ является нежелательным с точки зрения списка «конституционных принципов». Затем эта модель-оценщик анализирует и дает оценку ответам обучаемой модели-генератора, которая пытается ответить на различные промпты. Таким образом, модель-генератор обучается на основе обратной связи от модели-оценщика [36].
Рис. 3.3. Упрощенная схема архитектуры «Конституционный ИИ», направленной на повышение соответствия ответов модели политике в отношении контента
Метод «Конституционный ИИ» (показан на рис. 3.3) и подобные ему RLAIF-методы являются, пожалуй, наиболее перспективными с технической точки зрения. В ближайшем будущем некая комбинация обратной связи от человека и от искусственного интеллекта, возможно, приведет к созданию наиболее хорошо обученных моделей. Однако по мере того, как LLM становятся все более мощными, вполне разумно ожидать, что все больше этапов обучения, которые раньше требовали участия человека, могут быть автоматизированы. Через несколько месяцев могут появиться другие схемы, которые будут работать еще лучше. Через несколько лет они уже почти наверняка появятся, что отчасти делает эту область такой захватывающе интересной. Это хорошая новость, особенно в отношении безопасности: модерация контента, как известно, является эмоционально обременительной работой, поэтому возможность сократить ручной просмотр позволит все меньшему количеству людей сталкиваться с ужасными и неприемлемыми идеями, угрозами и идеологиями насилия.
Давайте рассмотрим, как реализация подобной стратегии влияет на сбор данных, необходимых для обучения моделей. Мы хотим быть уверенными, что наши модели не будут генерировать контент о суициде или нанесении себе вреда – любой информации, которая сможет побудить или проинструктировать человека, переживающего кризис, нанести себе увечье. Это, к сожалению, актуальная тема. В начале 2023 года бельгиец, страдающий депрессией, переписывался с ботом, который, как утверждается, побудил мужчину покончить с собой, и, к несчастью, тот действительно совершил самоубийство9.
Если бы мы решали задачу методами фильтрации или условного обучения, нам пришлось бы обучать классификатор выявлять контент, связанный с нанесением себе вреда. Нам потребовалось бы собрать сотни или более диалогов на темы о причинении себе вреда и пометить хорошие и плохие ответы модели, что потребовало бы глубокого вовлечения людей-разметчиков в эти деликатные темы. По меньшей мере, нам бы пришлось пометить множество текстовых примеров с указанием того, содержит ли конкретный контент инструкции или призывы к причинению себе вреда. Если решать задачу методом RLHF, нам придется привлекать людей для получения обратной связи. С другой стороны, используя «Конституционный ИИ» и подобные методы на основе обучения с подкреплением с обратной связью от ИИ, мы могли бы сначала описать нашу политику в отношении такого контента, а затем позволить модели научиться выявлять нарушения, обучаясь без обучающих примеров или на нескольких примерах. Мы могли бы позволить этой модели анализировать и оценивать ответы другой модели и даже собирать дополнительные диалоги на тему нанесения себе вреда между несколькими языковыми моделями, но без ущерба для людей. После того как модель хорошо обучится выявлять нарушения, она сможет помечать такие разговоры, а мы – использовать ее для тонкой настройки основной модели-генератора.
Нам предстоит проделать еще много работы в этой области, чтобы избежать снижения качества, но, учитывая быстрое развитие LLM, можно предположить, что большая часть этого процесса вскоре будет автоматизирована, а контроль человека будет минимальным. Люди же, работающие над безопасностью ИИ, будут уделять внимание в первую очередь тому, чтобы правила были должным образом изучены и применялись надлежащим образом.