Адаптация ИИ – это приведение в соответствие целей системы машинного обучения и предполагаемых целей ее создателей, или, в более широком смысле, соответствие между мощными системами ИИ и общечеловеческими ценностями.
Исследователи используют несколько стратегий, чтобы помешать модели генерировать ненадлежащие ответы, включая алгоритмы обнаружения нежелательных ответов модели, фильтрацию как ответов, так и обучающих данных, условное предварительное обучение, обучение с подкреплением и обратной связью от человека (RLHF), Конституционный ИИ или обучение с подкреплением и обратной связью от ИИ (RLAIF).
Еще одним риском нарушения конфиденциальности является утечка личных или секретных данных через пользовательский промпт. Эта информация может быть использована для дальнейшей доработки или обучения модели, но она также может просочиться в ответы на вопросы других пользователей.
Существующие законы о конфиденциальности и защите данных часто имеют ограниченный характер, и компании приняли внутренние меры для предотвращения утечки закрытых данных при использовании LLM их сотрудниками.