Темы этой главы
• Повышение безопасности выходных данных LLM
• Снижение рисков нарушения конфиденциальности данных, которые вводят в чат-боты
• Законы о защите данных в США и ЕС
В предыдущей главе мы обсуждали, как большие языковые модели обучаются на очень больших объемах данных из интернета, которые могут содержать персональную информацию, предвзятость и другой нежелательный контент. Несмотря на то, что некоторые разработчики указывают на отсутствие ограничений в своих моделях как на коммерческое преимущество, у большинства поставщиков LLM есть набор политик в отношении тех видов контента, которые, по их мнению, модель не должна генерировать, и они прилагают много усилий для того, чтобы модель как можно точнее соответствовала этим правилам. Например, провайдеры коммерческих LLM часто не хотят, чтобы LLM генерировали контент, содержащий ненавистнические или дискриминационные высказывания, поскольку это может плохо отразиться на компании в глазах потребителей. Хотя такие политики могут различаться в зависимости от ценностей организации и внешнего давления, повышение безопасности LLM в конечном счете связано с осуществлением контроля над тем, что генерирует модель, а это требует технических вмешательств.
В этой главе мы рассмотрим меры по снижению рисков, связанных с работой LLM, включая стратегии контроля небезопасного генерирования и предотвращения непреднамеренного раскрытия конфиденциальных данных. Также мы оценим существующие законы, связанные с данными и LLM, и порассуждаем о том, как возможные будущие законы могут повлиять на управление данными и моделями в долгосрочной перспективе. Как мы еще обсудим, правовое регулирование станет ключевым фактором, определяющим будущее.