Существуют относительно новые и более сложные стратегии машинного обучения, которые применялись в современном поколении больших языковых моделей. Как уже обсуждалось в главе 1, обучение с подкреплением и обучение с учителем представляют собой разные парадигмы обучения. В основе обучения с учителем лежит предположение, что где-то есть условная линия, которая разделяет то, что модель может сказать, и то, что она не должна говорить. Эта линия – и она вряд ли будет прямой, если вообще ее когда-нибудь можно будет точно определить – называется границей принятия решений. Методы обучения с учителем ориентированы на создание границы принятия решений для конкретной задачи. На рис. 3.1 показана гипотетическая задача классификации с тремя классами. Пунктирные линии – это границы принятия решений, выученные моделью для этой задачи на основе примеров из своих обучающих данных, которые изображены в виде точек.
Рис. 3.1. Визуальное представление задачи классификации при обучении с учителем с выученными границами принятия решений
Рис. 3.2. Общая схема обучения с подкреплением и обратной связью от человека (RLHF)
Обучение с подкреплением подразумевает управление поведением модели и раньше в основном использовалось для выполнения задач с легко определяемой функцией вознаграждения. Однако для надежного разделения на хорошие и плохие ответы, особенно учитывая широкий спектр возможных нежелательных тем – от публикации личной информации до создания вредоносной дезинформации, такой функции нет. Еще более проблематичным оказалось то, что не во всех случаях можно легко сказать, каков бы был допустимый и желаемый ответ модели, поэтому просто предопределить набор сценариев поведения не получается. В 2017 году исследователи из OpenAI и DeepMind предложили решение: через обучение с подкреплением попытаться «отучить» модель от небезопасного поведения, давая ей обратную связь с человеком и, таким образом, итеративно определяя функцию вознаграждения5. На практике это означает, что людей просят оценить ответы модели: либо обозначить эти ответы как приемлемые или проблемные, либо только указать предпочтительный ответ. Несмотря на то, что люди по-прежнему оценивают ответы модели по-разному, совокупные данные о предпочтениях людей в конечном итоге приблизят модель к идеальному поведению. С помощью этих данных вычисляется функция вознаграждения для модели, и со временем ответы модели улучшаются, а это улучшение определяется как написание более качественных и менее проблемных ответов, опять же по оценкам людей. Эта стратегия, известная как обучение с подкреплением и обратной связью от человека (reinforcement learning with human feedback, RLHF) (см. рис. 3.2), оказалась гораздо более масштабируемой и гибкой, чем предыдущие методы, и ее быстро приняли разработчики LLM по всей отрасли.
Однако у RLHF есть реальные издержки, как финансовые, так и эмоциональные. Краудсорсинговая разметка данных уже давно стала стандартной практикой при создании систем машинного обучения, в частности для модерации контента. В этой работе приходится постоянно просматривать контент, который может быть травматичным, и поэтому обычно она передается на аутсорсинг подрядчикам или фрилансерам, у которых нет ресурсов защиты на рабочем месте наемных работников. В случае ChatGPT расследование TIME показало, что OpenAI привлекала кенийских рабочих и платила им от 1 до 2 долларов в час за то, чтобы они размечали примеры ненавистнических высказываний, сексуального насилия и жестокости среди другого контента. С помощью этих размеченных примеров получилось создать инструмент для обнаружения «токсичного» контента, который в конечном итоге был встроен в ChatGPT. По словам кенийских работников, они не только получали низкую оплату, но и были «морально травмированы» тем содержанием, с которым им приходилось сталкиваться6. Даже самые передовые модели машинного обучения в мире по-прежнему в значительной степени зависят от человеческого интеллекта и труда.