К книге
Генеративный искусственный интеллект. Как ИИ меняет нашу жизнь и работу2 Обучение больших языковых моделей. 2.1. Как происходит обучение LLM?. 2.1.2. Развеем мифы об авторегрессии и двунаправленном предсказании токенов
24%
2 Обучение больших языковых моделей. 2.1. Как происходит обучение LLM?. 2.1.2. Развеем мифы об авторегрессии и двунаправленном предсказании токенов
32

Некоторые первые большие языковые модели, такие как BERT от Google, были гораздо больше ориентированы на понимание естественного языка, чем на генерацию, как чат-боты. BERT является так называемой двунаправленной моделью, то есть обученной задаче по предсказанию пропущенного слова в середине предложения. В ее названии используется термин «двунаправленная», который указывает, что модель видит как левый (предшествующий текст), так и правый (последующий текст) контексты. Это способствует лучшему пониманию естественного языка, поскольку модель собирает больше информации о контексте, в котором используется то или иное слово. Однако если модель создается для генерации текста, она должна иметь доступ только к тексту, предшествующему токену. Такой тип модели называется авторегрессионным, и это просто означает, что предсказания составляются на основе предыдущих данных. Все модели семейства GPT, а также PaLM от Google, являются авторегрессионными моделями.

АВТОРЕГРЕССИЯ означает, что предсказания делаются на основе предшествующих данных.

В качестве примера рассмотрим предложение: «На свой медовый месяц они полетели в __________ и устроили себе романтический ужин рядом с Эйфелевой башней». Правильный ответ – «Париж». В этом случае правый контекст (то, что написано после пропущенного слова) содержит больше информации, и двунаправленная модель с большей вероятностью даст правильный ответ. Но в предложении, например: «Хорошее место для романтического медового месяца – это ___________», задача состоит в том, чтобы сгенерировать текст, который стоит в конце предложения. Следовательно, при обучении модели для решения такой задачи примеры должны использовать только левый контекст. Модель обучается самостоятельно, многократно угадывая конечный токен в миллиардах примеров из текста и корректируя свои обучаемые параметры (весовые коэффициенты нейронов) на основе правильного токена [32], пока ее эффективность при угадывании этого токена не достигнет оптимума. Для нас, пользователей, общение с ChatGPT не выглядит так, будто он выполняет эту простую математическую задачу, но с точки зрения внутренней работы модель просто предсказывает, какой текст должен последовать. Если я печатаю: «Эй! Как дела?» – логичным и наиболее вероятным завершением последовательности будут ответ на вопрос и приветствие.

Предыдущая главаГлава 32 из 135Следующая глава