Популярным применением больших языковых моделей является генерация ответов на вопросы (Q&A), где им приходится отвечать на вопросы людей на естественном языке. В целом существует два типа задач в этой области: выбор наилучшего ответа и свободный ответ. Для первой из этих задач цель обучения модели заключается в поиске правильного ответа из набора возможных вариантов, в то время как в задаче со свободным ответом модель дает ответ на вопрос на естественном языке без каких-либо предварительно подготовленных вариантов.
В зависимости от входных и выходных данных существуют три основные разновидности Q&A-моделей. Первая – это извлекающая Q&A-модель; она ищет готовый ответ из контекста, который может быть представлен в виде текста или таблицы. Вторая разновидность – это модель с «открытой книгой» (open-book generative Q&A), которая использует предоставленный контекст для генерации ответа. Ее работа напоминает первый подход с той разницей, что модель здесь извлекает не дословный ответ из контекста, а использует контекст для генерации ответа своими словами. Последняя разновидность – это модель генерации ответов на вопросы с «закрытой книгой» (closed-book generative Q&A). Здесь вы не предоставляете никакого контекста в своих входных данных, кроме самого вопроса, а модель генерирует наиболее вероятный ответ в соответствии со своими «познаниями».
До недавних усовершенствований в технологии LLM задача «ответ на вопрос» обычно решалась методом «открытой книги» при наличии доступа к бесконечному множеству запросов и ответов. Более новые модели, такие как GPT‐3, оценивались в чрезвычайно строгих условиях «закрытой книги», где модели не предоставлялся никакой дополнительный контекст, а также ей не разрешалось ни в каком виде обучаться по наборам данных, используемых для оценки. В популярные датасеты [12] для оценки моделей Q&A входят простые вопросы (см. http://mng.bz/E9Rj) и поисковые запросы Google (см. http://mng.bz/NVy7). В качестве примера можно привести такие вопросы: «Какой политик получил Нобелевскую премию мира в 2009 году?», «Какую музыку сочинил Бетховен?».
Еще одно применение моделей, которое тесно связано с данной предметной областью, – понимание прочитанного. В этой задаче модели показывается несколько предложений или абзацев, а затем ее просят ответить на конкретный вопрос. Чтобы наилучшим образом имитировать человеческие качества, LLM часто тестировали по вопросам в разных форматах на понимание прочитанного, включая вопросы с множественным выбором, диалоги и абстрактные наборы данных. Давайте рассмотрим пример с набором входных данных, включающих диалог16. Задача состоит в том чтобы дать правильный ответ на вопрос, учитывая как контекст, так и происходящий диалог: «Джессика решила посидеть в своем кресле-качалке. Сегодня у нее был день рождения, ей исполнялось 80 лет. Во второй половине дня должна была приехать ее внучка Энни, и Джессика была очень рада ее увидеть. Ее дочь Мелани вместе со своим мужем Джошем тоже должны были приехать. У Джессики был…» Если первый вопрос диалога «У кого был день рождения?», правильный ответ будет «У Джессики». Затем модели задают следующий вопрос: «Сколько ей исполнялось лет?» – на который она должна ответить: «80».
Одним из наиболее ярких примеров модели, разработанной для генерации ответов на вопросы, была модель Watson от IBM Research. В 2011 году компьютер Watson соревновался в популярном игровом шоу Jeopardy! с двумя крупнейшими победителями за все время существования телешоу и победил17.