Как и следовало ожидать, большие языковые модели также хорошо подходят для решения множества других лингвистических задач. LLM уже давно и широко используются для машинного перевода, автоматизируя перевод между языками. Как обсуждалось ранее, на самом деле машинный перевод был одной из первых задач, которую поставили перед компьютерами еще 70 лет назад. Начиная с 1950‐х годов, эту задачу решали путем переноса лингвистических правил в компьютерную программу, что было не только вычислительноемким и времязатратным процессом, но и требовало набора компьютерных инструкций с полным словарным запасом для каждого языка и множеством типов грамматик. К 1990‐м годам американская многонациональная технологическая корпорация International Business Machines, более известная как IBM, внедрила статистический машинный перевод, поскольку исследователи предположили, что если они просмотрят достаточное количество текстов, то смогут найти закономерности в переводах. Это стало огромным прорывом в области перевода и привело к запуску в 2006 году Google Translate, в котором использовался статистический машинный перевод. Google Translate стал первым коммерчески успешным применением NLP и, возможно, наиболее известным. Область машинного перевода изменилась навсегда в 2015 году, когда компания Google стала использовать большие языковые модели и получать гораздо более впечатляющие результаты. В 2020 году Facebook Inc [15]. анонсировал выпуск первой многоязычной модели машинного перевода, которая позволяет переводить между любыми ста парами языков напрямую, минуя английский, – еще одна важная веха в области машинного перевода, поскольку теперь уменьшилась вероятность потери смысла при итерациях23.
Еще одним практическим применением является реферирование текста, то есть создание его краткой версии, в которой выделяется наиболее важная информация. Существует два типа методов реферирования: извлекающий (экстракция) и генерирующий (абстракция). Извлекающее реферирование связано с выделением наиболее важных предложений из длинного текста, которые объединяются в кратком обзоре. А вот генерирующее реферирование перефразирует текст и формирует краткий обзор, что похоже на написание «аннотации», которая может содержать слова и предложения, отсутствующие в исходном тексте.
Существуют и другие разнообразные области применения, например приложения, которые могут исправлять грамматику английского языка, изучать и использовать новые слова, а также решать лингвистические головоломки. Вот пример того, как GPT‐3 может изучать и использовать новые слова: модели дается определение несуществующего слова, например «гигамуру», а затем ее просят использовать его в предложении. Такие компании, как Grammarly и Duolingo, быстро внедряют LLM в свои продукты. В марте 2023 году Grammarly, популярный инструмент для проверки грамматики и орфографии, представил новую версию GrammarlyGO, в которой для генерации текста применяется ChatGPT (см. http://mng.bz/D9oa). Также в марте 2023 года Duolingo представила версию Duolingo Max, в которой GPT‐4 используется для реализации таких функций обучающей платформы, как «объясните мой ответ» и «ролевая игра» (см. http://mng.bz/lVvB).