История технологии обработки естественного языка так же стара, как и сами компьютеры. Первым применением NLP, вызвавшим интерес еще в 1950‐х годах, был машинный перевод. И именно в области машинного перевода компанией Google в 2006 году был запущен первый коммерческий продукт.
Модели с архитектурой трансформера и изобретение механизма внимания стали крупнейшим прорывом в NLP за десятилетие. Механизм внимания пытается имитировать работу мозга человека, придавая «важность» наиболее релевантным фрагментам информации.
Недавний бум в области NLP был вызван растущей доступностью текстовых данных из интернета и развитием мощных вычислительных ресурсов. Это сделало возможным построение больших языковых моделей.
Современные LLM в основном обучаются самостоятельно на больших объемах текста из интернета, а затем проходят тонкую настройку с помощью обучения с подкреплением.
Модель GPT от OpenAI была одной из первых LLM общего назначения, предназначенных для решения широкого круга разнообразных задач на естественном языке. Подобные модели особенно хорошо справляются с генерацией текста и идеальны в роли чат-ботов. Кроме того, их можно тонко настроить под определенные задачи.
LLM универсальны и могут применяться в различных областях и сценариях использования, включая генерацию текста, вопросы и ответы, программирование, логические рассуждения, генерацию контента и прочее. С другой стороны, они подвержены рискам, например появлению скрытой предвзятости и галлюцинациям, кроме того, они оставляют значительный углеродный след.
Наиболее значимые большие языковые модели, предназначенные для ведения диалога, были выпущены OpenAI, Microsoft, Google и Meta [28]. Модель ChatGPT от OpenAI установила рекорд по самому быстрому росту числа пользователей в истории и запустила гонку по разработке и выпуску диалоговых агентов, или чат-ботов, на основе ИИ.