Как намекает название и как подчеркивалось ранее, большие языковые модели являются действительно большими. Они используют огромные массивы данных, имеют сотни миллионов или триллионы параметров и требуют огромных вычислительных ресурсов, которые измеряются количеством используемых чипов и затраченного компьютерного времени. LLM обычно обучаются на графических (GPU) или тензорных (TPU) процессорах [21]– специализированных чипах, которые могут осуществлять масштабные вычисления, требующиеся для обучения нейронных сетей. Для этого может потребоваться арендовать на несколько недель тысячи графических процессоров у поставщика облачных вычислений, такого как Microsoft Azure (партнер OpenAI), Google Cloud Platform или Amazon Web Services. OpenAI еще не публиковала подобную отчетность, но, исходя только из расходов на вычислительные ресурсы, стоимость такой модели, как GPT‐3, могла бы составить около 4,6 миллиона долларов28.
К менее очевидным издержкам построения LLM относится их воздействие на окружающую среду, которое было предметом изучения и критики. В одной статье авторы попытались оценить энергопотребление и углеродный след LLM на основе опубликованной информации о процедуре обучения GPT‐3 и подсчитали, что только из-за потребления электроэнергии во время ее обучения выбросы составили 500 тонн углекислого газа29. Для сравнения, на долю среднестатистического американца приходится около 18 тонн выбросов углекислого газа в год; среднемировой показатель составляет всего 7,4 тонны в год (см. https://worldemissions.io/). В другой статье было показано, что модели потребляют еще больше электроэнергии уже после обучения в процессе генерации ответов30. Точные показатели выбросов для большинства LLM неизвестны, поскольку на них влияет множество других факторов, включая использование центра обработки данных, количество и тип чипов, размер модели и архитектуру.
Кроме того, приобрести так много графических процессоров непросто, даже если у вас на это есть миллионы долларов. Крупнейшие компании технологического сектора, включая Microsoft и Google, имеют неоспоримое конкурентное преимущество в разработке LLM благодаря имеющимся у них ресурсам. Некоторые наблюдатели опасаются, что мелкие игроки в такой ситуации не смогут удержаться на плаву, в результате чего создавать технологии LLM и получать прибыли от них смогут только транснациональные компании или страны, которые уже начали собирать ресурсы на национальном уровне для обучения LLM. С другой стороны, в настоящее время проводится много исследований, которые помогают сделать эти модели более доступными и сократить время или затраты на обучение, иногда путем создания версий с открытым исходным кодом на основе существующих LLM или попыток сократить уже обученную LLM до версии меньшего размера, которая могла бы поддерживать ту же производительность при меньших затратах. Некоторые успехи выглядят многообещающе, но еще требуют проверки. Наиболее значимые из таких моделей были выпущены в конце 2022 и начале 2023 годов компаниями OpenAI, Google, Microsoft и Meta [22].