На протяжении всей этой книги мы уделяли особое внимание тому, что делает большие языковые модели большими: от триллионов токенов в наборах данных для предварительного обучения до десятков миллиардов параметров в работающих моделях. Как этап обучения, так и работа готовой модели требуют больших финансовых затрат, выполняются на специализированном оборудовании и потребляют много электроэнергии. Рост числа LLM в разгар климатического кризиса не остался незамеченным, и в этой области появилась новая тема по изучению влияния моделей на окружающую среду.
Всеобъемлющий подход к измерению воздействия больших языковых моделей на окружающую среду должен начинаться с аппаратного обеспечения, на котором они работают: компьютерных чипов, то есть графических процессоров (GPU) – специальных чипов для параллельной обработки. Каждый чип изготовлен из полупроводникового материала, обычно кремния, и содержит миллионы или миллиарды транзисторов. Они работают как электронные переключатели и могут находиться во включенном и выключенном положении, сохраняя биты данных в процессе вычислений. Для производства компьютерных чипов, как и другой электроники, требуется множество различных материалов: основа, например кремний, металлы, такие как алюминий и медь, для соединения компонентов в чипе и множество других металлов, которые могут быть задействованы в процессе обработки и производства. Таким образом, можно считать, что полный жизненный цикл LLM включает в себя добычу сырья, например кварца, переработку сырья в чистый кремний и различные металлы, производство графических процессоров. Рынок современных компьютерных чипов является очень монополизированным, а сложность процесса производства означает, что для некоторых компонентов существует всего несколько надлежащих поставщиков в мире. Графические процессоры, подключенные к сети, являются продуктом скоординированной многонациональной цепочки поставок, возможно, с десятками участников.
В августе 2023 года газета New York Times сообщила о нехватке графических процессоров, поскольку стартапы и крупные корпорации стали скупать чипы.
«Охота за этим важнейшим компонентом началась в прошлом году, когда чат-боты в интернете, такие как ChatGPT, вызвали волну ажиотажа вокруг ИИ, что создало массовый спрос и создало дефицит чипов. Теперь в ответ на это стартапы и их инвесторы предпринимают значительные усилия, чтобы гарантировать доступ к этим крошечным кусочкам кремния и создаваемой ими „вычислительной мощности“»28.
Маленькие компании обычно не заводят собственное оборудование или центры обработки данных – они арендуют время работы на графических процессорах у поставщиков облачных вычислений, таких как Microsoft Azure, Google Cloud или Amazon Web Services.
Как только доступ к графическим процессорам обеспечен, обучение LLM сводится к выполнению невероятного количества математических операций, которые называются операциями с плавающей точкой (floating-point operations, FLOP). Стандартным показателем производительности компьютера является количество операций с плавающей точкой в секунду (FLOPS, флоп/с). Для обучения GPT‐3 потребовалось порядка 100 000 000 000 000 000 000 000 операций с плавающей точкой (1023), что соответствует количеству звезд в видимой Вселенной29. Даже при уровне производительности суперкомпьютера это занимает много часов работы большого количества графических процессоров, аккуратно размещенных на серверах в центрах обработки данных и потребляющих электроэнергию во время своей работы.
Поскольку во время обучения происходит самое интенсивное использование компьютеров, измерения в основном проводятся на этой стадии. Существуют инструменты, разработанные для измерения потребления электроэнергии во время обучения, и некоторые из них работают параллельно с процессом обучения модели, обеспечивая тщательный учет энергопотребления, а другие оценивают его по факту, то есть после получения окончательной модели. Инструмент CodeCarbon измеряет энергопотребление для центрального процессора, оперативной памяти и любого графического процессора, при этом он работает параллельно и может быть запущен на любом персональном компьютере (см. https://github.com/mlco2/codecarbon). Подобные инструменты отличаются великолепной ненавязчивостью и простотой. В документации CodeCarbon разработчики приводят слова Нильса Бора «ничего не существует, пока это не измерено» в качестве объяснения, почему они решили найти способ оценить уровень углекислого газа (CO2), образующегося во время работы программ (к парниковым газам относится не только углекислый газ, но и метан, и закись азота, однако для удобства измерения все остальные пересчитываются в эквивалент углекислого газа). Хотя отчетность о потреблении электроэнергии для выполнения различных задач еще не стала распространенной нормой – на самом деле ни в области ИИ, ни в других отраслях, – такие инструменты положительно влияют на весь сектор по мере их внедрения и повышения ожиданий о предоставлении экологических данных.
После обучения, в процессе генерации ответов на запросы пользователей, LLM по-прежнему требуются графические процессоры и энергия для вычислений с использованием весовых коэффициентов, полученных в ходе обучения. Вычисления на этом этапе не являются такими объемными и дорогими, как при обучении, но модели нужно обрабатывать сотни или тысячи запросов одновременно, чтобы обслуживать сразу множество пользователей, из-за чего общие затраты возрастают. Согласно отраслевому анализу на апрель 2023 года, поддержка работы модели ChatGPT, которая отвечает на миллионы входящих запросов, обходится OpenAI в 700 000 долларов в день из расчета затрат на компьютерную инфраструктуру30. Инструменты для измерения потребления электроэнергии во время обучения можно использовать также и на стадии обработки запросов.
Рис. 9.2. Схема жизненного цикла LLMs31
Соотношение размера модели и количества ее вычислений с потреблением процессорного времени и углеродным следом также зависит от множества других факторов, определяемых инфраструктурой: старые чипы менее эффективны (другими словами, могут выполнять меньше операций в секунду) и потребляют больше энергии, не все источники питания одинаковы. На рис. 9.2 перечислены различные этапы жизненного цикла LLM, которые вносят вклад в общее энергопотребление. Каждый из этих этапов может создать сложности для получения полной картины воздействия LLM на окружающую среду, особенно когда некоторые детали не раскрываются по соображениям конкуренции.
Наиболее систематическая работа по документации воздействия LLM на окружающую среду была проведена на базе свободной для использования [124] языковой модели BLOOM с 176B параметрами, выпущенной группой BigScience в 2022 году. Создатели этой модели, среди которых была руководитель климатических инициатив в Hugging Face доктор Саша Луччиони, проанализировали углеродный след BLOOM с точки зрения энергопотребления во время обучения, а также учли дополнительные факторы, такие как энергопотребление в режиме ожидания, предполагаемые выбросы от серверов и графических процессоров и потребляемое электричество при эксплуатации модели31. «Поскольку методологии учета выбросов углерода не стандартизированы, было трудно проводить точное сравнение углеродного следа BLOOM и других моделей аналогичных масштабов», – отметили они, но, основываясь на общедоступной информации, подсчитали, что в ходе обучения BLOOM было выброшено около 25 тонн эквивалента CO2, а GPT‐3 – около 502 тонн. Эти 502 тонны эквивалента CO2 равны выбросам парниковых газов от 112 легковых автомобилей за год32. Хотя количество параметров и эффективность энергопотребления центра обработки данных для BLOOM и GPT‐3 были сопоставимы, интенсивность выбросов углерода в сети, используемой для BLOOM, была намного ниже, поскольку сети, поддерживающие аппаратное обеспечение BLOOM, питались от более чистых источников энергии (таких как гидроэлектростанция и солнечная энергия, но не уголь и не природный газ). Авторы также отметили, что многие поставщики вычислительных услуг уменьшают свои выбросы углерода за счет покупки углеродных кредитов – разрешений, которые позволяют организациям не учитывать определенное количество углеродных выбросов в своем балансе. Авторы не учитывали такие кредиты, принимая во внимание полные выбросы.
Вопрос о том, засчитывать ли эти выбросы углерода, – лишь один из десятков вопросов, которые должны решаться, когда речь заходит об экологических издержках или отчетности: какие стадии включить в анализ, как производить оценку неизвестных деталей цепочки поставок или инфраструктуры. Поскольку у разработчиков LLM есть очевидный стимул занижать по возможности углеродный след своих моделей, крайне важно перейти к более систематической отчетности в отрасли.
Беря пример с документации для BLOOM, другие команды тоже внедрили подобную методологию, пусть даже частично, и начали сообщать о воздействии на окружающую среду в рамках технического отчета. В техническом отчете Llama 2, например, указано время предварительного обучения в часах работы графического процессора, энергопотребление и выброс углерода в тоннах эквивалента углекислого газа (CO2‐эквивалент). Впервые на проблему энергопотребления LLM обратила внимание Эмма Струбелл, доцент кафедры компьютерных наук в Унверситете Карнеги – Меллона. В 2019 году она опубликовала статью, в которой сообщалось, что при обучении BERT было выброшено примерно столько же углекислого газа, сколько производят пять автомобилей за все время своей эксплуатации33. В течение последующих лет LLM стали еще больше, хотя теперь они, как правило, обучаются эффективнее и используют более чистую энергию. Струбелл назвала статью о BLOOM самым тщательным анализом воздействия LLM на окружающую среду на сегодняшний день и выразила надежду, что, следуя примеру Hugging Face, которая провела анализ для BLOOM (и в меньшей степени Meta [125] с ее отчетом для Llama 2), другие технологические компании тоже начнут изучать углеродный след от разработки своих продуктов34.
Безусловно, ИИ и технологический сектор в целом вносят не самый большой вклад в увеличение глобальных выбросов углекислого газа и энергопотребления. По оценкам, на долю общемирового технологического сектора приходится около 2 % глобальных выбросов углекислого газа34. Тем не менее было бы ошибкой не учитывать воздействие LLM на окружающую среду при рассмотрении их более широкого применения, особенно в связи с тем, что конкурирующие компании продолжают накапливать все больше графических процессоров и создавать модели все большего размера. Помимо того, что экологические оценки должны стать нормой в технических отчетах, Луччиони, Струбелл и другие представители сообщества машинного обучения настаивают на том, что нужно уделять больше внимание созданию небольших и более эффективных моделей вместо однонаправленного стремления к получению огромных и дорогостоящих LLM. В конкретных областях применения модели меньшего размера во многих случаях могут работать не хуже или так же эффективно, как и большие, при этом они обладают дополнительным преимуществом – их гораздо легче повторно использовать и тонко настраивать. Как мы обсудим в следующем разделе, этот подход дал впечатляющие результаты при меньших затратах как для разработчиков, так и для всей планеты.