Автором еще одного взгляда на перспективы развития датацентров является мой коллега Андрей Воробьев.
Начну с притчи о Насреддине, который обещал за 20 лет научить осла читать, если падишах заплатит ему крупную сумму. И на сетования друзей ответил: «Получить столько золота, да еще и ишака не каждый день удается, а за голову мою не бойтесь – через 20 лет кто-нибудь обязательно умрет – либо ишак, либо падишах».
Мне бы не хотелось, чтобы эта глава воспринималась как предсказание, но уверен, что имеет смысл проанализировать некоторые технологические изменения, происходящие в современном мире, так как они определяют возможное будущее, в котором нам с вами придется существовать. В ближайшее время новые технологии могут радикальным образом изменить наше представление об устройстве как IT, так и инженерной инфраструктуры датацентра, следовательно и эксплуатация такого объекта в перспективе может значительно измениться.
Один из наиболее острых и спорных для владельцев датацентра вопросов – возможность частичного или полного исключения человека из процесса эксплуатации. Появился даже термин «темный датацентр», то есть объект, где освещение выключено ввиду отсутствия персонала и включается только в те моменты, когда там появляется человек. Есть несколько причин подобного «затемнения».
1. Фонд оплаты труда и все сопутствующие затраты, связанные с работой человека на объекте, составляют существенную долю всех операционных расходов, достигающую часто 30 %. Снижение этих затрат на протяжении всего жизненного цикла позволит снизить совокупную стоимость владения датацентра до 10–15 % за десять лет эксплуатации.
2. По разным оценкам, более половины всех сбоев в датацентре связаны с человеческим фактором. К сожалению, человек является с точки зрения работы датацентра самым сложно предсказуемым компонентом. Человек может не только заболеть физически, но и находиться в психологически сложном состоянии, вызванном усталостью, жизненными неприятностями, тревожностью и пр. Действия его, ошибочные или преднамеренные, могут привести к фатальной для датацентра ситуации.
3. Отсутствие квалифицированных кадров также является одной из проблем. Часто этот фактор является блокирующим при принятии решения о строительстве датацентра в регионах, где с точки зрения климата и энергоресурсов расположение объекта выглядит очень привлекательно, но обеспечить надлежащую эксплуатацию крайне затруднительно.
4. Пандемия и связанные с ней ограничительные меры значительно повлияли на желание снизить зависимость ДЦ от человека, так как именно в этот период выяснилось, что инженерный персонал массово болеет, использование сотрудников из других регионов невозможно из-за ограничения передвижения. И если такая ситуация сохраняется более полугода, то существенно увеличиваются риски остановки оборудования из-за задержки обслуживания.
Эти факторы полностью подтверждаются статистикой опроса IT-директоров крупнейших датацентров[41], в 2020 году трудности с подбором персонала испытали 50 % респондентов (38 % в 2018 году), возможности удаленной работы рассматривают 77 % (33 % в 2018-м), внедрение DCIM планируют 39 % (двумя годами ранее – 11 %), недостаточность текущей системы мониторинга подтвердили 90 % (73 % – в 2018-м). Также 43 % респондентов отметили возрастающую роль ИИ в течение пяти лет.
Однако у модели датацентра «без людей» есть определенные ограничения.
Во-первых, «затемнение» датацентра начинается с построения концепции. Объект должен с самого начала быть спроектирован с учетом минимизации людей при эксплуатации объекта. Существующие датацентры делать полностью «безлюдными» экономически нецелесообразно, для этого нужно существенно изменить проект и модернизировать уже работающую площадку. Однако применение отдельных элементов может принести желаемые результаты и на существующих объектах.
Во-вторых, накопленный положительный опыт – крайне важный аспект успешного внедрения «темных» датацентров. Только после того, как инновационные лидеры пройдут этот тернистый путь и докажут на своем опыте, что это реально и безопасно, большинство игроков рынка начнут реализацию на своих площадках.
Кто будет первым? Думаю, начнется все с небольших объектов распределенной инфраструктуры (модульные быстровозводимые датацентры для периферийных вычислений). На таких объектах держать службу эксплуатации крайне неэффективно, однако оставить объекты без контроля тоже нельзя. Именно поэтому на них должна появиться наивысшая степень автоматизации. Это мы наблюдаем уже сейчас.
Крупные коммерческие датацентры будут против исключения человека из процессов эксплуатации, так как они связаны определенными обязательствами со своими заказчиками в виде SLA-договоров (Service Level Agreement) часто с довольно высокими штрафными санкциями. В сегменте XL-датацентров именно корпоративные заказчики и провайдеры облачных услуг первыми начнут прорабатывать и внедрять «темные» датацентры.
Каким же образом будет решаться задача «затемнения» для крупных датацентров? Давайте более подробно рассмотрим, что делают люди на объекте и как эти задачи можно значительно упростить либо совсем упразднить.
До 30 % совокупного времени технического персонала тратится на наблюдение за состоянием инженерных систем. Это могут быть как наблюдение за системой мониторинга, так и регулярные обходы.
Современный уровень развития контрольно-измерительной аппаратуры позволяет более точно определить признаки аварии или предаварийного состояния, которые распознает человек, проводя обход: появление запаха гари, подтеки, вибрацию, температуру и влажность и т. п. Я встречал датацентры, где абсолютно все аварии за последний год были обнаружены только системой мониторинга, обходы не принесли никакой пользы и не добавили никакой информации.
Конечно, здесь встает вопрос о затратах на внедрение высокого уровня автоматизации. За последние десять лет мы наблюдаем значительное снижение стоимости датчиков. Причиной этого стало их массовое применение в устройствах IoT (смартфоны, умные дома, автомобили и др.), спрос на которые значительно вырос. В перспективе это может привести к отказу от круглосуточного дежурства на объекте. Вместо этого будет существовать общий ситуационный центр, обрабатывающий собранную информацию и принимающий решения о дальнейших действиях.
На первом этапе в этом процессе люди будут участвовать, контролируя принимаемые решения. Постепенно функция принятия решения будет замещаться искусственным интеллектом, так как прогнозировать, диагностировать неисправность и анализировать последствия сбоя, собрав тысячи показателей одновременно, человеку будет все сложнее. ИИ будет способен анализировать данные по аналогичным площадкам в мире и делать прогноз по своевременной замене компонентов.
Это происходит уже сейчас: например, десятки тысяч ИБП, подключенные к информационной сети, дают информацию о зависимости состояния батарей определенного типа конкретного производителя от количества циклов заряда-разряда, глубины разрядки, окружающей температуры, срока эксплуатации, режима зарядки и еще десятка различных показателей. Так что следующим шагом, скорее всего, будет отказ от круглосуточной дежурной смены в ситуационном центре.
Эти работы могут занимать до 25–30 % рабочего времени технического состава, и до сих пор они являются обязательными или крайне рекомендуемыми для основного оборудования датацентра. Однако и здесь происходят существенные изменения.
Рассмотрим для примера ИБП. Если еще десять лет назад в ИБП нужно было регулярно проверять состояние и менять конденсаторы постоянного и переменного тока, фильтры, вентиляторы, батареи, то в последних моделях ИБП для регулярной замены остались только вентиляторы. С появлением Li-Ion-технологий накопления энергии (а также находящихся на подходе Na-Ion, графеновых батарей и пр.) регулярные замены свинцово-кислотных батарей уходят в прошлое. Помимо этого происходит развитие инверторных технологий (многоуровневые инверторы, использование транзисторов на основе GaN, повышение рабочих частот и пр.), что приводит к уменьшению размеров оборудования и увеличению КПД. Снижение потерь до 1 % в перспективе будет означать выделение ИБП мощностью 500 кВт всего 5 кВт тепла, которое можно будет отводить через корпус, убрав последний компонент, требующий регулярной замены, – вентиляторы. ИБП превращается в устройство, не требующее обслуживания в течение всего срока жизни.
Интересны последние разработки ИБП, где функцию обоих преобразований (как AC-DC, так и DC-AC) выполняет BMS (Battery Management System). Это снижает тепловыделение систем и делает их более простыми в эксплуатации.
С системой охлаждения ситуация несколько другая. В настоящий момент большинство коммерческих датацентров использует рекомендуемый диапазон рабочих температур и влажности ASHRAE 18–27 ℃ / 60 %. Для его поддержания в наших широтах необходимо использовать холодильный цикл. По этой причине в датацентрах появляются чиллеры и фреоновые кондиционеры, требующие регулярного обслуживания.
В перспективе температурный диапазон работы IT-оборудования будет расширен, уже сейчас некоторые крупные объекты работают в режимах до +35 ℃. Электрооборудование, включая ИБП и Li-Ion-батареи, уже гарантированно работает при температуре +40 ℃, не снижая своих рабочих характеристик.
В ближайшее время мы увидим отказ от использования холодильного цикла и переход на естественное охлаждение. С точки зрения IT-инфраструктуры можно обратить внимание на Storage Class Memory – одну из новых технологий SSD, которая к тому же является энергонезависимой. При отключении питания информация не будет пропадать, а значит, и время восстановления системы после подачи питания может значительно сократиться. Для распределенных датацентров это позволит отказаться от таких сложных систем, как бесперебойное электроснабжение.
Отказ от применения высокотехнологичного оборудования сократит расходы на обслуживание.
Я не буду затрагивать все инженерные системы, скажу только, что технологически мы уже способны создать оборудование для датацентров, не требующее обслуживания в течение довольно длительного времени. Примером может служить эксперимент компании Microsoft Natic[42]. Уже два раза, в 2015 и 2018 годах, производилось погружение герметичных капсул, содержащих 860 серверов в 12 стойках в прибрежной зоне океана. Как показал этот опыт, такой мини-датацентр может работать до пяти лет без вмешательства человека. За счет использования инертных газов в капсуле количество отказов оборудования было снижено в восемь раз.
Насколько быстро этот подход начнет применяться в больших датацентрах – вопрос времени.
Пожалуй, это самый сложный вопрос для обсуждения на текущий момент. Конечно, можно представить роботов из Boston Dynamics, производящих замену одного сервера на другой, но для реализации такого подхода потребуется несколько условий.
• Уровень централизации вычислений становится действительно масштабным, то есть это не просто датацентр, а громадная фабрика с сотнями тысяч устройств. На текущий момент мы видим на рынке централизацию вычислений, многие облачные и colo-провайдеры имеют десятки тысяч стоек на одном объекте, при этом данный сегмент рынка по-прежнему показывает наибольший рост.
• Стандартизация оборудования должна выйти на качественно новый уровень. Любой сервер, СХД или маршрутизатор должны быть выполнен в определенном физическом формате, чтобы необходимый для его монтажа/демонтажа робот был достаточно простым и надежным.
• С точки зрения отдельных компонентов нужно уйти от централизованных систем к распределенным (то есть вместо десяти ИБП по 1500 кВт нужно использовать 1500 ИБП по 10 кВт). В этом случае отказ одного компонента будет незначительно сказываться на работоспособности системы, а деградация характеристик датацентра будет происходить линейно с потерей отдельных компонентов.
• В отличии от этого в централизованных системах выход одного компонента приводит к потере резерва, а в случае отказа второго возможна полная потеря сервисов. Именно поэтому для объектов с централизованными системами важным фактором является наличие в зоне быстрой доступности специалистов, способных устранить неисправности. Помимо этого, важно не забывать про ЗИП для централизованных систем. Ввиду масштабного сбоя цепочек поставок все критически важные компоненты должны храниться на объекте. Для распределенных систем целесообразнее хранить запасное устройство, которое можно установить вместо вышедшего из строя. В данном случае срочная поставка ЗИП не обязательна.
Одним из интересных проектов, демонстрирующих рассмотренный выше подход, является OCP[43] (Open Compute Project). Он предполагает высокий уровень стандартизации, возможность использования распределенной системы бесперебойного питания в каждой стойке, переход на питание нагрузки постоянным током, широкий диапазон рабочих температур с отказом от холодильного цикла, горячую замену компонентов и многое другое. Основными локомотивами OCP изначально были крупные компании, имеющие у себя крайне высокую концентрацию IT-мощностей, однако постепенно проектом заинтересовались и другие участники рынка.
На текущий момент говорить о полном отказе от человека при проведении ремонтных работ в датацентрах рано, однако возможно отказаться от моментальной реакции на аварию и сократить время пребывания сотрудников на объекте. Аварийные работы постепенно будут переходить в плановые, то есть работа на объекте будет производиться при накоплении определенного количества отказов.
Традиционно датацентр – это объект, на котором присутствуют люди, и при проектировании этот факт является крайне важным. Необходимо обеспечивать безопасность и охрану труда работающего персонала, соблюдать эпидемиологические и санитарные нормы и т. д.
При отсутствии людей в датацентре кардинально меняются требования к устройству и функционированию объекта.
• Температурный режим. Нет необходимости поддерживать комфортную для работы людей температуру в горячих и холодных коридорах машинного зала. Это даст нам возможность круглогодичного использования режима фрикулинга для охлаждения IT-оборудования, что способствует повышению PUE и снижению капитальных и операционных затрат.
• Размещение IT-оборудования. Работа на высоте уже не будет осложняющим фактором, поэтому возможно использование IT-стоек любой высоты, что позволит более эффективно использовать объем помещения.
• Система пожаротушения. При отсутствии персонала на объекте можно применить системы пожаротушения, использующие метод снижения уровня кислорода в помещениях.
• Система вентиляции. Можно отказаться от необходимого для человека воздухообмена, что позволит убрать системы подготовки входящего воздуха.
• Персонал. Возможно сократить расходы на персонал, обучение, сертификацию и проведение мероприятий, связанных с охраной труда, производственной безопасностью, санитарными нормами и т. д. Можно исключить риски, связанные с гибелью или потерей здоровья людей.
• Используемые площади. Сокращение площадей для размещения персонала позволит оптимизировать расходы.
Таким образом, датацентр превращается в сложный механизм, функционирующий уже без человека, но высокоэффективный за счет использования новых технологий и принципов работы.