С целью демонстрации вычислений в этой книге я выбрал язык программирования R – мощный инструмент для статистических вычислений и графики, созданный в 1993 году Россом Ихакой и Робертом Джентлменом. R быстро завоевал популярность и стал одним из наиболее востребованных инструментов статистического анализа и визуализации данных. Основные преимущества R заключаются в его обширной функциональности, огромном наборе доступных пакетов и активности сообщества пользователей, что делает его незаменимым для аналитиков данных. Несмотря на наличие альтернатив, таких как универсальный язык программирования Python, я остановился на R по двум причинам. Во-первых, R был изначально разработан для задач статистики и визуализации, что делает его более понятным и удобным именно для этих целей. Во-вторых, для новичков в области анализа данных R может оказаться более доступным благодаря своей узкой направленности на статистические задачи и логичному синтаксису. Таким образом, использование R в этой книге позволяет сосредоточиться на самом важном – вычислениях – и не отвлекаться на технические детали и настройки.
Другая особенность книги состоит в том, что я использую только один пакет R – библиотеку dplyr. Этот пакет, один из самых популярных, предназначен для манипулирования данными и предлагает интуитивно понятные и эффективные функции для работы с таблицами данных. Пакет разработан Хэдли Уикхэмом и его командой и представляет собой настоящую грамматику анализа данных. Будучи простым и интуитивно понятным, он оптимизирован для работы с большими наборами данных и обеспечивает высокую производительность. Функции dplyr – это все, что нужно для первых шагов. Например, функция filter() используется для отбора строк из данных, соответствующих определенным условиям. Это особенно полезно, когда необходимо выделить подмножество данных для анализа. Функция select() позволяет выбрать определенные столбцы из данных – это упрощает работу и дает возможность сфокусироваться на конкретных переменных. С помощью функции mutate() можно создавать новые столбцы или изменять существующие, чтобы добавлять новые переменные, основанные на имеющихся данных. Функция summarize() используется для агрегации данных, что позволяет вычислять различные статистики, такие как средние значения, суммы или медианы. С помощью функции arrange() можно сортировать строки в данных по значениям одного или нескольких столбцов. Это правда все, что нам нужно для первых шагов в психометрике.
И наконец, в этой книге мы используем для вычислений только реальные данные. Датасеты доступны для скачивания по ссылкам и QR-кодам, указанным в соответствующих главах. Данные представляют собой результаты выполнения студентами Яндекс Практикума заданий из трех вводных (бесплатных) онлайн-курсов по анализу данных, тестированию программного обеспечения (QA) и программированию. Задания разнообразны и содержат как квизы с выбором ответов, так и задачи онлайн-тренажера, где студенты самостоятельно вводят кодовое решение. В каждом из трех курсов я случайно выбрал по 250 студентов, проходивших обучение в период с августа 2023 года по январь 2024 года. Данные были анонимизированы и перекодированы в соответствии с современными стандартами и с использованием нескольких алгоритмов шифрования (md5, crc32, xxhash32, murmur32 и других).
Таким образом, несмотря на то, что наше погружение в анализ данных только начинается, мы делаем это основательно, уверенно и сразу по-настоящему.