Темные данные – это определение, данное информации, которая не является полной, достоверной и точно относящейся к конкретной интересующей вас теме.
Понятие темных данных возникло из аналогии с другим физическим термином – темной материей. Большое количество массы Вселенной состоит из вещества, которое мы никак не можем определить, измерить и изучить… Но оно есть и, по разным данным, составляет как минимум 27 % от общей массы Вселенной, а скорее всего – гораздо больше.
Темные данные ведут себя аналогично темной материи: мы не видим их, они не обнаруживаются, но оказывают существенное влияние на наши выводы, решения и поведение.
В профайлинге мы должны точно понимать, на основе информации какого качества мы принимаем решения и оцениваем ситуацию. Это один из принципиальных вопросов, на который большинство не обращают внимание.
Например, если мы оцениваем психотип человека на основе неполных, неточных и недостоверных данных, которыми мы обладаем о человеке, вероятность ошибки будет огромна.
Всего выделяют 15 типов темных данных:
ТИП 1. Данные, о которых мы знаем, что они отсутствуют.
Они возникают, когда мы знаем, что в данных есть пробелы, скрывающие значения, которые могли быть записаны.
При определении психотипа человека это, например, информация о том, как человек ведет себя в других контекстах, в которых мы его не видели.
ТИП 2. Данные, о которых мы не знаем, что они отсутствуют.
Делая вывод о человеке на основе чьего-либо мнения, мы, например, в принципе не знаем, какой информацией о нем мы не обладаем.
ТИП 3. Выборочные данные.
Ситуация, когда из всех имеющихся данных мы выбираем только те, которые нам выгодны и которые чаще всего подтверждают наше мнение.
Например, при анализе того, обманывает нас человек или нет, мы склонны рассматривать только те данные, которые прямо или косвенно подтверждают, что он обманывает. И скорее не обратим внимание на сигналы «честности». Иногда бывает наоборот.
ТИП 4. Самоотбор.
Является частным случаем предыдущего типа.
Он проявляется, когда людям дают право самостоятельно решать, что включать в базу данных для анализа, а что нет. И если не обращать внимание на правила формирования выборки, то может случиться так, что в нее попадет только то, что выгодно исследователю.
ТИП 5. Неизвестный определяющий фактор.
Иногда критически важный аспект системы совершенно незаметен. Это может привести к установлению ошибочных причинно-следственных связей, ведущих к дальнейшим ошибкам.
Например, при анализе поведения мужчины мы видим, что он преимущественно ведет себя истероидно. И посчитаем его истероидом. Но не обращаем внимание, что каждый раз это поведение демонстрируется в присутствии дам, что является критическим фактором ситуации.
ТИП 6. Данные, которые могли бы существовать, или контрфактуальные данные.
Это данные, которые мы смогли бы увидеть, если бы предприняли какие-то другие действия или наблюдали бы за происходящим при других условиях.
Пример в профайлинге: наши предположения о том, как человек вел бы себя, например, в ситуации стресса, когда мы этого не наблюдали, но делаем вывод на непроверенном предположении.
ТИП 7. Данные, меняющиеся со временем.
Время может скрывать данные разными путями. Данные могут перестать соответствовать точному описанию мира, одни факты перестают регистрироваться за пределами периода наблюдений, а другие – потому что изменилась их природа.
Пример в профайлинге и детекции – различное функциональное состояние организма в процессе (до, после, во время) полиграфной проверки.
ТИП 8. Неверно определяемые данные.
Различные определения, даже профессиональные, могут быть противоречивыми или со временем меняться.
Если мы, например, читаем метаанализ, посвященный невербальным признакам обмана, но нет уверенности, что все авторы одинаково понимают, что такое «закрытые жесты» или «строгий голос», то гарантии корректности результатов нет.
ТИП 9. Обобщение данных.
Обобщение по определению означает отбрасывание деталей.
Если учитывать только средние значения любого параметра, это не дает информации о диапазоне или асимметрии распределения. Среднее значение может скрывать существенные различия.
ТИП 10. Ошибки измерения и неопределенность.
Ошибки измерения часто приводят к неверным выводам. Мы изучаем параметры, которые нельзя измерить напрямую, и используем косвенные методы.
Пример: при измерении кожно-гальванической реакции низкое качество электрода может сильно исказить результат.
ТИП 11. Искажения обратной связи и уловки.
Возникают, когда собранные данные начинают влиять на процесс анализа.
Пример: если уже предполагается, что человек истероид, анализ остальных данных может стать менее объективным.
ТИП 12. Информационная асимметрия.
Когда один и тот же набор данных анализируют эксперты разного уровня подготовки, выводы могут существенно различаться.
ТИП 13. Намеренно затемненные данные.
Люди сознательно скрывают или искажают информацию.
Пример: выборочно отбрасывается часть данных для создания нужного впечатления.
ТИП 14. Фальшивые и синтетические данные.
Сфальсифицированные или искусственно созданные данные могут вводить в заблуждение. При этом в исследованиях симуляции и репликации данных применяются легально, но их некачественная реализация искажает выводы.
ТИП 15. Экстраполяция за пределы данных.
Наборы данных всегда конечны. Попытки делать выводы выше максимума или ниже минимума требуют предположений или данных из других источников.
Экстраполяция на другие контексты или события имеет ограничения и требует осторожности.