К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 1 Предсказание. 2. Справедливость. Невозможность справедливости
22%
Часть 1 Предсказание. 2. Справедливость. Невозможность справедливости
18

С 2012 года ученый-информатик из Корнеллского университета Джон Клейнберг и экономист из университета Чикаго Сендил Муллайнатан работали над проектом использования машинного обучения для анализа решений о мере пресечения обвиняемых, сравнивая мнение судей и оценки прогностических моделей машинного обучения. «Часть этой работы – вникнуть в вопросы, связанные с алгоритмическими инструментами, которые заботят людей в контексте расового неравенства, – говорил Клейнберг. – Я считал, мы это хорошо обдумали. И тут появилась статья ProPublica и… наши новостные каналы в социальных сетях тут же заполнились ее репостами. Она действительно захватила внимание людей. Они что‐то уловили. Мы хотели поглубже изучить проблему и узнать, как она связана с темами, о которых мы размышляли» [168].

В Питтсбурге статистик университета Карнеги – Меллона Александра Чулдехова с весны 2015 года работала с комиссией по вынесению приговоров штата Пенсильвания, создавая визуальную панель для изучения различных математических характеристик инструментов оценки риска. «Я стала все чаще и чаще задумываться об этих вопросах… чтобы понять различные представления справедливости, если говорить о классификационных показателях и их связях, – рассказывала она. – Все это происходило, когда я работала над другими проектами… Я обсудила с одним из своих старших коллег, что, возможно, стоит написать статью о проблемах проверки инструментов оценки риска. Мы уже сделали обзор литературы, когда прогремела статья ProPublica. Думаю, это действительно подтолкнуло многих людей к мыслям в этом направлении» [169].

Похожие истории можно услышать и от тех, кто обитал на другом конце страны. Аспирант Стэнфорда Сэм Корбетт-Дэвис начал работу над диссертацией, «желая заниматься роботами и чистой информатикой». Год спустя он обнаружил, что ему это не нравится: «В то же время я маниакально читал статьи по общественной политике в Соединенных Штатах – это было моим хобби. И тут я сообразил: нужно найти способ соединить свои технические навыки с чем‐то, что хоть немного ориентировано на политику» [170]. К преподавателям университета как раз присоединился Шарад Гоэль, работающий над компьютерными и статистическими подходами к общественной политике [171]. Сотрудничество двух исследователей казалось очевидным, и очень скоро они начали работать над рядом проектов, измеряя неравенство при принятии решений людьми. Они интересовались даже автомобилями, которые останавливали полицейские в Северной Каролине. Исследователи выяснили, что к чернокожим и латиноамериканским водителям применяется более низкий стандарт по сравнению с белыми: их машины обыскивают чаще, а контрабанду находят реже [172]. «Мы работали над этим, – объясняет Корбетт-Дэвис, – и размышляли о вопросах справедливости криминального правосудия и о том, что она означает для дискриминации. Затем… вышла статья ProPublica».

ProPublica уделила особое внимание видам ошибок, которые делал COMPAS, и подчеркнула, что программа постоянно переоценивала риски чернокожих обвиняемых, которые в будущем не совершали правонарушений, и недооценивала риски белых, нарушавших закон после УДО. Northpointe делала акцент не на типе ошибок, а на их величине, и придавала особое значение тому, что модель одинаково точна в прогнозах для чернокожих и белых обвиняемых и, более того, по каждой степени риска от 1 до 1 °COMPAS был откалиброван: обвиняемого могли освободить независимо от его расы и полученной оценки риска. Таким образом, вопрос о степени справедливости COMPAS разжег конфликт между двумя разными математическими определениями той самой справедливости.

Как иногда случается в науке, определенная идея или открытие созревает настолько, что несколько команд приходят к ней практически одновременно.

Появилось сразу три статьи [173]. Все три исследования привели к схожим, дополняющим друг друга результатам. Новости были не слишком хорошими.

Поставив во главу угла определение справедливости от ProPublica – предубеждение к чернокожим обвиняемым, которые совершали повторные преступления в два раза реже, чем их белые «коллеги», но были ошибочно отнесены к категориям с высоким риском, – Клейнберг написал: «Можно объединить это определение с другими, на которые люди обращают больше внимания, и спросить: „До какой степени они совместимы?“ Ответ: они не совместимы вообще».

Только в мире, где черные и белые обвиняемые будут иметь одинаковую «базовую ставку» – то есть совершать повторные преступления одинаково часто, – появится возможность удовлетворять критериям ProPublica и Northpointe одновременно. Иначе это просто невозможно.

Это никак не связано с машинным обучением. Не имеет отношения и к уголовному правосудию как таковому. «Это просто факт, – пишут Клейнберг и его коллеги, – имеющий отношение к оценкам рисков, когда базовая ставка у двух групп отличается» [174].

Анализ Чулдеховой пришел к тем же выводам. Она пишет, что откалиброванный инструмент «не может выдавать одинаковые ложноположительные и ложноотрицательные рейтинги в разных группах, когда показатель рецидивизма между этими группами отличается».

«Невозможно получить все сразу, – говорила она. – Это общий принцип, но в данном случае он подводит к интересным умозаключениям… имеющим последствия при оценке рисков в реальном мире» [175].

Например, если ни одна модель не в состоянии удовлетворить всем критериям, тогда попытка разоблачения любого инструмента оценки рисков гарантировано окончится чем‐нибудь неприятным и достойным заголовков в газетах.

Как объяснял Сэм Корбетт-Дэвис, «не существует такого мира, где ProPublica не найдет то, что можно назвать неравенством. Не существует такого алгоритма – такой версии COMPAS, – который не дал бы этой статье появиться на свет» [176].

(По иронии судьбы, в своем анализе данных округа Брауард Корбетт-Дэвис обнаружил, что COMPAS не откалиброван в отношении пола. «Женщина с оценкой риска 5 совершает повторные преступления так же часто, как и мужчина с оценкой 3, – утверждал он [177]. – [ProPublica] могла бы написать статью и об этом».) [178]

Бесчувственный математический факт невозможности существования таких алгоритмов также означает, что проблема влияет не только на модели машинного обучения, оценивающие риски, но и на любые средства классификации, которыми пользуется человек или машина. Как пишет Клейнберг, «любое присваивание оценок риска субъективно и может быть подвергнуто критике из-за предвзятости. Это одинаково верно и для тех случаев, когда оценка риска определяется алгоритмом, и для тех, когда она определяется людьми с помощью традиционной процедуры» [179].

Установив, что невозможно согласовать очень разные критерии справедливости, которые кажутся интуитивно понятными и желательными, и что старомодное человеческое правосудие при этом не лучше, остается задать один вопрос.

А что теперь делать?

Предыдущая главаГлава 18 из 83Следующая глава