К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 1 Предсказание. 2. Справедливость. Чем справедливость не является
20%
Часть 1 Предсказание. 2. Справедливость. Чем справедливость не является
17

Гарвардский специалист по теории вычислительных машин Синтия Дворк, возможно, больше всего известна благодаря разработке принципа дифференциальной приватности, который позволяет компаниям собирать данные о пользователях в целом, сохраняя приватность каждого. Компания, занимающаяся веб-браузерами, хочет понимать поведение пользователей, но не знать при этом, на какие именно сайты ходите лично вы. Компания, производящая смартфоны, желает улучшить проверку орфографии или текстовые подсказки, не вникая в содержание ваших личных разговоров. Дифференциальная приватность делает это возможным. Примерно с 2014 года она распространялась по крупным техническим компаниям и принесла Дворк премию Геделя, одну из самых высоких наград в области компьютерных наук [157]. Но летом 2010‐го исследовательница считала, что закончила теоретическую часть работы, и искала новую задачу.

«Я начала работать над приватностью в 2000–2001 годах, – объясняет Дворк. – Дифференциальная приватность к 2006‐му уже существовала. У меня в голове оставался последний ряд вопросов, которые я хотела осветить, и на этом работа была закончена. Тогда я решила, что нужно подумать о чем‐то еще» [158].

Дворк, работая в исследовательском отделе Microsoft, приехала в Беркли, чтобы встретиться со своим коллегой, специалистом по информатике Амосом Фиатом. Весь день они провели в разговорах. К обеду, сидя в своем любимом ресторане Chez Panisse, они затронули тему справедливости. Дворк вспоминает: «Чтобы не шокировать находящихся вокруг нас людей разговорами о расизме и сексизме, мы придумали слова-заменители, такие как „пурпурные галстуки“, „полосатые рубашки“ и тому подобное. Но к обеду… мы во всем этом погрязли».

Термин «справедливость» в теоретической информатике употребляется в ряде контекстов, начиная с теоретико-игровых механизмов разрезания пирога (или раздела наследства) так, чтобы каждый получил справедливую долю, и заканчивая алгоритмами планирования, которые нужны, чтобы убедиться: каждый процесс в ЦПУ занимает соответствующее время. Но Дворк подумала, что в идее справедливости есть что‐то еще, о чем никто в отрасли еще не подозревает.

Так случилось, что Дворк прочитала одну из статей Джулии Энгвин из рубрики «Что они знают» в Wall Street Journal. Заметка была посвящена онлайн-рекламе. В ней говорилось, что уже в 2010 году (если не раньше) компании могли провести опознание личности каждого пользователя их веб-сайтов, сузив неопределенность до нескольких десятков людей, и за доли секунды принимали решение о том, какие кредитные карты кому предлагать [159].

Проработав с проблемой приватности целых десять лет, Дворк начала думать об этой проблеме не только с точки зрения «что они знают?», но и задумываться о том, «что они делают с этими знаниями?».

Дворк вернулась в Microsoft и сказала: «Я нашла нашу проблему».

В ее лаборатории работал и Мориц Хардт, в то время учившийся в аспирантуре и проходивший тем летом стажировку от Принстонского университета. Хардт совершенно не хотел работать над проблемами реального мира. Он интересовался теорией: сложность алгоритма, теория неразрешимости, произвольность. Чем абстрактнее, тем лучше. «Никакого практического использования, – шутил он. – Старая школа!» [160]

«Я многому научился, – рассказывает Хардт, – но нашел, что существует ряд проблем, которые я мог бы рассмотреть на этой площадке… Это не имело отношения к тому, чем я интересовался. Но я быстро увлекся социальными проблемами в большем объеме, чем их касается информатика». Все началось с анализа сохранения приватности данных, проведенным с Дворк. Она же втянула Хардта и в проект, посвященный справедливости.

Как вспоминает Хардт, «Синтия предполагала, что порой, когда люди спрашивают о приватности, они на самом деле беспокоятся о том, что кто‐то будет пользоваться их данными ненадлежащим образом. Проблема не в том, чтобы скрыть информацию любой ценой, а в том, чтобы не допустить вреда от пользования ею… Это предположение оказалось достаточно точным. Со временем общественные обсуждения переключились с приватности на справедливость, и все, что выглядело как проблема приватности, вдруг оказалось проблемой справедливости».

Дворк, Хардт и их коллеги столкнулись не только с огромными сложностями по переводу философских и юридических идей о справедливости в жесткие математические конструкции, но также обнаружили, что фактически главные ориентиры и методы, некоторые из которых появились десятки лет назад, понимались совершенно неверно и могли напрямую нанести вред.

К примеру, закон США о борьбе с дискриминацией определяет ряд признаков, таких как раса, пол и статус инвалида. Подразумевается, что строго запрещено использовать эти переменные в моделях машинного обучения, которые могут повлиять на людей в таких областях, как трудоустройство, содержание под стражей и т. д. Если мы читаем в прессе, что модель использует расу (или пол) как атрибут, то приходим к выводу, что что‐то пошло не так. Напротив, компании или организации обычно защищают свою модель, доказывая, что она «не использует расу как атрибут» или «не различает цвет кожи». Это кажется интуитивно понятным: как что‐то или кто‐то может подвергать дискриминации определенную группу, если понятия не имеет, кто туда входит?

Но это положение ошибочно по нескольким причинам.

Просто убрать защищенный законом признак недостаточно. Пока модель вбирает в себя характеристики, коррелирующие, скажем, с полом или расой, ничего хорошего из того, что мы будем избегать упоминаний о них, не выйдет.

Как в случае с Бостонским симфоническим оркестром и, более того, с лингвистическими моделями анализа резюме, недостаточно просто убрать переменную, которая вас волнует (в данном случае – пол), особенно если существуют коррелирующие с ней факторы. Это явление известно как понятие избыточного кодирования. Гендерный атрибут избыточно закодирован среди других переменных.

В контексте уголовного правосудия история об ином отношении к одной из демографических групп пестрит проявлениями избыточного кодирования. В районах, населенных этническими меньшинствами, полиция действует более агрессивно, и это означает, что на ровном месте что‐то кажущееся нейтральным, например список правонарушений (количество предыдущих задержаний), может превратиться в избыточное кодирование признака расы [161].

Поэтому недостаточно просто не обращать внимания на критичные признаки. Одно из неприятных последствий избыточного кодирования в том, что, если система «слепнет» по отношению к таким атрибутам, становится только хуже. К примеру, создатель модели захочет измерить, насколько некая переменная коррелирует с расой. Без значения расового атрибута у него ничего не выйдет. Один программист, с которым я говорил, жаловался, что его начальство постоянно подчеркивает важность того, чтобы модели не искажали выводы на основе пола и расы. Но политика этой компании не позволяла программистам, работающим с машинным обучением, внести защищенные атрибуты в данные. Так что они не имели понятия, страдают их модели систематической ошибкой или нет.

Если исключить защищенные атрибуты, то невозможно не только измерить отклонение, но и уменьшить его. Например, модель машинного обучения, использующаяся при найме, может отклонить кандидата, потому что тот не работал в течение года. Мы бы не хотели, чтобы это распространялось на беременных женщин и молодых матерей, но учесть это сложно, если модель «слепа» по отношению к полу и не может включать в себя даже что‐то тесно с ним связанное, например беременность [162].

«Разработчики абсолютно уверены, – говорит Хардт, – что справедливость через слепоту не работает. Это самый доказанный и надежный факт во всей области исследований» [163].

Нужно время, чтобы эта идея дошла от компьютерщиков до ученых-правоведов, политической верхушки и общественности в целом, но она постепенно пробивает себе дорогу. «Могут быть случаи, когда позволить алгоритму учесть значение защищенного параметра означает сделать результаты более справедливыми, – отмечается в одной из последних статей, опубликованных в University of Pennsylvania Law Review. – Для этого может потребоваться изменение доктрины, поскольку во многих случаях рассмотрение защищенного статуса при принятии решения считается правовым нарушением» [164].

Лето, которое Мориц Хардт работал с Синтией Дворк, принесло свои плоды в виде статьи, где фиксировались первые результаты [165]. Более того, даже без учета итогов статья послужила сигналом для коллег-теоретиков, указывающим на нечто достойное их внимания, некий теоретический вопрос, обладающий большим потенциалом и имеющий неоспоримую важность для реального мира.

Вернувшись в Принстон и получив степень PhD, Хардт обнаружил, что его пригласили на что‐то вроде свидания вслепую. Дворк поговорила с Хелен Ниссенбаум, которая одной из первых задумалась об этических проблемах в информатике [166]. У Ниссенбаум был аспирант по имени Солон Барокас, и они с Дворк поняли, что их ученики могут оказаться единомышленниками [167].

Первая встреча началась необычно.

Хардт сидел за столиком в суши-баре Sakura Express на Уизерспун-стрит в Принстоне. Вошел Барокас. «Он сел, – вспоминает Хардт, – и вытащил статью. К моему разочарованию, за ней последовал желтый маркер, которым он тщательно выделял абзацы. Не так нужно читать статью по информатике!» Мориц смеется: «До этого момента я считал, что слова в статье просто заполняют промежутки между математическими расчетами… Было очень неловко, потому что написанное не имело смысла».

Двое молодых людей разговорились. Несмотря на непростое начало, сходство, которое заметили их наставницы, действительно существовало. В конце концов эти двое решили представить предложение на конференцию по нейросетевым системам обработки информации (Neural Information Processing Systems, NeurIPS) 2013 года, чтобы провести семинар по справедливости. NeurIPS отказала. «Они посчитали, что по теме проведено недостаточно работы и материала не хватает, – рассказывает Хардт. – В 2014 году мы с Солоном собрались вместе и решили, что попробуем снова». Исследователи дали теме другое название и более широкое понимание: «Справедливость, ответственность и прозрачность в машинном обучении» (Fairness, Accountability, and Transparency in Machine Learning, FATML). На этот раз NeurIPS согласилась. В том же году был проведен однодневный семинар в Монреале. Барокас и Хардт представляли тезисы, а Дворк произнесла вступительную речь.

Хардт закончил обучение, уехал из Принстона и начал работать в исследовательском отделе IBM. Параллельно он продолжал заниматься вопросами справедливости. «Мне всегда приходилось работать над сторонними проектами, чтобы продолжать существовать как специалист по теории вычислительных машин. С точки зрения карьеры, это своего рода хобби». Надо отдать должное IBM, компания предоставила Морицу достаточно свободы, несмотря на то, что его страсть не всегда разделяли. «Моя группа в IBM не особенно интересовалась этой темой, – говорит он, – но ею никто не интересовался».

Двое исследователей встретились вновь и повторили свое выступление на конференции в 2015 году. «Комната была полна, – вспоминает Хардт. – Люди пришли, но до революции, мягко говоря, было еще далеко». Он продолжал тратить львиную долю своего времени на информатику. Прошел еще год, и они с Солоном в третий раз провели семинар по FATML.

На этот раз кое-что изменилось. «2016‐й был годом, когда все вышло из-под контроля, – рассказывает Хардт. – Математик и блогер Кэти О’Нил, которая была на первом семинаре в 2014‐м, опубликовала свой бестселлер „Оружие математического поражения“ (Weapons of Math Destruction), посвященный социальным проблемам, порожденным безответственным использованием больших данных. Шокирующие результаты выборов, бросающие вызов исследованиям общественного мнения по всему миру, подорвали доверие к надежности прогностических моделей. Тем временем работа политических фирм, использующих большие данные, таких как Cambridge Analytica, вызвала вопросы о том, не используется ли машинное обучение для того, чтобы напрямую влиять на политику. Платформы одних крупных социальных сетей ссорились по поводу того, как применять машинное обучение для фильтрации информации, демонстрируемой миллиардам их пользователей, и делать ли это вообще. А группа репортеров из ProPublica после года неустанной работы с данными вынесла на суд общественности свои открытия об одном из самых популярных в стране инструментов оценки рисков.

Справедливость больше не была проблемой. Она превратилась в движение.

Предыдущая главаГлава 17 из 83Следующая глава