К книге
Бессовестная машина. Можно ли научить ИИ эмпатии, состраданию и другим человеческим ценностям?Часть 1 Предсказание. 3. Прозрачность. Клинический прогноз против статистического прогноза
29%
Часть 1 Предсказание. 3. Прозрачность. Клинический прогноз против статистического прогноза
24

Существует распространенный миф о том, что опытный судья добивается успеха с помощью неких мистических прорицаний. Разумеется, это глупости. Он достигает успеха, потому что делает меньше ошибок в фактах и реже ошибается в их оценке. Глубокое понимание ситуации и расследования должны быть способны без каких‐либо изъянов обеспечить нам все преимущества субъективных суждений (кроме их скорости и удобства).

Сталкиваясь с проблемой прозрачности (особенно крупных и сложных моделей), первое, что мы должны обдумать, – а стоит ли нам использовать такую крупную и сложную систему. Если уж на то пошло, должны ли мы пользоваться моделями?

Эти проблемы глубоко уходят в историю статистики и машинного обучения. Сегодня они остаются не менее актуальными, чем вчера, а ответы на них бывают весьма неожиданными.

В 1954 году Робин Доус был студентом философского факультета Гарварда и специализировался на этике. Его дипломная работа «Взгляд на анализ» изучала связь моральных оценок с эмоциями и то, насколько они влияют друг на друга.

Доус не просто считал эти вопросы значимыми, он полагал, что «эмпирическое исследование может оказаться важным. Но как его провести?» Задав этот вопрос, исследователь понял, что его интересы лежат скорее в области психологии, а не философии. Он подал заявки на постдипломные программы по психологии, и одна из лучших в стране – программа университета штата Мичиган – внесла его в список поступивших в последний день приема заявлений. Потрясенный Доус поведал об этом своему научному руководителю, который сказал: «Немедленно им перезвони, пока они не решили, что ошиблись» [231].

Доус поехал в Мичиган и начал подготовку по клинической психологии. В то время – в конце 1950‐х и начале 1960‐х годов – большое внимание уделялось тесту Роршаха. Доус скептически относился к нему как к клиническому инструменту: «Результаты основаны на интуиции и воспринимаются прежде всего бессознательно. Но потом я начал читать и узнал, что эмпирически большинство таких инструментов не работает».

Пока его доверие к Роршаху падало, Доус работал врачом-стажером в психиатрическом отделении. «У нас был пациент с галлюцинациями, – вспоминает он, – ему чудилось, что у него растет грудь. Он был в моей группе, содержался в закрытой палате, поскольку галлюцинации означали шизофрению. Почему же он подумал, что у него растет грудь? На той неделе у него в семье случилась трагедия, и у пациента начались галлюцинации. Это прекрасно все объясняет, верно?.. Врачи даже ни разу не попросили парня снять рубашку! Его просто отправили в психиатрическое отделение, и он шесть недель провел в закрытой палате. А когда его наконец раздели, оказалось, что он совершенно прав: у него росла грудь». У мужчины был синдром Клайнфельтера – генетическое отклонение, вызванное лишней Х-хромосомой, симптомы которого – отсутствие волос на теле и развитие грудных желез. Доус был вне себя. «Шесть недель просто выпали из его жизни, – говорил он, – потому что люди были так уверены в том, что у него галлюцинации».

Это привело к резкому повороту в карьере Доуса. Он отошел от клинической практики и занялся тем, что в те времена называлось математической психологией. Он написал статью, посвященную сравнению экспертных клинических оценок и простых математических моделей. Доус собирался ее опубликовать, но перед этим показал другу. Реакция приятеля привела ученого в замешательство: «Он усмехнулся, глядя на меня, и спросил что‐то вроде: „А ты уверен, что ниоткуда не списывал?“»

Так получилось, что Доус присоединился к академическому сообществу, о котором и понятия не имел. Проблема сопоставления экспертных суждений и математических моделей, которые тогда назывались «актуарными» методами, восходила к написанной в начале 1940‐х работе коллеги Эрнста Берджесса Теда Сарбина. Сарбин изучал прогнозы академической успеваемости первокурсников в университете Миннесоты. «Актуарная» модель представляла собой простую линейную регрессию, предсказывающую средний балл успеваемости в колледже всего по двум опорным точкам: рейтинг в классе в старшей школе и результаты отборочного теста в колледже. Экспертные прогнозы делали опытные клинические психологи, у которых был доступ к этим точкам, а также к результатам дополнительных тестов, восьмистраничному досье, заметкам с собеседования при поступлении в колледж и другим впечатлениям о студентах, полученным из первых рук.

Сарбин не нашел заметной разницы между двумя прогнозами. Если уж на то пошло, «актуарная» модель была немного более точной. Сарбина считал невероятным, что дополнительная информация, доступная клиническим психологам, никак не повлияла на точность прогнозов. «А как же старание, привычка работать и отдыхать, особые склонности, эмоциональные паттерны, постоянная рассеянность и сотни других факторов, – писал он, – казалось бы, связанных с такой сложной формой социального психологического поведения, как академические достижения? [232]» Как ни иронично, Сарбин узнал, что эксперты не уделяли этому особого внимания и делали прогнозы по тому же рейтингу в классе и оценкам за тест – то есть по тем же данным, что и регрессионная модель. Они просто были не столь последовательны и точны в своих оценках.

Сарбин пришел к выводу, что все время, потраченное на собеседования, ушло совершенно зря. Он предупреждал: «Без подтверждения статистическими исследованиями казуистический метод в социальных науках абсолютно бесполезен».

Находки Сарбина, в свою очередь, привлекли внимание молодого психолога по имени Пол Мил. Вдохновленный брошенным Сарбином вызовом и неуверенный в своей собственной позиции, Мил начал исследование, которое вылилось в целую книгу «Клинический или статистический прогноз» (Clinical versus Statistical Prediction: A Theoretical Analysis and a review of the evidence, 1954). Хотя бо́льшая часть книги (если не вся) была посвящена клиническим оценкам – откуда они берутся и как клинические психологи принимают решения, особое внимание привлекла глава, где Мил сравнивает клинические и актуарные прогнозы. Он обнаружил, что у экспертов нет шансов. Из почти сотни различных областей только в пяти или шести у специалистов, принимающих решения, появлялось хотя бы небольшое преимущество. «Мне говорили, – вспоминает Мил, – что на Среднем Западе половина преподавателей факультета клинической психологии в одном из крупнейших университетов, ориентированном на учение Фрейда, полгода страдала от реактивной депрессии после выхода моей маленькой книги» [233].

Обнаружив свой невольный плагиат, Доус, разумеется, очень заинтересовался работой Мила, но его научные руководители, казалось, не одобряли этого влияния. «Мои наставники по психоанализу говорили, что Мил – гений и об этом все знают, но его дело не имеет отношения к тому, чем занимаемся мы. И я начал волноваться: если его работа не связана с нашей, может быть, и я не хочу этим заниматься».

К середине 1970‐х годов Доус, который к тому времени перебрался в исследовательский институт Орегона, написал еще одну ошеломляющую статью по той же теме. По его словам, Сарбин и Мил открыли вопрос о том, насколько можно сравнивать статистический анализ с суждениями экспертов. «Считалось, что статистический анализ обеспечит нижний предел, с которым будут сравнивать оценки опытных клинических психологов, – писал Доус. – Так вышло, что низ оказался верхом» [234].

Через тридцать лет после первой статьи Сарбина и многих десятков более поздних работ Доус пришел к выводу: «Литературный поиск не выявил каких‐либо исследований, где клинические оценки оказались бы лучше статистических прогнозов, если и те и другие основывались на одних и тех же кодируемых входных параметрах» (курсив мой) [235].

Картина и в самом деле получилась унизительная. Даже в тех случаях, когда люди получали статистические прогнозы как еще одну часть данных для принятия решения, их заключения оказывались хуже, чем сам прогноз [236]. Другие исследователи пытались действовать наоборот: подавали экспертные суждения людей как входные данные для статистической модели. Особой разницы они не заметили [237].

Подобные заключения, подкрепленные многочисленными исследованиями, должны заставить нас остановиться [238]. Начнем с того, что они подталкивают нас к предположению: какое бы множество проблем ни ждало нас при передаче принятия решений статистической модели, одни только человеческие суждения не могут быть хорошей альтернативой. В то же время, чтобы достигнуть человеческого уровня или даже превзойти его, нет никакой необходимости в сложных и хитроумных моделях.

Тем не менее всплывает провокационный вопрос: что конкретно объясняет этот удивительный вердикт? Неужели человеческие оценки в самом деле столь плохи? Но так ли хороши линейные модели с небольшим количеством переменных? Или… существует третья возможность? Не может ли каким‐то образом человеческий опыт входить в простые модели там, где мы этого меньше всего ожидаем? Не ищем ли мы его в неправильном месте?

Предыдущая главаГлава 24 из 83Следующая глава