По сравнению с большинством других видов млекопитающих у людей достаточно большая и заметная склера – глазные белки́. Благодаря этому мы уникальным образом демонстрируем, куда направлено наше внимание или, по крайней мере, взгляд. Эволюционные биологи с помощью «гипотезы кооперативного глаза» доказывают, что это не ошибка, а функция. Она указывает на то, что человек как вид выжил во многом благодаря сотрудничеству. А также на то, что преимущества взаимодействия перевешивают недостаток приватности или свободы действий [266].
Понятно, почему мы ожидаем чего‐то подобного и от наших машин: нужно знать не только, что они, по их мнению, видят, но и куда при этом смотрят.
В машинном обучении идея получила название «зрительное внимание». Если система относит изображение к какой‐то категории, то можно предположить, что для этого одни детали изображения важнее или влиятельнее других. Будь у нас что‐то вроде тепловой карты, на которой выделены эти важные детали, мы могли бы использовать ее для контроля зрительного внимания и убедиться, что система ведет себя так, как мы от нее ожидаем [267].
Методы зрительного внимания полны сюрпризов, которые подчеркивают, насколько контринтуитивным может быть принцип работы систем машинного обучения. Часто они с энтузиазмом хватаются за те аспекты данных для обучения, которые мы вообще не относим к делу, и игнорируют то, что считается жизненно важной информацией.
В 2013 году аспирант университета штата Орегон в Портленде Уилл Лэндекер работал с нейросетью, обучая ее находить картинки, на которых есть животные. Лэндекер разрабатывал методы, которые позволили бы увидеть, какая часть изображения релевантна для окончательной классификации, и заметил кое-что странное. Во многих случаях нейронная сеть обращала больше внимания на фон, чем на передний план. Более внимательное изучение показало, что размытый фон, который фотографы называют боке, часто присутствует на фотографиях животных, когда фокус на морде, а не на заднем плане. Пейзажи же, напротив, обычно снимают в фокусе. Как выяснилось, исследователь обучил модель не животных обнаруживать, а боке [268].
В 2015 и 2016 годах дерматологи Джастин Ко и Роберто Новоа возглавили общий проект исследователей из медицинской и инженерной школ Оксфорда. Новоа был впечатлен прогрессом в системах компьютерного зрения и их способностью отличать сотни пород собак. «Я посчитал, – рассказывает он, – что если это возможно с собаками, то получится и с раком кожи» [269]. Исследователи собрали самый большой за всю историю набор данных с доброкачественными и злокачественными образованиями кожи. Всего в нем было 130 тысяч изображений, представляющих две тысячи различных заболеваний, а также образцы здоровой кожи. Ученые взяли стандартную систему машинного зрения с открытым исходным кодом Inception v3 от Google, обученную на наборе данных и категориях ImageNet, и начали обучать нейронную сеть находить разницу не между чихуахуа и лабрадором, а между акральной лентигиозной меланомой и амеланотической меланомой, а также тысячами других заболеваний.
Систему проверили в работе с помощью группы из двадцати пяти дерматологов. Она превзошла людей. Уровень точности дерматологов-специалистов показан в часто цитируемой статье, вышедшей в журнале Nature в 2017 году [270]. Для Джастина Ко, который гордился точностью своего диагностического взгляда, отточенного за более чем десять лет подготовки и клинической практики, результат был одновременно обидным и вдохновляющим. «Я тренировался долгие годы, – говорит Ко, – а эта штука научилась за нескольких недель» [271]. Особенно многообещающей выглядела способность системы «распространить высококачественную и дешевую диагностику в самые отдаленные части мира».
Выяснилось, что подобные системы полезны не только там, где не хватает первоклассных диагностов, но и там, где опытным специалистам, таким как сам Ко, необходимо еще одно мнение. Он навсегда запомнил день – 17 апреля 2017 года, – когда в его клинику пришел пациент с необычным пятном на плече. «Я не мог дать вердикт, – рассказывает врач. – Что‐то в этом пятне казалось неправильным. Но сквозь дерматоскоп я не увидел признаков ранней стадии меланомы. И все же пятно меня волновало. Тогда я решил, что настало время достать iPhone».
Ко сделал ряд фотографий под разными углами и с разным освещением и загрузил их в нейронную сеть. «Примечательно, – продолжает он, – что независимо от качества фотографий она обрабатывала их достаточно стабильно и была твердо уверена, что перед нами злокачественное поражение кожи». Ко сделал биопсию и поговорил со специалистом по дерматопатологии. «Каково же было мое удивление, когда она сказала: „Потрясающе! Это действительно раннее слабо выраженное поражение, развивающееся в меланому“. Так мы поймали рак на стадии, когда его можно полностью излечить». Это был первый случай, когда нейронная сеть оказала клиническое влияние. «И я надеюсь, – говорит Ко, – что это первый случай из многих».
Но история оказалась несколько сложнее. На следующий год Ко, Новоа и их коллеги отправили в Journal of Investigative Dermatology письмо, предупреждающее о том, что не стоит слишком быстро вводить нейросети в рутинную клиническую практику.
Теперь они чувствовали, что внедрять такие модели в отрасль нужно с предельной осторожностью, и подчеркнули свою точку зрения поучительной историей из личного опыта. Система компьютерного зрения, которую они использовали, с большой вероятностью относила к злокачественным новообразованиям изображения линейки. Почему? Дело в том, что на медицинских изображениях опухолей линейка для определения масштаба появляется чаще, чем на изображениях здоровой кожи. «Алгоритм самопроизвольно „научился“ тому, что линейки означают рак» [272]. Как бы то ни было, окончательное решение очень сложное: должен ли набор данных содержать достаточно разнообразные варианты или все подающиеся на вход изображения должны быть тем или иным образом стандартизированы? «Нужно и дальше рассматривать все множество затронутых нюансов, – пришли к выводу ученые, – чтобы безопасно внедрить новые технологии в больницы».