Вопрос на триллион долларов заключается в том, как превратить эти довольно комичные пробные запуски в нечто, что ведет себя по-настоящему целенаправленно — именно так, как мы ожидали бы от настоящего профессионального ассистента. Вспомните три этапа технологической эволюции, о которых говорилось в начале этого раздела. Когда речь заходит об истинных ИИ-помощниках (тех, которые действительно могут делать дела за вас), мы, пожалуй, все еще застряли где-то между «нефункциональной» и «забавной» стадиями, и пока не видно БЯМ, которым вы могли бы со спокойной душой поручить заказать пиццу (даже без дополнительных анчоусов). Сколько же времени потребуется, чтобы достичь следующего, «незаменимого» уровня? Возможно, стоит поддаться искушению экстраполировать бурные темпы прогресса в области ИИ и предсказать, что в самое ближайшее время у нас появятся БЯМ, способные выполнять длинные цепочки действий для решения рутинных задач так же легко, как они выстраивают цепочки логических выводов для решения сложной головоломки.
Однако, как мы уже знаем, решать задачи в реальном мире трудно, поскольку они открыты, неопределенны и протяженны во времени. В прошлом, когда исследователи пытались перенести ИИ из «игрушечных» сред — симулированных миров или видеоигр — в более непредсказуемый мир, в котором живем мы с вами, он часто падал лицом в грязь (иногда в самом буквальном смысле). Воплощенные агенты — роботы, — обученные в симуляции, почти всегда пасуют при первом же столкновении с реальным физическим миром, и это одна из причин, почему Toyota до сих пор не закончила разработку своего автономного выгульщика собак. Именно поэтому (вопреки многолетним обещаниям) наши улицы до сих пор не кишат элегантными беспилотными автомобилями. БЯМ сейчас сталкиваются с похожей проблемой переноса навыков на действия в реальном мире: не существует тривиального перехода от ИИ, способного решать школьные математические задачи, к ИИ, который может самостоятельно управлять вашим семейным бюджетом.
Я использую термин «инструментальный разрыв» для обозначения этой пропасти между способностью БЯМ говорить и действовать. Ключевые вопросы заключаются в том, насколько она широка и как мы можем ее преодолеть. Если бы мне пришлось рассуждать гипотетически, я бы сказал, что между нами и по-настоящему целенаправленными БЯМ стоят два основных барьера. Первый связан с тем, как БЯМ проектируются и создаются, а второй — с данными, на которых они обучаются. Оба они, вероятно, преодолимы в ближайшие несколько лет, хотя, возможно, и не так быстро, как самоуверенно заявляют самые оптимистичные сторонники ИИ.
В неопределенных и открытых средах вы не всегда можете предсказать последствия своих действий. Даже если вы профессиональный гольфист, случайный порыв ветра может сбить с курса ваш лучший удар на фервее. Вы можете бесконечно тренироваться перед экзаменом по вождению, но нетерпеливый участник дорожного движения подрежет вас на перекрестке, оставив вмятины как на вашей гордости, так и на машине инструктора. Возможно, вы приготовили идеальный праздничный обед ко дню рождения отца, но он внезапно заболевает гриппом, и вам приходится всех обзванивать и отменять встречу. Эти капризы судьбы отражены в знаменитом стихотворении самого известного шотландского поэта Роберта Бернса:
Но ты не одинок, малыш,
Предвиденье — напрасный труд.
И планы лучшие, поверь,
И для людей, и для мышей
Нередко прахом идут,
Что для всех, кто вырос не в Шотландии, переводится так: «как бы тщательно вы ни планировали, всё может пойти не так, и с этим ничего не поделать, независимо от того, грызун вы или человек».
Так как же префронтальная кора (или ПФК) помогает здоровым людям планировать? Нейробиологи полагают, что ПФК разделена на две области, каждая из которых играет свою роль. Латеральная часть (расположенная ближе к вискам) в основном отвечает за управление поведением. Она координирует работу нейронных центров, отвечающих за восприятие, память и действие, чтобы формировать соответствующие поведенческие паттерны в ответ на текущие стимулы. Медиальная же часть (в труднодоступной срединной области головы) отвечает за контроль того, все ли идет по плану. Нейроны в медиальной области активируются всякий раз, когда происходит что-то неожиданное или когда дела начинают идти наперекосяк — например, если вы уроните тарелку на пол, споткнетесь о камень или столкнетесь с предательством друга. Иными словами, ПФК в целом не только формулирует планы, но и постоянно проверяет, как они выполняются, при необходимости корректируя курс. У здоровых людей, если тесто для пирога кажется слишком соленым или появляется подозрительный запах гари, нейроны медиальной префронтальной коры активируются и подают сигнал латеральной части ПФК принять меры по исправлению ситуации. Эти петли мониторинга и контроля необходимы в любой неопределенной и открытой среде. Вы не можете просто сесть за завтраком и поминутно предусмотреть каждый свой шаг до самого отхода ко сну. Вместо этого в течение дня вам нужно постоянно следить за тем, что может пойти не так. Именно это и позволяет нам делать медиальная ПФК.
Если мы хотим получить системы ИИ, способные работать как настоящие помощники, им, по всей видимости, понадобятся спаренные системы управления и контроля ошибок. Им потребуется модуль для выработки планов действий как на естественном языке («чтобы забронировать билет на поезд из Лондона в Вену, мне нужно сначала зайти на сайт Eurostar, чтобы забронировать поезд до Парижа»), так и в виде последовательности цифровых действий (<API> Get /api/timetable?departureStation=Par&arrivalStation=LON&departureDate=2023–12–21 Http/1.1. Host: www.eurostar.com </API>). Но виртуальному ассистенту также понадобится способность формулировать запасные планы («билеты на поезда до Парижа распроданы, возможно, я смогу поехать через Брюссель») и взаимодействовать с пользователем для подтверждения изменения плана («Поездка через Брюссель вас устроит? Дорога займет на час больше»). Некоторые исследователи заимствовали идеи о принципах работы ПФК, включая разделение труда между модулями управления и контроля ошибок, чтобы разработать сложные сценарии промптинга для БЯМ. Однако пока все результаты ограничиваются лишь небольшими «игрушечными» средами.[*2]
Другим потенциальным препятствием на пути к прогрессу является доступность данных. БЯМ стремительно ворвались в нашу жизнь после того, как исследователи собрали из интернета триллионы токенов созданного людьми текста и использовали их для предварительного обучения гигантских моделей. Многие исследователи надеются, что, если дать БЯМ лишь несколько примеров использования цифровых инструментов, доступных в Сети, они освоят их в два счета — подобно ребенку, который чувствует себя в интернете как рыба в воде. Действительно, большинству детей требуется несколько лет, чтобы полностью овладеть родным языком, но они, кажется, в мгновение ока понимают, что TikTok — это источник безграничных развлечений. Однако на то, чтобы научиться ориентироваться во взрослом мире — знать, как открыть банковский счет, снять квартиру или зарегистрироваться для голосования, — уходит гораздо больше времени, что подтвердит любой родитель подростка. Маловероятно, что БЯМ, которые просто умеют говорить (пусть даже очень умно), смогут без особых усилий совмещать функции цифровых помощников без существенного дополнительного обучения.
Таким образом, мне кажется вероятным, что для эффективного и безопасного использования цифровых инструментов нам потребуются наборы данных, фиксирующие огромные объемы действий пользователей в интернете — прокрутку страниц, наведение курсора и клики в реальной веб-среде, — которые БЯМ смогут научиться копировать с помощью обучения с учителем. Эти данные необходимы, чтобы научить модели тому, как люди динамически корректируют свои действия в сети при столкновении с непредвиденными обстоятельствами, точно так же, как триллионы слов потребовались для того, чтобы научить БЯМ заканчивать предложения на любую тему под солнцем. Вряд ли существует какая-то алгоритмическая уловка, которая позволит БЯМ самостоятельно разобраться в тонкостях подачи вашей налоговой декларации, если они ни разу не видели, как кто-то заполняет эти формы в реальности. Конечно, существуют огромные массивы данных с историей просмотров в браузере, включая подробную информацию о нажатиях клавиш и движениях указателя мыши, но неясно, могут ли (и должны ли) компании использовать их из соображений конфиденциальности.
Еще одна причина, по которой нам, вероятно, придется обучать ИИ-помощников на масштабных человеческих данных, — это безопасность. В современных методах тонкой настройки оценщики-люди оценивают текстовые ответы с точки зрения их релевантности и уместности (если вы попросили перевести с испанского на английский, выполнила ли модель эту задачу?), а также безопасности (не содержат ли они предвзятого, незаконного или нежелательного эротического контента?). Эти оценки используются для улучшения последующих ответов моделей. Точно так же нам потребуются люди для оценки того, насколько успешно была выполнена цифровая задача, запущенная от вашего имени через серию API-запросов. Большинство пользователей вряд ли обрадуются, если при покупке билета на концерт модель решит продать данные их кредитной карты, попытается обмануть провайдера или по пути сделает перерыв на просмотр порнографии. Если мы хотим, чтобы будущие БЯМ совершали разумные действия в цифровом мире, мы не можем полагаться исключительно на их способность рассуждать. Как и в случае с текстовыми ответами, им понадобятся человеческие предохранители — социальная обратная связь, указывающая на допустимые и недопустимые способы поведения. Разумеется, именно так мы, люди, учимся вести себя разумно в реальном мире: родители, учителя и друзья комментируют наши поступки и направляют нас к поведению, соответствующему социальным нормам, и (хочется надеяться) уберегают от нарушения закона.
Примечания
*1 По крайней мере, это справедливо для повреждений более «дорсальной», или верхней, части лобной коры.
*2 Webb et al., 2023.