К книге
Генеративный искусственный интеллект. Как ИИ меняет нашу жизнь и работу8 Что ждет ИИ и LLM в будущем?. 8.3. Лучшие практики ответственного использования LLM. 8.3.1. Целенаправленно курируем наборы данных и стандартизируем документацию
79%
8 Что ждет ИИ и LLM в будущем?. 8.3. Лучшие практики ответственного использования LLM. 8.3.1. Целенаправленно курируем наборы данных и стандартизируем документацию
107

Все модели машинного обучения, включая генеративные, сильно зависят от обучающих данных. Качество модели напрямую коррелирует с качеством данных (общая аксиома, выражающая эту зависимость, гласит: «мусор на входе – мусор на выходе»), а генерируемые ответы основаны на вероятностях токенов из обучающих данных. Во влиятельной статье 2018 года «Спецификации для датасетов» (Datasheets for Datasets) исследователь в области ИИ Тимнит Гебру и ее соавторы из Корнеллского и Вашингтонского университетов и Microsoft Research утверждают, что для стандартизации способов документирования наборов данных проделано еще недостаточно работы в рамках воспроизводимого научного процесса. С одной стороны, это частично объясняется тем, что тренировочные датасеты в некоторых случаях являются коммерческим преимуществом, которое компании не хотели бы раскрывать, например, обучающие данные GPT‐4, как и других моделей, не были обнародованы публично. С другой стороны, как обсуждалось в главе 2 и неоднократно наблюдалось на протяжении многих лет, непрозрачность данных может привести к появлению предвзятости и другим проблемам, что приведет к ухудшению моделей и качества их ответов. Гебру и ее коллеги пишут:

«В электронной промышленности к каждому компоненту, независимо от его сложности, прилагается технический паспорт с описанием рабочих характеристик, результатов испытаний, рекомендуемого использования и другой информацией. По аналогии мы предлагаем, чтобы каждый набор данных сопровождался спецификациями, в которых документируются его происхождение, состав, процесс сбора, рекомендуемое использование и так далее».

Предложение на первый взгляд скромное, но значительно модернизирует процесс документирования общих наборов данных и помогает сокращать разрыв между создателями датасетов и их потребителями, одновременно поощряя обе группы более вдумчиво относиться к своим продуктам18. В случае большого количества датасетов такая работа, хоть и не сложная, может потребовать много времени; в случае данных для предварительного обучения LLM документирование каждого источника может занять целую вечность из-за их количества и разнообразия. Компания Hugging Face создала карточки для датасетов (мы упоминали их в главе 2), которые являются ключевой особенностью процесса документирования датасетов Hugging Face и содержат метаданные, указанные создателем набора, с объяснением того, для чего следует использовать эти данные. Упрощенный пример показан на рис. 8.3.

Рис. 8.3. Карточка для набора данных databricks-dolly‐15k

Разработчики больших языковых моделей являются как создателями наборов данных, так и потребителями. Создаваемые ими датасеты на самом деле являются суперсетами, состоящими из множества других наборов данных, которые могут быть хорошо или плохо задокументированными, но почти наверняка изначально не предназначенными для использования при обучении генеративных моделей. Это не обязательно плохо: единственный способ, с помощью которого модели учатся генерировать язык, – проглатывание огромных объемов текстов, написанных для других целей, будь то искусство, юмор или простой обмен информацией. Но когда никто не знает, из чего состоят данные, как это часто бывает с генеративными моделями, их содержание может оказаться неточным, неуместным, расистским, сексистским, экстремистским или жестоким. Они могут содержать личную информацию и не содержать необходимый контекст. Разработчикам LLM, вероятно, сложно гарантировать, что ни одна из этих проблем не присутствует в их данных, но они должны приложить все усилия, чтобы определить безопасность источников данных и то, как разный состав данных влияет на модель. Конечно, на этом их ответственность не заканчивается – им также необходимо выбрать стратегии обучения, которые будут устранять неизбежные недостатки в данных.

Детальное понимание своих данных является не только лучшей практикой, но и может стать законом. Ожидается, что Закон ЕС об искусственном интеллекте [103] станет первым крупным законодательным актом, регулирующим использование этой технологии в мире, и в 2023 году агентство Reuters сообщило, что законодатели добавили новое положение, которое будет сосредоточено на документировании и снижении рисков. В частности, оно будет требовать, чтобы компании, занимающиеся генеративным ИИ, использовали только «подходящие» наборы данных, составляли «обширную техническую документацию и понятные инструкции по использованию», а также указывали «защищенные авторским правом материалы в наборах данных, которые они используют»19. Последнее дополнение было нацелено на модели для генерации изображений, поскольку уже известно, что такие компании, как Midjourney, использовали «сотни миллионов» защищенных авторским правом изображений в своих обучающих наборах данных, но его можно точно так же применить и к языковым моделям, которые часто содержат защищенные авторским правом материалы, включая книги и статьи, а также лицензионный код20.

Предыдущая главаГлава 107 из 135Следующая глава