К книге
Генеративный искусственный интеллект. Как ИИ меняет нашу жизнь и работу2 Обучение больших языковых моделей. 2.3. Что попадает в обучающие данные?
27%
2 Обучение больших языковых моделей. 2.3. Что попадает в обучающие данные?
37

Как мы уже обсуждали ранее, большие языковые модели обучаются на огромных объемах необработанных данных из интернета. Сколько информации уже скормили этим LLM? Довольно много. Большая языковая модель общего назначения GPT‐3 была обучена на 45 терабайтах (Тб) текстовых данных3, причем 1 Тб, по оценкам, содержит 75 миллионов страниц4. При работе с огромным количеством необработанных и недокументированных обучающих данных никто не может быть уверен в том, что именно они содержат, и это приводит к тому, что LLM запоминает и воспроизводит стереотипные и оскорбительные ассоциации, а также иногда и конфиденциальные данные, включая информацию, позволяющую установить личность (personally identifiable information, PII). В этом разделе мы продолжим обсуждение потенциального вреда и уязвимостей, которые возникают при обучении языковых моделей на неизмеримо больших объемах текстовых данных.

Предыдущая главаГлава 37 из 135Следующая глава