Как мы уже обсуждали ранее, большие языковые модели обучаются на огромных объемах необработанных данных из интернета. Сколько информации уже скормили этим LLM? Довольно много. Большая языковая модель общего назначения GPT‐3 была обучена на 45 терабайтах (Тб) текстовых данных3, причем 1 Тб, по оценкам, содержит 75 миллионов страниц4. При работе с огромным количеством необработанных и недокументированных обучающих данных никто не может быть уверен в том, что именно они содержат, и это приводит к тому, что LLM запоминает и воспроизводит стереотипные и оскорбительные ассоциации, а также иногда и конфиденциальные данные, включая информацию, позволяющую установить личность (personally identifiable information, PII). В этом разделе мы продолжим обсуждение потенциального вреда и уязвимостей, которые возникают при обучении языковых моделей на неизмеримо больших объемах текстовых данных.