Как мы видели в главе 7, паттерны активации нейроноподобных элементов способны отражать отношения сходства между значениями слов. LLM используют именно такие паттерны – исследователи ИИ называют их эмбеддингами, или векторными представлениями, – подобные тем, которые мы рассматривали для цветов, деревьев, птиц и рыб в главе 7. Стоит отметить, что в языковых моделях паттерны распределены по сотням и даже тысячам элементов, а не по восьми, как в моделях из главы 7. Как мы уже знаем, паттерны слов со схожими значениями должны быть похожи, но не идентичны. Это позволяет отражать как сходства, так и различия в значениях. Например, на рисунке 7.6 мы видели, что паттерны для малиновки и канарейки очень похожи в целом, тогда как паттерны для канарейки и сосны сильно различаются. В эмбеддингах языковых моделей информация о таких явно именуемых признаках распределена по множеству элементов представления – точно так же, как информация о различии в окраске малиновки и канарейки была распределена по всем скрытым элементам модели Румельхарта в главе 7. Возможно, вы спросите: что же заставляет паттерны слов со схожими значениями быть похожими в языковой модели? Никто специально эти паттерны не проектирует. Паттерн, представляющий значение конкретного слова, формируется в процессе обучения, когда сеть корректирует веса связей для предсказания окружающих слов в контексте. Некоторые лингвисты утверждают, что значение слова по своей природе зависит от контекста. Как сказал знаменитый английский лингвист Джон Руперт Ферс: «Слово познается по его окружению».
По этой логике нейросетевая модель совершенствует свои предсказания, исправляя ошибки при предсказании слов в окружающем контексте. В ходе этого процесса формируются представления, основанные на сходстве: слова с близкими значениями порождают схожие предсказания и сами появляются в схожих контекстах. Возьмем, к примеру, слово малиновка – после него могут идти фразы имеет крылья, покрыта перьями и умеет летать. То же самое справедливо для канареек и множества других птиц.
Вот что важно: близость значений проявляется через сходство контекстов употребления слов, а представления в языковых моделях, которые улавливают эту смысловую близость, формируются именно благодаря сходству предсказаний. Такой подход эффективен, поскольку слова со схожими представлениями порождают схожие предсказания в новых контекстах. Это позволяет переносить знания о предсказаниях одного слова на другие слова с близкими значениями.
Мы снова наблюдаем процесс, аналогичный описанному в главе 7. Там мы обучали сеть формировать распределенные представления различных объектов, напрямую предсказывая их явно именуемые свойства – наличие перьев или способность плавать. В результате объекты, имевшие много общих именуемых свойств, получали схожие распределенные представления. В LLM происходит нечто подобное. Формируемые в процессе обучения распределенные представления отражают сходство предсказаний для разных слов, а значит, и сходство их значений.
Подведем итог: представления в LLM оказываются схожими для объектов, которые встречаются в схожих контекстах и порождают схожие предсказания. Эти контексты и предсказания указывают, помимо прочего, на объекты с общими именуемыми свойствами – что и составляет важную часть того, что мы называем сходством значений.