В языке нет ничего, кроме различий…
Языковая система — это ряд различий в звуках, соединённых с рядом различий в понятиях.
Итак, для простоты и лучшего понимания: вектор — это токен на пересечении множества осей, где одна условно говорит об «одушевлённости», другая — об «абстрактности», третья — о «связи с действием» и т. д.
Представьте, что мы проводим такую операцию с любым словом — обнаруживаем все его связи со всеми словами во всех возможных текстах. Как вы думаете, мы поймём в результате этого, что это за слово?
Звучит даже дико, но да, ведь, по сути, мы всегда так и делаем: любой предмет для нас — человек, научная теория или произведение искусства — это как раз множество параметров. Если определить эти параметры от А до Я, то перед нами проступит сам этот предмет, человек или теория.
Очевидность значения
Давайте поиграем: я загадываю токен, ближе всего к которому относятся токены — «предмет», «мебель», «ножка», «спинка», «сидеть», «твёрдый»… Полагаю, что после «ножки» уже можно было заподозрить «табурет», после «спинки» ещё оставалась развилка с «креслом» и «диваном», но после «твёрдого» — это точно «стул».
Иными словами, близость слов (токенов) друг к другу создаёт, по сути, смысловое пространство, в котором какие-то предсказания оказываются более вероятными, а какие-то совсем невероятными (вряд ли вы думали, решая мою загадку, о «любви» или «теории эволюции»).
Но ещё раз: у осей признаков, создающих вектор, нет ни человеческих названий, ни человеческих смыслов. У нас одни параметры для определения предметов или явлений, у ИИ — другие. Мы понимаем по-своему, а ИИ — как-то по-другому.
Геометрия смысла
Нейросеть сама создаёт своё многомерное пространство, используя обнаруженные ею и неизвестные нам закономерности (соотношения) в текстах и данных, на которых мы её обучаем. И в этом гигантском, невообразимом геометрическом пространстве векторов проступают контуры нашего с вами мира.
Да, в это сложно поверить, но просто подумайте об этом. Например, понятно, что векторы условных токенов «собака», «пёс» и «щенок» окажутся в пространстве языковой модели очень близко друг к другу. А вектор слова «телескоп» будет находиться очень далеко от них. В целом, это соответствует, что называется, здравому смыслу.
Поэтому и сами направления в этом пространстве буквально обретают смысл. Пример с токеном «король», который мы уже рассматривали, показывает: простая математическая операция с наборами чисел способна воспроизвести сложную смысловую аналогию — вычли «мужчину», прибавили «женщину» и получили «королеву».
Выглядит так, что в этом пространстве есть определённое направление, вектор, который кодирует идею «смены гендера в контексте монархии». Однако ни что такое «гендер», ни что такое «монархия» — в том виде, как мы их себе образно представляем, — модель, разумеется, не знает[84].
Таким образом, машина, решая задачу перевода слов в числа, не просто кодирует их, а создаёт внутри себя сложнейшую, многомерную карту токенизированного языка, где смысл обретает геометрическую форму.
Смысл условного токена «король» не записан где-то в одном месте этого пространства. Он словно бы «растворён» в тысячах чисел соответствующего вектора и имеет уникальное положение относительно всех других векторов на этой карте.
Именно эти векторы, эти числовые «слепки» смысла и становятся тем сырьём, с которым будут работать более глубокие слои нейронной сети, чтобы в конечном итоге сделать своё предсказание.
В результате обучения вся нейронная сеть превращается в сложнейший навигационный инструмент — это не просто карта, а своего рода «семантический компас».
Теперь, чтобы понять отношения между разными токенами, ей не нужно снова перечитывать всю библиотеку. Ей достаточно произвести простые геометрические операции в этом пространстве: измерить расстояние и вычислить направление.
Большая лингвистическая модель — это, по сути, гигантская логарифмическая линейка, позволяющая рассчитать «семантическую арифметику». Весь хаос нашего языка представлен в современных ИИ упорядоченной геометрией, по которой можно не только путешествовать, но и в которой каждая точка этой системы, рассмотри мы её в отдельности, является квинтэссенцией всех текстов, на которых обучалась модель.