К книге
Рождение разума: Как интеллект зарождается в людях и нейросетяхЧасть III Знание и обучение – все это в связях. Глава 8 Эмерджентная мыслящая машина. Вычисление вероятностей следующего слова: два гипотетических подхода
65%
Часть III Знание и обучение – все это в связях. Глава 8 Эмерджентная мыслящая машина. Вычисление вероятностей следующего слова: два гипотетических подхода
66

Представим, что вы хотите создать программу, предсказывающую окончание слова по уже введенным буквам. Простейший способ реализовать автодополнение – предлагать самое частотное слово, которое начинается с введенной последовательности. Например, если вы набрали букву Т, функция предложит the – самое частое английское слово на T. Если следующая буква S, системе нужно найти слова на TS, а их немного. Среди вариантов – tsunami, tsar и tsarina. Руководствуясь частотностью, автодополнение предложит самое распространенное – tsunami.

Итак, базовую систему автодополнения можно построить так: взять введенные буквы (например, TS), найти слова с таким началом (tsunami, tsar, tsarina) и выбрать самое частотное как основной вариант (в данном случае tsunami). Это вычислительно посильная задача, поскольку в английском языке всего около 100 000 употребительных слов, и современным компьютерам несложно отслеживать их частотность.

Можно ли применить частотный подход для предсказания следующего слова в предложении, опираясь только на предыдущие слова? Ведь в языке существуют устойчивые частотные паттерны. Если кто-то набрал «Я люблю», то по частотности следующим словом, скорее всего, будет «тебя». Возможно ли построить языковую модель, которая поддерживала бы диалог, основываясь на частотности предложений с определенным началом?

Нет, это невозможно. Ноам Хомский, крупнейший лингвист XX века, указал на суть проблемы: большинство фраз, которые мы встречаем, никогда прежде не были написаны. Нужен подход, выходящий за рамки простого воспроизведения увиденных ранее словесных последовательностей.

Второй подход мог бы опираться на свод правил, управляющих языком. Хомский отстаивал именно такой, основанный на правилах метод. Он утверждал, что все человеческие языки строятся на системах правил, которые базируются на простом наборе фундаментальных принципов. Эти правила, по Хомскому, определяют ключевые компоненты предложений и ограничивают способы их организации. Например, базовое правило английской грамматики гласит, что повествовательное предложение должно состоять из именной группы (скажем, «кошка») и следующей за ней глагольной группы (например, «охотится на мышь»). Другие правила уточняют, что именная группа включает необязательный артикль (слова вроде «a» или «the»), при необходимости одно или несколько прилагательных и существительное. В совокупности такие грамматические правила позволили бы предсказать, что после последовательности «Мальчик прыгнул в…» должно следовать прилагательное или существительное.

Однако здесь возникает проблема: грамматические правила не дают возможности делать точные предсказания. Предпринимались попытки создать более детальные и специфичные системы правил, но все они потерпели неудачу. Такие правила плохо работают, потому что почти у каждого правила есть исключения. Закономерности, которые мы пытаемся зафиксировать правилами, носят скорее вероятностный, чем абсолютный характер, и крайне сложно определить, что делать в ситуациях, когда правила противоречат друг другу. Дэйв Румельхарт стал заниматься моделированием нейронных сетей именно потому, что в начале 1970-х годов не смог заставить работать системы, основанные на правилах.

Итак, ни таблицы поиска с вероятностями последовательностей, ни программы на основе правил не позволили программистам и инженерам создать системы, эффективно предсказывающие следующее слово в контексте. Так что же наделяет этой способностью LLM?

Предыдущая главаГлава 66 из 102Следующая глава