универсальный закон обобщения: Шепард, «Towards a Universal Law of Generalization for Psychological Science».
экспоненциальная функция расстояния: Почему это так? Чтобы упростить задачу, давайте представим одномерное пространство. Предположим, вы заметили, что определенный красный гриб безопасен для употребления в пищу, а поблизости есть другие грибы, похожие на него с виду, но других оттенков красного. Вы можете представить все эти грибы как точки в одномерном пространстве, различающиеся по степени красноты. Предположение о том, что множество безопасных грибов представляет собой область в этом пространстве, означает, что вы допускаете существование определенного диапазона красноты — интервала в пространстве, — в котором грибы безопасны. Ваши гипотезы касаются того, каким может быть этот интервал. Тот единственный безопасный гриб, который вы уже обнаружили, обязательно должен находиться в этом интервале, поэтому ненулевую апостериорную вероятность будут иметь только те гипотезы, которые содержат эту точку. Чтобы вычислить вероятность того, что другая точка принадлежит к множеству безопасных грибов, вы суммируете апостериорные вероятности всех интервалов, содержащих эту точку. Если все интервалы одинакового размера имеют одинаковую вероятность, то — при рассмотрении только интервалов одного размера — вероятность того, что другая точка принадлежит к тому же интервалу, что и первая, будет снижаться линейно по мере удаления (каждый шаг в сторону от первой точки исключает часть гипотез, пока вы не исключите их все). Но чем крупнее интервалы, тем медленнее вы их исключаете. Эти два фактора — линейное снижение вероятности обобщения при фиксированном размере интервала и замедление темпа исключения гипотез по мере увеличения размера интервала — приводят к тому, что после усреднения по всем гипотезам вероятность обобщения падает экспоненциально по мере увеличения расстояния. Математически экспоненциальная функция характеризуется тем, что она убывает все медленнее, и именно к этому результату приводят оба фактора.
«Несомненно, психологическая наука»: Шепард, «Towards a Universal Law of Generalization for Psychological Science», с. 1323.
«хотя я и предпринял героическую попытку»: Азимов, Gold: The Final Science Fiction Collection, с. 226.
«У меня такое чувство, что Хари Селдон»: Азимов, Gold: The Final Science Fiction Collection, с. 227.
Джош Тененбаум вырос в окрестностях Стэнфорда: Биографические сведения взяты из статьи: Tenenbaum, «Joshua B. Tenenbaum (Award for Distinguished Scientific Early Career Contributions to Psychology)».
он написал диссертацию: Tenenbaum, «A Bayesian Framework for Concept Learning».
Один из первых проектов, над которыми мы работали вместе: Tenenbaum and Griffiths, «Generalization, Similarity, and Bayesian Inference».
его чтение во время отпуска: Эта история и описанная далее работа изложены в книге: John R. Anderson, The Adaptive Character of Thought.
«Я предлагаю»: Шепард, «How a Cognitive Psychologist Came to Seek Universal Laws», с. 18.
«Абстрактные задачи с бумагой и карандашом»: Шепард, «How a Cognitive Psychologist Came to Seek Universal Laws», с. 18.
особенно убедительный пример: Опубликовано в Wason, «Reasoning». Дальнейшая работа над этой задачей привела Уэйсона к гипотезе о том, что человеческое мышление может задействовать двойные процессы — рефлекторную реакцию и обдуманное переосмысление, — концепцию, популяризированную Канеманом в книге «Думай медленно... решай быстро». См. Manktelow, Beyond Reasoning: The Life, Times and Work of Peter Wason, Pioneering Psychologist.
Майк Оуксфорд и Ник Чейтер опубликовали статью: Oaksford and Chater, «A Rational Analysis of the Selection Task as Optimal Data Selection».
простая модель: См. Griffiths and Tenenbaum, «Randomness and Coincidences: Reconciling Intuition and Probability Theory», а также Griffiths et al., «Subjective Randomness as Statistical Inference».
с точки зрения байесовского вывода: Tenenbaum, Griffiths, et al., «The Rational Basis of Representativeness».
Джуда Перл читал статью: Биографические сведения о Джуде Перле взяты из Russell, «Biography of Judea Pearl».
«Мера, которую я предложу»: Статья была опубликована как Rumelhart, «Toward an Interactive Model of Reading», однако изначально вышла в виде технического отчета в 1976 году. Цитата приведена на с. 747.
«Чтение статьи Румельхарта»: Pearl, «A Personal Journey into Bayesian Networks», с. 4.
Джей Макклелланд ответил на этот вопрос: McClelland, «Integrating Probabilistic Models of Perception and Interactive Neural Networks: A Historical and Tutorial Review».
однослойная нейронная сеть, реализующая это байесовское решение: Этот аргумент приводится в Minsky, «Steps Toward Artificial Intelligence», и более подробно раскрывается в Minsky, Linear Decision and Learning Models. Вот его краткая версия: хотя мы использовали правило Байеса для вычисления вероятности того, что животное является кошкой, мы могли бы с тем же успехом вычислить вероятность того, что это собака, P(собака∣ признаки )= P( признаки ∣собака)P(собака) P( признаки )
Затем мы можем взять отношение этих двух апостериорных вероятностей,
P(кошка∣ признаки ) P(собака∣ признаки ) = P( признаки ∣ кошка ) P( признаки ∣собака) P(кошка) P(собака)
где все, что я сделал, — это разделил правую часть одного уравнения на правую часть другого, воспользовавшись тем, что значение P(признаки) одинаково в обоих случаях, чтобы сократить этот член. Запись правила Байеса в таком виде наглядно показывает, что степень изменения нашей убежденности в том, является ли животное кошкой или собакой, определяется относительной вероятностью признаков этого животного при двух данных гипотезах. Если оба признака независимы друг от друга для обеих категорий, мы можем разбить вероятность признаков на отдельные составляющие, по одной для каждого признака. При наличии двух признаков это дает нам P( кошка ∣ признаки ) P( собака ∣ признаки ) = P( признак 1∣ кошка ) P( признак 1∣ собака ) P( признак 2∣ кошка ) P( признак 2∣ собака ) P( кошка ) P( собака )
что ясно указывает на то, что каждый признак получает отдельную возможность влиять на наши убеждения о том, кошка это или собака. Поскольку логарифмы превращают произведения в суммы (то есть log xy = log x + log y), взятие логарифма этого уравнения дает log P( кошка ∣ признаки ) P( собака ∣ признаки ) =log P( признак 1∣ кошка ) P( признак 1∣собака) +log P( признак 2∣ кошка ) P( признак 2∣собака) +log P( кошка ) P( собака )
Это позволяет нам увидеть, что принятие решения о том, является ли объект кошкой или собакой, может быть выражено в виде линейной функции признаков — в точности такой, какую вычисляет перцептрон. Входной сигнал перцептрона указывает на наличие или отсутствие каждого признака, а весовые коэффициенты кодируют свидетельство в пользу того, что животное является кошкой, а не собакой, обеспечиваемое наличием этого признака, измеряемое как
log P( признак 1∣кошка) P( признак 1∣собака) и log P( признак 2∣кошка) P( признак 2∣собака) . Априорная вероятность кодируется как постоянно присутствующий дополнительный вес. Если сумма этих весов больше 0, то более вероятно, что животное — кошка, а не собака (поскольку log 1 = 0), и перцептрон указывает на кошку.
таким образом, также может получить байесовскую интерпретацию: Как и другие модели категоризации — см. работу Эшби и Альфонсо-Риса «Categorization as Probability Density Estimation».
допускать некоторую вариативность при применении: См. работу Ноя Гудмана и др. «A Rational Analysis of Rule-Based Concept Learning».
мы можем описать причинно-следственные связи: См. работу Редера и Хэсти «Causal Knowledge and Categories: The Effects of Causal Beliefs on Categorization, Induction, and Similarity».
порождающий процесс, который мы можем описать: Пример этого см. в работе Лейка и Пьянтадози «People Infer Recursive Visual Concepts from Just a Few Examples».
Кемп и Тененбаум показали: Кемп и Тененбаум, «The Discovery of Structural Form».
Байесовский подход: Если вы хотите подробнее узнать об этом подходе, см. работу Гриффитса, Чейтера и Тененбаума Bayesian Models of Cognition: Reverse Engineering the Mind.
ГЛАВА 14: ЯЗЫК КАК РАСПРЕДЕЛЕНИЕ ВЕРОЯТНОСТЕЙ
русский математик Андрей Марков: Увлекательная история работы Маркова приведена в статье Хейза «First Links in the Markov Chain».
скрытая марковская модель, обученная на газетных текстах: Перейра, «Formal Grammar and Information Theory: Together Again?».
Вероятностная модель, таким образом, способна обнаруживать: Стоит отметить, что связь между вероятностью и грамматичностью не столь однозначна: предложение с более высокой вероятностью не обязательно будет более грамматически правильным, поскольку вероятность зависит от таких факторов, как частотность слов и длина предложения. Тем не менее, показатели, которые скорее служат подтверждением принадлежности предложения к данному языку (например, его вероятность по отношению, скажем, к независимому выбору слов на основе их частотности), отлично справляются с выявлением предложений, которые люди считают приемлемыми. Более подробное обсуждение см. в работе Ло, Кларка и Лаппина «Grammaticality, Acceptability, and Probability: A Probabilistic View of Linguistic Knowledge».
его вдохновила скрытая марковская модель: Андерсон и Розенфельд, Talking Nets: An Oral History of Neural Networks, с. 379.
«Я хочу получить разрешение верить»: Интервью с Джеромом Фельдманом, 8 октября 2024 года.
В своей диссертации Хорнинг показал: Хорнинг, «A Study of Grammatical Inference».
случайная выборка будет отдавать предпочтение меньшим гипотезам: Тененбаум назвал это принципом размера: вероятность выбора примера из гипотезы обратно пропорциональна размеру этой гипотезы (то есть количеству примеров, которые могли быть сгенерированы). Модель усвоения слов детьми представлена в работе Сюй и Тененбаума «Word Learning as Bayesian Inference».
совместно со специалистом по компьютерным наукам Полом Витаньи Ник Чейтер доказал: Чейтер и Витаньи, «“Ideal Learning” of Natural Language: Positive Results About Learning from Positive Evidence».
стремления к простоте достаточно: Перфорс, Тененбаум и Регьер, «The Learnability of Abstract Syntactic Principles».
Данные, с которыми люди сталкиваются в процессе обучения, таким образом, несомненно, богаче: Более подробную аргументацию в этом ключе см. в работе Смит «Can Lessons from Infants Solve the Problems of Data-Greedy AI?».
Недавняя статья Юань Яна и Стивена Пьянтадози: Ян и Пьянтадози, «One Model for the Learning of Language».
моя недавняя совместная работа с Томом Маккоем: Маккой и Гриффитс, «Modeling Rapid Language Learning by Distilling Bayesian Priors into Artificial Neural Networks».
«искры» общего искусственного интеллекта: Бубек и др., «Sparks of Artificial General Intelligence: Early Experiments with GPT-4».
«тлеющие угли» задачи прогнозирования, на которой она обучалась: Маккой и др., «Embers of Autoregression Show How Large Language Models Are Shaped by the Problem They Are Trained to Solve».
мышление в категориях вероятностей по-прежнему полезно: Более развернутую версию этого аргумента см. в работе Гриффитса и др. «Bayes in the Age of Intelligent Machines».