«Что происходило в темные века»: Андерсон и Розенфельд, Talking Nets: An Oral History of Neural Networks, с. 254.
Дэвид Румельхарт был настойчив: Биографические сведения взяты из Протоколов заседаний Конгресса США (United States Congressional Record), сессия Сената от 25 февраля 1964 года, с. 3448–3449 (заявление сенатора Макговерна). Численность населения приведена по данным переписи населения США 1960 года.
«У них была такая тенденция»: Интервью с Джеем Макклелландом, 17 мая 2018 года.
«Когда мы начинали»: https://www.psychologicalscience.org/observer/david-rumelhart.
более сложные функции от своих входных данных: Классический результат об универсальности нейронных сетей показывает, что добавление большего числа скрытых нейронов является ключом к тому, чтобы эти сети могли аппроксимировать любые непрерывные функции, но этого можно достичь с помощью одного или двух скрытых слоев в зависимости от функции активации, используемой в скрытых нейронах — см. Hornik, Stinchcombe, and White, «Multilayer Feedforward Networks Are Universal Approximators». Это наводит на мысль, что важна лишь ширина скрытого слоя. Однако аналогичные результаты можно показать и для глубины, например в Lu et al., «The Expressive Power of Neural Networks: A View from the Width». Преимущество увеличения глубины, а не ширины сети, по-видимому, заключается в эффективности с точки зрения количества требуемых скрытых нейронов: существуют задачи, для которых при увеличении ширины вместо глубины требуется экспоненциально больше скрытых нейронов, как показано в Cohen, Sharir, and Shashua, «On the Expressive Power of Deep Learning: A Tensor Analysis».
информацию из более широкого диапазона входных сигналов: В книге «Перцептроны» Минский и Пейперт отметили, что объем входных данных, который может «видеть» нейрон, потенциально растет экспоненциально с его глубиной. Например, если на каждом слое нейроны получают входные сигналы от двух нейронов ниже, то объем входных данных, который может охватить один нейрон, составит 2d, где d — это глубина нейрона в сети. Это способ преодолеть некоторые из выявленных ими проблем, таких как ограничения возможностей простых перцептронов, где ассоциативные элементы получали входные сигналы из ограниченных областей изображения.
«В некотором смысле»: Интервью в Андерсон и Розенфельд, Talking Nets: An Oral History of Neural Networks, с. 273.
«Я думаю, это была очень хорошая подготовка»: Интервью в Андерсон и Розенфельд, Talking Nets: An Oral History of Neural Networks, с. 361.
«Я ожидал, что у них будут модели»: Цитаты из Андерсон и Розенфельд, Talking Nets: An Oral History of Neural Networks, с. 363.
«Спустя какое-то время я встретил настоящего плотника»: Интервью с Джеффом Хинтоном, 3 декабря 2018 года.
«Это совершенно отличалось от Англии»: Интервью с Джеффом Хинтоном, 3 декабря 2018 года, с. 370.
«Я просто не справлялся»: Интервью с Джеффом Хинтоном, 3 декабря 2018 года, с. 276.
«Я помню ту встречу»: Интервью с Джеем Макклелландом, 17 мая 2018 года.
«Мы притворялись, что они линейные»: Интервью с Джеем Макклелландом, 17 мая 2018 года, с. 278.
Трюка Румельхарта оказалось достаточно, чтобы решить: Итак, любители математического анализа, вот подробности. Мы хотим минимизировать
E = (tr − ar)2
взяв производную по w3r. Предположив, что функция активации линейна, Румельхарт смог переписать ar как a3w3r + a4w4r, а затем продифференцировать напрямую, получив ∂E ∂ w 3r =−2 t r − a r a 3
Δ w 3r =−η ∂E ∂ w 3r где η — это величина шага, который мы делаем в направлении, указанном градиентом (скорость обучения).
Альтернативный вариант — использовать цепное правило дифференцирования (открытое Лейбницем!), заметив, что
∂E ∂ w 3r = ∂E ∂ a r ∂ a r ∂ w 3r
так что мы сначала дифференцируем E по ar, а затем умножаем полученный результат на производную ar по w3r. Это дает нам ∂E ∂ w 3r =−2 t r − a r × a 3
где знак × используется здесь для разделения членов, соответствующих двум производным, чтобы было проще понять, что произошло. Преимущество такого подхода состоит в том, что мы можем легко справиться с дополнительной сложностью, связанной с добавлением функции активации. Если мы используем функцию активации g(·), так что теперь ar = g(inputr) и inputr = a3w3r + a4w4r, мы просто вводим дополнительный шаг ∂E ∂ w 3r = ∂E ∂ a r ∂ a r ∂ input r ∂ input r ∂ w 3r
что дает нам
∂E ∂ w 3r =−2 t r − a r × g ′ input r × a 3
где g’(·) — это производная функции активации g(·).
следующее правило обучения: Румельхарт и его коллеги называли этот простой алгоритм обучения с непрерывными активациями дельта-правилом или правилом Уидроу — Хоффа в честь аналогичного результата, представленного в работе Widrow and Hoff, «Adaptive Switching Circuits».
«У него была эта идея»: Интервью в Андерсон и Розенфельд, Talking Nets: An Oral History of Neural Networks, с. 278.
«Что ж, мы просто притворимся»: Интервью в Андерсон и Розенфельд, Talking Nets: An Oral History of Neural Networks, с. 278.
Румельхарт вывел простое правило обучения: Еще один экскурс в математический анализ! Вот развернутое выражение для ошибки последнего слоя нашего перцептрона при условии, что выходной нейрон имеет линейную функцию активации: E = (tr − a3 × w3r − a4 × w4r)2
Активация скрытых нейронов (нейронов 3 и 4) является результатом входных сигналов, которые они получают от нейронов, расположенных под ними. Если предположить, что эти нейроны также имеют линейные функции активации, то мы можем переписать активацию нейрона 3 как a3 = a1 × w13 + a2 × w23
поскольку нейроны 1 и 2 находятся на слое ниже и соединяются со скрытым нейроном 3 через веса w13 и w23 соответственно. В этом случае ошибка принимает вид E = (tr − (a1 × w13 + a2 × w23) × w3r − a4 × w4r)2
которую мы можем продифференцировать по весам более низкого уровня, чтобы найти градиент, который можно использовать для градиентного спуска. Например, производная ошибки по w13 равна ∂E ∂ w 13 =−2× t r − a r × w 3r × a 1 .
Опять же, мы можем легко проделать это с помощью цепного правила. Если все зависимости линейны, мы можем записать:
∂E ∂ w 13 = ∂E ∂ a r ∂ a r ∂ a 3 ∂ a 3 ∂ w 13 .
что просто обращает вспять последовательность шагов при переходе от w13 к ошибке: w13 влияет на a3, которая влияет на ar, которая влияет на E. Если мы вычислим каждую из этих производных, то получим: ∂E ∂ w 13 =−2 t r − a r × w 3r × a 1 .
Введение функций активации лишь добавляет в этот процесс дополнительные шаги, как и раньше. Использование функции активации g(·), так что активация любого нейрона равна ai = g(входi), дает нам: ∂E ∂ w 13 = ∂E ∂ a r ∂ a r ∂ вход r ∂ вход r ∂ a 3 ∂ a 3 ∂ вход 3 ∂ вход 3 ∂ w 13
что в итоге дает:
∂E ∂ w 13 =−2 t r − a r × g ′ вход r × w 3r × g ′ вход 3 × a 1
где g’(·) — это производная функции g(·). В этом и заключается сила обратного распространения ошибки: мы можем создавать все более и более сложные нейронные сети, добавляя новые слои весов или новые функции, реализующие преобразования между слоями, и нам просто нужно продолжать применять цепное правило для вычисления соответствующих градиентов. Единственное требование состоит в том, чтобы каждое используемое нами преобразование было дифференцируемым, и чтобы мы следили за тем, чтобы градиенты не становились слишком малыми при их обратной передаче через слои. Современные библиотеки глубокого обучения используют автоматическое дифференцирование для нахождения градиентов, поэтому все, что требуется, — это описать саму модель.
«М-да, это довольно скверно»: Интервью в Anderson and Rosenfeld, Talking Nets: An Oral History of Neural Networks, с. 278.
«Никаких гарантий не было»: Интервью в Anderson and Rosenfeld, Talking Nets: An Oral History of Neural Networks, с. 376.
«Помнишь тот свой алгоритм?»: Интервью в Anderson and Rosenfeld, Talking Nets: An Oral History of Neural Networks, с. 378.
статья, опубликованная в Nature: Речь идет о статье: Rumelhart, Hinton, and Williams, “Learning Representations by BackPropagating Errors”. Судя по всему, она была написана Хинтоном: «Вообще-то у нас с Дейвом Румельхартом был договор: я напишу короткую статью об обратном распространении ошибки, которое было его идеей, а он напишет короткую статью об автокодировщиках, которые были моей идеей. Всегда лучше, чтобы статью писал тот, кто не сам придумал эту идею, потому что он может яснее выразить, что именно в ней важно». Интервью в Anderson and Rosenfeld, Talking Nets: An Oral History of Neural Networks, с. 380.
был не первым человеком: Более подробную информацию об этой истории см. в: Schmidhuber, “Deep Learning in Neural Networks: An Overview”.
Пол Вербос в 1981 году: Доклад был представлен в 1981 году, но опубликован в 1982-м: Werbos, “Applications of Advances in Nonlinear Sensitivity Analysis”. Вербос исследовал подобные идеи еще с 1970-х годов, руководствуясь идеями из психологии: «Но обратное распространение ошибки использовалось не для адаптации системы обучения с учителем; оно должно было перевести идеи Фрейда на язык математики, реализовать поток того, что Фрейд называл „психической энергией“, через систему». Интервью в Anderson and Rosenfeld, Talking Nets: An Oral History of Neural Networks, с. 342.
получило название «коннекционизм»: Этот термин был заново введен в употребление в 1980-х годах Джеромом Фельдманом и Даной Баллардом в: Feldman and Ballard, “Connectionist Models and Their Properties”.
использовалось Розенблаттом: Rosenblatt, «Перцептрон: вероятностная модель хранения и организации информации в мозге» (The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain), с. 387.
бихевиористское представление Эдварда Торндайка: Thorndike, Human Learning, с. 122.
что такое категории и как люди могут их усваивать: Ранняя демонстрация этого приведена в: McClelland and Rumelhart, “Distributed Memory and the Representation of General and Specific Information”.
предсказывать временную динамику человеческого обучения: См., например: Kruschke, “ALCOVE: An Exemplar-Based Connectionist Model of Category Learning”.
нейросетевые модели человеческого познания: Сборник таких моделей представлен в: Ellis and Humphreys, Connectionist Psychology: A Textbook with Readings.
может быть способом, с помощью которого мозг осуществляет обратное распространение ошибки: Современные взгляды на эти вопросы см. в: Whittington and Bogacz, “Theories of Error BackPropagation in the Brain” и Lillicrap et al., “Backpropagation and the Brain”.
решение проблемы катастрофического забывания: McClelland, McNaughton, and O’Reilly, “Why There Are Complementary Learning Systems in the Hippocampus and Neocortex: Insights from the Successes and Failures of Connectionist Models of Learning and Memory”.
локализация звука у сов: См. Golden and Rumelhart, «Модель параллельной распределенной обработки для понимания и припоминания историй» (A Parallel Distributed Processing Model of Story Comprehension and Recall) и Rosen, Rumelhart, and Knudsen, “A Connectionist Model of the Owl’s Sound Localization System”.
его влияние на когнитивистику продолжает жить: См. «Дэвид Румельхарт умер в возрасте 68 лет; создатель компьютерных симуляций восприятия» (David Rumelhart Dies at 68; Created Computer Simulations of Perception), The New York Times, March 19, 2011.
Область машинного обучения: Этот термин впервые был использован в работе: Samuel, “Some Studies in Machine Learning Using the Game of Checkers”, однако прецеденты уже существовали, как показывает пример Тьюринга.
«Вместо того чтобы пытаться создать программу»: Turing, “Computing Machinery and Intelligence”, с. 456.
сверточная нейронная сеть: Подробное введение см. в: LeCun and Bengio, “Convolutional Networks for Images, Speech, and Time Series”.
Дэвид Хьюбел и Торстен Визель показали: Hubel and Wiesel, “Receptive Fields of Single Neurones in the Cat’s Striate Cortex”. Эта работа обобщена в книге: Hubel and Wiesel, Brain and Visual Perception: The Story of a 25-Year Collaboration, и оказала непосредственное влияние на разработку неокогнитрона — предшественника сверточных нейронных сетей; см. также Fukushima, “Visual Feature Extraction by a Multilayered Network of Analog Threshold Elements”.
«шаблоны», воспроизводимые на всем изображении: Розенблатт, Принципы нейродинамики: «Перцептроны» и теория механизмов мозга.
распознавание почтовых индексов на письмах и цифр на банковских чеках: См.: LeCun et al., «Применение метода обратного распространения ошибки к распознаванию рукописных почтовых индексов» (“Backpropagation Applied to Handwritten Zip Code Recognition”), а также LeCun et al., “Learning Algorithms for Classification: A Comparison on Handwritten Digit Recognition”.
построение сети слой за слоем: Hinton and Salakhutdinov, “Reducing the Dimensionality of Data with Neural Networks”.
WordNet — это масштабная семантическая сеть: Джордж Миллер и др., “Introduction to WordNet: An On-line Lexical Database”.
Ли приехала в Соединенные Штаты: История Ли прекрасно описана в ее книге: Li, The Worlds I See: Curiosity, Exploration, and Discovery at the Dawn of AI.
четырнадцать миллионов изображений и двадцать одна тысяча категорий: Оригинальный набор данных описан в работе: Deng et al., “ImageNet: A Large-Scale Hierarchical Image Database”, а конкурс ImageNet (в котором победила сеть AlexNet) описан в: Russakovsky et al., “ImageNet Large Scale Visual Recognition Challenge”. Изначально этот набор данных содержал немногим более трех миллионов изображений и пяти тысяч категорий, но с тех пор расширился (см. http://www.image-net.org).
без создания специализированных машин: Конечно, существовали и исключения — на конференции NeurIPS было немало исследователей, занимавшихся разработкой нейроморфных вычислительных чипов, которые проектировались для имитации определенных аспектов работы мозга.
Рик Сэлиски, бывший студент Хинтона: Этот рассказ о переходе на графические процессоры (GPU) основан на личном сообщении Джеффри Хинтона от 25 января 2025 года.
Крижевский обучил сверточную нейронную сеть: Krizhevsky, Sutskever, and Hinton, “ImageNet Classification with Deep Convolutional Neural Networks”.
события развивались стремительно: Эта история подробно описана в книге: Metz, Genius Makers: The Mavericks Who Brought AI to Google, Facebook, and the World.
моделировать человеческие суждения о сходстве: См.: Peterson, Abbott, and Griffiths, “Evaluating (and Improving) the Correspondence Between Deep Neural Networks and Human Representations”.
многие последующие исследования человеческого обучения: Различные подходы к этому вопросу см. в: Battleday, Peterson, and Griffiths, “Capturing Human Categorization of Natural Images by Combining Deep Networks and Cognitive Models” и Sanders and Nosofsky, “Training Deep Networks to Construct a Psychological Feature Space for a Natural-Object Category Domain”.
ГЛАВА 10: ЯЗЫК КАК ЗАДАЧА ПРОГНОЗИРОВАНИЯ
«Мы предполагаем, что закономерное поведение»: Rumelhart and McClelland, “On Learning the Past Tenses of English Verbs”, p. 217.
Берко была дочерью иммигрантов из Трансильвании: Интервью в рамках проекта устной истории Общества исследований детского развития (SRCD) с Джин Берко Глисон, 2 июня 1998 года.
«Люди говорили, что не могут его понять»: “All You Need Is Wug”, Harvard Graduate School of Arts and Sciences, 22 февраля 2021 года, https://gsas.harvard.edu/news/all-you-need-wug.
«Он только и говорил что о языке»: “All You Need Is Wug”.
«Их просто этому учат?»: “All You Need Is Wug”.
«просто выхватил у меня статью»: Интервью в рамках проекта устной истории SRCD. Статья: Berko, “The Child’s Learning of English Morphology”.
«Моя учительница подержила маленьких крольчат»: Приписывается Джин Берко Глисон в: Cazden, Child Language and Education.
Сьюзан Эрвин была преподавателем: “Susan Ervin-Tripp: A Life of Research in Psycholinguistics and Work for the Equity of Women”, Class of 1931 Annual Oral History Interview at University History, University of California, Berkeley, 2017.
Работая с лингвистом Уиком Миллером: Wick Miller and Ervin, “The Development of Grammar in Child Language”.
Ребенок начинал с: Ervin-Tripp, “Imitation and Structural Change in Children’s Language”.
С точки зрения Хомского: См.: Chomsky and Halle, The Sound Pattern of English, что подробно объяснено в: Pinker, Words and Rules: The Ingredients of Language.
Неправильные глаголы — это не просто аномалии: Bybee and Slobin, “Rules and Schemas in the Development and Use of the English Past Tense”.
«Поведение модели было закономерным»: Rumelhart and McClelland, “On Learning the Past Tenses of English Verbs”, p. 218.
«которые ребенок усваивает первыми»: Rumelhart and McClelland, “On Learning the Past Tenses of English Verbs”, p. 241.
«Мы, как нам кажется»: Rumelhart and McClelland, “On Learning the Past Tenses of English Verbs”, p. 267.
Пинкер вырос в Монреале: Биографические сведения взяты из: Pinker, Words and Rules: The Ingredients of Language, а также из интервью со Стивеном Пинкером от 12 февраля 2025 года. Упомянутым философом был Гарри Брэкен, который номинировал Хомского на Нобелевскую премию мира в 1969 году: https://www.nobelprize.org/nomination/archive/show_people.php?id=14891.
«было не совсем справедливо по отношению к Макклелланду»: Pinker, “Whatever Happened to the Past Tense Debate?”, p. 221.
«Я выступал в течение 20 минут»: Интервью с Джеем Макклелландом, 17 мая 2018 года.
список их претензий: Pinker and Prince, «О языке и коннекционизме: анализ модели параллельной распределенной обработки для усвоения языка» (“On Language and Connectionism: Analysis of a Parallel Distributed Processing Model of Language Acquisition”), с. 81.
многие высокочастотные глаголы являются неправильными: Подробный анализ этой связи в английском языке см. в: Michel et al., “Quantitative Analysis of Culture Using Millions of Digitized Books”.
на протяжении следующих двадцати лет: См.: Pinker and Ullman, “The Past and Future of the Past Tense Debate” и McClelland and Patterson, “Rules or Connections in Past-tense Inflections: What Does the Evidence Rule Out?”.
Элман исследовал технологии совершенно иного рода: Эта история, другие биографические сведения и приведенные здесь цитаты Элмана взяты из интервью с Джеффом Элманом от 16 августа 2016 года. В том интервью Элман признался, что именно он скрывался под псевдонимом Джейк Лок в книге: Lapsley, Exploding the Phone: The Untold Story of the Teenagers and Outlaws Who Hacked Ma Bell.
«Разыскиваются: Гарвард, МТИ»: Lapsley, Exploding the Phone: The Untold Story of the Teenagers and Outlaws Who Hacked Ma Bell, p. 2.
аналогичная модель восприятия речи: McClelland and Elman, “The TRACE Model of Speech Perception”.
простая рекуррентная сеть: Elman, “Finding Structure in Time”.
Сьюзан Дюмей выросла в Льюистоне, штат Мэн: Биографические сведения и цитаты в этом разделе взяты из интервью со Сьюзан Дюмей от 11 июля 2024 года.
окружению, в котором они находятся: Эта фраза взята из работы Firth, “A Synopsis of Linguistic Theory, 1930–1955”, p. 11. Сам пассаж довольно забавен: «Повседневная практика ведения языковых игр признает обычаи и правила. Отсюда следует, что текст в таком устоявшемся употреблении может содержать предложения вроде “Не будь таким ослом!”, “Ах ты глупый осел!”, “Какой же он осел!” В этих примерах слово "осел" (ass) находится в привычном и постоянном окружении, обычно сочетаясь с "ах ты глупый...", "он глупый...", "не будь таким...". Вы узнаете слово по его окружению!»
метод решения этой проблемы: Deerwester et al., “Indexing by Latent Semantic Analysis” («Индексирование с помощью латентно-семантического анализа»).
метод линейной алгебры: Этот метод из линейной алгебры известен как сингулярное разложение (SVD). Для заданной матрицы X, где строки соответствуют словам, а столбцы — документам, сингулярное разложение представляет эту матрицу в виде произведения трех матриц: X = UDVT. Первая, U, представляет каждое слово в виде d-мерного вектора, вторая, D, — это диагональная матрица, содержащая веса для каждого из этих d измерений, а третья, V, представляет каждый документ в виде d-мерного вектора. Эти матрицы можно интерпретировать как матрицы весов линейной нейронной сети, сопоставляющей слова с их частотностью в документах, как это представлено в исходной матрице X.
может предложить иное решение: Landauer and Dumais, “A Solution to Plato’s Problem: The Latent Semantic Analysis Theory of Acquisition, Induction, and Representation of Knowledge” («Решение проблемы Платона: теория усвоения, индукции и репрезентации знаний на основе латентно-семантического анализа»).
word2vec: Mikolov et al., “Distributed Representations of Words and Phrases and Their Compositionality” («Дистрибутивные репрезентации слов и фраз и их композиционность»).
«Сейчас невероятно захватывающее время»: Интервью со Сьюзан Дюмей, 11 июля 2024 года.
Отражение этих отношений в пространственном представлении: Другие примеры и обсуждение этих проблем см. в Griffiths, Steyvers, and Tenenbaum, “Topics in Semantic Representation” («Темы в семантическом представлении»).
Те же проблемы характерны и для пространственных аналогий: Peterson, Chen, and Griffiths, “Parallelograms Revisited: Exploring the Limitations of Vector Space Models for Simple Analogies” («Возвращение к параллелограммам: исследование ограничений моделей векторного пространства для простых аналогий»).
компьютерная система машинного перевода: “Russian Is Turned into English by a Fast Electronic Translator” («Быстрый электронный переводчик превращает русский язык в английский»), New York Times, 8 января 1954 года, с. 1.
Несколько исследовательских групп пришли к одной и той же идее: Sutskever, Vinyals, and Le, “Sequence to Sequence Learning with Neural Networks” («Обучение от последовательности к последовательности с помощью нейронных сетей»); см. также Cho, “Learning Phrase Representations Using RNN Encoder-Decoder for Statistical Machine Translation” («Обучение репрезентациям фраз с использованием кодировщика-декодировщика на базе рекуррентных нейросетей для статистического машинного перевода»).
«Сегодня я смотрю на Google Переводчик»: Интервью с Джеем Макклелландом, 17 мая 2018 года.
сети долгой краткосрочной памяти: Эта идея была представлена в техническом отчете 1995 года и опубликована в работе Hochreiter and Schmidhuber, “Long Short-Term Memory” («Долгая краткосрочная память»).
могли обучаться простым контекстно-свободным языкам: Rodriguez, Wiles, and Elman, “A Recurrent Neural Network That Learns to Count” («Рекуррентная нейронная сеть, которая учится считать»).
и даже некоторым контекстно-зависимым языкам: Delétang et al., “Neural Networks and the Chomsky Hierarchy” («Нейронные сети и иерархия Хомского»).
трансформеры используют совершенно иной подход: Vaswani et al., “Attention Is All You Need” («Внимание — это всё, что вам нужно»).
обучение трансформера предсказанию следующего слова в последовательности: Radford et al., Improving Language Understanding by Generative Pretraining («Улучшение понимания языка с помощью генеративного предобучения»).
еще более впечатляющая способность генерировать фрагменты текста: Radford et al., Language Models Are Unsupervised Multitask Learners («Языковые модели способны к обучению без учителя для решения множества задач»).
законы масштабирования: Kaplan et al., Scaling Laws for Neural Language Models («Законы масштабирования для нейросетевых языковых моделей»).
теперь Джин Берко Глисон: Джин Берко вышла замуж за Эндрю Глисона, математика, который (помимо прочего) работал вместе с Аланом Тьюрингом над взломом немецких шифров во время Второй мировой войны (Hodges, Alan Turing: The Enigma [«Алан Тьюринг: Энигма»], p. 306).
стратегии поиска, выявленные Ньюэллом и Саймоном: См. Yao et al., “Tree of Thoughts: Deliberate Problem Solving with Large Language Models” («Дерево мыслей: осознанное решение задач с помощью больших языковых моделей»), и Sumers et al., “Cognitive Architectures for Language Agents” («Когнитивные архитектуры для языковых агентов»).
«потребовались бы тысячи или миллионы нейронов»: Jeremy Bernstein, “A.I.: Marvin Minsky’s Vision of the Future” [«ИИ: Видение будущего Марвина Минского»], p. 70.
непрерывно говорить в течение пяти тысяч лет: Хотя стоит отметить, что эти модели по-прежнему способны извлекать впечатляющий объем языковой структуры при более реалистичных объемах обучающих данных. См. Warstadt et al., “Findings of the BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora” («Результаты BabyLM Challenge: эффективное предобучение на корпусах, соответствующих уровню развития ребенка»), и Hu et al., “Findings of the Second BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora” («Результаты второго BabyLM Challenge: эффективное предобучение на корпусах, соответствующих уровню развития ребенка»).
вуг-тест, проведенный на ChatGPT: Weissweiler et al., “Counting the Bugs in ChatGPT’s Wugs: A Multilingual Investigation into the Morphological Capabilities of a Large Language Model” («Подсчет ошибок в "вугах" ChatGPT: мультиязычное исследование морфологических возможностей большой языковой модели»).
«Обработка на основе правил способна справиться»: Интервью со Стивеном Пинкером, 12 февраля 2025 года.