Из психологии восприятия хорошо известно, что процесс формирования образа начинается с различения и далее идёт через опознание к полному и адекватному восприятию данного объекта.
Попытка дать ИИ «тело в кавычках» через симуляции, при всей своей инженерной элегантности, вскрыла более глубокий изъян в этом подходе.
Стало очевидно, что проблема не просто в отсутствии правильных данных о физическом мире и не в качестве симуляции, а в самой архитектуре разума, который мы пытаемся обучить.
Мы пытались научить исходно «лингвистический мозг» решать физические задачи. По сути, это сродни попытке объяснить геометрию существу, которое способно воспринимать мир лишь как одномерную линию.
Четыре измерения
Здесь на сцену выходит Фэй-Фэй Ли — одна из самых авторитетных и влиятельных фигур в современном ИИ. Будучи профессором Стэнфордского университета, она также является создателем проекта ImageNet[170] — это именно та платформа, на которой нейронная сеть AlexNet продемонстрировала результат, запустивший революцию глубокого обучения ИИ в 2012 году.
Так что её слово имеет вес, и когда она говорит о следующем рубеже в развитии ИИ, к ней прислушиваются. По мнению Фэй-Фэй Ли и команды, которую она объ-единила в компании World Labs, мы не решим проблему воплощённости без пространственного интеллекта (Spatial Intelligence)[171].
Пространственный интеллект — не просто ещё одна модальность, которую можно «прикрутить» к существующим моделям, а фундаментальная концепция, сравнимая, как утверждает Ли, по важности с языком.
Если большие языковые модели (LLM) достигли совершенства в обработке одномерного, линейного мира текста, то пространственный интеллект — это попытка создать разум, который изначально «думает» в трёхмерной (и четырёхмерной, с учётом времени) логике нашего мира.
Язык, если смотреть на вещи здраво, это лишь сжатая, уплощённая проекция богатой многомерной реальности. И да, LLM гениально научились реконструировать мир по этой плоской «карте» из слов.
Однако пространственный интеллект же ставит перед собой куда более амбициозную задачу: научить ИИ строить внутреннюю модель самой «территории» — понимать физику, геометрию, причинно-следственные связи, рождённые из движения в пространстве, не из описаний, а как нативную, внутреннюю структуру.
Стремительное развитие вычислительных мощностей, появление новых алгоритмов (таких как Neural Radiance Fields, или NeRF, способных реконструировать 3D-сцены из 2D-изображений[172]), а также огромные массивы данных создали условия для того, чтобы мы могли перейти от разума, читающего о мире, к разуму, который строит его внутреннюю рабочую модель.
Давайте попробуем осознать всю революционность этой идеи. Для этого нам, прежде всего, нужно сравнить «мир языка», на котором мы выучили современный ИИ, и «мир пространства», который определяет внутреннюю логику того мира, в котором мы физически существуем, который мы воспринимаем и понимаем.
Язык при всей своей сложности и красоте — это искусственно созданная, одномерная система. Слова в предложении выстраиваются в линию, одно за другим, как бусины на нитке.
И большие языковые модели научились улавливать тончайшие статистические закономерности в этой «нитке» из слов и, основываясь на них, с поразительной точностью предсказывать, какая «бусина» должна идти следующей. Но они всегда остаются заложниками этой линейной проекции.
Когда мы описываем объёмную, многомерную реальность с помощью языка, мы неизбежно совершаем акт компрессии, сжатия. Мы «уплощаем» богатый, параллельный опыт в последовательную цепочку символов, информация не только теряется, но и становится принципиально иной.
Пространство же — совсем другая история. Это физическая реальность с внутренней трёхмерной структурой, где объекты имеют объём, положение и ориентацию. Здесь действуют незыблемые законы физики.
Наш собственный мозг, получая на сетчатку глаза лишь плоские 2D-проекции, тратит колоссальные ресурсы на то, чтобы реконструировать из них внутреннюю 3D-модель мира.
Именно эта модель позволяет нам ориентироваться в пространстве, протягивать руку и безошибочно брать чашку со стола, а не просто распознавать её образ. Причём в самом этом действии реализуется и четвёртое — временно́е — измерение.
Таким образом, пространственный интеллект — это попытка построить в ИИ такую нативную 4D-модель реальности. Это фундаментально иной способ «мышления», основанный на геометрии и физике, а не на лингвистике.
Такой ИИ должен понимать не то, как слова «стул» и «стол» соотносятся в тексте, а то, как реальные стул и стол соотносятся в пространстве, как они взаимодействуют и что можно с ними сделать.
Это переход от интеллекта, который читает описания мира, к интеллекту, который воспринимает его структуру.
Разум без точки отсчёта
И всё же при всей своей революционности этот подход содержит в себе принципиальный изъян. Ведь даже если с помощью невероятных вычислительных инструментов пространственного интеллекта мы сможем построить самую совершенную модель мира, у неё не будет точки опоры.
Пространственный интеллект повиснет в пустоте, потому что он не заземлён в первичном, неопровержимом опыте физического контакта. И чтобы понять это, мы должны вернуться к вопросу, который задал себе ещё в детстве выдающийся отечественный психолог Лев Маркович Веккер.
Глядя из окна ленинградской квартиры на прохожих, маленький Лёва был поражён странным фактом: если образ прохожих возникает у него в глазу и в мозге, — рассуждал он, — то почему он видит их там, на улице, а не внутри своей головы?
В самом деле, люди, которых он видел, согласно физическому закону, должны были остаться там, куда поступает соответствующий сигнал, — в зрительной коре. Почему же они проецируются вовне — именно в то самое место, где он сейчас видит прохожих?
Так впервые была осознана фундаментальная проблема «предметности» — поразительное свойство нашей психики «выносить» воспринимаемый ею образ во внешний мир, прикрепляя его как бы к самому наблюдаемому объекту.
Когда мы видим чашку на столе, мы видим её именно так — на столе, а не в возбуждении фоторецепторов сетчатки глаза и не в затылочной коре. Как это возможно? Где тот механизм, который превращает внутреннее состояние нашего мозга во внешний, объективный мир?
Сейчас мы проследим за веккеровской мыслью, чтобы обнаружить ту самую точку опоры (или, точнее, точку сопротивления), на которой держится вся грандиозная конструкция нашего разума, физичность нашего — человеческого — понимания.
Ключ к разгадке — в методологическом ходе, который предпринял Л. М. Веккер, разделив все свойства наблюдаемой нами реальности (нашего умвельта) на два принципиально разных типа[173].
Первый тип — это «переносимые» (трансферные) свойства: форма, размер, цвет, расположение в пространстве. Информацию об этих свойствах можно «снять» с объекта — сфотографировать, записать на видео, отсканировать в 3D и т. п. — и передать другому лицу. Фотография «снимает» форму и цвет объекта, звукозапись переносит акустические характеристики, видео — систему движений.
Искусственный интеллект живёт исключительно в мире таких «переносимых» данных. Его реальность — это гигантский поток цифровой информации (пикселей, вокселей, координат), которую можно скопировать, обработать, сохранить и передать.
Однако что-то с нашим восприятием не так или не со-всем так… Допустим, мы зафиксировали копию объекта на фотоплёнке, там она теперь и будет находиться, а то, что мы видим нашим мозгом, — это уже проекция, образ, вынесенный вовне. За счёт какого механизма?
И здесь Веккер объясняет нам, что есть и второй тип свойств — «непереносимые» (контактные) свойства. К ним относятся внутренние характеристики материальных тел: твёрдость, упругость, вес, текстура, вязкость.
Эти свойства вы не можете «сфотографировать» и кому-то передать, их можно ощутить лишь через непосредственное физическое взаимодействие, буквально физически столкнувшись с сопротивлением материала.
Когда наша рука касается реального объекта, возникает уникальное физическое состояние, которое Веккер назвал «двусторонним»: давление, которое мы ощущаем в ладони. Это одновременно:
• и состояние нашего тела (включаются рецепторы на коже, на связках и мышцах);
• и проявление свойства самого объекта (сопротивление физического объекта нашему воздействию).
В этот миг субъект и объект физически слиты на границе контакта. Соответственно, такой психический образ (в данном случае — ощущение твёрдости) рождается не «внутри головы», чтобы потом каким-то мистическим образом «проецироваться» наружу, а изначально возникает как бы на самом объекте, в точке этого сопротивления.
Наша психика не выдумывает объективность — она обнаруживает её в самом акте физического взаимодействия. Это и есть первая, базовая, неопровержимая объективность — тот «якорь», та точка опоры, за которую наш разум цепляется, чтобы отличить себя от мира.
Искусственный интеллект напрочь лишён способности обнаружить такое сопротивление реальности. Даже если он оснащён самыми совершенными датчиками, через них он получает лишь «переносимые» данные, а наши «непереносимые» данные он получает уже в абстрагированном, «переносном» виде: давление — столько-то Паскалей (Н/м2) или 120/80 мм рт. ст., температура — 300 К или +36,6 °C.
То есть всё это числа, символы, токены, репрезентации, а не фактическое сопротивление, возникающее между человеком и той средой, с которой мы непосредственно здесь и сейчас — в каждый момент времени — физически взаимодействуем.
Любопытно, что если лишить нас кожной и мышечно-суставной чувствительности — именно этот эффект возникает в специальных сурдокамерах с соляным раствором, — то после получаса наш мозг начнёт галлюцинировать, видеть сновидение наяву[174]. То есть буквально — утрата ощущения контакта нашего мозга с физической реальностью пускает наши внутренние образы в пляс!
Пространственный интеллект может создать самую совершенную 3D— или 4D-модель реальности, но это будет мир без сопротивления, без веса, напряжения и текстуры. Это мир без «якоря» реальности.
Помню, как на последней научной конференции, на которой Лев Маркович, прилетев из Вашингтона, присутствовал лично, кто-то задал ему вопрос: «Лев Маркович, а над чем вы планируете работать дальше?» Он улыбнулся (ему шёл тогда 82-й год) и, показывая на кончик пальца, сказал: «Надеюсь показать, как отсюда рождается мысль».
Мир в руке
Итак, мы обнаружили ту самую точку опоры, на которой держится объективность нашего мира, — непосредствен-ный физический контакт. Но как из этого простого, почти животного ощущения вырастает вся сложная вселенная человеческого мышления?
Ответ на этот вопрос — в самом процессе нашего психического развития. Наш разум не возникает внезапно, как Афина из головы Зевса. Он последовательно строится «снизу вверх», и каждый новый его «этаж» опирается на фундамент, заложенный предыдущим.
Давайте проследим за работой этого удивительного архитектора на примере развития ребёнка.
Первый этап: субстанциальность мира (новорождённость)
Мир новорождённого — это хаотичный поток ощущений. Нет чётких границ между «я» и «не-я», нет отдельных предметов. Но даже в этом первозданном хаосе есть один достоверный источник знания — осязание.
Ребёнок познаёт мир через рот (сосание) и кожу (прикосновения матери). Он ощущает «непереносимые» свойства: твёрдость соска, мягкость пелёнки, тепло тела. Это первое, самое фундаментальное знание о том, что реальность субстанциальна, она сопротивляется.
Второй этап: предметность мира (раннее младенчество)
К 3–4 месяцам в игру вступает рука: развивается зрительно-моторная координация — то есть зрительные и слуховые образы начинают активно соединяться на платформе физических ощущений и конкретных мышечных действий.
Ребёнок начинает целенаправленно тянуться к предметам, чтобы схватить их. Казалось бы, простой акт, а на деле — настоящая когнитивная революция. Веккер называет этот механизм «рефлекторным кольцом»: рука выступает одновременно и как орган действия, и как орган восприятия.
Двигаясь и ощупывая погремушку, рука генерирует непрерывный поток тактильных (гладкая, ребристая) и кинестетических (вес, форма, размер) сигналов. В результате временна́я последовательность этих ощущений синтезируется мозгом в одновременный (симультанный) пространственный образ.
Ребёнок начинает «понимать» погремушку не как набор ощущений, а как целостный, трёхмерный предмет, имеющий границы. Он опирается на свои чувства физического мира и притягивает к ним весь спектр «переносимых свойств» — цвет, визуальную форму, звук и т. д.
Искусственный интеллект, обрабатывая текст, также имеет дело с последовательностями (токен за токеном), но для него это лишь математическая последовательность. У него нет механизма, который преобразовывал бы переживаемый временной опыт телесного действия в стабильную пространственную структуру. Его «пространство» — абстрактное и векторное, оно не выросло из ощупывания мира.
Третий этап: материальность мира (6–12 месяцев)
Ребёнок активно манипулирует предметами. Он видит красный мячик, хватает его, сжимает и чувствует его упругость. Он видит синий кубик и ощущает его твёрдость. В этот момент происходит калибровка чувств: мозг строит прочные нейронные связи между зрительным образом («переносимые» свойства) и осязательным опытом («непереносимые» свойства).
В результате наше зрение становится предметным: мы смотрим на камень и буквально видим его твёрдость и тяжесть. Мы смотрим на подушку и видим её мягкость. Наше восприятие — это уже не просто регистрация фотонов, а машина предсказаний, которая на основе визуальных подсказок мгновенно прогнозирует результат возможного физического контакта.
Мультимодальный ИИ тоже может связать картинку камня с текстом «камень твёрдый». Но это статистическая корреляция, а не физическая калибровка. Его «знание» о твёрдости не основано на личном опыте сопротивления предметов, с которыми он никогда физически не сталкивался.
Четвёртый этап: стабильность мира (после 8–9 месяцев)
Становясь чуть старше, ребёнок начинает понимать, что спрятанная игрушка не исчезла. И это уже переход от непосредственного восприятия к представлению: внутри психики формируется устойчивый осязательно-зрительный образ, который хранится теперь в памяти.
Таким образом, модель мира впервые становится не только актуальной (то, что есть сейчас), но и потенциальной (то, что было и будет). И это не простая гипотеза, не просто предположение — это предугадываемое физическое ощущение.
Пятый этап: категоризация мира (1–3 года)
С развитием речи слово становится «ярлыком» для этого целостного, богатого осязательно-зрительного образа. Слово «мяч» — это не абстракция, а звуковой код для всего сенсомоторного опыта: «круглый, красный, прыгучий, можно схватить и бросить».
Речь позволяет ребёнку обобщать его опыт, а сама модель мира, которая постепенно формируется его мозгом, начинает структурироваться по смысловым категориям.
Шестой этап: абстрактная модель мира (дошкольный и школьный возраст)
Наконец, постепенно развивается и понятийное мышление. Ребёнок может оперировать отношениями, открытыми в ходе практических действий, но уже в отрыве от них. Например, он понимает, что «круглость» — общее свойство мяча и солнца.
Умственные операции «анализа» и «синтеза», как указывал Веккер, являются прямым продолжением физического разделения и соединения предметов руками. Подумайте, как мы говорим об этом: анализ — это разделение целого на части, синтез — это соединение частей в целое.
Эти «ручные» и «двигательные» метафоры пронизывают буквально всю нашу интеллектуальную деятельность: мы «схватываем мысль», «тянем время», «раскладываем по полочкам», «находим» или «нащупываем аргументы», «приходим к выводу», а ещё «тупим», «тормозим» и т. п. При этом сами наши мысли могут «зудеть», «биться», «гоняться», «складываться» и т. п.
То есть мы буквально мыслим своим «телом», выстраивая иерархии понятий и знаний. И вся эта внутренняя вселенная наших представлений вырастает из простого, но фундаментального для нас акта — эффекта прикосновения.
Благодаря сращиванию в теменной коре всех «переносимых свойств» на фундаменте «непереносимых», объективно-фактических, мы обнаруживаем себя не в мире собственных фантазий, а в предметно-материальной реальности.
Тогда как ИИ, напротив, не имея этого опыта, вынужден постоянно галлюцинировать — реальность не сопротивляется ему в нём самом, как она сопротивляется нам в нас самих.
Любое действие чревато для нас болью: мы несколько раз в своём детстве «поздоровались» головой с углом стола, и теперь, видя перед собой любой «угол», сами того не замечая, аккуратно обходим его. Мы обожглись, нас ударило током — и мы теперь знаем такие предметы, как «печь», «конфорка», «электрическая розетка», и действуем уже из самих себя так, словно бы эти объекты содержат в себе нашу боль.
Разум же искусственного интеллекта сразу родился в мире абстракций, он не проходил нашей школы телесного взаимодействия с миром. Он никогда не испытывал естественного сопротивления, а потому его знание лишено этого фундаментального, физического чувства реальности. Он знает о мире, но не соприкасается с ним.
Именно поэтому «понимание» ИИ всегда будет иным. Оно не прорастает в нём из первичного, дорефлексивного опыта столкновения с миром, как у нас с вами. Это «понимание» лишено той самой точки опоры, которая и определяет нашу уверенность в том, что мир, который мы воспринимаем, — не просто наша галлюцинация.
Разум без «якоря» реальности обречён вечно дрейфовать в океане собственных снов.