К книге
Главное про AIГлоссарий
100%
Глоссарий
21

Ключевые термины, упомянутые в книге. Русскоязычные термины идут первым блоком, англоязычные — вторым, в обоих случаях по алфавиту. После термина — короткое определение, после определения — ссылка на главу, где термин раскрывается подробно.

ГЛОССАРИЙ: РУССКОЯЗЫЧНЫЕ ТЕРМИНЫ

Авторегрессия (autoregressive) — способ генерации, при котором модель выдаёт токен за токеном слева направо, и каждый следующий токен зависит от всех предыдущих; основной режим работы современных текстовых LLM. См. главу 1.

Бенчмарк — стандартизированный набор задач для оценки возможностей модели (MMLU, HumanEval, GSM8K и др.). См. главу 4.

Галлюцинация — уверенно выданный моделью вымышленный факт, который выглядит правдоподобно, но не подтверждается источниками. См. главы 1, 2, 12.

Гибридная (мультимодальная) модель — модель, которая в одном окне принимает и выдаёт текст, картинки, аудио и видео; архитектурно это «склейка» авторегрессии для текста и диффузии для изображений. См. главу 1.

Глоссарий — вы сейчас его читаете; алфавитный список ключевых терминов книги с короткими определениями и отсылками к главам. См. структуру главы в любой из глав 1–17.

Диффузионная модель (diffusion) — семейство моделей, которые не «пишут» текст или картинку, а учатся убирать шум из хаоса за N проходов; основа почти всех современных генераторов изображений. См. главу 1.

Квантование — сжатие весов модели для уменьшения занимаемой памяти и ускорения работы; уровни Q4, Q8 обозначают степень сжатия. См. главу 5.

Контекстное окно — максимальный объём текста, который модель может обработать за один запрос; измеряется в токенах. См. главу 1.

Корпоративная лицензия — договор с поставщиком AI на использование модели сотрудниками компании; обычно включает соглашение об обработке данных и юридические гарантии. См. главу 16.

критерий трёх R — Repetition × Risk × Reversibility — фильтр для решения, какие задачи отдавать AI; все три «да» — отдавайте AI, хотя бы одно «нет» — человек нужен в контуре. См. главу 3.

Мультиагентная система — архитектура, в которой несколько AI-агентов взаимодействуют для решения задачи. См. главу 7.

Параметры модели (B, миллиарды) — числовой размер модели: 7B ≈ семь миллиардов обучаемых весов (карманный помощник), 70B (серьёзный собеседник), 405B (старший эксперт); цифра отвечает на вопрос «сколько железа нужно», а не «насколько умна модель». См. главу 1.

Песочница (sandbox) — изолированная среда исполнения кода, в которой модель может запускать скрипты, но не имеет выхода в файловую систему, интернет или чужие процессы; в книге упоминается в контексте Code Interpreter и подобных инструментов. См. главу 2.

Потерянная середина (lost in the middle) — эмпирически обнаруженный эффект, при котором модель лучше помнит начало и конец длинного контекста и хуже — середину; практический вывод — важное ставить в начало и в конец. См. главу 1.

Предвзятость (bias) — систематическое искажение в ответах модели, унаследованное из обучающих данных. См. главу 2.

Промпт — текст запроса к модели; качество промпта определяет качество ответа. См. главу 6.

Промпт-инжиниринг — практика составления и итеративного улучшения промптов. См. главу 6.

Разреженное внимание (sparse attention) — вариант механизма внимания, при котором модель смотрит не на все токены контекста, а на отобранное подмножество; снижает квадратичную сложность self-attention и позволяет работать с миллионными окнами. См. главу 1.

Резюме — финальный раздел каждой главы, содержащий сжатые рабочие моменты и суть главы. См. структуру главы в любой из глав 1–17.

Российские модели — большие языковые модели, разработанные в России (GigaChat, YandexGPT и др.). См. главу 4.

Системный промпт — постоянная инструкция для модели, определяющая её роль, формат вывода и ограничения; задаётся один раз и действует на все последующие запросы. См. главу 6.

Скрытое состояние (hidden state) — числовой вектор, который рекуррентная сеть обновляет на каждом шаге, пытаясь удержать в нём смысл уже прочитанной части последовательности; ключевое понятие RNN и LSTM. См. главу 1.

Стохастический попугай (stochastic parrot) — метафора, введённая Тимнит Гебру, Эмили Бендер и соавторами в 2020 году для описания модели, которая воспроизводит услышанное, не понимая смысла; в книге используется как контраргумент к тезису «статистика порождает понимание». См. главу 1.

Токен — минимальная единица текста, обрабатываемая моделью; для русского текста один токен обычно соответствует части слова или одному короткому слову. См. главу 1.

Токенизация — процесс разбиения текста на токены перед подачей в модель. См. главу 1.

Трансформер (transformer) — архитектура нейросети, придуманная в 2017 году (статья «Attention Is All You Need»); основа всех современных LLM. Ключевое свойство — параллелизуемость на видеокартах благодаря self-attention. См. главу 1.

Цепочка рассуждений (CoT, chain-of-thought) — техника, при которой модель явно показывает промежуточные шаги рассуждения. См. главу 2.

Эмерджентность (emergence) — кажущиеся резкие скачки в способностях модели при увеличении размера; Стэнфордская работа Schaeffer, Miranda и Koyejo показала, что «скачки» могут быть артефактом способа измерения и при смене метрики зависимость становится гладкой («мираж эмерджентности»). См. главу 1.

ГЛОССАРИЙ: АНГЛОЯЗЫЧНЫЕ ТЕРМИНЫ И АББРЕВИАТУРЫ

AGI (Artificial General Intelligence) — гипотетический уровень AI, способный решать любые интеллектуальные задачи на уровне человека или выше; в 2026 году не достигнут. См. главу 15.

ATLAS — Adversarial Threat Landscape for AI Systems; матрица угроз MITRE для AI-систем (по аналогии с MITRE ATT&CK для кибербезопасности); каталог тактик и техник атак на ML-системы. См. главу 16.

BANI — Brittle, Anxious, Non-linear, Incomprehensible; фреймворк описания мира после пандемии COVID-19 (2020), пришедший на смену VUCA; используется в обсуждениях внедрения AI в условиях неопределённости. См. главы 14, 15. CFG — Classifier-Free Guidance; метод в диффузионных моделях, при котором сила следования текстовому промпту управляется отдельным параметром guidance_scale (обычно 5–15). См. главу 10.

CoT (Chain-of-Thought) — см. «Цепочка рассуждений». См. главу 2.

CPU (Central Processing Unit) — центральный процессор; в книге обсуждается в контексте запуска локальных моделей. См. главу 5.

CUDA — язык программирования и платформа для вычислений на GPU, выпущенная NVIDIA в 2007 году; на нём написан код AlexNet, разрезавший нейросеть между двумя GTX 580. См. главу 1.

EU AI Act — закон Европейского союза об искусственном интеллекте, вступивший в силу в 2024 году с поэтапным применением до 2026–2027 годов. См. главу 17.

centaur-модель — модель сотрудничества человека и AI, в которой человек ставит вопрос и принимает финальное решение, а AI делает черновой обзор и поиск; термин из шахмат 1998 года (Каспаров, Advanced Chess). См. главу 3. VUCA — Volatility, Uncertainty, Complexity, Ambiguity; фреймворк описания нестабильного мира (1990-е, военная академия США); в 2020-е годы дополнен BANI. См. главы 14, 15. few-shot prompting — техника промптинга, при которой в запрос включается 2–5 примеров «вопрос-ответ» для управления форматом и тоном ответа модели. См. главы 2, 6.

fine-tuning — дообучение модели на собственных парах «вопрос-ответ» с подкруткой её внутренних весов; самая дорогая из трёх операций адаптации (промпт, RAG, дообучение). См. главы 2, 5.

FP16 — 16-битное число с плавающей точкой; формат хранения весов модели, дающий компромисс между точностью и памятью; половинная точность относительно FP32. См. главу 5.

GGUF — формат квантованных весов модели, используемый llama.cpp и Ollama; единый формат для распространения локальных моделей с разными уровнями квантования. См. главу 5.

GPU (Graphics Processing Unit) — графический процессор; основное железо для запуска современных моделей. См. главу 5.

GSM8K (Grade School Math 8K) — бенчмарк из 8,5 тысячи математических задач школьного уровня; классический тест на цепочку рассуждений. См. главу 4.

HumanEval — бенчмарк для оценки способности модели писать код; используется OpenAI и другими лабораториями. См. главу 4.

image-in (vision-in) — способность модели распознавать картинку, приложенную к сообщению; один из двух модов мультимодальности. См. главу 1.

image-out — способность модели генерировать картинку прямо в чате без отдельного сервиса; почти всегда означает гибридную архитектуру. См. главу 1.

KV-кэш — Key-Value cache; механизм кэширования ранее вычисленных проекций self-attention для ускорения генерации; основной потребитель VRAM при длинных контекстах. См. главы 4, 5.

llama.cpp — C++ реализация инференса LLaMA-моделей; поддерживает квантование (GGUF) и запуск на CPU/GPU на пользовательском железе. См. главу 5.

LLM (Large Language Model) — большая языковая модель; класс нейросетей на архитектуре трансформер, обученных на терабайтах текста предсказывать следующий токен. Основа современных AI-чатботов. См. главу 1.

LLM01 — код уязвимости в OWASP Top 10 for LLM (Prompt Injection); атака, при которой вредоносные инструкции встраиваются в пользовательский ввод и переопределяют поведение модели. См. главу 16.

LLM04 — код уязвимости в OWASP Top 10 for LLM (Model Denial of Service); атака, при которой специально сконструированный запрос заставляет модель потреблять аномально много ресурсов. См. главу 16.

LoRA (Low-Rank Adaptation) — метод тонкой настройки модели через обучение матриц малого ранга; позволяет адаптировать большую модель с минимальными затратами памяти. См. главу 5.

MCP (Model Context Protocol) — открытый протокол подключения AI-агентов к внешним инструментам и данным; разработан Anthropic, принят индустрией в 2024–2025 годах. См. главу 7.

MITRE ATT&CK — база знаний MITRE о тактиках и техниках кибератак; в AI-контексте — модельный фреймворк для классификации атак на AI-системы (ATLAS). См. главу 16.

MMLU (Massive Multitask Language Understanding) — бенчмарк из ~16 тысяч вопросов по 57 академическим предметам; стандарт для оценки общей эрудиции модели. См. главу 4.

MoE (Mixture of Experts) — архитектура, при которой модель состоит из нескольких специализированных подмоделей и для каждого токена выбирается своя; снижает стоимость инференса без потери качества. См. главу 1.

MVP — Minimum Viable Product; минимально жизнеспособный продукт; в AI-контексте — пилотная версия AI-решения для проверки гипотезы перед полноценным внедрением. См. главу 14.

NANDA — MIT NANDA (Networked Agents Deciding AI); проект MIT по исследованию реального состояния AI-пилотов в компаниях; в отчёте 2025 года зафиксировал 95% AI-пилотов без ROI. См. главы 8, 14, 15.

NPU — Neural Processing Unit; выделенный процессор на устройстве для ускорения AI-инференса (Apple Neural Engine, Qualcomm Hexagon); снижает энергопотребление AI-задач на устройстве. См. главы 9, 15.

Ollama — инструмент для запуска открытых моделей на локальной машине; один из трёх стеков (Ollama, vLLM, llama.cpp), обсуждаемых в главе 5. См. главу 5.

on-prem (on-premises) — локальная установка модели на серверах компании; для российских моделей часто единственный способ соответствия ФЗ-152. См. главу 1.

OOM — Out Of Memory; ошибка нехватки памяти GPU при попытке загрузить или обработать слишком большую модель или батч; ключевое ограничение для локальных моделей. См. главу 5.

OWASP Top 10 for LLM — ежегодный список 10 главных уязвимостей LLM-приложений по версии OWASP; включает prompt injection, insecure output handling, training data poisoning, model denial of service и другие. См. главу 16.

pass@k — метрика качества генерации кода: доля задач, для которых хотя бы одно из k сгенерированных решений проходит тесты. См. главу 4.

prefill — приём промптинга, при котором модель получает начало ответа в своём же ответе (например, { для JSON), что заставляет её продолжить в нужном формате. См. главу 6.

prompt injection — тип атаки на LLM-системы, при которой злоумышленник через входные данные (prompt) обходит системные инструкции модели; один из ключевых рисков продакшн-систем. См. главы 6, 16.

Q4, Q8, FP16, INT8, INT4 — уровни квантования модели; меньшая цифра — большее сжатие и ниже качество. См. главу 5.

QLoRA — Quantized Low-Rank Adaptation; метод дообучения с 4-битным квантованием весов, сокращает требования к VRAM для модели 8B с 69 ГБ до 16 ГБ. См. главу 2.

RAG (Retrieval-Augmented Generation) — техника, при которой модель получает фрагменты из внешней базы знаний перед генерацией ответа; снижает галлюцинации, но не устраняет их полностью. См. главу 2.

RLHF (Reinforcement Learning from Human Feedback) — метод тонкой настройки модели на основе человеческих оценок ответов. См. главу 2.

RNN (Recurrent Neural Network) — рекуррентная нейронная сеть; архитектура-предшественник трансформера, упомянутая в главе 1 для исторической перспективы. См. главу 1.

ROI (Return on Investment) — возврат на инвестиции; ключевая метрика экономики внедрения AI. См. главу 8.

self-attention — механизм внутреннего внимания в трансформере: каждое слово «смотрит» на все остальные и решает, насколько они для него важны; дал параллелизацию на видеокартах, без которой современных LLM не существовало бы. См. главу 1.

SentencePiece — вариант BPE-токенизации, работающий без предварительной разбивки на слова; часто используется в многоязычных моделях, включая кириллические. См. главу 1.

SLAVA — бенчмарк для оценки мультимодальных моделей (текст + изображения) на русском языке; семейство моделей SLAVA от SberDevices. См. главу 4.

SLM — Small Language Model; компактная языковая модель (обычно до 10B параметров); альтернатива большим LLM для on-prem развертывания. См. главу 14.

STT — Speech-to-Text; технология распознавания речи из аудио в текст; основной API-блок для голосовых AI-агентов. См. главу 10.

Test-time compute — дополнительные вычисления, которые модель тратит уже после обучения, на этапе ответа; основа режима рассуждения (o1, Claude thinking, Qwen3-Max-Thinking). См. главу 1.

U-образная кривая внимания трансформера — эффект, при котором модель лучше помнит начало и конец длинного контекста и хуже — середину; в книге упоминается в главе 2 как причина маркера «длинный ответ — выше шанс галлюцинации в середине»; в глоссарии также есть запись «Потерянная середина (lost in the middle)» из главы 1. См. главы 1, 2.

vLLM — высокопроизводительный сервер инференса для LLM с поддержкой PagedAttention; оптимален для production-нагрузок на своих серверах. См. главу 5.

VRAM (Video Random Access Memory) — видеопамять; память графического процессора, на котором идёт обучение и инференс модели; полное дообучение модели 7B требует 100–120 ГБ VRAM и ключевое ограничение для запуска локальных моделей. См. главы 2 и 5.

WordPiece — вариант BPE-токенизации, используемый в моделях Google (BERT и др.); отличается от BPE критерием выбора пар для склейки. См. главу 1.

Предыдущая главаГлава 21 из 21К книге