В марте 2026 года маркетолог небольшой компании попросил «сделать иллюстрацию к посту в Telegram». Раньше это означало письмо дизайнеру, три дня ожидания и выбор одного из четырёх присланных вариантов. В этот раз запрос ушёл в Midjourney V8: через пять минут вернулись двенадцать вариантов, через двадцать минут один из них уже висел в канале. Стоимость картинки — семь центов, скорость выросла в двести раз, цена кадра упала с десятков долларов до одного цента. Это и есть реальная картина AI для специальных задач: снятие рутины там, где раньше приходилось ждать дизайнера.
ГЕНЕРАЦИЯ ИЗОБРАЖЕНИЙ: НОВЫЙ ВИЗУАЛЬНЫЙ КОНВЕЙЕР
Диффузионная модель учится двум процессам. В прямом (forward diffusion, прямое зашумление) к изображению шаг за шагом добавляется гауссов шум — модель видит тысячи пар «исходное → зашумлённое». В обратном (reverse diffusion, обратное зашумление) она предсказывает, какой шум убрать на каждом шаге, и из случайного шума за двадцать–пятьдесят шагов собирается структурированное изображение. Поверх этой схемы работает детерминистический планировщик DDIM: он задаёт количество шагов и порядок их выполнения.
Stable Diffusion работает не в пиксельном, а в скрытом пространстве: текст кодируется через CLIP, шум проходит через UNet со связью с текстовыми векторами, и только затем декодер превращает результат в пиксели. Именно это позволяет запускать генерацию на обычных видеокартах с восьмью–двадцатью четырьмя гигабайтами видеопамяти, а не на серверах с сотнями гигабайт.
Короткий словарь терминов главы (для тех, кто встречает их впервые):
– DDIM (Denoising Diffusion Implicit Models) — детерминированный планировщик шагов диффузии, даёт воспроизводимые результаты.
– CFG (Classifier-Free Guidance, «управление без классификатора») — параметр, задающий, насколько строго модель следует тексту промпта.
– CLIP (Contrastive Language-Image Pre-training) — модель, которая переводит текст и картинку в общий вектор, чтобы модель понимала, «о чём» картинка.
– UNet — нейросеть, которая пошагово уточняет картинку по текстовому описанию.
– LoRA (Low-Rank Adaptation, дообучение на малом наборе примеров) — способ быстро дообучить модель на своих картинках.
– WER (Word Error Rate, доля неверно распознанных слов) — основная метрика качества распознавания речи; чем ниже, тем лучше.
– HumanEval+ — тест на написание коротких функций по описанию.
Эта схема — фундамент, на котором стоят Stable Diffusion 3.5, Flux 1.1/2, GPT Image 2, Midjourney V8, Imagen 4, Ideogram 2.0 и Recraft V4.1. Все они диффузионные; разница в обучающих данных, размере модели, токенизаторе и пост-обработке.
Связку «CLIP + диффузия» популяризировала работа DALL-E 2 (OpenAI, апрель 2022): компонент «prior» переводил текст в CLIP-вектор — переводчик текста в идею картинки, — а декодер превращал вектор в пиксели. Дальше DALL-E 3 (2023) перешёл на родную диффузию, а в апреле 2026 года OpenAI выпустила ChatGPT Images 2.0 (внутреннее имя GPT Image 2) — модель с шагом рассуждения, которая лучше держит текст в изображении и сложные многоэлементные сцены. Имя DALL-E уходит, идея остаётся: два с половиной года назад «текст в картинку» был фокусом, сегодня это базовый уровень.
Промпт для картинки работает иначе, чем промпт для текста. Для большой языковой модели (LLM) мы пишем инструкцию; для диффузионной модели мы описываем то, что хотим увидеть, на языке, на котором обучалась модель. Структура рабочего промпта собирается из пяти элементов: субъект (что изображено), стиль (фотореализм, иллюстрация, инфографика или трёхмерный рендер — в сервисах ищется как 3d render), среда (где происходит действие), настроение (свет, цвет, эмоции) и технические параметры (ракурс, оптика, фокусное расстояние, освещение).
У каждой модели свой характер. У Midjourney короткий естественно-языковой промпт работает лучше длинного. У Stable Diffusion — наоборот: лучше работает длинный промпт, с токенами и весами. У GPT Image 2 задачу лучше давать в разговорной форме через чат, и тогда модель сама перепишет промпт под себя.
Негативные промпты — то, чего не должно быть на картинке («искажения, лишние пальцы, артефакты»), — до сих пор критичны для стабильности результатов в пайплайнах с открытым кодом. В коммерческих сервисах они почти бесполезны: модели фильтруют такие случаи автоматически. То же самое с параметрами масштаб управления, шаги и стартовое число (guidance scale, steps, seed) — рабочий инструмент в ComfyUI и Automatic1111 и почти бесполезная деталь в Midjourney или ChatGPT.
В тесте из шестисот изображений, проведённом командой AI Magicx в 2025 году, вскрылась разница: «качество из коробки» и «доля кадров, которые можно использовать без перегенерации» — это два разных числа. FLUX 1.1 Pro Ultra получил 9.2 из 10 за качество на продуктовой фотографии и 85 процентов стабильности. Каждый шестой кадр всё равно приходится перегенерировать. DALL-E 3 на той же задаче — 7.5 из 10 и 70 процентов стабильности, зато с лучшим текстом в изображении.
Цифры меняют решение на практике. Если нужна иллюстрация к посту в Telegram на этой неделе, стабильность 70 процентов терпима: сделал десять картинок, выбрал семь. Для задачи «фото на главную страницу сайта» та же стабильность — провал: каждый третий кадр уйдёт в брак. Демонстрация на одной удачной картинке не показывает ни процента брака, ни стоимости, ни количества итераций.
Продакшн — это когда вы платите за тысячу картинок, а не за одну.
В 2026 году диффузионные модели стали заметно лучше в трёх вещах, по которым их раньше сразу опознавали как работу AI. И появилась четвёртая ловушка — из правового поля.
Руки с пятью пальцами и правильным числом фаланг — норма для FLUX 1.1 Pro и Midjourney V8. Для Stable Diffusion 3.5 Large на сложных позах это всё ещё проблема. Текст в изображении по-прежнему остаётся ахиллесовой пятой, и здесь лидер — GPT Image 2: он рисует читаемые логотипы и подписи там, где Midjourney и Flux дают кашу. Галлюцинации объектов никуда не делись: модель всё ещё может «придумать» несуществующий бренд, лишний объект на фоне или абсурдную этикетку. Четвёртая ловушка — правовая: модель способна сгенерировать изображение, слишком близкое к защищённому произведению. Именно это и произошло в деле Getty Images против Stability AI — об этом ниже, в разделе про правовую границу для AI-картинок.
На этом держится первый миф этой главы: «AI-картинки заменят дизайнерскую работу для соцсетей». Частично это правда: стоковую графику и простые иллюстрации к постам AI действительно закрывает. Но он не заменит работу под фирменный стиль с точными требованиями к палитре, сложную композицию и любые задачи, где важна узнаваемость бренда. Дизайнер, который использует AI, делает в три-пять раз больше за то же время. Дизайнер, который не использует AI, проигрывает тому, кто использует, в скорости и в объёме выпускаемого материала. Если вы запускаете AI для дизайна без человека-редактора, результат получается «красиво, но не то».
МОДЕЛИ ДЛЯ ИЛЛЮСТРАЦИЙ: БАЛАНС КАЧЕСТВА, СКОРОСТИ И ЦЕНЫ
Между «нарисовать красивую картинку для демо» и «рабочая картинка в продакшне» — пропасть, через которую модель проходит или не проходит. В этом разделе две таблицы: первая сравнивает модели по качеству и цене, вторая связывает выбор с типом задачи.

Цена за кадр — полезная, но недостаточная метрика: $0.07 за картинку, которую нельзя использовать, дороже, чем $0.20 за ту, которая подойдёт. В тесте AI Magicx «цену попытки» (цена за генерацию) делили на consistency (долю кадров, пригодных без перегенерации) и получали «цену готового кадра» — то самое число, по которому модели и нужно сравнивать в продакшне. У Schnell цена готового кадра составляет $0.021, у Pro Ultra — $0.075, у Midjourney v6.1 — около $0.091. Разница в 4.4 раза между «дешёвой» и «дорогой» моделью — это разница в стоимости, но не в семантике. Семантика живёт в следующей строке: за какую задачу.
Иллюстрация к посту в Telegram и обложка презентации для совета директоров — разные продукты с разной ценой ошибки. Таблица «задача — выбор» собирает это в одной сетке.

Юридическая граница для AI-картинок в 2026 году — три разные правовые позиции, и они не совпадают. США: US Copyright Office в январе 2025 года выпустил вторую часть доклада по AI и авторскому праву. Вывод: чистый вывод генеративной модели не охраняется авторским правом. Охрана возможна только там, где человек определил «достаточные выразительные элементы» — композицию, отбор, расположение. Великобритания: Высокий суд Лондона 4 ноября 2025 года отклонил основной иск Getty Images к Stability AI о нарушении авторских прав, но признал ограниченное нарушение товарных знаков — водяные знаки Getty иногда появлялись в выходных изображениях Stable Diffusion. Китай: Beijing Internet Court 27 ноября 2023 года в деле Li v. Liu признал AI-изображение, созданное человеком через Stable Diffusion, охраняемым объектом авторского права, если человек докажет творческий вклад — выбор ракурса, освещения, настроек. В России Гражданский кодекс (статья 1229, 1259) защищает произведения, «созданные творческим трудом автора», и устойчивой судебной практики по AI-картинкам пока нет. Практический вывод, если вы публикуете в блоге московской компании: держитесь американской линии «человек принимает решения, AI генерирует» и фиксируйте, что именно решал человек.
Парадокс стоков в 2026 году: цены упали, выбор вырос, лицензии упростились, а AI-генерация в ряде сценариев обходится дороже, чем покупка готового кадра. Unsplash, Pexels, Pixabay по-прежнему дают бесплатные изображения под permissive-лицензией. Shutterstock, Adobe Stock, Getty Images продают премиум-контент от $5 до $50 за кадр, с прозрачной коммерческой лицензией. AI-генерация стоит $0.01–0.12 за картинку, плюс время человека на промпт, отбор и доводку результата.
Дальше срабатывает простая арифметика. Задача «нужна одна хорошая иллюстрация к статье» — почти всегда за стоком: вы получаете лицензию сразу, без промпт-инжиниринга и без правового риска. Задача «нужна серия из пятидесяти кадров в едином стиле с возможностью быстрой перегенерации» — за генерацией: пятьдесят кадров по десять долларов в стоке — это пятьсот, плюс переписка с дизайнером про единство стиля. AI-генерация обходится в $0.05 за кадр, плюс день работы дизайнера с LoRA — и выходит дешевле.
Разовая картинка — сток. Серия в стиле — генерация. Спорный объект (лицо конкретного человека, логотип) — всегда сток или профессиональная съёмка.
КОНСИСТЕНТНОСТЬ ПЕРСОНАЖЕЙ НА СЕРИИ ИЗОБРАЖЕНИЙ
«Один и тот же персонаж на десяти картинках» — открытая задача 2026 года. Готового решения нет. Есть три техники, у каждой свои ограничения, и пять приёмов, которые работают в продакшне.
Именно на этом держится второй миф этой главы: «Консистентность персонажей решена». Она не решена. Тот, кто заходит в проект с этим ожиданием, на четвёртой-пятой картинке серии получает размытые лица и вынужден пересобирать пайплайн с нуля.
LoRA (Low-Rank Adaptation) — дообучение модели на тридцати–пятидесяти изображениях одного персонажа. Модель учит «это конкретное лицо» как отдельный токен в словаре. Качество высокое (90+ процентов совпадения), но требуется графический процессор (GPU) и два-четыре часа на обучение, и работает это только с моделями с открытыми весами (Stable Diffusion 3.5, FLUX 2). LoRA — единственная техника, которая даёт устойчивый результат на серии из двадцати и более изображений.
IP-Adapter (Image Prompt Adapter) — модель берёт референсное изображение и переносит его «суть» в новые генерации. Дообучения не нужно, но совпадение ниже (60–70 процентов), и работает это в рамках одной сессии или в пайплайне с фиксированным seed. IP-Adapter — рабочий инструмент для коротких серий из трёх–пяти изображений.
Character Reference (Midjourney V8, GPT Image 2) — встроенная функция сервиса, которая принимает референс и генерирует новое изображение «в том же персонаже». Самая простая в использовании (одна кнопка), но наименее контролируемая: модель сама решает, что именно сохранять — лицо, одежду, позу, — и результат может «плыть» на длинных сериях.
Почему задача остаётся открытой? Модели обучены на парах «текст — картинка», а не на трёхмерном представлении объекта. При смене ракурса лицо перестраивается. Одежда и аксессуары «плывут»: серёжки, родинки, шрамы — модель игнорирует детали, которые человек помнит. Стиль референса не переносится чисто: реалистичный референс плюс промпт «аниме» даёт лицо, которое сохранится плохо.
Пять приёмов работы с серией в продакшне:
1: Фиксировать стартовое число (seed) при генерации. Одно стартовое число, один промпт, разные позы — лицо сохраняется в 80 процентах случаев вместо 50 без фиксации. Приём работает только в пайплайнах с открытым кодом (ComfyUI, Automatic1111).
2: Обучать LoRA на своём наборе (см. выше раздел про техники). Лучший баланс между качеством и стоимостью для серии от двадцати кадров.
3: Использовать IP-Adapter для коротких серий. До пяти изображений IP-Adapter держит персонажа на 70 процентов, дальше деградирует.
4: Генерировать в одном сервисе с фиксированными настройками. Смена сервиса (Midjourney → FLUX) ломает лицо, даже если промпт тот же. Для серии из десяти и более картинок выбирайте один сервис и придерживайтесь его.
5: Ретушировать в Photoshop или GIMP. Когда восемь из десяти изображений «почти» одинаковые, ручная доводка двух проблемных — дешевле, чем перегенерация всей серии. Для коммерческой работы ручная ретушь — стандарт.
Что работает для стилистической серии и что — для повторяющегося героя, это разные задачи с разными инструментами. Стилистическая серия строится через ControlNet плюс промпт-anchor, повторяющийся герой — через LoRA, брендовый стиль — через Recraft V4.1.
РАСПОЗНАВАНИЕ И СИНТЕЗ РЕЧИ: ДВА ПОЛЮСА ГОЛОСОВОГО AI
РАСПОЗНАВАНИЕ РЕЧИ: ОТ ЗВУКА К ТЕКСТУ
(Все цифры WER ниже — доля неверно распознанных слов: чем меньше, тем лучше.)
Распознавание речи в 2026 году — решённая задача для русского и английского на чистой записи. Whisper Large-v3 (OpenAI, ноябрь 2023, открытая модель) показывает Word Error Rate (WER, доля неверно распознанных слов) 2.1–2.7 процента на чистом английском аудио и 7–10 процентов на чистом русском. Дообученная на русском версия (whisper-large-v3-russian) снижает WER до 6.4 процента — улучшение примерно на 35 процентов относительно базовой модели.
GigaAM-v3 (Сбер, открытый код в ноябре 2025) — фундаментальная модель на архитектуре Conformer, двести двадцать–двести сорок миллионов параметров, предобученная на больших объёмах русской речи. По заявлению Сбера, GigaAM превосходит Whisper на русском, и это не маркетинг: модель обучена на русскоязычных данных, что даёт ей преимущество в распознавании редукции гласных, русской просодии и имён собственных. Лицензия MIT, запуск — локально или через API SaluteSpeech.
Если вам нужно расшифровать встречу в московском офисе, GigaAM-v3 — лучший выбор, чем Whisper: точнее на русских именах, устойчивее к разговорной речи, и аудио не уходит за рубеж. Silero — компактная модель для устройств на краю сети (edge-устройств), четыре-семь процентов WER на русском, работает на центральном процессоре (CPU). Vosk — старая, но всё ещё рабочая альтернатива для офлайн-распознавания.
Для шумной записи (кафе, улица, конференц-зал) WER вырастает до пятнадцати–двадцати пяти процентов — об этом подробнее в блоке «Где AI в речи не работает» ниже.
СИНТЕЗ РЕЧИ: ОТ ТЕКСТА К ГОЛОСУ
Синтез речи в 2026 году — почти решённая задача для типовых сценариев. ElevenLabs v3 (июнь 2025, коммерческий сервис) даёт «живую» речь с эмоциями, паузами, интонациями, и отличить её от речи живого человека можно только в специальных тестах. Сервис поддерживает семьдесят с лишним языков, аудиотеги (теги звука: шёпот, смех, паузы, эмоции) и режим диалога. На русском языке качество ElevenLabs заметно ниже, чем на английском: произношение бывает с «иностранным» акцентом, ударения иногда сбиваются.
Для русского в 2026 году локальные решения выигрывают: Yandex SpeechKit Brand Voice — корпоративный диктор с обученным на русской речи голосом, SaluteSpeech (GigaChat TTS) с поддержкой нескольких русских голосов, и Silero TTS — открытая модель с шестью русскими голосами, которая запускается на центральном процессоре (CPU) без графического процессора. Edge TTS (Microsoft) — бесплатный вариант, качество ниже, но для внутренних задач подходит.
Русский язык в TTS и STT — отдельный рынок, с лидерами (Сбер, Яндекс, Silero), которых нет в глобальных обзорах. В работе с русской речью локальные модели стабильно выигрывают у глобальных.
СИЛЬНЫЕ СТОРОНЫ ГОЛОСОВОГО AI В 2026 ГОДУ
Транскрибация встреч и интервью: один час аудио превращается в текст за одну-две минуты обработки, качество распознавания русского — 95+ процентов для чистой речи. Озвучка обучающих видео и презентаций: десять минут аудио за пять минут, качество на уровне профессионального диктора. Озвучка IVR (интерактивного голосового меню) и автоответчиков: «живой» голос вместо робота, повышение удовлетворённости клиентов. Голосовые ассистенты в мобильных приложениях: GPT-4o realtime API позволяет говорить с AI голосом и с паузами. Локализация аудио: один актёр озвучивает на десять языков, нет необходимости в десяти переводчиках.
УЗКИЕ МЕСТА ГОЛОСОВОГО AI
Художественное озвучивание: AI не передаёт нюансы актёрской игры, для кино и аудиокниг нужен человек. Юридически значимые записи: расшифровка суда или допроса должна быть проверена человеком, ошибка в одном слове меняет смысл показаний. Шумная запись без шумоподавления: WER растёт до 25 процентов, и качество падает ниже приемлемого. Узкие диалекты и редкие языки: для языков с малым корпусом качество распознавания и синтеза ощутимо хуже, чем для русского и английского из таблиц выше — WER растёт, ударения сбиваются, имена собственные превращаются в кашу.
ГЕНЕРАЦИЯ ЗВУКА И МУЗЫКИ: НОВЫЙ ИНСТРУМЕНТ САУНД-ДИЗАЙНА
Речь и музыка — разные задачи. Речь требует интонации, пауз, эмоций; музыка требует структуры (куплет, припев, бридж), ритма, гармонии. Модели 2026 года закрывают оба класса задач на уровне «достаточно для офиса».
Suno за 2024–2025 годы прошёл три заметных релиза (по пресс-релизам Suno). Suno v4 (конец 2024) поднял планку по качеству вокала и увеличил максимальную длину композиции до четырёх минут. v4.5 (начало 2025) добавил режим «Covers» — возможность загрузить свой трек и попросить модель сделать его в другом жанре — плюс улучшил разборчивость слов в припевах. v5 (осень 2025) дал самый заметный скачок: вокалисты перестали звучать «роботизированно», сведение стало напоминать работу звукоинженера, тексты песен реже уезжают в абсурд.
В деньгах: апрельский обзор Chartlex (2026) оценивает Suno в $2.45 млрд с годовой выручкой около $300 млн и двумя миллионами платных подписчиков. Это уже не эксперимент, а индустрия. Если нужен фоновый трек на шестьдесят секунд для корпоративного видео, Suno закроет задачу за две минуты — и это самая быстрая ниша, где AI-музыка реально заменила стоковые библиотеки.
Udio — конкурент Suno по качеству, а по обзорам AI-музыки 2025–2026 годов он сильнее в длинных композициях и в жанровом разнообразии. Модель умеет «расширять» сгенерированный фрагмент до полного трека — у Suno это работает хуже.
Meta MusicGen и AudioCraft — это альтернативы с открытым исходным кодом. MusicGen обучен на двадцати тысячам часов лицензированной музыки, в основном из внутренних датасетов Meta и Shutterstock. Это принципиальное отличие от Suno и Udio, чьи тренировочные данные стали предметом судебных исков. Лицензия: код открыт под MIT, веса моделей — под собственной лицензией Meta, разрешающей коммерческое использование. MusicGen работает без вокала, идеален для фоновых треков и джинглов. AudioCraft — экосистема: MusicGen плюс AudioGen (звуковые эффекты по описанию, например «дождь по жестяной крыше») плюс EnCodec (кодек для сжатия звука нейросетью). Качество ниже Suno и Udio, но достаточно для подкастов, видеороликов, фоновой музыки на сайте.
Stable Audio (Stability AI) — коммерческая лицензия, генерация до девяноста секунд за раз. Хорош для длинных фоновых треков и саундскейпов.
Юридическая сторона AI-музыки в 2026 году — серая зона с одним большим исключением. В июне 2024 года RIAA (Американская ассоциация звукозаписывающих компаний) от имени Sony Music, Universal Music Group и Warner Music Group подала иски против Suno и Udio за обучение на защищённых копирайтом фонограммах без лицензий — от Мэрайи Кэри (Mariah Carey) до Чака Берри (Chuck Berry). По данным Business Insider (июнь 2024), в иске запрашивалось до $150 000 за каждую из предположительно нарушенных композиций, что давало потенциальную сумму ущерба до $1.65 млрд по каждому ответчику.
В октябре 2025 года Universal Music Group объявила об урегулировании спора с Udio, 25 ноября 2025 года Warner Music Group урегулировала спор с Suno. На ноябрь 2025 года единственным мейджором, оставшимся в суде, оставалась Sony. Forbes (декабрь 2025) формулирует это так: «Запусти, обучи, урегулируй» — модель, при которой стартап сначала обучает на чужом контенте, выходит на рынок, а потом договаривается с правообладателями задним числом.
Практический вывод: для внутреннего использования (корпоративное видео, подкаст) AI-музыка сегодня безопасна. Для коммерческого релиза (песня на Spotify, реклама на ТВ) нужен юридический обзор и резервный план. Юридическая чистота конкретного трека зависит от текущей лицензии конкретного сервиса, а не от того, что «AI-генерация легальна по определению».
Пять сценариев AI-звука с конкретным эффектом:
1: Фоновая музыка для подкаста — MusicGen или Suno (инструментал). Тридцать минут аудио за пять минут генерации, от $0 до $10.
2: Джингл для бренда (5–10 секунд) — Suno или Stable Audio. Бренд-айдентика в звуке, десять вариантов за час.
3: Песня для промо-ролика — Suno v4/v5 или Udio. Двухминутный трек с вокалом, $0.50–2.
4: Звуковые эффекты (дождь, шаги, фон офиса) — AudioGen. Реалистичные эффекты по текстовому описанию.
5: Саундскейп для медитации или ASMR — Stable Audio. Длинные атмосферные треки, коммерческая лицензия.
ГЕНЕРАЦИЯ ВИДЕО
Генерация видео в 2026 году — самая быстрорастущая часть специальных моделей и самая дорогая. Ключевые игроки: Sora 2 (OpenAI, выпуск 30 сентября 2025; синхронизированный звук и физически корректное движение), Veo 3.1 (Google, лето 2025), Runway Gen-3 Alpha и Gen-4 (Runway, 2024–2025), Kling 2.0/2.1 (Kuaishou, 2025), Pika 2.0 (Pika, 2025), Luma Dream Machine (Luma Labs, 2025). Gen-3 Alpha (лето 2024) дал резкий скачок в качестве движения и физики, Gen-4 (весна 2025) сделал первую попытку длинного нарратива с контролируемой стилистикой. По оценкам обзоров (Genesys Growth, февраль 2026), Runway остаётся лидером по контролю: камера, движение, стиль, монтаж. Для задачи «сделать десять вариантов рекламного ролика для A/B-теста» Runway — рабочий инструмент: можно задать раскадровку, указать движение камеры, получить предсказуемый результат.
26 апреля 2026 года OpenAI закрыла потребительское приложение Sora, при этом сама модель Sora 2 осталась доступна через интерфейс программирования приложений (API) для разработчиков и бизнеса. Для нас это значит, что Sora жив — просто теперь через командную строку и API, а не через отдельное приложение. Видеогенерация у OpenAI перешла из категории «отдельного продукта» в категорию «функции в экосистеме ChatGPT и API». Стоимость одной минуты сгенерированного видео — $1–10 в зависимости от разрешения, длины и модели. Качество: пятисекундные клипы выглядят почти как реальные съёмки, тридцатисекундные пока с артефактами.
СИЛЬНЫЕ СТОРОНЫ ВИДЕО-AI В 2026 ГОДУ
Короткие клипы для соцсетей: пятисекундный ролик для TikTok, Reels, Shorts — основное применение. Промо-ролики для лендингов: десятисекундный зацикленный ролик с продуктом. Визуализация идей: показать клиенту «как будет выглядеть» до того, как тратить деньги на рабочую съёмку. Образовательные видео: объяснение сложной концепции через визуальную метафору. Анимация статичных изображений: «оживить» фотографию, превратить картинку в пятисекундный клип.
УЗКИЕ МЕСТА ВИДЕО-ГЕНЕРАЦИИ
Полноценные рекламные ролики тридцать и более секунд: артефакты на стыках, непоследовательность персонажей, странные движения. Длинные видео (одна+ минута): модели пока не умеют держать связный сюжет больше двадцати–тридцати секунд. Сложные сцены с несколькими персонажами: лица и взаимодействия часто «плывут». Видео с точной текстовой информацией: AI делает ошибки в надписях. Юридически значимые видео: реклама лекарств, финансовых продуктов — требует проверки человеком и контроля соответствия закону.
Именно отсюда растёт третий миф этой главы: «AI-видео уже готово для продакшна». В 2026 году это не так. Видеогенерация готова для прототипов, не для финального материала. Миф подпитывается маркетингом Sora и Runway, но на любом проекте длиннее тридцати секунд их онлайн-демо рассыпается. AI-видео — это прототип, а не готовая сцена. Тащите его в продакшн без пересъёмки — заплатите дважды.
Шесть моделей генерации видео рядом:

Пять сценариев AI-видео с конкретным эффектом:
1: Короткие клипы для соцсетей — Kling 2.1 или Pika 2.0. Пятисекундный ролик за две минуты, около $0.10.
2: Промо-ролик для лендинга — Sora 2 (через API) или Veo 3.1. Десятисекундный зацикленный ролик за десять минут, $1–2.
3: Визуализация концепции для клиента — Runway Gen-4 с референсом. «Как будет выглядеть» до продакшна, экономия нескольких тысяч долларов на тестовой съёмке.
4: Анимация статичной иллюстрации — Kling 2.1 в режиме image-to-video. Пятисекундная «живая» картинка для поста, около $0.05.
5: Образовательное видео с визуальной метафорой — Sora 2 через API. Пятнадцатисекундное объяснение концепции без съёмочной группы.
Временная согласованность кадров остаётся технической проблемой видеогенерации номер один: между пятым и шестым кадром десятисекундного клипа у модели может «поехать» цвет одежды, направление взгляда, положение рук. Это видно не на демо-роликах, а на собственных проектах. Именно поэтому для офисных задач видео пока остаётся нишевой историей, а не массовым инструментом.
Промптинг для видео строится по тем же принципам, что и для картинок, но требует указания на движение в кадре — камера, объект («камера медленно наезжает», «объект вращается против часовой стрелки») — и тайминга («первая секунда — общий план, вторая — крупный план лица»). Без этого модель выдаёт статичную сцену с лёгким параллаксом, а не видео.
ГЕНЕРАЦИЯ КОДА: AI КАК СОАВТОР РАЗРАБОТЧИКА
Генерация кода в 2026 году — самое зрелое из специальных применений и самое спорное. По данным Stack Overflow Developer Survey 2025, 84 процента разработчиков используют AI-инструменты, но 46 процентов не доверяют точности их вывода. Это расхождение и есть суть рынка: AI вошёл в повседневную работу программиста, но доверие к нему ниже, чем частота использования — и это объясняет, почему раздел заканчивается правилами ревью для AI-кода, а не заверениями «модель всё сделает сама».
Рабочий набор профессионального разработчика к 2026 году: GitHub Copilot, Cursor, Claude Code, Cody, Continue.dev, Windsurf (коммерческие) и Cline, Tabby (с открытым кодом). По оценкам Digital Applied (декабрь 2025), более 92 процентов разработчиков регулярно используют AI-ассистентов; рынок, по оценкам той же компании, к 2027 году достигнет $12.3 млрд. Качество результата сильно зависит от типа задачи. Для типовых задач (CRUD, тесты, документация, рефакторинг) AI выдаёт код, который проходит code review в 70–85 процентах случаев. Для сложных задач (архитектура, отладка распределённых систем, оптимизация производительности) процент принятого кода падает до тридцати–пятидесяти.
Прогресс по SWE-bench Verified (бенчмарку реальных задач из GitHub) впечатляет: 4.4 процента решаемых задач в 2023 году, 71.7 процента в 2024-м, по Stanford AI Index 2025. Шестнадцатикратный рост за полтора года — один из самых быстрых скачков в истории AI-бенчмарков. Но, как отмечает тот же Stanford AI Index, на SWE-bench Pro (более сложные многошаговые задачи) те же модели работают заметно хуже. 71.7 процента — это «AI решает чётко поставленные задачи при наличии нужных инструментов», а не «AI пишет код».
КОД: ЗОНА УСКОРЕНИЯ РАЗРАБОТКИ
Генерация шаблонного кода: CRUD-операции, тесты, документация, миграции. Рефакторинг: переименование, вынос функций, замена шаблонов проектирования. Проверка кода (code review): AI проверяет код на стандартные ошибки, предлагает улучшения. Перевод между языками: Python → TypeScript, JavaScript → TypeScript. Документация: генерация docstring, README, комментариев. Отладка: анализ трассировки стека (stack trace), поиск причины ошибки. Генерация тестов: модульные тесты (unit-тесты), интеграционные тесты (integration-тесты) по спецификации. Все эти задачи — именно те, на которых процент принятого кода держится в диапазоне 70–85.
КОД: ПРОБЛЕМЫ AI
Архитектура больших систем: AI предлагает «правильный» паттерн в вакууме, но не видит контекст всей системы. Оптимизация производительности: AI умеет «сделать быстрее» в теории, но не знает реальных узких мест конкретной системы. Безопасность: AI часто предлагает уязвимый код, и проверка безопасности — отдельный шаг. Бизнес-логика: AI не знает, почему скидка 15 процентов применяется только к VIP-клиентам, и не угадает это из кода. Интеграция со сторонними сервисами: API меняются, документация отстаёт, AI выдаёт код по устаревшим примерам.
Пять правил работы с AI в коде, проверенных практикой 2025–2026 годов:
1: AI пишет черновик, человек принимает. Никогда не отправляйте AI-код в рабочую среду без вычитки. Это не дискриминация AI — это нормальная инженерная практика. По данным DORA Report 2024 (исследование DevOps-практик), в командах с сильными процессами ревью AI измеримо улучшает и скорость, и качество; в командах со слабыми процессами AI делает ситуацию хуже. Отсюда правило для всей главы: AI — усилитель того, что уже есть в команде.
2: Один файл за раз. AI лучше работает с одной задачей в одном файле, чем с задачей уровня «перепиши весь проект».
3: Конкретный контекст. AI не знает вашу кодовую базу. Дайте ему релевантные файлы, документацию, примеры.
4: Тесты как контракт. «Сделай функцию, которая проходит эти десять тестов» работает лучше, чем «сделай функцию, которая делает X».
5: Проверка безопасности. AI-код проходит через обзор безопасности (security review), как и человеческий. AI не освобождает от ответственности.
Семь инструментов: пять коммерческих и два с открытым кодом. GitHub Copilot ($10/мес Individual) — глубокая интеграция с VS Code и JetBrains, автодополнение в реальном времени, самый большой охват (по данным Augment Code, около пятнадцати миллионов разработчиков к началу 2025 года). Cursor ($20/мес Pro) — редактор с приоритетом AI, Composer для многофайловых правок, требует миграции из привычной интегрированной среды разработки (IDE). Claude Code ($20/мес Pro) — терминальный агент, длинные автономные задачи, многофайловый рефакторинг. Windsurf ($15/мес) — IDE на базе VS Code с интегрированным AI, локальные варианты с моделью SWE-1.
Cline — расширение VS Code с открытым кодом, агентный режим, поддержка разных больших языковых моделей (LLM) через API, бесплатно плюс стоимость API-ключа. Tabby — размещаемый на своих серверах ассистент с открытым кодом, автодополнение ниже, чем у Copilot, зато код не уходит в облако.
Для команд с требованиями приватности (банк, оборона, медицинские данные) Tabby и Cline с локальной большой языковой моделью вроде Qwen2.5-Coder-32B-Instruct — основные кандидаты. Qwen2.5-Coder-32B показывает 88.4 процента на HumanEval+ (выше DeepSeek-Coder V2 Lite 81.1 и Codestral 22B 81.1), лицензия Apache 2.0, запускается на одном A100/H100. Это означает, что LLM для кода с открытым исходным кодом перестали быть «слабой заменой» и стали «первым выбором для локальной установки».
Пять признаков плохого AI-кода:
– Код работает на примере, но ломается на крайних случаях (edge cases). AI часто обрабатывает «счастливый путь» (happy path) — типичные входные данные — и забывает про null, undefined, пустые массивы.
– Дублирование и копипаста (copy-paste). AI копирует блоки кода вместо того, чтобы вынести общую логику.
– Слишком абстрактный или слишком конкретный. Либо «функция, которая делает всё», либо «тридцать параметров в каждом вызове».
– Нет обработки ошибок. AI любит «идеальный» код, в котором ошибки не случаются.
– Уязвимости безопасности. SQL-инъекции, XSS (межсайтовый скриптинг), отсутствие санитизации ввода — AI часто воспроизводит уязвимости из обучающих данных.
Из этого складывается четвёртый миф этой главы: «AI-код убьёт программистов». Реальность мягче: AI-код вытесняет плохо написанный код и плохо поставленные задачи. Но это и есть то, чего от него ждали.
Если вы не программист, AI-ассистент по коду для вас — скорее прототип, чем рабочий инструмент: вы не можете оценить качество сгенерированного кода и принимаете чужие решения без проверки. Для профессионала AI — рабочий инструмент с оговорками: всё, что сгенерировано, проверяется человеком, и граница ответственности остаётся за разработчиком, а не за моделью. По данным The Register (январь 2025), разрыв между «30-секундным демо» AI-инструмента и реальным пользовательским опытом остаётся вызовом индустрии в 2025–2026 годах. Покупателям стоит тестировать продукт самостоятельно, а не верить маркетинговым роликам. Маркетинг в AI — это сценарий продавца, а не руководство покупателя.
РЕЗЮМЕ
Специальные модели в 2026 году закрывают разные задачи — картинки, речь, видео, код, музыку — и для каждой есть свой лидер, а не один универсальный инструмент. Выбор определяется не «эффектностью» по рейтингу, а задачей, бюджетом и ценой ошибки.
Четыре вопроса отсеивают задачи до выбора инструмента. Какой тип задачи: под него есть конкретный лидер, универсального инструмента нет. Где будет использоваться результат: внутри команды, для клиента или в рабочей среде — разная цена ошибки и разный контроль качества. Сколько единиц в месяц: один-два десятка — подписка, сотня — API, тысяча — своя инфраструктура. Какая цена ошибки: внутренний чат, пост в соцсетях или обложка продукта — разный уровень проверки человеком.
Задача, прошедшая все четыре вопроса, — кандидат на AI. Задача, провалившая хотя бы один, требует сначала разобраться с причиной отказа, и только потом выбирать инструмент.
Юридическая сторона — сдерживающий фактор коммерческого использования номер один, а не техническое качество. Это касается AI-картинок, AI-музыки и AI-видео: права на образ, авторские права, товарные знаки проверяются раньше, чем технические метрики.
Четыре мифа, которые развенчиваются прямо в своих разделах: замена дизайнеров, консистентность персонажей, AI-видео в продакшне, AI-код. Реальность мягче, чем миф: AI вытесняет плохо поставленные задачи и плохо написанный код, и это именно то, чего от него ждали.
До сих пор мы разбирали AI как индивидуальный инструмент: как один человек решает одну задачу — картинку, трек, видео или код. В этой главе специальные модели разложены по полкам, и каждая закрывает свой кусок работы. Но в реальной компании эти куски не лежат по полкам — они складываются в командный процесс, и здесь начинается другая история. Следующая глава разберёт, как распределять задачи между людьми и AI, как провести первую командную встречу про AI и уйти с неё с правилами, а не ссорой, как не ссориться с теми, кто AI не использует, и что делать с психологической ловушкой «AI пишет лучше меня». Отдельный раздел — что AI даёт конкретной офисной роли: менеджеру, бухгалтеру, юристу, дизайнеру, HR, — и где проходит граница между усилением и заменой. Переход от «AI помогает мне одному» к «AI работает внутри команды».