К книге
Главное про AIГлава 4. Бенчмарки и сравнение моделей
24%
Глава 4. Бенчмарки и сравнение моделей
5

Менеджер по закупкам открывает Artificial Analysis и видит строчку «Claude Opus 4.7 — 61, GPT-5.5 — 58». Звонит в ИТ-отдел: «Какую ставим? У которой цифра выше — на ту и подписываемся». Через полгода та же команда обнаруживает, что модель с «низкой» цифрой закрывает их рабочие задачи лучше, чем «лидер рейтинга». Подписка на топовую модель оказывается чистой переплатой. История знакомая — и она повторяется во многих компаниях, которые покупают AI, не проверив, как модель справляется именно с её задачами.

Из неё вытекают два следствия. Первое: бенчмарк оценивает одну способность модели — и только её. MMLU на 95% не гарантирует, что модель напишет хорошее коммерческое предложение. HumanEval на 80% не означает, что она починит ваш рабочий код. Второе: цифра в бенчмарке объективна, а вот выбор этой цифры — чей-то. Когда вендор измеряет «интеллект» через multiple choice по 57 академическим предметам, он за вас решает, что считать важным. Для офисного внедрения это не та метрика.

Бенчмарки полезны как стартовая точка для отбора. Опасны — как финальное решение. Вся глава сводится к одной фразе: бенчмарк — это рентгеновский снимок одной способности, а не медицинская карта. По одному снимку лечение не назначают.

ТИПОЛОГИЯ БЕНЧМАРКОВ ДЛЯ БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ

Massive Multitask Language Understanding, MMLU, появился в 2020 году как попытка измерить «широту знаний» модели. Внутри — 57 предметов: от элементарной математики и американской истории до права, медицины и компьютерных наук. Формат — multiple choice (закрытый вопрос с выбором из нескольких вариантов), четыре варианта ответа, как в американских SAT (Scholastic Assessment Test — стандартизированный тест для поступления в вуз) или GRE (Graduate Record Examinations — экзамен для поступающих в магистратуру и аспирантуру). В оригинальной версии — около 16 000 вопросов, собранных в основном из открытых экзаменационных материалов. На сайте Stanford CRFM (Stanford Center for Research on Foundation Models — Стэнфордский центр исследований фундаментальных моделей, 2020) про MMLU сказано прямо: «multiple-choice question answering test that covers 57 tasks including elementary mathematics, US history, computer science, law, and more» — в переводе: «тест с выбором ответа, охватывающий 57 задач, от элементарной математики и истории США до компьютерных наук, права и других».

MMLU не творческий тест. Это распознавание правильного варианта из четырёх. Чтобы получить высокий балл, модель должна в среднем хорошо угадывать правильный ответ. Ближе к тесту на эрудицию, чем к проверке способности решать рабочую задачу. MMLU стал де-факто стандартом «общего интеллекта» — и одновременно самым обманчивым тестом для не-исследователя. Высокий балл ещё не говорит, что модель справится с вашей задачей.

HumanEval, выпущенный OpenAI в 2021 году, — это 164 коротких задачи на Python. Каждая задача даёт сигнатуру функции, docstring с описанием поведения и набор скрытых юнит-тестов, а метрика pass@k означает, что модель генерирует k решений, и задача засчитывается, если хотя бы одно прошло все тесты. На странице IBM Think по HumanEval сказано, что HumanEval измеряет функциональную корректность через метрику pass@k — это проверка «код запускается и даёт правильный вывод», а не «код красиво написан» или «код поддерживается в долгую». У HumanEval есть структурная проблема, важная для офисного работника: задачи короткие, каждая умещается в одну функцию, контекст минимальный, и это тест на «синтаксическую и логическую мелочь», а не на способность модели разобраться в вашей кодовой базе из 200 000 строк.

В 2024–2025 годах отрасль сместилась к SWE-bench Verified — там задача уже настоящая: реальный GitHub-баг в реальном репозитории. Princeton выпустил SWE-bench в 2023-м: 2 294 задачи из реальных GitHub-issues в популярных Python-репозиториях (Django, Flask, pytest, scikit-learn и др.). Модель получает кодовую базу и issue, должна сгенерировать патч, который закроет issue и пройдёт существующие тесты. В 2024 году OpenAI и Princeton выпустили «Verified» — отфильтрованную человеком подвыборку из 500 задач. Из исходного набора убрали всё, что модель не может корректно оценить; на сайте SWE-bench: «Verified is a human-filtered subset of 500 instances» — в переводе: «проверенная человеком подвыборка из 500 задач».

SWE-bench Verified — золотой стандарт для оценки кодинга. Задача близка к реальной работе инженера: открыть issue, понять контекст, починить. И для офисного читателя здесь критическая деталь: SWE-bench Verified измеряет способность модели работать с существующим кодом в реальной кодовой базе. Это совсем другой навык, чем «написать функцию с нуля по docstring». Если ваша компания внедряет AI-ассистента для существующего кода, SWE-bench Verified предскажет результат лучше, чем HumanEval.

GSM8K — это 8 500 школьных математических задач, собранных OpenAI в 2021 году. Задачи требуют пошагового рассуждения (chain of thought): модель должна сначала расписать ход решения, а потом дать числовой ответ. На странице датасета на Hugging Face описание: GSM8K (Grade School Math 8K) — это 8,5 тысячи разнообразных по формулировкам школьных математических задач. К 2024–2025 годам лучшие модели набрали на GSM8K больше 95%.

Scale AI в 2024-м выпустила параллельный бенчмарк GSM1K — тысячу новых задач, написанных людьми без помощи LLM. Цель: исключить контаминацию, то есть попадание задач или их близких аналогов в обучающие данные модели.

На GSM1K модели стабильно просели на 8–13 процентных пунктов. Практический вывод неприятный. Если вы видите в маркетинге модели «99% на GSM8K», это скорее характеристика того, насколько хорошо модель «выучила» конкретный набор задач, чем её реальной способности решать похожие, но новые. Контаминация — системная болезнь всех публичных бенчмарков.

Stanford CRFM в 2022 году выпустил HELM (Holistic Evaluation of Language Models) — не один бенчмарк, а фреймворк, где вместо одной цифры считаются 7 метрик (точность, accuracy; калибровка, calibration; устойчивость, robustness; справедливость, fairness; предвзятость, bias; токсичность, toxicity; эффективность, efficiency) на 42 сценариях. Лидер проекта Перси Лян (Percy Liang) с командой из примерно 50 человек прогнали через HELM 30 заметных моделей. На сайте HELM этот проект назван живым бенчмарком для прозрачности языковых моделей — постоянно обновляемой публичной инфраструктурой.

HELM важен другим. Он показывает другую философию оценки. Вместо вопроса «какая модель первая по среднему баллу» — «у какой модели лучше баланс по всем важным для внедрения метрикам». Для офисного внедрения это ближе к реальности: вас волнует не только точность, но и насколько предсказуемо модель ошибается, насколько она устойчива к провокационным запросам и сколько это стоит.

Четыре бенчмарка, которые чаще всего встречаются в маркетинге моделей, сведены в таблицу ниже — с годом выпуска и слабостью каждого.

Слабость всех четырёх — узкая специализация. Каждый измеряет одну способность. Для офисной задачи нужно смотреть на свой набор, а не на топ рейтинга.

БЕНЧМАРКИ ПРОТИВ ОФИСНОЙ РЕАЛЬНОСТИ

Ниже — шесть типовых офисных задач и какой бенчмарк (если он вообще есть) ближе к каждой.

1: Суммаризировать длинный документ — человеческая оценка на своём наборе и косвенно RULER (бенчмарк для оценки работы с длинным контекстом), потому что суммаризация — это качество, а не задача с правильным ответом, и MMLU с GSM8K её не измеряют.

2: Ответить на письмо клиента в нужном тоне — Chatbot Arena Elo и свой оценочный набор, потому что тон — это человеческая оценка, не multiple choice, и HumanEval с MMLU на стиль не смотрят.

3: Сделать простой SQL-запрос по описанию — HumanEval как прокси и свой оценочный набор, потому что задача близка к «написать функцию», а GSM8K и MMLU не помогут.

4: Посчитать скидку по таблице — GSM8K как прокси и проверка на своих задачах, потому что пошаговая арифметика — это GSM8K, но без проверки на своих числах доверять нельзя.

5: Перевести документ с английского — свой оценочный набор с экспертом-переводчиком, потому что качество перевода — отдельный навык, и все перечисленные бенчмарки англоцентричны и text-only.

6: Разобрать входящий PDF и вытащить сущности — MMLU как прокси на понимание текста и свой оценочный набор, потому что нужна комбинация OCR (распознавания текста с картинки) и рассуждения, и ни один из четырёх не покрывает это напрямую.

Эти шесть пунктов показывают суть: для большинства офисных задач ни один публичный бенчмарк не даёт прямого ответа. Свой набор закрывает разрыв. Только он.

ДОВЕРИЕ К БЕНЧМАРКУ: УСЛОВИЯ И ОГОВОРКИ

Бенчмарк предсказывает ваш результат, если одновременно выполнены четыре условия:

1: Задачи в бенчмарке похожи на ваш случай по структуре — формат, длина контекста, тип ответа — и метрика считает то, что вам важно. Не «доля правильных ответов в тестах с выбором ответа» (MCQ, multiple choice question), а «процент задач, где результат пригоден для отправки клиенту».

2: Тестовый набор чист от контаминации.

3: Бенчмарк ещё не насыщен (разница между лидерами статистически значима, а не «91% против 92%») и регулярно обновляется. Иначе модели учат его наизусть.

4: Метрика измеряет то, что связано с вашей задачей, а не постороннюю способность.

Хотя бы одно условие не выполнено — бенчмарк показывает красивую цифру без всякого отношения к вашему офису.

Четыре признака «мёртвого» бенчмарка.

1: Топ-5 моделей выдают результаты в диапазоне 1–2 процентных пункта — разница не различима за пределами шума.

2: Бенчмарк не обновлялся 2+ года — за это время его вопросы попали в обучающие данные всех крупных моделей.

3: Метрика измеряет то, что не связано с реальной задачей (например, тест с выбором ответа по праву для ассистента, который должен переписываться с клиентом).

4: Публичные результаты расходятся с числами, которые вендор заявляет сам, на 5+ пунктов в одну или другую сторону.

Если вы видите хотя бы два признака из четырёх, бенчмарку доверять нельзя. Ориентиром становится свой оценочный набор.

Что показывает Chatbot Arena, а что — нет. Chatbot Arena (от LMSYS, Lab for Machine Learning and Systems at UC Berkeley — лаборатория Беркли) — самый цитируемый лидерборд по «человеческому рейтингу», где пользователи в слепом сравнении голосуют за ответ А или Б, а рейтинг считается через систему Эло по сумме миллионов диалогов.

Показывает Arena общую «человеческую» привлекательность ответа — тон, структуру, полноту. Не показывает точность в задачах с единственным правильным ответом (арифметика, код, юридические ссылки), устойчивость к граничным случаям (edge case, нестандартным входным данным, на которых модели часто ломаются), устойчивость к попыткам взлома через запрос (jailbreak) и стабильность на длинном контексте.

В 2025 году опубликована работа, показывающая, что рейтинг можно сместить целенаправленным голосованием. Это последний аргумент в пользу собственного оценочного набора: чужие цифры можно исказить, свои — сложнее.

Классы задач, которые не покрывает ни один популярный бенчмарк.

1: Работа с таблицами и числами из вашей корпоративной базы (нужен RAG — поиск ответов модели по вашей базе документов — и свой оценочный набор).

2: Генерация длинных связных документов на 10+ страниц (бенчмарки смотрят на короткие ответы).

3: Следование вашему внутреннему тону голоса бренда и шаблонам (бенчмарки не знают ваш стиль).

4: Соблюдение ваших нормативных ограничений — юридических, отраслевых, внутренних.

5: Многошаговые agent-сценарии, где модель должна планировать, вызывать инструменты и откатываться.

Прежде чем доверять бенчмарку, проверьте семь вещей.

1: Дата сбора датасета и дата обучения модели — пересекаются ли (если да, контаминация почти гарантирована).

2: Тип оценки: multiple choice, генерация, человеческий Эло, LLM-as-a-Judge — разные шкалы нельзя сравнивать напрямую.

3: Размер выборки: 164 задачи (HumanEval) — это статистически хрупко, 8 500 (GSM8K) — плотнее.

4: Метод подсчёта: pass@1, pass@k, accuracy, F1, Brier — не путать.

5: Self-reported против независимого замера: разница в 5+ пунктов — красный флаг.

6: Способ подачи запроса: ввод без примеров, с примерами в самом запросе, с просьбой рассуждать по шагам, с системным запросом или без — меняет результат радикально.

7: Стоимость прогона: на дорогих моделях один прогон может стоить сотни долларов.

Модель, которая отлично сдала MMLU, HumanEval и GSM8K, доказала только одно: она умеет решать задачи этого типа «в вакууме» — короткие, с чётким форматом и эталонным ответом. Это ничего не говорит о том, как она поведёт себя в реальном офисе — с грязными данными, неполным контекстом, прерванным разговором, нечёткой постановкой задачи. Если нанять по результатам единого госэкзамена, можно получить отличника, который не умеет вести переговоры. Высокий балл на бенчмарке — пропуск в следующий тур отбора. Не гарантия работы.

Насыщенный бенчмарк — линейка с делением только до 90 сантиметров. Когда 99% моделей набирают больше 90% на GSM8K, разница между «отличной» и «средней» моделью становится невидимой, как рост человека выше 190 см на линейке, где последнее деление — 90. Линейка не врёт, но она больше не различает. MMLU, HumanEval и GSM8K к 2026 году превратились в инструмент «отсева слабых моделей», а не ранжирования сильных. Для сравнения топ-моделей нужны более длинные линейки — SWE-bench Verified, GPQA Diamond, Humanity’s Last Exam.

СЛЕПЫЕ ЗОНЫ БЕНЧМАРКОВ И ЦЕННОСТЬ СОБСТВЕННЫХ МЕТРИК

Бенчмарки измеряют то, что легко автоматизировать: наличие правильного ответа, скорость работы, объём памяти. Не измеряют то, что в офисной работе критично: тон, стиль, уместность, этические границы, устойчивость к необычному запросу.

Эмили Бендер (Emily M. Bender) с соавторами в работе 2021 года «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» поставила вопрос жёстко: риски LLM смягчаются, если заранее заложить бюджет на курирование и документацию и не создавать датасеты больше, чем можно качественно поддерживать. Бенчмарки измеряют, насколько хорошо модель имитирует «правильные ответы» в выборке, на которой она обучалась. Это не то же самое, что понимание. Stochastic parrots — термин из этой работы, ставший символом критического взгляда на метрики LLM.

Четыре области, которые остаются за пределами стандартных метрик.

1: Креативность. Способность сгенерировать неожиданный, но релевантный ответ не измеряется ни одним публичным бенчмарком. Модель может набрать 95% на MMLU и выдавать пресные тексты — при обучении её оптимизировали на правдоподобие, а не на оригинальность.

2: Этика. Стремление отказаться от этически сомнительного (по мнению создателей модели) запроса — неизмеримая метрика. Универсального теста на «хорошее поведение» нет. Есть только наборы сценариев, которые вендор сам выбирает.

3: Актуальность знаний. Бенчмарк фиксирует знания на момент сбора датасета. Если модель обучена на данных до 2023 года, она не ответит на вопрос о событиях 2024-го. Ни один бенчмарк этого не зафиксирует, пока вендор не выпустит обновлённую версию.

4: Устойчивость к инъекции промптов. Способность модели не поддаться на манипуляцию в тексте запроса — отдельный класс проверок. Результаты сильно зависят от того, какие именно инъекции проверялись.

Цифра в бенчмарке — статичная. Ваша задача меняется каждый квартал, и разрыв между цифрой и реальностью растёт. Бенчмарк не отличает «модель облажалась в безвредном месте» от «модель облажалась в критичном для бизнеса месте». Оба раза это минус один процент к accuracy.

Я рекомендую компаниям собрать свой оценочный набор из 50–100 реальных задач — тех, которые они решают каждый день. Шаблонные письма, отчёты, первичный анализ контрагентов, классификация входящих запросов. На этом наборе прогоняются 3–5 отобранных моделей, и сравнивается не абстрактная «точность», а процент задач, где результат пригоден для отправки клиенту или руководителю. День-два работы одного человека экономят месяцы разочарований и десятки тысяч рублей на ненужной подписке.

Что измерять в AI-решении, чтобы понимать, работает ли оно. Три класса метрик:

1: Метрики конвейера — скорость, стоимость, процент ошибок инфраструктуры (модель не отвечает, таймаут, сбой). Это метрики работы системы как таковой, без оценки качества ответа.

2: Метрики качества ответа — точность на своём оценочном наборе, процент пригодных для отправки, экспертная оценка по 5-балльной шкале. Это метрики того, насколько результат применим в реальной работе.

3: Метрики влияния на процесс — время выполнения задачи до и после AI, NPS (индекс лояльности клиентов, Net Promoter Score), процент переделанных результатов. Это метрики того, улучшает ли AI реальный результат, а не только оценку.

Без измерений внедрение AI превращается в веру. Менеджер объявляет «мы внедряем AI», но не определяет, как он узнает, что внедрение работает. Через несколько месяцев нет данных — только ощущение, что «что-то работает». Через полгода компания платит за AI-сервис десятки тысяч долларов в месяц и не может ответить на вопрос «а что мы за это получили». Через год проект закрывают или масштабируют. Оба решения одинаково безответственны.

Кейс Klarna — учебник по провалу измерений. Разбор был в предыдущей главе, здесь зафиксируем только то, что относится к теме главы: компания оптимизировала то, что легко измерить, и не измеряла то, что важно для бизнеса. По материалу Fortune (2024), бот был «ограниченным» — не плохим, просто ограниченным метриками.

Кейс Shopify — другой урок. По материалу Slator о мемо генерального директора (CEO) Shopify Тобиаса Лютке (Tobias Lütke) от апреля 2025: «An internal memo published by Shopify CEO Tobias Lütke mandates AI use throughout the company; the app has already sped up translation 100x» — в переводе: «внутреннее мемо CEO Shopify Тобиаса Лютке предписывает использовать AI во всей компании; приложение уже ускорило перевод в 100 раз». Shopify измерила эффект: переводы ускорились в 100 раз — конкретная метрика. Мемо «сначала докажи, что AI не может» — управленческое решение, основанное на данных, а не декларация. Бенчмарки таких данных не дают. Но и не мешают их собирать.

СВОДНАЯ ТАБЛИЦА МОДЕЛЕЙ: ИНСТРУКЦИЯ ПО ЧТЕНИЮ

Сводная таблица моделей — это попытка уместить десятки параметров в один экран. Искушение выбрать модель по одной цифре («Intelligence Index» — сводный индекс «интеллекта» от Artificial Analysis) сильно. Именно на нём держится маркетинг лидербордов. Под одной цифрой скрывается десяток разных метрик, и у каждой модели свой профиль: одна лучше в рассуждении, другая — в коде, третья — в диалоге на естественном языке, четвёртая — в работе с длинным контекстом. Универсального победителя нет. Кто говорит обратное — продаёт.

При чтении порядок такой.

1: Первая колонка — не «MMLU», а «цена и контекст», потому что если модель не влезает в ваш бюджет или в ваш документ, дальше можно не смотреть.

2: Вторая — задача: что вы реально будете делать (код, рассуждение, перевод).

3: Третья — точность на релевантном бенчмарке.

4: Четвёртая — бенчмарк на нужном языке (русский отдельно от английского).

5: Пятая — скорость и формат API (программного интерфейса, через который ваше приложение отправляет запросы модели).

Принцип простой. Смотрите не на «общую оценку», а на параметр под ваш аппетит, задачу и бюджет.

Очередной миф: «OpenAI / Claude / Gemini лучше всех остальных». Зависит от задачи и языка. Для русского, для агентских задач, для маленьких моделей на локальной машине — лидер другой, и миф поддерживается маркетингом западных лабораторий и игнорированием китайских и российских альтернатив.

OpenAI и Anthropic конкурируют в зоне топовых рассуждающих моделей (reasoning-моделей, моделей с пошаговым рассуждением) с длинным контекстом. Google делает ставку на мультимодальность (текст, картинки, видео, аудио в одной модели). DeepSeek, Qwen — китайские open-weight альтернативы (модели с открытыми весами — можно скачать и запустить у себя), активно догоняющие западные аналоги по бенчмаркам при цене в 5–10 раз ниже. Mistral — европейский open-source (с открытым исходным кодом) с акцентом на развёртывание на своих серверах (on-premise — на своей инфраструктуре) и защиту данных (privacy — приватность). Это не чёрно-белое «хорошие против плохих», а разные ниши с разной экономикой.

Короткий срез лидеров на 1 мая 2026 — в таблице ниже. Среди open-weight в 2026 году отдельная лига: DeepSeek V4 Preview (архитектура MoE — смесь экспертов: 1,6 триллиона параметров всего, 49 миллиардов активны на каждом запросе) и Llama 4 Scout с заявленным контекстом 10M токенов, Qwen 3.5 Medium (35B-A3B) — GPT-5-mini-класс за долю стоимости. Разрыв между «топом» и «средним» в абсолютных цифрах меньше, чем кажется: на Artificial Analysis Intelligence Index даже «лучшая модель мира» набирает 61, а не 100, и разница между первым и пятым местом — это 3–5 процентных пунктов. «Топ-1» в этой реальности — переходящий кубок: в каждой номинации свой обладатель.

Какая модель лучше для русскоязычных задач в 2026 году? Прямого ответа нет, и любой, кто его даёт, — продаёт. Сравнивать нужно на своём оценочном наборе. Это единственный честный способ.

Топ-1 в рейтинге — победитель марафона, не лучший бегун для вашего забега. Если победитель марафона бежит 42 км за 2:10, это не значит, что он выиграет спринт на 100 метров у вашего офисного курьера. Модель, топовая на SWE-bench Verified (сложный код), может быть средней в маркетинговых текстах. Модель, лидирующая в HumanEval (короткий код), может проигрывать в многошаговом агенте.

КИРИЛЛИЦА И ТОКЕНИЗАЦИЯ: СТРАТЕГИИ ПРОТИВ ПЕРЕПЛАТЫ

Токенизация разобрана в первой главе. Здесь — про экономику кириллицы в конкретных моделях 2026 года, про стратегии против переплаты и про то, как читать русскоязычные бенчмарки. Эта часть опирается на те же термины: токен (смысловой фрагмент слова, на которые модель «режет» текст перед обработкой), словарь модели (набор всех токенов, которые она знает), BPE (алгоритм разбиения слов на части, Byte Pair Encoding), и предполагает, что они понятны.

Русский язык работает в LLM иначе по трём причинам.

1: Другая токенизация: английский текст токенизируется по 4 символа на токен в среднем (BPE-словарь), русский — по 2,5 символа, и это значит, что русский текст обходится в 1,5–2 раза дороже, а в контекстное окно помещается меньше.

2: Качество корпуса: большая часть обучающих данных — английский, китайский, испанский, и русскоязычный корпус меньше, и качество его ниже (больше шума, меньше размеченных данных).

3: Отсутствие специализированного предобучения: большинство моделей обучаются на универсальном корпусе без отдельного этапа «русский язык», и только несколько моделей выделяются — YandexGPT 5.1 Pro, GigaChat 2 Max, Alice AI LLM, Qwen3, DeepSeek.

«Налог на кириллицу» — это бухгалтерия, не метафора. Когда пользователь отправляет в модель английский текст, токенизатор GPT-4o (o200k_base, словарь около 200 000) режет его в среднем на 1,3 токена на слово, а когда тот же пользователь шлёт русский — токенов становится примерно 2,5–3,3 на слово.

Слово «налогоплательщик» в GPT-4 уезжает на 4–5 токенов, в Qwen3 — на 1–2. На маленьком письме разница незаметна. На 50-страничном договоре — десятки тысяч лишних токенов. Один и тот же русскоязычный документ через OpenAI API стоит в 1,5–3 раза дороже, чем его английский перевод. Плюс в контекстное окно GPT-4o 128k на русском помещается примерно 12 000 слов вместо 26 000 на английском — почти в два раза меньше содержания за те же деньги.

Ключевой вывод из этой таблицы: проблема — в словарном запасе модели, не в «русском как таковом». Где кириллических токенов больше 4 000 (GPT-4o), русский стоит в 1,3–1,5 раза дороже английского; где 435 (GPT-4) — в 2,5–3 раза. Расширение словаря — техническая задача, и некоторые провайдеры её решают сознательно. Qwen3 (235B-A22B — MoE) и DeepSeek V3/R1 тренируются на больших многоязычных корпусах, где русский занимает заметную долю, и их словари изначально включают тысячи кириллических токенов, что даёт лучший баланс цена/качество для русского при работе через API или локально. Российские системы (YandexGPT 5.1 Pro, GigaChat 2 Max, Alice AI LLM) оптимизированы под русский «по определению» — обучающий корпус собран преимущественно из русскоязычных источников, тестирование ведётся на MERA и RussianSuperGLUE, плюс они «знают» ГК РФ, НК РФ, ФЗ-152, ГОСТы и региональную специфику.

Три рабочих стратегии для тех, кто устал платить «налог на кириллицу».

1: Сменить модель: для чисто русскоязычных задач взять YandexGPT 5.1 Pro или GigaChat 2 Max, у которых кириллица в словаре изначально. По данным Яндекса, YandexGPT 5.1 Pro превосходит предыдущее поколение в 58% случаев. Яндекс также заявляет превосходство над GPT-4.1 в 56% случаев, но независимого подтверждения этого заявления нет — это маркетинговая цифра, а не измеренная.

2: Взять модель с открытым кодом с большим кириллическим словарём: Qwen3 (235B-A22B) или DeepSeek R1; обе модели можно запустить локально или через API. Стоимость токена в 5–10 раз ниже, чем у западных конкурентов.

3: Дообучить tokenizer: взять открытую модель с крепкой архитектурой и заменить ей словарь на расширенный кириллический. Это сложно, дорого и подходит только для команд, у которых есть свои серверы и data-инженер.

Самая частая ошибка — попытка «просто перевести на английский» перед отправкой в западную модель. Это работает для технических текстов, но не работает для юридических: формулировки на русском — часть юридической силы документа. Перевод договора — это другой договор, а не тот же.

Что меряет и чего не меряет ruMMLU. ruMMLU — это переведённый на русский MMLU, тест на «общую эрудицию» из 57 предметов: от философии и права до клинической медицины. Создатели ruMMLU честно предупреждают, что результаты на русском и английском напрямую несравнимы: тест переводили через GPT-3.5, и в переводе потерялась часть нюансов. Это и есть «налог на кириллицу» на уровне бенчмарка: даже тест, по которому судят о русскоязычных моделях, сделан через западный переводчик. MERA закрывает часть этих дыр: 21 задача, среди которых ruMMLU, ruEthics, SimpleAr (арифметика на русском), CheGeKa (вопросы из «Что? Где? Когда?»), работа с длинным контекстом, код и падежная морфология. GigaChat 2 Max в марте 2025-го на MERA обходит иностранных конкурентов. YandexGPT с Alice AI LLM держатся в лидерах SLAVA-бенчмарка. Всё это доказывает не то, что российские модели «умнее», а то, что для русскоязычной работы у них другая точка отсчёта. И другая тренировочная программа.

РОССИЙСКИЕ МОДЕЛИ НА КАРТЕ РЫНКА

КОММЕРЧЕСКИЕ СЕМЕЙСТВА МОДЕЛЕЙ

GigaChat — семейство моделей Сбера (LLM, большая языковая модель), вышедшее в публичный доступ в 2023 году. К 2026-му оно доросло до линейки GigaChat 2 (Lite, Pro, Max) и нового флагмана GigaChat Ultra. Lite — быстрые ответы на простые вопросы, черновики писем, саммари, чат-боты. Pro — баланс скорости и качества, маркетинговые тексты, инструкции, рерайт. Max — тяжёлые задачи: аналитика, работа с большими документами (контекст 128 000 токенов, это примерно 200 страниц A4), глубокая работа с данными. GigaChat Ultra (по сообщению Сбера от марта 2026) — отдельный класс. Это первый релиз Сбера с режимом рассуждения (Ultra Thinking), где модель показывает цепочку рассуждений, а потом даёт ответ.

По внутренним тестам Сбера на 32 управленческих сценариях (методология не опубликована) режим рассуждения ухудшил результат на 3,3% — с 3,26 до 3,15 балла. Для точных данных и расчётов длинная цепочка рассуждений только мешает. На задачах со множеством факторов (стейкхолдер-анализ, подготовка к переговорам) режим помогает. На «посчитай 4,3% от 17 миллионов» — вредит. Важная деталь: режим рассуждения — не серебряная пуля.

YandexGPT и Alice AI — это разные семейства моделей, и в 2026 году Яндекс их разделяет осознанно. YandexGPT — рабочая лошадка для API, для встраивания в бизнес-процессы, для интеграции в Yandex Cloud AI Studio. Alice AI LLM — ядро для диалоговых и ассистентских сценариев, в первую очередь для Алисы. YandexGPT 5.1 Pro (август 2025): контекст 128 000 токенов (рост с 32 000 в предыдущем поколении), инференс в 2,5 раза быстрее YandexGPT 4 Pro, режим chain-of-reasoning, второе место в SLAVA-бенчмарке после Alice AI LLM. YandexGPT Lite — облегчённые модели для быстрых ответов, чат-ботов, bulk-операций. Alice AI LLM — лидер SLAVA с фокусом на разговорных ассистентах. С июля 2025 года «Чат с Алисой» в режиме Pro и рассуждения бесплатен для пользователя — это меняет экономику для b2c-сценариев.

Kandinsky — отдельная ветка моделей Сбера для генерации изображений и видео, не часть GigaChat, но встроенная в его интерфейс. Актуальная линейка — Kandinsky 5.0 (ноябрь 2025), три модели: Image Lite (универсальная, HD-картинки), Video Pro (10-секундные видео в разных форматах), Video Lite (2 миллиарда параметров, оптимизирован под скорость), все с открытыми весами. Что Kandinsky умеет по делу: генерация иллюстраций для презентаций и соцсетей, доработка изображений (inpainting — дорисовка части картинки по маске), генерация видео до 10 секунд по текстовому описанию или по стартовому кадру. Разрешение — от SD (720×576) до HD (1280×720). По независимым тестам, Kandinsky 5.0 Lite по качеству превосходит предыдущее поколение, но по детализации и фотореализму уступает Midjourney v6 и DALL-E 3. Это рабочий инструмент для офисных задач, а не конкурент топовым западным генераторам. Исторически Kandinsky — одна из первых публичных мультимодальных моделей на кириллице: с 2022 года поддерживает русскоязычные промпты на уровне, где западные генераторы требовали английского. Для офиса это и есть преимущество.

ОТКРЫТАЯ ВЕТКА РАЗРАБОТКИ

Параллельно с коммерческими GigaChat и YandexGPT в России развивается открытая ветка — модели с публичными весами, которые можно запустить локально или дообучить под себя. Открытые семейства: Saiga (на основе Llama, instruction-tuning на русском), Vikhr (на основе Mistral с усиленным вниманием к русской морфологии), T-pro 2.0 (гибридная модель рассуждения от Тинькофф; препринт опубликован в декабре 2025), RuadaptQwen (Qwen3 с расширенным русским словарём). Все опубликованы на Hugging Face.

Смысл открытой ветки: компания, которой нужно запустить LLM на своём сервере (по требованию импортозамещения, по соображениям безопасности, по экономии), получает готовую модель с крепкой русской базой. Тинькофф в T-pro 2.0 приводит цифры: их токенизатор даёт 0,45 токенов на слово на типичном русском новостном корпусе против 0,65 у GigaChat 2 Max. Это 30% экономии на обработке при том же качестве. Для пакетной обработки документов такая разница — десятки тысяч рублей в месяц.

ЮРИДИЧЕСКИЙ КОНТЕКСТ: «СВОЙ» ИИ ПО ТРЕБОВАНИЮ РЕГУЛЯТОРА

С 1 января 2025 года в России действует прямой запрет на использование иностранного ПО на значимых объектах критической информационной инфраструктуры (КИИ). Он оформлен Указом Президента РФ от 30 марта 2022 года № 166 (о запрете использования иностранного ПО на объектах КИИ) и Указом от 1 мая 2022 года № 250 (о дополнительных мерах по импортозамещению). Это означает, что банки, госкорпорации, операторы связи, энергетики, транспортники обязаны перейти на отечественные решения.

AI-модели в указах № 166 и № 250 прямо не упомянуты. Формально это требование к программному обеспечению, и LLM в нём — серая зона. Поэтому компании должны сами оценивать риски и консультироваться с регулятором (Минцифры, ФСТЭК) для разъяснения применимости к своим сценариям. Параллельно работает реестр отечественного ПО (Минцифры), куда попадают сертифицированные продукты, и требования ФЗ-152 «О персональных данных», которые для гостайны и критической инфраструктуры исключают передачу данных на зарубежные серверы без жёстких процедур.

GigaChat и YandexGPT включены в реестр. У YandexGPT есть сертификат ISO/IEC 42001 (по заявлению Яндекса — первый среди российских AI-сервисов). Для компании, которая работает с персональными данными, государственной тайной или просто входит в список КИИ, использование западной модели в облаке — не вопрос цены. Это вопрос допуска.

Из общедоступных данных: модели с большой долей русскоязычных данных в обучении (YandexGPT 5.1 Pro, GigaChat 2 Max, Alice AI LLM) лучше работают с бытовым русским, но уступают западным моделям в сложных reasoning-задачах на русском. Западные модели с большим контекстом (Claude Opus 4.7, GPT-5.5) компенсируют недостаток данных в обучении через длинный контекст, в который можно загрузить всю переписку. Это работает, только если у вас есть что загружать (корпоративный контекст) и если API разрешает.

РОССИЙСКИЕ МОДЕЛИ ПРОТИВ ЗАПАДНЫХ: СПОРНАЯ ТЕРРИТОРИЯ

Четыре места, где разрыв объективен.

1: Универсальные знания о мире: GigaChat Ultra в режиме рассуждения в собственных тестах Сбера проседает на точных расчётах. Заявление Яндекса о превосходстве YandexGPT 5.1 Pro над GPT-4.1 (упомянуто выше) не имеет независимого подтверждения.

2: Кодинг: на SWE-bench и Terminal-Bench лидеры — Claude Opus 4.7 (82% на SWE-bench Verified на 1 мая 2026) и GPT-5.5. GigaChat с YandexGPT в этих рейтингах не участвуют, и независимых данных по их кодинг-способностям на уровне сложных задач нет. Для типовых задач (шаблонный код, объяснение существующего, мелкий рефакторинг) российские модели работают. Для серьёзной инженерной работы — нет.

3: Мультиязычность: российские модели обучены преимущественно на русском и английском. На других языках (китайский, хинди, арабский) они проседают. Qwen3, DeepSeek V3, GPT-5.5, Gemini 3.1 Pro здесь сильнее. Если в команде есть потребность в третьем-четвёртом языке, российская модель её не закрывает.

4: Экосистема инструментов: у OpenAI и Anthropic развитые SDK (наборы для разработчиков), плагины, встроенные функции, MCP-серверы (протокол подключения внешних инструментов к модели, Model Context Protocol), широкая база разработчиков. У GigaChat с YandexGPT экосистема беднее, и часть интеграций приходится писать руками. Это не недостаток самих моделей. Это сетевой эффект, который набирается годами.

Все четыре разрыва возвращают к одному вопросу: какая модель закрывает мою задачу дёшево и быстро, и как я это измерю. Дальше — про скорость и цену, потому что именно они определяют итоговую стоимость выбора, даже если сама модель уже найдена.

СКОРОСТЬ, ЦЕНА И СКРЫТЫЕ ОСИ ВЫБОРА МОДЕЛИ

Когда пользователь жалуется, что «модель тормозит», он имеет в виду одно из двух, и это два разных решения. TTFT (Time To First Token) — время от отправки запроса до получения первого токена ответа. Для чат-бота, ассистента, оператора поддержки это критичная метрика: 1,5 секунды тишины в диалоге воспринимаются как «бот завис». TPS (Tokens Per Second) — скорость выдачи токенов после первого. Для длинных ответов (5 000+ токенов) это критично: разница между 50 и 200 t/s — разница между «20 секунд и ждём» и «3 минуты и уходим пить чай».

Лидеры по TTFT, по данным Artificial Analysis: Nova Micro (0,3 с), Llama 4 Scout (0,33 с), Gemini 2.0 Flash (0,34 с). Reasoning-модели (Claude Opus 4.x, GPT-5.5) — 0,5–1,5 с, потому что «думают» перед ответом.

Лидеры по TPS, по Vellum Leaderboard: Llama 4 Scout (2 600 t/s), Llama 3.3 70B (2 500 t/s), Llama 3.1 8B (1 800 t/s). Reasoning-модели — 50–70 t/s.

Путать TTFT и TPS — типичная ошибка. Модель с TTFT 0,5 с и TPS 30 t/s — «отвечает быстро, но медленно пишет». Она подходит для коротких ответов в чате. Модель с TTFT 2 с и TPS 200 t/s — «долго думает, зато строчит». Она подходит для генерации больших документов. Выбор между ними — выбор сценария, и здесь встроена ловушка: «быстрая модель = лучшая модель». Скорость и качество — два разных измерения. Для бизнеса критично понимать, когда важно первое, когда второе, и как они упираются в цену.

Что реально тормозит. Скорость ответа складывается из трёх фаз. Prefill — модель «читает» промпт и строит KV-cache (кэш ключ-значение, структура в памяти GPU — графического процессора, на котором считаются нейросети), и это параллелизуемая фаза: на GPU она занимает десятки-сотни миллисекунд для коротких промптов и секунды для длинных (100K+ токенов). Decode — модель генерирует ответ по одному токену, последовательно, и это узкое место: каждый токен зависит от предыдущего, параллелизация ограничена. Post-processing — сериализация, передача по сети, рендеринг.

Длина промпта решает всё. По данным NVIDIA, TTFT растёт почти линейно с длиной префилла. Для промпта в 100 000 токенов даже быстрые модели показывают 1,5–3 секунды TTFT против 0,3 с для промпта в 1 000 токенов. Для длинного контекста (анализ длинного договора, разбор большого отчёта) это становится узким местом. Пользователь ждёт не ответа, а «загрузки».

Пакетная обработка и интерактив — разные модели поведения.

Пакетная обработка — это когда компания вечером ставит 100 000 договоров в очередь и к утру получает саммари. Здесь TPS и цена решают всё, а TTFT неважна (пользователь не ждёт у экрана). Лучший выбор — дешёвая модель с высоким TPS: Gemini 2.0 Flash, Nova Micro, Gemma 3 27B. Рассуждающие модели (Claude Opus 4.x, GPT-5.5) сюда не подходят: они и медленнее, и дороже, и часто «передумывают» то, что в простой задаче не требует рассуждений.

Интерактив — это когда оператор в банке общается с клиентом и AI помогает подсказывать ответы. Здесь TTFT решает всё, а TPS и цена второстепенны (запросов немного, платит компания, а не клиент). Лучший выбор — модель с TTFT ниже 0,5 с: Nova Micro, Gemini 2.0 Flash, маленькие локальные модели на своём железе. Рассуждающие модели снова мимо: 1,5 секунды тишины в живом диалоге — провал.

Гибрид — это когда есть и пакетная, и интерактивная нагрузка. Типовое решение — бытовая интерактивная модель на каждый день, тяжёлая рассуждающая модель для «ночных» задач. YandexGPT 5.1 Pro закрывает оба сценария (быстрый для интерактива через Lite, мощный для пакетной аналитики через Pro с chain-of-reasoning), и GigaChat — аналогично (Lite для чат-ботов, Max для больших документов, Ultra Thinking для задач со множеством факторов).

Как токенизация русского удлиняет и удорожает каждый сценарий. Русский текст режется на больше токенов, чем английский. Для одной и той же задачи «саммари 50-страничного договора» русский запрос содержит 60 000–80 000 токенов вместо 30 000–40 000 для английского. Время обработки и цена растут пропорционально объёму. Если TTFT на 100K-промптах и так 2–3 секунды, то для русского она становится 3–5 секунд. На конкретных цифрах: GigaChat 2 Max — 0,65 токенов на слово, контекст 128 000; для русского договора в 200 страниц (около 80 000 слов) — 52 000 токенов, умещается в окно с запасом, TTFT умеренный. T-pro 2.0 — 0,45 токенов на слово, тот же договор уходит в 36 000 токенов, окно почти не напрягается. GPT-4o — 2,0–2,5 токенов на русское слово, тот же договор занимает 160 000–200 000 токенов, не влезает в 128K, нужно либо резать, либо брать модель с большим контекстом (400K у GPT-5.5 или 1M у Gemini 3.1 Pro). Для пакетной обработки разница в токенизации 0,45 против 2,5 — это разница в 5,5 раза по стоимости инференса. На 100 000 договоров в месяц это миллионы рублей.

Цена — скрытая ось выбора. Цена API у LLM устроена сложнее, чем кажется по заголовку «$5 / $25».

1: Вход и выход: по тарифам Anthropic, OpenAI и Google выход обычно в 3–6 раз дороже входа, потому что генерация токенов нагружает GPU сильнее, чем чтение контекста.

2: Кэшированный вход (со скидкой 10% от цены входа) и продление кэша (в 1,25× или 2× от цены входа, в зависимости от TTL — времени жизни кэша в часах): если в проекте идёт многократная переработка одного и того же системного запроса, кэш окупается за 1–2 чтения.

3: Пакетное и отложенное API со скидкой 50%: ответ приходит в течение 24 часов, не годится для работы в реальном времени.

4: Доплата за длинный контекст: OpenAI ввёл двойную цену для запросов больше 200K токенов, Google применяет 2× на вход и 1,5× на выход.

Называть просто «Claude Opus 4.7 стоит $5/$25» — это как говорить «бензин стоит 65 рублей», не уточняя, что на заправке премиум-95 плюс 12 рублей за литр. Конкретная цифра здесь — для примера, она устаревает каждый квартал. Важно в ней только то, что она иллюстрирует разрыв между «заголовком» и «реальностью». Для расчёта реальной стоимости используйте средневзвешенную цену = (входные токены × цена входа + выходные токены × цена выхода) / общее число токенов. Скрытая статья расхода, которую не видно в рекламной цене (так называемая headline-цена — цена «с витрины», без учёта реального потребления), — стоимость перепроверки человеком: обычно 30–60% от времени оператора (по отраслевым наблюдениям). Без её замера экономика проекта не сходится.

Семь способов уменьшить счёт за счёт правильной работы с API.

1: Кэширование запросов (prompt caching, по тарифу Anthropic — попадание в кэш даёт скидку 10% от базовой цены входа; стандартный сценарий с системным запросом на 4 тысячи токенов и перепиской на 50 тысяч токенов (K = тысяча, англ. thousand) даёт 80% попаданий и экономию в 4× на входе).

2: Пакетное API (batch API, по условиям OpenAI, Anthropic, xAI и Google — 50% скидка при готовности ждать до 24 часов; подходит для ETL (пакетной загрузки и преобразования данных) и RAG-индексации).

3: Маршрутизация (routing, OpenRouter и Martian автоматически направляют запросы на самую дешёвую модель, способную решить задачу, экономия до 80% в смешанных нагрузках).

4: Квантизация (сжатие модели за счёт снижения точности весов) и дистилляция (обучение компактной модели на ответах большой) — DeepSeek-R1-distill-Qwen-32B стоит в 4–5 раз дешевле полного R1 на управляемом инференсе (запуск модели на арендованном железе) при приемлемом качестве.

5: Маршрутизация по региону (region-based routing): если вы в Азии — Qwen-Plus в режиме без рассуждения (non-thinking) за $0,115/$0,688 вместо Claude Haiku 4.5 за $1/$5 для не-критичных задач; с учётом времени отклика (latency) экономия может быть и в деньгах, и во времени.

6: Оптимизация токенов (token optimization): сжимайте системные запросы, удаляйте шаблонный boilerplate (повторяющийся служебный текст), используйте структурированный вывод вместо свободной формы — экономит выходные токены в 2–5 раз.

7: Предварительная фильтрация запросов (pre-filter, по заявлениям вендоров и независимым тестам — лёгкая модель Ministral 3B / Qwen 9B решает 60–80% типовых задач за $0,04/1M, и только сложные 20% уходят в GPT-5.5 / Opus 4.7; средний blended cost падает в 3–5 раз).

РЕЗЮМЕ

Бенчмарк измеряет одну способность, а не работу модели в целом. MMLU, HumanEval, GSM8K — это тесты с эталонным ответом, не прокси для офисной задачи. К 2026 году они стали инструментом отсева слабых, а не ранжирования сильных.

Свой оценочный набор из реальных задач надёжнее публичного рейтинга. Пятьдесят-сто задач, прогнанных через топ-3 модели, дают ответ за день. Для оценки нужны три класса метрик: конвейера, качества ответа, влияния на процесс.

Для русскоязычных задач есть модели с расширенным словарём. Для работы с персональными данными и в критической инфраструктуре — отечественные решения, включённые в реестр. Российские модели сильнее западных в бытовом русском и нормативной базе, уступают в универсальных задачах и экосистеме.

Лидер рейтинга — не лучшая модель для конкретной задачи. Универсального победителя нет, есть лидеры под сценарий. Модель, лидирующая в одном бенчмарке, может проигрывать в другом.

Рынок моделей меняется раз в квартал. Решение о выборе стоит пересматривать регулярно.

Когда модель выбрана и её цифры на вашем оценочном наборе совпали с вашими ожиданиями, остаётся открытым вопрос: на чьих серверах ей работать. У облака и у локального запуска своя экономика, своя регуляторная рамка и свои риски для данных. В 2026 году граница между ними проходит не по тарифу, а по тому, какие документы и персональные данные вы готовы отдать наружу. Следующая глава разберёт эти варианты в деталях — со стоимостью владения, инженерными требованиями и конкретными ситуациями, в которых локальный запуск окупается, а в которых нет.

Предыдущая главаГлава 5 из 21Следующая глава