Skip to content
EN

Российские ИИ-сервисы в 2026 году: три месяца эксплуатации в цифрах

Кратко. С мая по август 2026 года мы сделали 30 449 обращений к YandexGPT на живых пользовательских запросах.

С мая по август 2026 года мы сделали 30 449 обращений к YandexGPT на живых пользовательских запросах. Медиана ответа — 3 793 мс, пустых ответов 0,14%.

Средняя задержка за три месяца выросла с 2,2 до 4,0 секунды, и это легко прочитать как «стало медленнее». На деле скорость генерации не менялась: около 14 мс на токен все три месяца — просто ответы стали длиннее.

Проверить заголовки сайта →

Что мы знаем из своей эксплуатации

С мая по август 2026 года мы сделали 30 449 реальных обращений к YandexGPT в рабочем режиме — на живых запросах пользователей, не в тесте. Это не обзор рынка, а отчёт о трёх месяцах эксплуатации одного сервиса, и таких данных в открытом доступе нет ни у кого.

Распределение времени ответа:

ПерцентильВремя
p503 793 мс
p754 911 мс
p906 242 мс
p957 256 мс
p999 538 мс

Быстрее двух секунд отвечают 17,2% вызовов, дольше десяти — 0,7%. Хвост короткий: разница между медианой и p99 всего в два с половиной раза, тогда как у обычных веб-запросов она у нас десятикратная.

Пустых ответов — 43 из 30 525, то есть 0,14%. Для трёх месяцев непрерывной работы это хороший показатель.

Данные исследования

Исходные данные всех таблиц этого отчёта доступны в виде открытого CSV-файла (UTF-8, первая строка — заголовки).

Скачать датасет (CSV)

Скорость генерации не менялась — удлинились ответы

Средняя задержка за три месяца выросла с 2,2 до 4,0 секунды. Легко прочитать это как «сервис стал медленнее», но данные говорят другое:

МесяцВызововСредн. времяТокенов выходмс на токен
май2442 169 мс16013,6
июнь3 3673 379 мс23814,2
июль7 1853 923 мс28713,7
август19 7293 954 мс28314,0

Задержка выросла на 82%, длина ответа — на 77%. В пересчёте на токен скорость держится около 14 мс и за три месяца не сдвинулась, при том что нагрузка выросла в восемьдесят раз.

Практический вывод: время ответа языковой модели предсказывается длиной ответа, а не загрузкой сервиса. Хотите быстрее — просите короче. Ограничение на число токенов в ответе работает надёжнее любых таймаутов.

Почему запросы разделены по языкам

У нас русские запросы идут к российскому провайдеру, английские — к зарубежному. Это не оптимизация по цене и не выбор по качеству, а требование к обработке данных: передача сведений о пользователях за границу регулируется, и разделение снимает вопрос в корне.

Есть и техническая сторона, которую мы проверили. С нашего московского сервера:

АдресСоединениеОтвет без ключа
llm.api.cloud.yandex.net30 мс404 — служба отвечает
api.openai.com43 мс403
api.anthropic.com22 мс403

Сеть до всех трёх короткая — десятки миллисекунд. Но зарубежные интерфейсы отвечают отказом на запрос с российского адреса. Поэтому английская часть нашей системы работает через промежуточный узел за пределами страны, и часть её времени ответа — сетевой путь, а не работа модели. Медиана там 5 489 мс против 3 793 у российского провайдера, и сравнивать их напрямую как «модель против модели» нельзя.

Чего мы измерить не смогли и не станем выдумывать

Долей рынка российских ИИ-сервисов не существует. Ни один регулятор, ни одна отраслевая организация, ни один независимый исследователь не публикует, сколько компаний использует какой сервис. Всё, что встречается в подборках, — либо пересказ маркетинговых заявлений, либо выдумка.

Мы не проверяли доступность чужих интерфейсов по угаданным адресам. Отрицательный результат при неверно угаданном имени хоста означает только неверное имя, а не недоступность службы. Публиковать такое как «сервис не работает» — распространённая и грубая ошибка.

Наши данные описывают один сервис и один тип нагрузки. Мы просим модель делать краткое резюме технической проверки — короткий структурированный вход, короткий выход. У чата с длинным контекстом или у генерации кода профиль будет совсем другим.

Что эти данные действительно дают: ориентир по времени ответа для встроенной модели в российской инфраструктуре. Если вы проектируете интерфейс, исходите из четырёх секунд на типичный ответ и десяти на худший случай — и показывайте это пользователю, а не крутите спиннер молча.

Как это выглядит у нас, можно посмотреть на любой странице проверки — например, в проверке DNS или проверке SSL.

Больше по теме

Часто задаваемые вопросы

Yandex GPT качество?

В RU language — comparable с GPT-4 (2024). В сложных tasks (math, coding) — ниже frontier. Отлично для Runet text gen (tone, style).

Как workaround OpenAI?

VPN + card foreign (BCS bank, Georgian, Kazakhstan). Или proxy services (OpenRouter, ProxyAPI.ru) принимают RU card. Legal grey area.

GigaChat cost?

$0.60/1M для Lite, $1/1M Pro. Включен в Sber Cloud. GigaChain (их LangChain fork) для RAG.

Enterno использует RU AI?

Mainly: Claude Opus 4.7 (Anthropic, via VPN). Backup: Llama 3 70B через Together.ai. Не используем RU providers из-за quality.

Запустить инструмент, который описан в этой статье

Бесплатный тариф — 10 мониторов, проверки каждые 5 мин, без карты. Платные тарифы — интервал от 1 минуты и проверки из нескольких регионов.