С мая по август 2026 года мы сделали 30 449 обращений к YandexGPT на живых пользовательских запросах. Медиана ответа — 3 793 мс, пустых ответов 0,14%.
Средняя задержка за три месяца выросла с 2,2 до 4,0 секунды, и это легко прочитать как «стало медленнее». На деле скорость генерации не менялась: около 14 мс на токен все три месяца — просто ответы стали длиннее.
Бесплатный онлайн-инструмент — проверка HTTP-заголовков: результат мгновенно, без регистрации.
С мая по август 2026 года мы сделали 30 449 реальных обращений к YandexGPT в рабочем режиме — на живых запросах пользователей, не в тесте. Это не обзор рынка, а отчёт о трёх месяцах эксплуатации одного сервиса, и таких данных в открытом доступе нет ни у кого.
Распределение времени ответа:
| Перцентиль | Время |
|---|---|
| p50 | 3 793 мс |
| p75 | 4 911 мс |
| p90 | 6 242 мс |
| p95 | 7 256 мс |
| p99 | 9 538 мс |
Быстрее двух секунд отвечают 17,2% вызовов, дольше десяти — 0,7%. Хвост короткий: разница между медианой и p99 всего в два с половиной раза, тогда как у обычных веб-запросов она у нас десятикратная.
Пустых ответов — 43 из 30 525, то есть 0,14%. Для трёх месяцев непрерывной работы это хороший показатель.
Исходные данные всех таблиц этого отчёта доступны в виде открытого CSV-файла (UTF-8, первая строка — заголовки).
Скачать датасет (CSV)Средняя задержка за три месяца выросла с 2,2 до 4,0 секунды. Легко прочитать это как «сервис стал медленнее», но данные говорят другое:
| Месяц | Вызовов | Средн. время | Токенов выход | мс на токен |
|---|---|---|---|---|
| май | 244 | 2 169 мс | 160 | 13,6 |
| июнь | 3 367 | 3 379 мс | 238 | 14,2 |
| июль | 7 185 | 3 923 мс | 287 | 13,7 |
| август | 19 729 | 3 954 мс | 283 | 14,0 |
Задержка выросла на 82%, длина ответа — на 77%. В пересчёте на токен скорость держится около 14 мс и за три месяца не сдвинулась, при том что нагрузка выросла в восемьдесят раз.
Практический вывод: время ответа языковой модели предсказывается длиной ответа, а не загрузкой сервиса. Хотите быстрее — просите короче. Ограничение на число токенов в ответе работает надёжнее любых таймаутов.
У нас русские запросы идут к российскому провайдеру, английские — к зарубежному. Это не оптимизация по цене и не выбор по качеству, а требование к обработке данных: передача сведений о пользователях за границу регулируется, и разделение снимает вопрос в корне.
Есть и техническая сторона, которую мы проверили. С нашего московского сервера:
| Адрес | Соединение | Ответ без ключа |
|---|---|---|
| llm.api.cloud.yandex.net | 30 мс | 404 — служба отвечает |
| api.openai.com | 43 мс | 403 |
| api.anthropic.com | 22 мс | 403 |
Сеть до всех трёх короткая — десятки миллисекунд. Но зарубежные интерфейсы отвечают отказом на запрос с российского адреса. Поэтому английская часть нашей системы работает через промежуточный узел за пределами страны, и часть её времени ответа — сетевой путь, а не работа модели. Медиана там 5 489 мс против 3 793 у российского провайдера, и сравнивать их напрямую как «модель против модели» нельзя.
Долей рынка российских ИИ-сервисов не существует. Ни один регулятор, ни одна отраслевая организация, ни один независимый исследователь не публикует, сколько компаний использует какой сервис. Всё, что встречается в подборках, — либо пересказ маркетинговых заявлений, либо выдумка.
Мы не проверяли доступность чужих интерфейсов по угаданным адресам. Отрицательный результат при неверно угаданном имени хоста означает только неверное имя, а не недоступность службы. Публиковать такое как «сервис не работает» — распространённая и грубая ошибка.
Наши данные описывают один сервис и один тип нагрузки. Мы просим модель делать краткое резюме технической проверки — короткий структурированный вход, короткий выход. У чата с длинным контекстом или у генерации кода профиль будет совсем другим.
Что эти данные действительно дают: ориентир по времени ответа для встроенной модели в российской инфраструктуре. Если вы проектируете интерфейс, исходите из четырёх секунд на типичный ответ и десяти на худший случай — и показывайте это пользователю, а не крутите спиннер молча.
Как это выглядит у нас, можно посмотреть на любой странице проверки — например, в проверке DNS или проверке SSL.
В RU language — comparable с GPT-4 (2024). В сложных tasks (math, coding) — ниже frontier. Отлично для Runet text gen (tone, style).
VPN + card foreign (BCS bank, Georgian, Kazakhstan). Или proxy services (OpenRouter, ProxyAPI.ru) принимают RU card. Legal grey area.
$0.60/1M для Lite, $1/1M Pro. Включен в Sber Cloud. GigaChain (их LangChain fork) для RAG.
Mainly: Claude Opus 4.7 (Anthropic, via VPN). Backup: Llama 3 70B через Together.ai. Не используем RU providers из-за quality.
Бесплатный тариф — 10 мониторов, проверки каждые 5 мин, без карты. Платные тарифы — интервал от 1 минуты и проверки из нескольких регионов.