С мая по август 2026 года мы сделали 61 977 обращений к языковым моделям на живых пользовательских запросах. Из них 48,6% отдал кэш, и до провайдера они не дошли вовсе — а доля выросла с 23% в мае до 52% в августе.
Самое полезное наблюдение при этом другое: механизм кэша один и тот же, а результат различается в восемьдесят раз — 82% на одной поверхности и 1% на другой. Разница не в настройке, а в том, повторяется ли вход.
Бесплатный онлайн-инструмент — проверка HTTP-заголовков: результат мгновенно, без регистрации.
С 29 мая по 27 августа 2026 года наша система сделала 61 977 обращений к языковым моделям в рабочем режиме — не в тесте, а на живых пользовательских запросах. Каждое обращение логируется: поверхность, провайдер, язык, число токенов на входе и выходе, время ответа, попал ли запрос в кэш.
Чего здесь нет: денег. Поле стоимости у двух основных провайдеров не заполняется — 31 796 вызовов записаны с нулём. Это пробел в нашем учёте, а не бесплатная услуга, и выдавать эти нули за расходы мы не станем. Поэтому дальше речь о токенах и о доле кэша — величинах, которые измерены достоверно.
Это, впрочем, не потеря. Главный рычаг стоимости — не цена за токен, а доля запросов, которые до провайдера вообще не доходят. Её мы измерили точно.
Исходные данные всех таблиц этого отчёта доступны в виде открытого CSV-файла (UTF-8, первая строка — заголовки).
Скачать датасет (CSV)Из 61 977 обращений 30 119 (48,6%) отданы из кэша и до провайдера не дошли. Помесячно:
| Месяц | Обращений | Из кэша |
|---|---|---|
| май 2026 (с 29-го) | 318 | 23% |
| июнь | 4 941 | 30% |
| июль | 14 248 | 47% |
| август | 42 470 | 52% |
Доля выросла с 23% до 52% за три месяца, и механизм здесь простой: кэш работает тем лучше, чем больше запросов уже прошло. Ключ строится по содержимому запроса, поэтому каждый новый пользователь, спрашивающий про уже проверенный объект, получает ответ бесплатно.
Практический вывод для любого, кто встраивает модель: кэш даёт больше, чем выбор модели подешевле. Переход на модель вдвое дешевле снижает счёт вдвое один раз. Кэш с растущей долей попаданий снижает его непрерывно, и к третьему месяцу у нас он убрал половину нагрузки.
В токенах это примерно 37 миллионов, которые не были отправлены и не были оплачены — оценка по среднему размеру обращения в нашей выборке.
Это, пожалуй, самое полезное наблюдение. Механизм кэширования у всех поверхностей один и тот же, а результат различается в восемьдесят раз:
| Поверхность | Обращений | Из кэша |
|---|---|---|
| Статьи | 28 612 | 82% |
| Проверка ASN | 1 227 | 51% |
| DNS | 1 932 | 36% |
| Почтовые записи | 851 | 27% |
| Реестр блокировок | 10 353 | 20% |
| Проверка портов | 916 | 20% |
| SSL | 1 382 | 14% |
| Вредоносное ПО | 3 568 | 11% |
| Заголовки HTTP | 2 027 | 1% |
Разница объясняется повторяемостью входа. У статей вход — сам текст статьи, он один и тот же для всех читателей, отсюда 82%. У проверки заголовков вход — полный набор заголовков конкретного сайта в конкретный момент; он не повторяется почти никогда, отсюда 1%.
Отсюда правило проектирования: прежде чем встраивать модель, посмотрите, насколько повторяем вход. Если вход уникален у каждого запроса, кэш не поможет, и экономить придётся другими способами — сокращать промпт, брать модель поменьше, отдавать часть работы обычному коду.
| Провайдер | Вызовов | Токенов вход | Токенов выход | Среднее время |
|---|---|---|---|---|
| YandexGPT | 30 522 | 29 222 832 (~957 на вызов) | 8 477 615 (~278) | 3 869 мс |
| OpenAI | 1 274 | 969 165 (~761) | 448 216 (~352) | 5 419 мс |
Три наблюдения.
Вход втрое больше выхода. На один токен ответа приходится примерно три с половиной токена запроса. Поскольку у большинства провайдеров вход дешевле выхода, но не в три с половиной раза, сокращение промпта обычно выгоднее сокращения ответа — а оптимизируют чаще второе.
Ответ занимает секунды, а не миллисекунды. 3,9 и 5,4 секунды в среднем — это на два порядка дольше, чем отвечают наши обычные инструменты, где медиана 95 мс. Встраивая модель в интерфейс, надо исходить из того, что ответ придёт через секунды, и показывать это пользователю.
Оговорка к времени OpenAI: наши запросы к нему идут через промежуточный узел за пределами России, и часть из этих 5,4 секунды — сетевой путь, а не работа модели. Сравнивать провайдеров по этому столбцу напрямую нельзя.
Русских обращений 60 545, английских 1 432 — соотношение 42 к 1. Это отражает состав аудитории, а не качество моделей, но имеет прямое следствие для расходов: основная нагрузка приходится на провайдера, обслуживающего русский язык, и его тарифы определяют счёт почти целиком.
Разделение по языкам у нас сделано не ради цены: русские запросы обслуживаются провайдером с инфраструктурой в России, английские — зарубежным. Это требование к обработке данных, а не оптимизация.
Общий вывод по трём месяцам работы: стоимость встроенной модели определяется не тарифом, а архитектурой. Доля кэша, повторяемость входа и длина промпта дают кратные различия; выбор между моделями сопоставимого класса — доли.
Оговорка о применимости: это данные одного продукта с конкретным набором задач. Доля кэша в 48,6% — наша, а не отраслевая; у продукта с уникальным входом на каждом запросе она будет околонулевой.
>10M tokens/day при постоянной нагрузке. 1 H100 $3/h × 24 × 30 = $2,160/мес = ~2,4B tokens throughput.
Mini: $0.15/$0.60. 25x дешевле GPT-5. Quality: 70-85% на most tasks. Для chatbot / classification / simple extraction — используйте mini.
Anthropic cache 90% cheaper на hit. OpenAI automatic 50% cheaper. 35% cache hit = 30%+ cost reduction.
Per-provider dashboard + app-level tagging через X-Project header. Anomalies → alert (daily spend > threshold).
Бесплатный тариф — 10 мониторов, проверки каждые 5 мин, без карты. Платные тарифы — интервал от 1 минуты и проверки из нескольких регионов.