Skip to content
EN

Что определяет стоимость встроенной модели: 61 977 рабочих вызовов

Кратко. С мая по август 2026 года мы сделали 61 977 обращений к языковым моделям на живых пользовательских запросах.

С мая по август 2026 года мы сделали 61 977 обращений к языковым моделям на живых пользовательских запросах. Из них 48,6% отдал кэш, и до провайдера они не дошли вовсе — а доля выросла с 23% в мае до 52% в августе.

Самое полезное наблюдение при этом другое: механизм кэша один и тот же, а результат различается в восемьдесят раз — 82% на одной поверхности и 1% на другой. Разница не в настройке, а в том, повторяется ли вход.

Проверить заголовки сайта →

Что мы измерили и чего в этих данных нет

С 29 мая по 27 августа 2026 года наша система сделала 61 977 обращений к языковым моделям в рабочем режиме — не в тесте, а на живых пользовательских запросах. Каждое обращение логируется: поверхность, провайдер, язык, число токенов на входе и выходе, время ответа, попал ли запрос в кэш.

Чего здесь нет: денег. Поле стоимости у двух основных провайдеров не заполняется — 31 796 вызовов записаны с нулём. Это пробел в нашем учёте, а не бесплатная услуга, и выдавать эти нули за расходы мы не станем. Поэтому дальше речь о токенах и о доле кэша — величинах, которые измерены достоверно.

Это, впрочем, не потеря. Главный рычаг стоимости — не цена за токен, а доля запросов, которые до провайдера вообще не доходят. Её мы измерили точно.

Данные исследования

Исходные данные всех таблиц этого отчёта доступны в виде открытого CSV-файла (UTF-8, первая строка — заголовки).

Скачать датасет (CSV)

Половину запросов обслуживает кэш, и доля растёт

Из 61 977 обращений 30 119 (48,6%) отданы из кэша и до провайдера не дошли. Помесячно:

МесяцОбращенийИз кэша
май 2026 (с 29-го)31823%
июнь4 94130%
июль14 24847%
август42 47052%

Доля выросла с 23% до 52% за три месяца, и механизм здесь простой: кэш работает тем лучше, чем больше запросов уже прошло. Ключ строится по содержимому запроса, поэтому каждый новый пользователь, спрашивающий про уже проверенный объект, получает ответ бесплатно.

Практический вывод для любого, кто встраивает модель: кэш даёт больше, чем выбор модели подешевле. Переход на модель вдвое дешевле снижает счёт вдвое один раз. Кэш с растущей долей попаданий снижает его непрерывно, и к третьему месяцу у нас он убрал половину нагрузки.

В токенах это примерно 37 миллионов, которые не были отправлены и не были оплачены — оценка по среднему размеру обращения в нашей выборке.

Одинаковый кэш даёт от 1% до 82% в зависимости от поверхности

Это, пожалуй, самое полезное наблюдение. Механизм кэширования у всех поверхностей один и тот же, а результат различается в восемьдесят раз:

ПоверхностьОбращенийИз кэша
Статьи28 61282%
Проверка ASN1 22751%
DNS1 93236%
Почтовые записи85127%
Реестр блокировок10 35320%
Проверка портов91620%
SSL1 38214%
Вредоносное ПО3 56811%
Заголовки HTTP2 0271%

Разница объясняется повторяемостью входа. У статей вход — сам текст статьи, он один и тот же для всех читателей, отсюда 82%. У проверки заголовков вход — полный набор заголовков конкретного сайта в конкретный момент; он не повторяется почти никогда, отсюда 1%.

Отсюда правило проектирования: прежде чем встраивать модель, посмотрите, насколько повторяем вход. Если вход уникален у каждого запроса, кэш не поможет, и экономить придётся другими способами — сокращать промпт, брать модель поменьше, отдавать часть работы обычному коду.

Размеры обращений и время ответа

ПровайдерВызововТокенов входТокенов выходСреднее время
YandexGPT30 52229 222 832 (~957 на вызов)8 477 615 (~278)3 869 мс
OpenAI1 274969 165 (~761)448 216 (~352)5 419 мс

Три наблюдения.

Вход втрое больше выхода. На один токен ответа приходится примерно три с половиной токена запроса. Поскольку у большинства провайдеров вход дешевле выхода, но не в три с половиной раза, сокращение промпта обычно выгоднее сокращения ответа — а оптимизируют чаще второе.

Ответ занимает секунды, а не миллисекунды. 3,9 и 5,4 секунды в среднем — это на два порядка дольше, чем отвечают наши обычные инструменты, где медиана 95 мс. Встраивая модель в интерфейс, надо исходить из того, что ответ придёт через секунды, и показывать это пользователю.

Оговорка к времени OpenAI: наши запросы к нему идут через промежуточный узел за пределами России, и часть из этих 5,4 секунды — сетевой путь, а не работа модели. Сравнивать провайдеров по этому столбцу напрямую нельзя.

Соотношение языков и что из этого следует

Русских обращений 60 545, английских 1 432 — соотношение 42 к 1. Это отражает состав аудитории, а не качество моделей, но имеет прямое следствие для расходов: основная нагрузка приходится на провайдера, обслуживающего русский язык, и его тарифы определяют счёт почти целиком.

Разделение по языкам у нас сделано не ради цены: русские запросы обслуживаются провайдером с инфраструктурой в России, английские — зарубежным. Это требование к обработке данных, а не оптимизация.

Общий вывод по трём месяцам работы: стоимость встроенной модели определяется не тарифом, а архитектурой. Доля кэша, повторяемость входа и длина промпта дают кратные различия; выбор между моделями сопоставимого класса — доли.

Оговорка о применимости: это данные одного продукта с конкретным набором задач. Доля кэша в 48,6% — наша, а не отраслевая; у продукта с уникальным входом на каждом запросе она будет околонулевой.

Больше по теме

Часто задаваемые вопросы

Когда self-host окупается?

>10M tokens/day при постоянной нагрузке. 1 H100 $3/h × 24 × 30 = $2,160/мес = ~2,4B tokens throughput.

gpt-4o-mini vs GPT-5?

Mini: $0.15/$0.60. 25x дешевле GPT-5. Quality: 70-85% на most tasks. Для chatbot / classification / simple extraction — используйте mini.

Cache effectiveness?

Anthropic cache 90% cheaper на hit. OpenAI automatic 50% cheaper. 35% cache hit = 30%+ cost reduction.

Как monitor AI spend?

Per-provider dashboard + app-level tagging через X-Project header. Anomalies → alert (daily spend > threshold).

Запустить инструмент, который описан в этой статье

Бесплатный тариф — 10 мониторов, проверки каждые 5 мин, без карты. Платные тарифы — интервал от 1 минуты и проверки из нескольких регионов.