Skip to content
EN

Вычисления моделей на устройстве в 2026 году: платформа готова, применения нет

Кратко. WebAssembly поддерживают 95,96% браузеров, WebGPU — 83,99%. Платформа для вычислений на устройстве готова и доступна практически всем.При этом работу на графическом процессоре выполняют 0,003967% загрузок страниц — четыре из ста тысяч. Разрыв примерно в двадцать одну тысячу раз,…

WebAssembly поддерживают 95,96% браузеров, WebGPU — 83,99%. Платформа для вычислений на устройстве готова и доступна практически всем.

При этом работу на графическом процессоре выполняют 0,003967% загрузок страниц — четыре из ста тысяч. Разрыв примерно в двадцать одну тысячу раз, и объясняется он не модой, а весом моделей и тем, что обращение к серверу просто работает.

Проверить заголовки сайта →

Браузер готов запускать модели

Три технологии делают вычисления в браузере возможными, и с поддержкой у них по-разному:

ТехнологияПолная поддержкаЧастичнаяСтатус спецификации
WebAssembly95,96%0%стабильна
WebGPU83,99%2,95%рабочий черновик
WebNNв справочнике поддержки не отслеживается вовсе

Данные caniuse на 24 августа 2026 года. WebAssembly доступен практически везде и давно, WebGPU — у пяти браузеров из шести, но всё ещё черновик.

Про WebNN — отдельно, потому что здесь легко ошибиться. Мы искали его и в справочнике поддержки, и в перечне счётчиков использования Chrome. В справочнике записи нет. В перечне признаков Chrome упоминаний нет тоже. То есть распространённость WebNN сегодня измерить нечем, и любая цифра по нему взята не из наблюдения.

Данные исследования

Исходные данные всех таблиц этого отчёта доступны в виде открытого CSV-файла (UTF-8, первая строка — заголовки).

Скачать датасет (CSV)

И почти никто этого не делает

Chrome публикует, на какой доле загрузок страниц вызывается та или иная возможность. На 25 августа 2026 года работу на графическом процессоре выполняют 0,003967% загрузок — примерно четыре из ста тысяч.

Сопоставим:

ВеличинаЗначениеЧто меряет
Браузеры с WebGPU83,99%доля просмотров, взвешенная по трафику
Загрузки с работой на GPU0,003967%доля загрузок страниц в Chrome

Разрыв примерно в двадцать одну тысячу раз. Знаменатели у двух чисел разные, поэтому читать это надо как порядок величины, — но порядок здесь и есть содержание.

Рост при этом настоящий: 0,000003% в августе 2023-го, 0,000550% в 2025-м, 0,003967% сейчас — примерно всемеро за год. Просто база околонулевая, а WebGPU доступен в Chrome с мая 2023 года. Три года и четыре месяца спустя работу на GPU делают меньше четырёх загрузок из ста тысяч.

Подробнее про то, как устроен этот разрыв, — в отдельном разборе WebGPU.

Почему готовность платформы не превращается в применение

Причины видны из самих цифр, и они не про моду.

Модель надо доставить. Любая модель, способная на что-то полезное, весит десятки или сотни мегабайт. Это сопоставимо с весом целого приложения и на порядки больше медианной страницы, которая в нашем замере по России весит 2,33 МБ. Один раз скачать и закэшировать — можно; но первый визит становится неприемлемо дорогим.

Железо не гарантировано. Поддержка «по версии браузера» и наличие пригодного адаптера — разные вещи. Chrome под Linux числится поддерживающим, а на конкретной машине адаптера может не быть. Значит запасной путь нужен всегда, а раз он нужен — часто проще на нём и остаться.

Спецификация ещё черновик. WebGPU имеет статус рабочего черновика, WebNN не отслеживается даже справочниками. Закладывать в продукт то, что может измениться, решаются немногие.

И главное: обращение к серверу работает. В нашей собственной эксплуатации медиана ответа модели — 3,8 секунды. Это медленно по меркам веб-запроса, но приемлемо для действия, которое пользователь сознательно запускает. Вычисления на устройстве должны дать что-то, чего сервер не даёт вовсе, — приватность или работу без сети, — иначе выигрыша нет.

Когда считать на устройстве всё-таки стоит

Из перечисленного следует довольно узкий, но реальный список случаев.

  1. Данные не должны покидать устройство. Это единственный довод, который не перебивается скоростью сервера. Обработка документа, фотографии или записи голоса без отправки куда-либо — задача, где вычисление на месте выигрывает по определению.
  2. Работа без сети обязательна. Приложение, которое должно продолжать работать в самолёте или в подвале, сервером не обойдётся.
  3. Задача маленькая и повторяется постоянно. Распознавание жеста, подсказка при вводе, классификация по нескольким категориям — здесь модель весит мегабайты, а не сотни, и обращение к серверу на каждое нажатие клавиши невозможно.

Во всех прочих случаях обращение к серверу проще, предсказуемее и работает у всех. Числа выше — не приговор технологии, а описание того, что рынок пока выбирает именно так.

Проверить, что ваша страница отдаёт и сколько весит, можно в проверке скорости.

Больше по теме

Часто задаваемые вопросы

Apple Intelligence доступен в РФ?

Feature блокирован region-based, включая EU (DMA), China, RU. Workaround: change region в Apple ID. Но без App Store access к ограниченным apps.

Llama 3.2 1B local — useful?

Да, для простых tasks: summary, classification, rewriting. Runs на консьюмерском CPU. Quality comparable с GPT-3.5 для simple queries.

NPU / ANE что?

NPU (Neural Processing Unit) — dedicated chip для AI on-device. Apple ANE (Neural Engine): 35 TOPS. Google Tensor TPU. Intel Core Ultra NPU: 40 TOPS. Runs AI без GPU/CPU load.

Будет ли cloud заменён?

Нет, frontier models (GPT-5, Claude Opus) всё ещё cloud-only. On-device для privacy + cost + latency. Hybrid — best.

Запустить инструмент, который описан в этой статье

Бесплатный тариф — 10 мониторов, проверки каждые 5 мин, без карты. Платные тарифы — интервал от 1 минуты и проверки из нескольких регионов.