Для московского времени правило DeepSeek выглядит так: с понедельника по пятницу 04:00–07:00 и 09:00–13:00 действует пиковый тариф. В остальные часы, а также все выходные, действует непиковый тариф — ровно половина пиковой цены.
Это удобная скидка для ночных проверок, пакетной классификации и отложенной обработки. Но она не должна управлять интерактивными запросами. Если пользователь ждёт ответ сейчас, авария требует немедленной диагностики или автоматизация имеет жёсткий срок, задержка ради тарифа способна стоить дороже самих токенов.
Цены ниже сверены с официальной таблицей DeepSeek 3 сентября 2026 года. Провайдер оставляет за собой право менять прайс, поэтому перед закупкой большого объёма таблицу нужно проверить заново.
Две модели, три вида токенов, два тарифа
DeepSeek считает не просто весь ввод одной строкой. Входные токены делятся на попадание в кэш и промах кэша; выход оплачивается отдельно. Все значения указаны в долларах США за миллион токенов официального hosted API.
| Модель | Период | Ввод, попадание в кэш | Ввод, промах кэша | Вывод |
|---|---|---|---|---|
deepseek-v4-flash | вне пика | $0,007 | $0,22 | $0,66 |
deepseek-v4-flash | пик | $0,014 | $0,44 | $1,32 |
deepseek-v4-pro | вне пика | $0,022 | $0,66 | $1,98 |
deepseek-v4-pro | пик | $0,044 | $1,32 | $3,96 |
Эта таблица не описывает цену посредника, облачного marketplace или собственного запуска открытых весов. У таких вариантов бывают наценка, иная единица тарификации, собственные лимиты и правила списания. Доступ через сайт или приложение DeepSeek тоже нельзя смешивать с API-биллингом.
Сначала выбирайте модель по результату. Flash — разумная отправная точка для массовых задач с автоматической проверкой. Pro имеет смысл, если на вашем наборе задач он заметно сокращает ошибки, повторы или ручную проверку. Только после этого выбирайте время выполнения.
Расчёт, который можно сверить с usage
Для одного ценового окна сумма считается так:
textстоимость = токены с попаданием в кэш / 1 000 000 × ставка кэша + токены с промахом кэша / 1 000 000 × ставка обычного ввода + выходные токены / 1 000 000 × ставка вывода
Допустим, обработка накопила 8 млн входных токенов, из которых 6 млн попали в кэш, и 1 млн выходных. Получается 6 млн cache hit, 2 млн cache miss и 1 млн output.
Для V4 Flash:
- вне пика:
6 × 0,007 + 2 × 0,22 + 1 × 0,66 = $1,142; - в пик:
6 × 0,014 + 2 × 0,44 + 1 × 1,32 = $2,284.
Для V4 Pro:
- вне пика:
6 × 0,022 + 2 × 0,66 + 1 × 1,98 = $3,432; - в пик:
6 × 0,044 + 2 × 1,32 + 1 × 3,96 = $6,864.
Перенос фиксированного объёма в непиковое окно уменьшает именно строку провайдера вдвое. Повышение доли попаданий в кэш — другой механизм: дорогой обычный ввод заменяется более дешёвым. Оба эффекта можно сочетать, но расчёт выше не включает повторные запросы, налоги, курс карты, наценку шлюза, задержку и работу проверяющего.
Сверять результат следует по полям usage каждого ответа и по журналу заданий. Общего изменения баланса недостаточно: оно не объяснит, вырос ли вывод, упал ли кэш или одна задача выполнилась дважды.

Почему расписание лучше хранить в UTC
Официальное правило задаёт пик как 01:00–04:00 UTC и 06:00–10:00 UTC по рабочим дням. Москва живёт в UTC+3 без сезонного перевода, поэтому локальные интервалы устойчивы: 04:00–07:00 и 09:00–13:00 того же дня.
Тем не менее в распределённой системе лучше оставить UTC источником истины. Сервер может работать в другом регионе, контейнер — наследовать неожиданную локальную зону, а интерфейс — показывать время оператору в третьей стране. Храните метку с часовым поясом и отдельно отображайте московское время.
Полезный журнал для каждого задания содержит:
- время постановки и отправки с UTC offset;
- точный model ID;
- три категории токенов;
- номер попытки и итоговый статус;
- крайний срок задания и фактическую стоимость.
Так можно доказать не только попадание в дешёвое окно, но и сохранение результата работы.
Не всякая очередь экономит деньги
Перед переносом задайте заданию пять вопросов. Вход уже сохранён? Повторный запуск безопасен? Результат можно автоматически проверить? До крайнего срока остаётся больше, чем до следующего дешёвого окна? При исчерпании повторов есть понятный способ восстановления?
Если ответ везде «да», задача подходит для отложенного выполнения. Типичные кандидаты — ночные регрессионные прогоны, разметка, классификация, пополнение индекса, не срочный анализ репозитория и подготовка данных, которую можно воспроизвести.
Если хотя бы срок или идемпотентность не определены, сначала исправьте это. Реальное время общения, платёжные и риск-решения, реагирование на инцидент, интерактивный coding agent и автоматизация с коротким SLA обычно должны выполняться сразу.
Для промежуточных случаев задайте два поля: самое раннее время запуска и крайний срок. Планировщик ждёт непикового окна, пока запас достаточен; затем переводит задание в немедленную очередь. Такой подход использует цену как сигнал, а не как безусловный запрет на запуск.

Дешёвое окно не является обещанием свободной мощности
В документации по ограничениям сейчас указано 2500 одновременных запросов на аккаунт для Flash и 500 для Pro. При превышении лимита API возвращает HTTP 429. Для отдельных аккаунтов возможно расширение, но публичная цифра не гарантирует ни задержку, ни доступность.
Даже ночной потребитель должен иметь экспоненциальную паузу, предел попыток, контроль возраста очереди и очередь необработанных ошибок. Сравнивайте пик и непик не только по доллару: добавьте долю успешно принятых результатов, p95 задержки, повторы, длину вывода и минуты ручной проверки.
Историческая причина расхождений со старыми статьями проста: новый прайс вступил в силу 16 августа 2026 года в 16:00 UTC вместе с обновлением линейки V4. Старые фиксированные цены и статус Preview больше не подходят для текущего бюджета.
Если вы выбираете не время, а поставщика, сравнивайте одинаковые входы, лимиты вывода и критерии приёмки в обзоре актуальных цен LLM API. Уменьшение цены за токен становится экономией только тогда, когда принятая задача завершилась вовремя и без лишней ручной работы.



