Сколько стоят токены DeepSeek: считаем реальный бюджет
Бюджет на DeepSeek собирается из входных и выходных токенов, кеша и времени запроса.

Сколько стоят токены DeepSeek — вопрос с подвохом. Одна цифра на странице цен успокаивает, но счёт в конце месяца часто выходит другим. Причина не в обмане: тариф собран из нескольких ставок, и платите вы сразу по нескольким. Ниже разбираем, как посчитать бюджет за месяц до того, как включите оплату.

Почему одной цифры со страницы цен мало

У модели DeepSeek нет единственной цены за токен. На официальной странице цен (api-docs.deepseek.com, данные на октябрь 2026) ставки разложены сразу по трём признакам: вход или выход, попадание в кеш или промах, часы пик или низкая нагрузка. Каждый запрос попадает в одну клетку этой таблицы, и счёт складывается из всех.

Обычно смотрят на первую строчку, видят цену за миллион входных токенов и умножают на объём. Так и появляется заниженная оценка. Потом выясняется, что выход стоит в разы дороже входа, а часть трафика пришлась на дорогие часы. Экономика тут не в одной цифре, а в том, как ваш трафик распределён по клеткам таблицы.

Вход и выход считаются по-разному

Модель читает промпт и историю диалога, это входные токены. Ответ, который она пишет, это выходные токены. Ставки на них отличаются. По данным официальной страницы, у модели deepseek-flash вход с промахом по кешу в часы низкой нагрузки стоит $0,15 за миллион, а выход — $0,60. Выход дороже входа в четыре раза.

Отсюда первое правило расчёта: считайте вход и выход отдельно. Если приложение просит модель писать длинные тексты, счёт тянет выход. Если приложение только разбирает короткие реплики по категориям, основной вес даёт вход.

Кеш решает больше, чем кажется

Входные токены DeepSeek считает по двум ставкам, в зависимости от того, был ли фрагмент в кеше. Когда вы повторно отправляете один и тот же системный промпт или длинный документ, часть токенов берётся из кеша и стоит заметно дешевле. Разрыв большой: промах по кешу у deepseek-flash стоит $0,15 за миллион в часы низкой нагрузки, а попадание — $0,003. Разница в пятьдесят раз.

Практический вывод простой: стабильная неизменная часть промпта в начале запроса экономит деньги. Чем чаще повторяется один и тот же блок, тем больше входных токенов попадает в дешёвую строку. Приём ничего не стоит и не требует менять модель.

Часы пик и низкая нагрузка

Вторая развилка — время запроса. У DeepSeek есть часы пик и часы низкой нагрузки, и ставки в них отличаются вдвое. По официальной странице, пиковыми считаются интервалы с 01:00 до 04:00 и с 06:00 до 10:00 по UTC с понедельника по пятницу. Всё остальное время, включая выходные, идёт по сниженной ставке.

Для сервиса, который работает круглосуточно, часть запросов автоматически попадает в дорогое окно. Если задача не срочная, её выгодно сдвинуть в дешёвые часы. Пакетная обработка ночью в будни и днём в выходные обходится дешевле, чем поток запросов на пике.

Формула месячного бюджета

Считать удобно по частям. Сначала оцените объём: сколько запросов в день и сколько в среднем входных и выходных токенов в каждом. Умножьте на число рабочих дней и получите месячные объёмы входа и выхода.

Дальше осталось распределить их по ставкам. Вход разделите на кеш и промах, выход оставьте отдельной строкой, добавьте поправку на часы пик.

Бюджет = вход_промах × ставка_промах + вход_кеш × ставка_кеш + выход × ставка_выхода.
Ставки берите из официальной таблицы вендора на дату расчёта.
Долю кеша и долю запросов на пике подставьте своими числами.
Умножьте результат на запас 20–30% и получите ориентир для планирования.

Запас нужен потому, что реальный трафик неровный. Он даёт подушку на рост, на служебные вызовы и на подорожание, о котором вендор может сообщить заранее.

Пример расчёта на своём трафике

Возьмём небольшой сервис. Допустим, он обрабатывает 3 000 запросов в день, в среднем 1 000 входных и 500 выходных токенов на запрос. Это 3 миллиона входных и 1,5 миллиона выходных токенов в день. За 22 рабочих дня выходит 66 миллионов на входе и 33 миллиона на выходе.

Подставим ставки deepseek-flash для часов низкой нагрузки: $0,15 за миллион входа и $0,60 за миллион выхода. Вход даёт около $9,9, выход — около $19,8. Итого примерно $30 в месяц, если весь трафик идёт по низкой ставке. Тот же объём в часы пик обойдётся примерно вдвое дороже.

Числа условные, они показывают только порядок. В своём расчёте подставьте реальные объёмы и актуальные ставки вендора, а результат переведите в рубли по курсу на дату оплаты.

Что можно сократить без потери качества

Уменьшить счёт можно настройками, не только сменой модели.

  • Уберите лишнюю историю. Каждый предыдущий ход диалога снова уходит во вход. Короткая память дешевле длинной.
  • Ограничьте длину ответа. Параметр максимальной длины выхода не даёт модели писать больше, чем нужно.
  • Стабилизируйте начало промпта. Неизменный блок в начале повышает долю попаданий в кеш.
  • Переносите не срочное в дешёвые часы. Пакетные задачи можно запускать в часы низкой нагрузки.
  • Выбирайте модель под задачу. Разница между Flash и Pro в цене заметная, а что нужно именно вам, разобрано в статье про DeepSeek и Qwen.

Проверка перед первой оплатой

Прежде чем считать бюджет всерьёз, стоит закрыть несколько вопросов.

  1. Определите объёмы входа и выхода по своим логам, а не по ощущениям.
  2. Сверьте ставки на официальной странице вендора в день расчёта.
  3. Оцените долю кеша: сколько в вашем промпте повторяется от запроса к запросу.
  4. Посчитайте сценарий на пике и вне пика, возьмите худший.
  5. Заложите запас на рост трафика.

Если платить нужно в рублях с расчётного счёта, к расчёту добавляются курс и документы. Об этом — в статье про оплату DeepSeek из России и в разборе провайдеров LLM API.

Бюджет на китайские модели считается без магии: объёмы, ставки, доля кеша и часы запросов. Кто один раз собрал такую таблицу, тот перестаёт бояться счёта.

Платформа Китай-API готовится к запуску: один ключ к DeepSeek, Qwen, GLM и Kimi, оплата в рублях, счёт с НДС. Оставить заявку на ранний доступ можно в Telegram-боте, мы сообщим, когда откроем доступ первым. Что уже известно о платформе, собрано на главной странице.