Самый дешёвый LLM API провайдер: где купить ту же модель дешевле
Единого самого дешёвого провайдера нет: DeepSeek V4 Pro вне пика у владельца вдвое дешевле, чем у Together, а роутер берёт 5,5 % с пополнения.
Содержание

Самого дешёвого LLM API провайдера «вообще» не существует: победитель меняется от модели к модели и даже от часа, в который вы отправляете запросы. По состоянию на 26 сентября 2026 года месяц работы DeepSeek V4 Pro со 100 млн входных и 20 млн выходных токенов стоит $105,60 напрямую у DeepSeek в непиковые часы, $182 у DeepInfra и $211,20 у Together — ровно столько же, сколько у самого DeepSeek в часы пик. При этом Qwen3.7-Max дешевле у Together, а Kimi K3 — у DeepInfra.
Отсюда порядок действий. Сначала выберите модель — сравнение моделей по цене собрано в статье «Сравнение цен AI API: какая модель дешевле для вашей нагрузки». Затем для этой модели сравните каналы по фактическому счёту: прайс, комиссия за пополнение, непиковые часы или пакетный режим (Batch), точная версия модели. И только после пробного прогона на своих промптах переводите продакшен-трафик.
Четыре канала и что каждый из них продаёт
Одну и ту же модель можно купить четырьмя способами, и в каждом случае вы заключаете разный договор.
| Канал | Примеры | Что вы покупаете | Когда он дешевле | Что проверить |
|---|---|---|---|---|
| Напрямую у владельца модели | DeepSeek, OpenAI, Anthropic, Google, xAI | Текущую официальную версию по прайсу владельца | Непиковые часы DeepSeek, Batch и Flex у OpenAI, Batch у Gemini — вдвое ниже обычной цены | Можете ли вы открыть аккаунт и оплатить его, лимиты запросов |
| Хостинг открытых весов | Together, DeepInfra, Fireworks | Запуск открытой модели на серверах хостера по его прайсу | Когда хостер ставит цену ниже официальной или продаёт более старый снимок модели | Версию и дату снимка, точность весов, контекст, цену кэша |
| Роутер или API-шлюз | OpenRouter, laozhang.ai | Один ключ и один адрес для моделей разных владельцев | Редко дешевле по токенам; выигрывает на интеграции и переключении моделей | Комиссию, наценку или множитель, кто фактически обработал запрос |
| Местный посредник с оплатой в рублях | ProxyAPI, AITUNNEL, VseGPT, Serverspace | Доступ по договору посредника, его цены и его условия | Когда прямой канал вам недоступен | Кто стоит за ним, какой источник модели, курс, возвраты, хранение данных |
Главное различие — открытые и закрытые модели. Хостинги открытых весов продают только модели с опубликованными весами: DeepSeek, Kimi, Qwen, GLM, gpt-oss. Закрытые GPT-6, Claude, Gemini и Grok они не запускают, поэтому для них выбор сводится к владельцу или посреднику, который перепродаёт доступ к API владельца. У закрытых моделей самый крупный рычаг экономии находится у самого владельца: у OpenAI режимы Batch и Flex стоят вдвое меньше обычного, у Gemini вдвое дешевле режим Batch. Расчёты по конкретным владельцам разобраны в статьях «Claude API или OpenAI API: где дешевле при вашей нагрузке» и «Цена Grok API: grok-4.7, grok-4.3 и расчёт месячного бюджета».
Для открытых моделей сравнение каналов действительно меняет счёт — это видно на DeepSeek.
Одна модель в разных каналах: расчёт по DeepSeek
DeepSeek удобен как пример: модели с открытыми весами продаёт и сам DeepSeek, и хостинги. У владельца действуют два тарифа по времени. Пиковый — по будням с 01:00 до 04:00 и с 06:00 до 10:00 UTC, то есть с 04:00 до 07:00 и с 09:00 до 13:00 по Москве, кроме праздничных дней в Китае. В остальное время, включая выходные, цена ровно вдвое ниже (официальный прайс DeepSeek).
Цены за 1 млн токенов по состоянию на 26 сентября 2026 года:
| Канал | Модель в прайсе | Ввод | Ввод из кэша | Вывод |
|---|---|---|---|---|
| DeepSeek, пик | deepseek-v4-pro (V4-Pro-0813) | $1,32 | $0,044 | $3,96 |
| DeepSeek, вне пика | deepseek-v4-pro (V4-Pro-0813) | $0,66 | $0,022 | $1,98 |
| Together | DeepSeek V4 Pro 0813 | $1,32 | $0,13 | $3,96 |
| DeepInfra | DeepSeek-V4-Pro | $1,30 | $0,10 | $2,60 |
| DeepSeek, пик | deepseek-flash (V4.1-Flash) | $0,30 | $0,006 | $1,20 |
| DeepSeek, вне пика | deepseek-flash (V4.1-Flash) | $0,15 | $0,003 | $0,60 |
| Together | DeepSeek V4.1 Flash | $0,30 | $0,006 | $1,20 |
Возьмём месячную нагрузку в 100 млн входных и 20 млн выходных токенов без кэша. Стоимость = 100 × цена ввода + 20 × цена вывода:
- DeepSeek V4 Pro вне пика: 100 × 0,66 + 20 × 1,98 = $105,60;
- DeepInfra: 100 × 1,30 + 20 × 2,60 = $182,00;
- DeepSeek V4 Pro в пик и Together: 100 × 1,32 + 20 × 3,96 = $211,20;
- DeepSeek V4.1 Flash вне пика: 100 × 0,15 + 20 × 0,60 = $27,00;
- DeepSeek V4.1 Flash в пик и Together: 100 × 0,30 + 20 × 1,20 = $54,00.

Из этих цифр следуют три правила.
Если нагрузку можно сдвинуть на непиковые часы, прямой DeepSeek дешевле всех. Ночная обработка, пакетные задачи и всё, что можно запускать в будни вне окон 04:00–07:00 и 09:00–13:00 по Москве, обходятся у владельца в 1,7 раза дешевле, чем у DeepInfra, и вдвое дешевле, чем у Together. Как планировать такие задачи, разобрано в статье «Тарифы DeepSeek V4 по часам: как считать API и планировать пакетные задачи».
Если запросы идут в рабочие часы, хостинг может выиграть. В пик DeepInfra по V4 Pro дешевле владельца примерно на 14 %: $182 против $211,20. Выигрыш создаёт в основном вывод — $2,60 против $3,96.
Together по этим двум моделям никогда не дешевле владельца. Его строки совпадают с пиковыми ценами DeepSeek, а непиковой скидки в прайсе нет. С кэшем разрыв растёт: кэшированный ввод V4 Pro у Together стоит $0,13 против $0,044 у DeepSeek в пик. Если половина из тех же 100 млн входных токенов приходит из кэша, в пик получается 50 × 1,32 + 50 × 0,044 + 20 × 3,96 = $147,40 у DeepSeek, 50 × 1,32 + 50 × 0,13 + 20 × 3,96 = $151,70 у Together и 50 × 1,30 + 50 × 0,10 + 20 × 2,60 = $122,00 у DeepInfra.
Одна оговорка: в строке DeepInfra нет даты снимка, поэтому перед переносом нагрузки откройте карточку модели и убедитесь, что там та же V4-Pro-0813, которую отдаёт DeepSeek.
Ни один хостинг не дешевле всех
Рейтинги «самых дешёвых провайдеров» не работают потому, что хостеры назначают цену отдельно на каждую модель. На одинаковой нагрузке 100 млн входных и 20 млн выходных токенов:
| Модель | Together, ввод / вывод | DeepInfra, ввод / вывод | Месяц у Together | Месяц у DeepInfra |
|---|---|---|---|---|
| DeepSeek V4 Pro | $1,32 / $3,96 | $1,30 / $2,60 | $211,20 | $182,00 |
| Kimi K3 | $3,00 / $15,00 | $2,85 / $14,25 | $600,00 | $570,00 |
| Qwen3.7-Max | $1,50 / $4,50 | $2,50 / $7,50 | $240,00 | $400,00 |
DeepInfra выигрывает по DeepSeek и Kimi, Together — по Qwen3.7-Max, причём по Qwen разница заметно больше: $160 в месяц. Поэтому сравнивайте каналы по конкретной модели, а не по «репутации дешёвого хостинга». Это касается и Fireworks: у него оплата за токены по факту (постоплата) и $1 бесплатного кредита на старте, а цены по отдельным моделям опубликованы в его документации.
Кроме DeepSeek, у хостингов есть и другие недорогие открытые модели: у Together gpt-oss-120B стоит $0,15 за ввод и $0,60 за вывод, GLM-5.3-Flash — $0,15 и $0,50; чем эта модель отличается и где её запускать, описано в статье «GLM-5.3-Flash: что скрывалось под именем Ox Alpha и как выбрать способ запуска».
Четыре ловушки дешёвой строки в прайсе
Цена хостера равна пиковой официальной
Хостер может выглядеть как «альтернатива» владельцу, но брать столько же, сколько владелец в самые дорогие часы. Together по DeepSeek V4 Pro и V4.1 Flash — именно такой случай. Сравнивайте строку хостера не с единственной «официальной ценой», а с тем тарифом владельца, который реально применится к вашему расписанию.
Похожее имя, другая версия
Официальный API DeepSeek сейчас обслуживает модель deepseek-flash на базе V4.1-Flash; прежнее имя deepseek-v4-flash выведено из употребления и тоже отдаётся V4.1-Flash по цене Flash. Хостинги при этом продолжают продавать более старые снимки с открытыми весами:
- DeepSeek V4 Flash 0731 у Together — $0,14 за ввод и $0,28 за вывод;
- DeepSeek-V4-Flash-0731 у DeepInfra — $0,06 и $0,18;
- DeepSeek-V4-Flash у DeepInfra — $0,09 и $0,18, без даты снимка в названии.
На той же месячной нагрузке снимок 0731 у DeepInfra стоит 100 × 0,06 + 20 × 0,18 = $9,60 против $27 у DeepSeek V4.1 Flash вне пика. Это почти в три раза дешевле, но это другая, более ранняя модель. Её качество на ваших задачах нужно проверять отдельно, а не переносить на неё выводы о V4.1-Flash.

С версией связана и точность: дешёвый хостер может запускать модель с пониженной точностью весов (квантизацией). Иногда это видно прямо в названии — у Together есть строка «Qwen3 235B A22B Instruct 2507 FP8 Throughput». Если точность не указана, ищите её в карточке модели и проверяйте качество на своём наборе промптов.
Комиссия поверх сквозных цен роутера
OpenRouter пишет, что передаёт цены поставщиков без наценки на инференс, но берёт комиссию при покупке кредитов: 5,5 % на тарифе Standard и 8 % на Business (тарифы OpenRouter). При пополнении на $500 комиссия Standard составит $27,50. Если запросы к DeepSeek V4 Pro обработает поставщик с ценой DeepInfra, месяц обойдётся примерно в 182 × 1,055 ≈ $192 — всё ещё дешевле пика у владельца, но заметно дороже его непикового тарифа.
Со своими ключами поставщиков (BYOK) на тарифах Standard и Business первые $25 000 инференса в месяц по прайсовой цене идут без комиссии, дальше — 5 %. Бесплатный тариф без комиссии даёт доступ к 25+ бесплатным моделям, но ограничен 50 запросами в день и не поддерживает BYOK.
Самопровозглашённые рейтинги и цифры без модели
Сервис, который ставит себя на первое место в списке «самых дешёвых провайдеров», сообщает о своей позиции, а не результат сравнения. Цифра вида «от $0,00… за 1 млн токенов» без названия модели, версии и типа токенов тоже ничего не говорит. На странице DeepInfra, например, кэшированный ввод DeepSeek-V4-Flash-Vision-Exp стоит $0,0069 за 1 млн, но обычный ввод той же модели — $0,2156, а вывод — $0,6468. Самая маленькая цифра на странице описывает частный случай, а не цену модели.
Роутер или шлюз: когда удобство окупает разницу
Роутер со сквозными ценами не снижает цену токенов, но может снизить общие затраты. OpenRouter на платных тарифах даёт один API к 500+ моделям от 80+ поставщиков, автоматическую маршрутизацию, бюджеты и лимиты расходов. Это окупается, когда вы используете модели нескольких владельцев, часто переключаетесь между ними или не хотите вести отдельный аккаунт и баланс у каждого.
laozhang.ai — API-шлюз от команды этого блога, и к нему применимы те же проверки, что и к любому посреднику. Что он даёт по документации:
- один адрес
https://api.laozhang.ai/v1для OpenAI-совместимых клиентов, формат Anthropic Messages по пути/v1/messagesи формат Gemini; резервный хостapi2.laozhang.aiна случай, если основной недоступен из вашей сети; - предоплаченный баланс: в зависимости от модели списание идёт за токены или за вызов, а у некоторых групп ключей действует множитель цены;
- содержимое запросов и ответов по умолчанию не хранится; хранятся служебные метаданные — время, модель, объём, статус, задержка;
- оператор — сингапурская компания YingTu Technology Pte. Ltd., оплата через Stripe, для регистрации нужен адрес Gmail, доступ открывают после проверки заявки.
laozhang.ai не является официальным оператором моделей. Цена конкретной модели — на странице «Models and pricing» и в консоли; умножьте её на множитель своей группы и сравните с официальной строкой владельца на той же нагрузке. Подробнее о том, когда шлюз уместен для Claude, — в статье «Как выбрать стабильный доступ к Claude: прямой Anthropic, поддерживаемое облако или шлюз laozhang.ai?».
Если вам нужна одна открытая модель и задачи можно сдвинуть на непиковые часы, никакой роутер или шлюз не будет дешевле прямого канала. Шлюз выигрывает на другом: единый ключ, единый счёт и переключение моделей без переписывания кода.
Местные агрегаторы с оплатой в рублях
ProxyAPI, AITUNNEL, VseGPT, Serverspace и похожие сервисы продают доступ по собственному договору: в рублёвую цену входят их курс, наценка и условия. Сравнивать такой прайс с долларовой строкой владельца напрямую нельзя — сначала переведите его в доллары за 1 млн токенов по курсу, по которому вы фактически пополняете баланс. Перед оплатой выясните:
- какая компания принимает деньги и отвечает за сервис;
- откуда берётся модель — официальный API владельца или хостинг, и какой снимок стоит за названием;
- цену ввода, кэша и вывода отдельно, а также комиссию за пополнение и минимальный платёж;
- списываются ли неудачные вызовы и повторы, какие лимиты запросов;
- можно ли вернуть неиспользованный остаток;
- хранятся ли тексты запросов и ответов и кто их видит;
- выдаёт ли сервис закрывающие документы, если вы платите от компании.
Какие сервисы и бесплатные квоты доступны российским пользователям, разобрано в статье «Бесплатный AI API: какой выбрать и что доступно из России».
Стоимость принятого результата
Прайс сравнивает цену токена, а платите вы за результат. Формула для сравнения каналов:
стоимость принятого ответа = полный счёт за пробный прогон / число ответов, прошедших вашу проверку
В полный счёт входят повторы после ошибок и тайм-аутов, комиссия за пополнение и лишние токены, если модель пишет длиннее. Если канал продаёт ту же версию модели с той же точностью весов, доля принятых ответов почти не должна меняться, и решает цена. Если за дешёвой строкой стоит другой снимок, решают оба множителя.
Условный пример. 1 000 задач по 10 000 входных и 2 000 выходных токенов — это 10 млн ввода и 2 млн вывода. Снимок DeepSeek-V4-Flash-0731 у DeepInfra: 10 × 0,06 + 2 × 0,18 = $0,96. DeepSeek V4.1 Flash вне пика: 10 × 0,15 + 2 × 0,60 = $2,70. Старый снимок остаётся выгоднее, пока его доля принятых ответов не упадёт ниже 0,96 / 2,70 ≈ 36 % от доли у V4.1 Flash. Если V4.1 Flash принимается в 90 % случаев, порог для снимка — около 32 %. В расчёт не входит время на проверку отклонённых ответов: когда их разбирает человек, порог сдвигается в пользу более качественной модели.
Чек-лист перед переводом продакшен-трафика
- Версия. ID модели, дата снимка, контекст и точность весов в выбранном канале совпадают с тем, что вы тестировали.
- Прайс для ваших токенов. Ввод, кэшированный ввод, вывод и отдельно оплачиваемые позиции (запросы, изображения, токены рассуждений) взяты из текущей строки канала.
- Время. Понятно, какая часть трафика попадает в пиковые часы DeepSeek и что можно перенести в непиковое окно или Batch.
- Сборы сверху. Учтены комиссия за пополнение, множитель группы, курс и минимальный платёж.
- Пробный прогон. Один и тот же набор промптов прошёл через все каналы-кандидаты; записаны токены, ошибки, повторы, задержка и число принятых ответов.
- Ошибки и лимиты. Известно, списываются ли неудачные вызовы, и лимиты RPM/TPM выдерживают ваш пик нагрузки.
- Данные. Если в промптах бывают персональные данные, секреты или код клиентов, сначала пройдите проверку хранения данных и Zero Data Retention для конкретного канала.
- Постепенный запуск. Новый канал получает небольшую долю трафика с лимитом расходов, запасным каналом и планом отката; понятно, кто отвечает, если откажет модель у поставщика.
Если хотя бы один пункт остаётся без ответа, дешёвая строка в прайсе пока не означает дешёвый продакшен.
Частые вопросы
Какой LLM API провайдер самый дешёвый?
Единого ответа нет: хостеры назначают цену отдельно для каждой модели, а у DeepSeek цена зависит ещё и от часа. По состоянию на 26 сентября 2026 года DeepSeek V4 Pro дешевле всего напрямую у DeepSeek вне пика ($105,60 за 100 млн входных и 20 млн выходных токенов), в пиковые часы — у DeepInfra ($182). Kimi K3 у DeepInfra дешевле, чем у Together, а Qwen3.7-Max, наоборот, дешевле у Together.
Выгоднее ли агрегатор или роутер, чем прямой API?
По цене токенов — почти никогда. OpenRouter передаёт цены поставщиков без наценки, но берёт 5,5 % при пополнении на тарифе Standard. Агрегатор выгоден, когда экономит работу: один ключ на модели разных владельцев, единый счёт, переключение без переписывания кода или доступ там, где прямой канал недоступен.
Какие провайдеры LLM доступны в России?
Это зависит от того, кто принимает вашу оплату и обслуживает ваш регион, а условия владельцев моделей меняются. Официальные варианты и бесплатные квоты разобраны в статье «Бесплатный AI API: какой выбрать и что доступно из России». Рублёвые агрегаторы — это отдельный договор: сравнивайте их по списку вопросов из раздела про местных посредников.
Ухудшает ли квантизация качество у дешёвых хостингов?
Может, но заранее по прайсу этого не узнать. Точность весов иногда указана в названии модели (например, FP8), иногда только в карточке модели. Надёжный способ — прогнать один и тот же набор промптов через хостинг и официальный API и сравнить долю принятых ответов.





