Сравнение цен AI API: какая модель дешевле для вашей нагрузки
На 26 сентября 2026 года ниже всех официальный прайс у GPT-6 Luna, следом DeepSeek Flash вне пиковых часов; среди моделей за $2 порядок решает доля output.
Содержание

По состоянию на 26 сентября 2026 года самый низкий официальный прайс среди OpenAI, Anthropic, Google, xAI и DeepSeek у GPT-6 Luna: $0,10 за 1 млн входных токенов (input) и $0,50 за 1 млн выходных (output). Следом идёт DeepSeek Flash, но только вне пиковых часов: $0,15 и $0,60, в пиковые часы вдвое дороже. Среди моделей с input за $2 одинаковая цена входа ничего не решает: у Grok 4.7 output стоит $6, у GPT-6 Sol и Claude Sonnet 5 — $10, у Gemini 3.1 Pro Preview — $12, поэтому чем больше модель пишет, тем заметнее отрыв Grok.
Все цены ниже — официальные прайсы владельцев моделей в долларах США за 1 млн токенов: стандартная обработка, короткий контекст, без кэша, если не сказано иное. Порядок в таблице меняют пять вещей: соотношение input и output, доля попаданий в кэш, готовность задачи ждать (пакетная обработка), длина промпта и, у DeepSeek, время вызова. Прайсы меняются, а у Gemini 3.8 Flash повышение уже объявлено, поэтому перед пополнением баланса откройте страницу цен выбранного поставщика.
Официальные цены по ступеням
Ступени в таблицах ценовые, а не рейтинг качества. xAI, например, называет Grok 4.7 своей флагманской моделью, но по цене он стоит рядом с GPT-6 Sol. Колонка «Input из кэша» — цена входных токенов при попадании в кэш.
Нижняя ступень: input до $1,50
| Модель | Input | Output | Input из кэша | Что меняет цену |
|---|---|---|---|---|
| GPT-6 Luna | $0,10 | $0,50 | $0,01 | промпт длиннее 272 тыс. токенов: весь запрос по $0,20 / $0,75 |
| DeepSeek Flash | $0,15 вне пика, $0,30 в пик | $0,60 / $1,20 | $0,003 / $0,006 | время вызова |
| Gemini 3.1 Flash-Lite | $0,25 (аудио $0,50) | $1,50 | $0,025 | есть бесплатный уровень |
| Gemini 3.5 Flash-Lite | $0,30 | $2,50 | — | пакетная обработка вдвое дешевле |
| DeepSeek V4-Pro | $0,66 вне пика, $1,32 в пик | $1,98 / $3,96 | $0,022 / $0,044 | время вызова |
| Gemini 3.8 Flash | $0,75 до 31.12.2026, с 1.01.2027 — $1,50 | $3,75, затем $7,50 | $0,075 плюс хранение $0,50 за 1 млн токенов в час | вводная цена заканчивается; output включает токены рассуждений |
| Claude Haiku 4.5 | $1 | $5 | $0,10 | запись в кэш дороже input: $1,25 на 5 минут, $2 на час |
У DeepSeek модель deepseek-flash сейчас обслуживает DeepSeek-V4.1-Flash. Старое имя deepseek-v4-flash выведено из употребления, но запросы с ним принимаются и тарифицируются по цене Flash, так что прежняя пара $0,14 / $0,28 больше не действует.
Средняя ступень: input $2
| Модель | Input | Output | Input из кэша | Что меняет цену |
|---|---|---|---|---|
| Grok 4.7 | $2 | $6 | $0,50 | промпт от 200 тыс. токенов: весь запрос по $4 / $12, кэш $1; пакетного режима нет |
| GPT-6 Sol | $2 | $10 | $0,20 | промпт длиннее 272 тыс.: весь запрос по $4 / $15 |
| Claude Sonnet 5 | $2 | $10 | $0,20 | весь контекст до 1 млн токенов по базовой цене |
| Gemini 3.1 Pro Preview | $2 до 200 тыс. токенов, $4 выше | $12 / $18 | — | порог 200 тыс. токенов в промпте |
Запланированное повышение цены Sonnet 5 до $3 / $15 отменили, подробности — в статье Повышение цен Claude Sonnet 5 отменили: как пересчитать расходы на API.
Верхняя ступень: флагманы
| Модель | Input | Output | Input из кэша | Что меняет цену |
|---|---|---|---|---|
| Claude Opus 5.5 | $4 | $20 | $0,20 | быстрый режим (Fast mode): $8 / $40 |
| GPT-6 Astra | $10 | $50 | $1 | промпт длиннее 272 тыс.: весь запрос по $20 / $75 |
| Claude Fable 5.1 | $10 | $50 | $0,25 | кэш стоит всего 2,5 % от input |
Где в колонке кэша стоит прочерк, цену кэширования уточняйте на странице Gemini API. Цены взяты со страниц OpenAI, Anthropic, Gemini API (именно Gemini Developer API с ключом из AI Studio, не Vertex AI), xAI и DeepSeek.
Какие условия меняют цену строки
Одно число в таблице верно только для стандартного режима и короткого промпта. Вот что сдвигает фактическую цену и у кого:
| Условие | Кого касается | Как меняется счёт |
|---|---|---|
| Доля output | всех | output дороже input в 3–8 раз (у Grok 4.7 в 3 раза, у Gemini 3.5 Flash-Lite более чем в 8), поэтому генерация длинных текстов меняет порядок моделей |
| Время вызова | DeepSeek | пиковые часы по будням 01:00–04:00 и 06:00–10:00 UTC, то есть 04:00–07:00 и 09:00–13:00 по Москве; в это время все строки вдвое дороже. Выходные и китайские праздники целиком идут по сниженной цене |
| Попадание в кэш | все пять поставщиков | у OpenAI кэш стоит 10 % от input, у Grok 4.7 — 25 %; у Anthropic 10 % для Haiku 4.5 и Sonnet 5, 5 % для Opus 5.5 и 2,5 % для Fable 5.1. Запись в кэш у OpenAI и Anthropic дороже обычного input, у Gemini 3.8 Flash платится ещё хранение |
| Пакетная обработка (Batch) и Flex | Batch у OpenAI, Anthropic и Gemini, Flex у OpenAI | ровно половина стандартной цены, если ответ может прийти не сразу; Grok 4.7 пакетный режим не поддерживает |
| Длинный промпт | OpenAI, xAI, Gemini 3.1 Pro | у GPT-6 после 272 тыс. токенов input и кэш ×2, output ×1,5 для всего запроса, а не только для хвоста; у Grok 4.7 с 200 тыс. весь запрос вдвое дороже; у Gemini 3.1 Pro порог 200 тыс.; у Claude 4.6 и новее надбавки нет до 1 млн |
| Дата | Gemini 3.8 Flash | с 1 января 2027 года все строки вдвое дороже |
| Быстрый режим | OpenAI, Anthropic, xAI | Fast mode у OpenAI (раньше назывался Priority) и приоритетная обработка (Priority) у xAI вдвое дороже стандарта; у Opus 5.5 быстрый режим стоит $8 / $40 |
| Резидентность данных | OpenAI, xAI | у OpenAI региональная обработка данных плюс 10 % для моделей, вышедших 5 марта 2026 года и позже; у xAI запросы через региональную точку доступа в США тарифицируются по ставке ×1,1 |
Месячный счёт на двух примерах
Формула одна для всех: стоимость = input в млн токенов × цена input + output в млн токенов × цена output. Ниже два месячных профиля. Допущения: стандартная обработка, без кэша, промпты короче 200 тыс. токенов, без повторов, инструментов и колебаний в объёме рассуждений. Это оценка по прайсу, а не реальный счёт.
- Профиль A, много input: поддержка или ответы по базе знаний, 300 млн входных и 30 млн выходных токенов в месяц.
- Профиль B, много output: генерация текстов или кода, 20 млн входных и 40 млн выходных.
| Модель | Профиль A | Профиль B |
|---|---|---|
| GPT-6 Luna | $45 | $22 |
| DeepSeek Flash, вне пика / в пик | $63 / $126 | $27 / $54 |
| Gemini 3.1 Flash-Lite | $120 | $65 |
| Gemini 3.5 Flash-Lite | $165 | $106 |
| DeepSeek V4-Pro, вне пика / в пик | $257,40 / $514,80 | $92,40 / $184,80 |
| Gemini 3.8 Flash, цена 2026 / 2027 | $337,50 / $675 | $165 / $330 |
| Claude Haiku 4.5 | $450 | $220 |
| Grok 4.7 | $780 | $280 |
| GPT-6 Sol | $900 | $440 |
| Claude Sonnet 5 | $900 | $440 |
| Gemini 3.1 Pro Preview | $960 | $520 |
| Claude Opus 5.5 | $1 800 | $880 |
| GPT-6 Astra | $4 500 | $2 200 |
| Claude Fable 5.1 | $4 500 | $2 200 |
Проверить любую строку просто. Grok 4.7 в профиле A: 300 × $2 + 30 × $6 = $780. Что видно из таблицы:
- Luna дешевле всех в обоих профилях, DeepSeek Flash вне пика рядом. В пиковые часы DeepSeek Flash в профиле A обходится в $126 и уже дороже Gemini 3.1 Flash-Lite ($120).
- DeepSeek V4-Pro вне пика в профиле B стоит $92,40 и оказывается дешевле Gemini 3.5 Flash-Lite ($106), хотя в профиле A дороже его больше чем в полтора раза.
- Grok 4.7 дешевле Sol и Sonnet 5 на 13 % в профиле A и на 36 % в профиле B: разница в цене output работает тем сильнее, чем больше модель пишет.
- Gemini 3.8 Flash по цене 2027 года в профиле A ($675) дороже Claude Haiku 4.5 ($450). Если бюджет считается на следующий год, берите $1,50 / $7,50.

Как кэш и пакетная обработка сдвигают счёт
Кэш окупается, когда большая часть промпта повторяется: одна и та же системная инструкция, одни и те же документы. Пример: профиль A на DeepSeek Flash вне пика, 60 % входных токенов попадают в кэш.
- 180 млн × $0,003 = $0,54 за попадания в кэш;
- 120 млн × $0,15 = $18 за промахи;
- 30 млн × $0,60 = $18 за output.
Итого $36,54 вместо $63. У DeepSeek в прайсе только две строки input, попадание и промах, а у OpenAI и Anthropic есть ещё отдельная плата за запись в кэш, поэтому выгода у них зависит от того, как часто кэш приходится перезаписывать.
Пакетная обработка просто делит счёт пополам. Профиль A на Gemini 3.1 Flash-Lite: 300 × $0,125 + 30 × $0,75 = $60 вместо $120. На GPT-6 Sol: 300 × $1 + 30 × $5 = $450 вместо $900. Это подходит для ночной разметки, извлечения полей и отчётов, но не для чата, где пользователь ждёт ответ.
Длинный промпт: где одинаковая цена расходится
GPT-6 Sol и Claude Sonnet 5 стоят одинаково, $2 / $10, пока промпт короче 272 тыс. токенов. Возьмём один запрос на 400 тыс. входных и 5 тыс. выходных токенов, без кэша:
| Модель | Какая цена применяется | Расчёт | Итог |
|---|---|---|---|
| GPT-6 Sol | длинный контекст на весь запрос: $4 / $15 | 0,4 × $4 + 0,005 × $15 | $1,675 |
| Claude Sonnet 5 | базовая, до 1 млн токенов | 0,4 × $2 + 0,005 × $10 | $0,85 |
| Gemini 3.1 Pro Preview | промпт больше 200 тыс.: $4 / $18 | 0,4 × $4 + 0,005 × $18 | $1,69 |

Если считать Sol по короткой цене, получится $0,85, то есть ошибка почти вдвое. Окно контекста у GPT-6 Sol 1 050 000 токенов, у Claude 4.6 и новее и у DeepSeek 1 млн, у Grok 4.7 500 тыс. Этот же запрос у Grok 4.7 целиком переходит на цену длинного контекста: 0,4 × $4 + 0,005 × $12 = $1,66. Как устроены такие запросы у старшей модели OpenAI, разобрано в статье GPT-6 Astra API: тарифы, доступ и стоимость длинного контекста.
Почему цифры на разных сайтах не совпадают
Первая причина — поколение моделей. Если в таблице стоят GPT-5.x, Claude Sonnet 4.6 или deepseek-v4-flash по $0,14 / $0,28, это цены прошлых релизов.
Вторая — посредники. Рублёвый прайс агрегатора или прокси-сервиса — это его собственный договор: в цену входят его курс, наценка и условия. Сравнивать такой прайс с официальным долларовым напрямую нельзя. У посредника отдельно выясните точный ID модели, единицу тарификации, списываются ли неудачные вызовы, работает ли кэш, какие лимиты, как устроены возвраты и где хранятся журналы запросов. Как сравнивать шлюзы по цене, качеству и задержке, разобрано в статье Самый дешевый LLM API провайдер: цена, качество, задержка и риск gateway.
Третья — токены считаются по-разному. Anthropic пишет, что токенизатор Claude 4.7 и новее даёт примерно на 30 % больше токенов для того же текста, чем прежний токенизатор Claude. Сколько токенов тот же русский текст займёт у OpenAI, Google или DeepSeek, прайс не говорит. Поэтому цены за 1 млн токенов у разных поставщиков сравнимы только приблизительно; точную картину даст прогон ваших же текстов и счётчик токенов в ответе API.
Бесплатный уровень — не цена для продакшена
У Gemini API на бесплатном уровне Gemini 3.8 Flash и Gemini 3.1 Flash-Lite не стоят ничего. Но данные с бесплатного уровня Google использует для улучшения своих продуктов, а с платного — нет. Поиск Google в ответах (Grounding with Google Search) даёт 5 000 бесплатных запросов в месяц на все модели Gemini 3.x, дальше $14 за 1 000. Для прототипа этого хватает, для клиентских данных и стабильной нагрузки нужен платный уровень. Лимиты бесплатных уровней у разных поставщиков собраны в обзоре Бесплатный AI API: какой выбрать и что доступно из России, а как оплатить Gemini API — в статье как купить доступ к Gemini API в России.
Как выбрать одну-две модели для теста
Сначала определите профиль, потом берите из таблицы две соседние модели:
- Много input, короткие ответы, задача может ждать. GPT-6 Luna и Gemini 3.1 Flash-Lite в пакетном режиме; DeepSeek Flash, если основные вызовы приходятся на время вне пика.
- Много output. Luna и DeepSeek Flash вне пика; если нужна модель уровня Sol или Sonnet, первым проверьте Grok 4.7 из-за output за $6.
- Промпты длиннее 272 тыс. токенов. Claude Sonnet 5 или Opus 5.5 без надбавки за длину; GPT-6 считайте по ценам длинного контекста.
- Бюджет на 2027 год. Gemini 3.8 Flash закладывайте по $1,50 / $7,50.
- Дешёвые модели не проходят по качеству. Поднимайтесь на одну ступень, а не сразу к флагманам: разница между Sol и Astra в профиле A — $900 против $4 500.
Потом прогоните одинаковые 20–50 реальных запросов через обе модели с одним и тем же системным промптом и лимитом длины ответа. Для каждого запроса запишите входные и выходные токены по счётчику API, число повторов и то, приняли ли вы ответ без правки. Разделите счёт на число принятых ответов: дешёвая модель, которую приходится перезапускать или править, может обойтись дороже соседней. Для агентов и пакетных задач поставьте лимит расходов на ключ до запуска.
Частые вопросы
Что дешевле: Claude API или OpenAI API?
Зависит от ступени. На нижней OpenAI заметно дешевле: GPT-6 Luna стоит $0,10 / $0,50 против $1 / $5 у Claude Haiku 4.5. На средней GPT-6 Sol и Claude Sonnet 5 стоят одинаково, пока промпт короче 272 тыс. токенов, а выше Sonnet 5 дешевле почти вдвое. Среди флагманов GPT-6 Astra и Claude Fable 5.1 стоят одинаково, $10 / $50. Подробный расчёт по задачам — в статье Claude API и OpenAI API: цены и расчёт стоимости задач.
DeepSeek всегда самый дешёвый?
Нет. По официальному прайсу GPT-6 Luna дешевле DeepSeek Flash в обоих профилях из примеров выше. Кроме того, в пиковые часы (по будням 04:00–07:00 и 09:00–13:00 по Москве) DeepSeek Flash вдвое дороже и при большом объёме input уступает Gemini 3.1 Flash-Lite. Как планировать вызовы по часам, описано в статье Тарифы DeepSeek V4 по часам: как считать API и планировать пакетные задачи.
Почему у посредника в рублях цена выше или ниже официальной?
Потому что это другой прайс: посредник продаёт доступ по своему договору, со своим курсом, наценкой и правилами списания. Официальная цена владельца модели указывается в долларах за 1 млн токенов. Прежде чем сравнивать, проверьте у посредника точный ID модели и списание за неудачные вызовы.
Сколько будет стоить Gemini 3.8 Flash после нового года?
С 1 января 2027 года вдвое больше: $1,50 за input и $7,50 за output вместо нынешних $0,75 и $3,75, кэш — $0,15 вместо $0,075. Пакетная обработка останется вдвое дешевле стандарта.





