Claude Fable 5.1 в прямом Claude API стоит 10 долларов за миллион входных токенов без кэша и 50 долларов за миллион выходных. Повторное чтение сохранённого префикса обходится в 0,25 доллара за миллион токенов, но его первоначальная запись оплачивается дороже обычного ввода. Пакетная обработка Message Batches уменьшает все эти тарифы на токены вдвое. Цены проверены 19 сентября 2026 года по официальной таблице Anthropic.
Для расчёта бюджета нужны фактические категории usage, а не только длина запроса или видимого ответа. Ниже — тарифы в USD за миллион токенов, формула и примеры для прямого API с обычной глобальной обработкой. Налоги, индивидуальные договоры и тарифы посредников в расчёт не входят.
Сколько стоит каждый тип токенов
У модели claude-fable-5-1 запись кэша, чтение кэша и обычный ввод — разные оплачиваемые операции. Один и тот же фрагмент при первом запросе может попасть в категорию записи, а при следующем — в категорию чтения.
| Категория токенов | Обычный запрос, USD за 1 млн | Message Batches, USD за 1 млн |
|---|---|---|
| Ввод без кэша | 10,00 | 5,00 |
| Запись кэша на 5 минут | 12,50 | 6,25 |
| Запись кэша на 1 час | 20,00 | 10,00 |
| Чтение кэша | 0,25 | 0,125 |
| Вывод | 50,00 | 25,00 |
В столбце Batch скидка уже учтена: повторно делить эти ставки на два нельзя. Anthropic указывает, что скидка пакетной обработки сочетается с коэффициентами кэширования; приведённые ставки Batch рассчитаны из официальных тарифов.
Дешевле стало именно чтение: у Fable 5 оно стоило 1 доллар за миллион токенов, у Fable 5.1 — 0,25 доллара. Снижение на 75% относится к этой строке, а не ко всему счёту. Если запросы почти не используют кэш или генерируют длинные ответы, общая экономия будет другой. Базовые ставки ввода, вывода и записи кэша при переходе с Fable 5 не изменились. См. описание Fable 5.1.
Для контекста до 1 млн токенов действуют те же ставки: отдельной надбавки за длинный контекст нет. Однако объём по-прежнему оплачивается. Например, миллион обычных входных токенов стоит 10 долларов до учёта ответа — даже если они помещаются в один запрос.
Как восстановить стоимость из usage
Главная ловушка — принять input_tokens за весь входящий контекст. В ответе Claude API это только входные токены, которые не были записаны в кэш или прочитаны из него. Для полного расчёта нужны отдельные поля, описанные в документации по учёту кэширования.
Что берём из usage | Как учитываем в счёте |
|---|---|
input_tokens | Ввод без кэша |
cache_creation.ephemeral_5m_input_tokens | Запись с TTL 5 минут |
cache_creation.ephemeral_1h_input_tokens | Запись с TTL 1 час |
cache_read_input_tokens | Чтение кэша |
output_tokens | Оплачиваемый вывод |
Поле cache_creation_input_tokens — общая сумма записанных токенов. Если вы уже использовали разбивку на 5 минут и 1 час, не прибавляйте к ней эту сумму ещё раз. Для проверки общего объёма ввода складывайте обычный ввод, суммарную запись и чтение; для расчёта цены сохраняйте категории раздельными.
Обозначим число токенов без кэша как U, запись на 5 минут как W5, запись на час как W60, чтение как R, вывод как O. Тогда стоимость обычного запроса в долларах:
textСтоимость = (10 × U + 12,5 × W5 + 20 × W60 + 0,25 × R + 50 × O) / 1 000 000
Например, после суммирования usage за день получились следующие объёмы. Это условный расчёт, а не результат замера или реальный счёт.
| Категория | Токенов за день | Стоимость, USD |
|---|---|---|
| Ввод без кэша | 120 000 | 1,20 |
| Запись на 5 минут | 400 000 | 5,00 |
| Запись на 1 час | 200 000 | 4,00 |
| Чтение кэша | 3 200 000 | 0,80 |
| Вывод | 80 000 | 4,00 |
| Итого | 3 920 000 входных + 80 000 выходных | 15,00 |

Здесь наиболее объёмная категория — чтение кэша — стоит меньше каждой категории записи. Но если использовать для всего ввода ставку 0,25 доллара, оценка окажется сильно заниженной. Если, наоборот, умножить все 3,92 млн входных токенов на 10 долларов, вы не учтёте уже состоявшиеся попадания в кэш.
output_tokens важнее длины видимого ответа. Токены рассуждений входят в оплачиваемый вывод: их нельзя игнорировать, но и нельзя второй раз прибавлять к показателю, который их уже учитывает. Anthropic отдельно объясняет оплату токенов рассуждений. Для предварительной оценки используйте подсчёт токенов, а для сверки — возвращённый usage; постоянного коэффициента «символы русского текста → токены» для точного бюджета недостаточно.
Когда кэш на 5 минут или на час окупается
Кэш выгоден, когда API действительно повторно использует один и тот же префикс. Само наличие cache_control ещё не означает, что следующий запрос будет оплачен как чтение. Для Fable 5.1 минимальный кэшируемый объём составляет 512 токенов; более короткий префикс обрабатывается без кэша и без ошибки кэширования. Условия и ограничения приведены в документации Prompt caching.
Чтобы понять окупаемость, отделите неизменный префикс — например, инструкции и справочник — от новых сообщений и ответа. Рассмотрим префикс на 20 000 токенов, который записывается один раз, а затем читается до истечения TTL. Новые данные и вывод в этой таблице не учитываются: они одинаковы в сравниваемых вариантах.
| Использований одного префикса | Без кэша, USD | Кэш на 5 минут, USD | Кэш на 1 час, USD |
|---|---|---|---|
| 1: только первый запрос | 0,200 | 0,250 | 0,400 |
| 2: запись и одно чтение | 0,400 | 0,255 | 0,405 |
| 3: запись и два чтения | 0,600 | 0,260 | 0,410 |
При этих предпосылках пятиминутный кэш окупается при первом повторном использовании, часовой — при втором. Часовой вариант после единственного чтения всё ещё немного дороже двух обычных отправок. Это сравнение расходов на префикс, а не обещание такой же экономии для всего запроса.
Практический выбор зависит от интервалов. Если обращения идут часто, пятиминутного TTL может хватать надолго: каждое попадание продлевает срок жизни кэша без повторной платы за запись. Само чтение при этом оплачивается. TTL отсчитывается от начала запроса, который записывает или читает кэш, а не от момента получения ответа. Если обращения приходят раз в 10–15 минут, часовой кэш способен сократить число новых записей, но сначала стоит проверить фактическое повторное использование.

Автоматическое кэширование включается верхнеуровневым параметром cache_control. По умолчанию срок хранения составляет 5 минут; для часа укажите TTL явно:
json{ "cache_control": { "type": "ephemeral", "ttl": "1h" } }
Это фрагмент тела запроса, а не полный пример вызова API. Настройка должна сопровождаться подходящим по длине повторяемым префиксом.
После истечения TTL следующий подходящий запрос снова оплачивает запись. Если же изменились начало системной инструкции, определения инструментов, предыдущие сообщения или верхнеуровневая настройка effort, соответствующая часть префикса может перестать совпадать с сохранённой. Поэтому диагностируйте расходы по росту cache_creation_input_tokens и падению cache_read_input_tokens, а не по одному факту включения кэша.
В длинном диалоге история тоже участвует во входе. Очередное сообщение не обязательно оплачивается только за новый текст: передаваемая история вновь относится к чтению, записи или обычному вводу. Суммируйте usage всех запросов диалога. Это особенно важно при прогнозе цены поддержки клиента или многошаговой обработки документа.
Batch снижает тариф, но не гарантирует попадания в кэш
Message Batches подходит для задач, результат которых можно получить позже: например, ежедневной классификации отзывов или извлечения данных из накопившихся документов. Это асинхронная обработка без потоковой выдачи ответа. По документации Batch, большинство пакетов завершается в течение часа, но обработка может длиться до 24 часов; незавершённые запросы затем истекают.
Если бы условные дневные объёмы из расчёта выше остались точно такими же, токены в Batch стоили бы 7,50 вместо 15,00 доллара. Это корректный пересчёт одинакового usage. Но заранее обещать такую сумму нельзя: запросы в пакете выполняются асинхронно и параллельно, поэтому совместное использование кэша работает по принципу best effort. Нельзя считать, что первый элемент пакета обязательно создаст кэш для всех остальных.
Разницу видно на простой модели нагрузки. Пусть 100 запросов содержат общий префикс на 20 000 токенов, а новые данные и вывод временно исключены из расчёта. При пятиминутном кэше в Batch:
- одна запись и 99 чтений префикса стоят 0,3725 доллара;
- 100 записей без единого чтения стоят 12,50 доллара;
- 100 отправок без кэша стоят 10,00 доллара.
Это три условных набора оплачиваемых операций, а не прогноз работы конкретного пакета. Они показывают, почему низкая ставка чтения бесполезна без попаданий: оплачивать повторную запись иногда дороже, чем отправлять данные без кэша. Часовой TTL может помочь при растянутой обработке, но его более высокую цену нужно сопоставлять с реальными показателями usage.
Перед запуском большой очереди сохраните для каждого элемента собственный custom_id. Сопоставляйте результаты по нему: порядок выдачи не гарантируется. Ограничение одного пакета — 100 000 запросов или 256 МБ, смотря что будет достигнуто раньше; результаты хранятся 29 дней с момента создания пакета. Эти условия описаны в руководстве по пакетной обработке.
При сверке затрат различайте статус API и качество ответа. Запросы со статусами errored, canceled и expired не оплачиваются согласно правилам Batch. Успешный succeeded с ответом, который не устроил вашу проверку качества, уже израсходовал токены. Его успешный повторный запуск создаст новые расходы.
Какие расходы добавить к токенам
Для прямого Claude API параметр inference_geo: "us" увеличивает на 10% стоимость всех категорий токенов. При Batch коэффициенты сочетаются: базовая сумма умножается на 0,5 и на 1,1. Поэтому условные 15 долларов превращаются в 8,25 доллара при одинаковом usage, пакетной обработке и выбранной географии US. Это правило прямого API, а не универсальная надбавка для AWS Bedrock или Google Cloud.
Инструменты могут давать два вида расходов. Их описания и результаты увеличивают входной контекст, а серверные инструменты могут иметь отдельную плату за использование. Например, веб-поиск стоит 10 долларов за 1 000 поисков сверх стоимости токенов по таблице Anthropic. Скидку Batch на токены не следует автоматически переносить на такие сервисные сборы.
Платёж за подписку Claude также не подставляется в эту формулу: здесь рассчитываются отдельные расходы прямого API. Рублёвый тариф стороннего сервиса может включать свою наценку и собственные правила учёта. Для сравнения запросите у сервиса ставки по тем же категориям, а не приравнивайте цену в рублях к официальному тарифу Anthropic.
Что измерить перед утверждением бюджета
Начните с небольшой выборки реальной нагрузки. Сохраняйте модель, режим обработки, географию, все пять категорий токенов и отдельно платные вызовы инструментов. Для диалогов складывайте запросы целиком, для Batch привязывайте успешные результаты и повторные попытки к исходным задачам.
Затем сравните общую стоимость с числом результатов, которые прошли вашу проверку качества. Такой расчёт показывает цену полезного результата: длинный ответ, повторная попытка или постоянная перезапись кэша могут оказаться важнее номинальной скидки. Выбирайте TTL по фактическим интервалам повторного использования, а Batch — по допустимому времени ожидания и измеренным категориям usage.
Если вы ещё решаете, какую модель подключать и что менять при переходе, начните с руководства по миграции на Claude Fable 5.1. Для расчёта уже выбранной интеграции достаточно сохранить исходные объёмы, применить актуальные ставки и отдельно учесть инструменты: тогда следующую смену цен можно будет пересчитать без догадок о составе старого счёта.



