Claude Platform Docs
Справочник APIПоддержка и конфигурация

Ограничения скорости

Чтобы предотвратить злоупотребления и управлять пропускной способностью API, установлены ограничения на то, в каком объёме организация может использовать Claude API.

Существует два типа ограничений:

  1. Лимиты расходов (spend limits) устанавливают максимальную ежемесячную сумму, которую организация может потратить на использование API.
  2. Ограничения скорости (rate limits) устанавливают максимальное количество запросов к API, которое организация может выполнить за определённый период времени.

API применяет настроенные сервисом ограничения на уровне организации, но вы также можете установить настраиваемые пользователем ограничения для рабочих пространств вашей организации.

Об ограничениях скорости

  • Ограничения разработаны для предотвращения злоупотреблений API при минимальном влиянии на типичные сценарии использования клиентами.
  • Ограничения определяются уровнем использования (usage tier). Организации автоматически помещаются на определённый уровень на основе истории использования и состояния аккаунта и со временем могут переходить на более высокий уровень по мере использования API.
  • Новые организации и организации с ограниченной историей использования могут начинать с уровня Evaluation, лимиты которого ниже стандартных лимитов, указанных на этой странице, пока формируется история аккаунта. Эти начальные лимиты являются частью мер Anthropic по предотвращению мошенничества и злоупотреблений, и они автоматически увеличиваются по мере того, как ваша организация накапливает историю использования.
  • Ограничения устанавливаются на уровне организации. Вы можете увидеть уровень вашей организации и текущие лимиты на странице Rate limits в Claude Console.
  • Вы можете столкнуться с ограничениями скорости на более коротких временных интервалах. Например, скорость 60 запросов в минуту (RPM) может применяться как 1 запрос в секунду. Короткие всплески запросов могут превысить лимит и вызвать ошибки ограничения скорости.
  • Приведённые ниже лимиты являются стандартными для каждого уровня. Если вам нужны более высокие лимиты, см. раздел Запрос более высоких лимитов.
  • Для ограничения скорости API использует алгоритм маркерной корзины (token bucket). Это означает, что ваша пропускная способность непрерывно пополняется до максимального лимита, а не сбрасывается через фиксированные интервалы.
  • Все описанные здесь лимиты представляют собой максимально допустимое использование, а не гарантированные минимумы. Эти лимиты предназначены для снижения непреднамеренного перерасхода и обеспечения справедливого распределения ресурсов между пользователями.

Лимиты расходов

Каждый из уровней Start, Build и Scale имеет ежемесячный предел расходов — максимальную сумму, которую ваша организация может потратить на API в каждом календарном месяце. Вы можете просмотреть ежемесячный предел расходов вашей организации и установить собственный лимит на странице Billing.

Уровень использованияЕжемесячный предел расходов
Start$500 USD
Build$1 000 USD
Scale$200 000 USD

Организации на уровне Custom не имеют ежемесячного предела расходов; лимиты согласовываются с их командой по работе с аккаунтом.

Достижение предела расходов

Как только вы достигнете предела расходов вашего уровня, использование API приостанавливается до 00:00 UTC первого дня следующего месяца, если только вы не запросите более высокий лимит раньше. Пока использование приостановлено, запросы к API возвращают HTTP 429:

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
    "details": { "error_code": "enforced_spend_limit_reached" }
  },
  "request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}
  • Тип ошибки — rate_limit_error, такой же, как при ограничении скорости, но в ответе отсутствует заголовок retry-after. Повторные попытки, включая автоматические повторы в SDK, завершаются неудачей до возобновления доступа.
  • В Messages API значение error.details.error_code равно enforced_spend_limit_reached. Используйте его, чтобы отличить этот ответ от ограничения скорости.
  • Переход на более высокий уровень восстанавливает доступ; см. раздел Запрос более высоких лимитов.

Установка собственного лимита расходов

Вы также можете установить собственный лимит расходов ниже предела вашего уровня для контроля затрат:

  1. Перейдите на страницу Billing

    Откройте Settings > Billing в Claude Console.

  2. Откройте редактор лимита расходов

    В разделе Spend limits нажмите Adjust limit (или Set limit, если лимит в данный момент не установлен).

  3. Измените лимит расходов

    Введите новое значение. Ваш лимит расходов не может превышать предел вашего текущего уровня.

Когда использование достигает установленного вами лимита расходов, запросы возвращают HTTP 400 с типом ошибки invalid_request_error. Сообщение начинается со слов You have reached your specified API usage limits или You have reached your specified workspace API usage limits для лимита рабочего пространства и указывает, когда доступ будет возобновлён. Повысьте или удалите лимит, чтобы восстановить доступ раньше.

Лимиты рабочего пространства Claude Code проверяются отдельно: запросы Claude Code, превышающие лимит этого рабочего пространства, могут вместо этого получить ответ 429 с заголовком retry-after.

Ограничения скорости

Ограничения скорости для Messages API измеряются в запросах в минуту (RPM), входных токенах в минуту (ITPM) и выходных токенах в минуту (OTPM) для каждого класса моделей. Если вы превысите любое из ограничений скорости, вы получите ошибку 429 с описанием того, какое ограничение скорости было превышено, а также заголовок retry-after, указывающий, сколько нужно подождать.

ITPM с учётом кэша

Многие поставщики API используют комбинированный лимит «токенов в минуту» (TPM), который может включать все токены — как кэшированные, так и некэшированные, входные и выходные. Для большинства моделей Claude в ограничениях скорости ITPM учитываются только некэшированные входные токены. Это ключевое преимущество, благодаря которому ограничения скорости фактически выше, чем может показаться на первый взгляд.

Ограничения скорости ITPM оцениваются в начале каждого запроса, и оценка корректируется в ходе запроса, чтобы отразить фактическое количество использованных входных токенов.

Вот что учитывается в ITPM:

  • input_tokens (токены после последней точки разрыва кэша) ✓ Учитываются в ITPM
  • cache_creation_input_tokens (токены, записываемые в кэш) ✓ Учитываются в ITPM
  • cache_read_input_tokens (токены, прочитанные из кэша) ✗ НЕ учитываются в ITPM для большинства моделей

Пример: при лимите 2 000 000 ITPM и доле попаданий в кэш 80% вы могли бы фактически обрабатывать 10 000 000 входных токенов в минуту (2 млн некэшированных + 8 млн кэшированных), поскольку кэшированные токены не учитываются в ограничении скорости.

Чтобы максимально эффективно использовать ограничения скорости, кэшируйте повторяющееся содержимое, такое как системные инструкции и подсказки, большие контекстные документы, определения инструментов и историю разговора; рекомендации см. в разделе кэширование подсказок. При эффективном кэшировании вы можете существенно увеличить фактическую пропускную способность без повышения ограничений скорости. Отслеживайте долю попаданий в кэш на странице Usage, чтобы настроить стратегию кэширования.

Ограничения скорости OTPM оцениваются в реальном времени по мере генерации выходных токенов, при этом учитываются только фактически сгенерированные токены. Параметр max_tokens не участвует в расчётах ограничения скорости OTPM, поэтому установка более высокого значения max_tokens не имеет недостатков с точки зрения ограничений скорости.

Ограничения скорости применяются отдельно для каждой модели; поэтому вы можете одновременно использовать разные модели в пределах их соответствующих лимитов. Вы можете проверить текущие ограничения скорости и их поведение на странице Rate limits в Claude Console или программно прочитать настроенные лимиты с помощью Rate Limits API.

МодельМаксимум запросов в минуту (RPM)Максимум входных токенов в минуту (ITPM)Максимум выходных токенов в минуту (OTPM)
Claude Fable 5.x11 000500 000100 000
Claude Opus 5.51 0002 000 000400 000
Claude Opus 51 0002 000 000400 000
Claude Opus 4.x21 0002 000 000400 000
Claude Sonnet 5.51 0002 000 000400 000
Claude Sonnet 51 0002 000 000400 000
Claude Sonnet 4.x31 0002 000 000400 000
Claude Haiku 4.51 0002 000 000400 000
Claude Haiku 3.5 (выведена из эксплуатации, кроме Bedrock и Google Cloud)1 000100 000420 000

1 Ограничение скорости Fable — это общий лимит, применяемый к совокупному трафику Claude Fable 5.1 и Claude Fable 5. Claude Mythos 5.1 и Claude Mythos 5 используют отдельный совокупный лимит на тех же условиях.

2 Ограничение скорости Opus — это общий лимит, применяемый к совокупному трафику Claude Opus 4.8, Opus 4.7, Opus 4.6 и Opus 4.5. У каждой из моделей Claude Opus 5.5 и Claude Opus 5 отдельное ограничение скорости, и они не входят в эту общую корзину.

3 Ограничение скорости Sonnet 4.x — это общий лимит, который применяется к совокупному трафику Sonnet 4.6 и Sonnet 4.5. Claude Sonnet 5.5 и Claude Sonnet 5 имеют собственные отдельные ограничения скорости и не входят в этот общий пул.

4 Лимит учитывает cache_read_input_tokens в использовании ITPM.

Message Batches API

Message Batches API имеет собственный набор ограничений скорости, общих для всех моделей. К ним относятся лимит запросов в минуту (RPM) для всех конечных точек API и лимит на количество пакетных запросов, которые могут одновременно находиться в очереди обработки. Под «пакетным запросом» здесь понимается часть Message Batch. Вы можете создать Message Batch, содержащий тысячи пакетных запросов, каждый из которых учитывается в этом лимите. Пакетный запрос считается частью очереди обработки, пока он ещё не был успешно обработан моделью.

Максимум запросов в минуту (RPM)Максимум пакетных запросов в очереди обработкиМаксимум пакетных запросов в одном пакете
1 000200 000100 000

Managed Agents

Конечные точки Claude Managed Agents имеют ограничения скорости на уровне организации. Эти лимиты отделены от приведённых выше ограничений скорости Messages API.

ОперацияЛимит
Конечные точки создания (например, агенты, сеансы и окружения)300 запросов в минуту
Конечные точки чтения (например, получение, список и потоковая передача)1 200 запросов в минуту

Files API

Запросы к Files API имеют собственный лимит на уровне организации, общий для операций загрузки, получения списка, получения, скачивания и удаления и отдельный от лимитов Messages API, описанных ранее на этой странице. Текущее значение см. в разделе Ограничения скорости Files API.

Ограничения скорости быстрого режима

При использовании быстрого режима (исследовательская предварительная версия) с speed: "fast" на Claude Opus 5.5, Claude Opus 5, или Opus 4.8 действуют выделенные ограничения скорости, отдельные от стандартных ограничений скорости Opus. При превышении ограничений скорости быстрого режима API возвращает ошибку 429 с заголовком retry-after. Быстрый режим недоступен на Claude Opus 4.7 (запросы возвращают ошибку) и Claude Opus 4.6 (запросы к claude-opus-4-6 с speed: "fast" выполняются на стандартной скорости). См. Быстрый режим.

Ответ включает заголовки anthropic-fast-*, которые указывают состояние ваших ограничений скорости быстрого режима. Подробнее об этих заголовках см. в разделе Ограничения скорости быстрого режима.

Мониторинг ограничений скорости в Console

Вы можете отслеживать использование ограничений скорости на странице Usage в Claude Console.

Помимо графиков токенов и запросов, страница Usage предоставляет два отдельных графика ограничений скорости. Используйте эти графики, чтобы увидеть, какой у вас запас для роста, определить, когда вы можете достигать пикового использования, понять, какие ограничения скорости запрашивать, и узнать, как улучшить показатели кэширования. Графики визуализируют ряд метрик для заданного ограничения скорости (например, по модели):

  • График Rate Limit - Input Tokens включает:
    • Почасовой максимум некэшированных входных токенов в минуту
    • Ваше текущее ограничение скорости по входным токенам в минуту
    • Долю кэширования для ваших входных токенов (то есть процент входных токенов, прочитанных из кэша)
  • График Rate Limit - Output Tokens включает:
    • Почасовой максимум выходных токенов в минуту
    • Ваше текущее ограничение скорости по выходным токенам в минуту

Запрос более высоких лимитов

Чтобы запросить более высокие ограничения скорости или более высокий ежемесячный предел расходов, используйте Request rate limit increase на странице Rate limits. Служба поддержки Anthropic также может повысить лимиты; при срочной необходимости обратитесь в службу поддержки Anthropic.

Установка более низких лимитов для рабочих пространств

Подробнее о рабочих пространствах см. в разделе Рабочие пространства.

Чтобы защитить рабочие пространства в вашей организации от возможного чрезмерного использования, вы можете установить собственные лимиты расходов и ограничения скорости для каждого рабочего пространства.

Пример: если лимит вашей организации составляет 40 000 входных токенов в минуту и 8 000 выходных токенов в минуту, вы можете ограничить одно рабочее пространство 30 000 входных токенов в минуту. Это защищает другие рабочие пространства от возможного чрезмерного использования и обеспечивает более справедливое распределение ресурсов в вашей организации. Оставшиеся неиспользованные токены в минуту (или больше, если это рабочее пространство не использует свой лимит) становятся доступны для использования другими рабочими пространствами.

Примечание:

  • Вы не можете устанавливать лимиты для рабочего пространства по умолчанию.
  • Если лимиты рабочего пространства не заданы, они совпадают с лимитом организации.
  • Лимиты рабочего пространства устанавливаются для каждого типа ограничителя (например, запросы в минуту, входные токены в минуту или выходные токены в минуту).
  • Лимиты на уровне организации применяются всегда, даже если сумма лимитов рабочих пространств больше.

Чтобы программно прочитать текущие ограничения скорости вашей организации и рабочих пространств, используйте Rate Limits API.

Заголовки ответа

Ответ API включает заголовки, которые показывают применяемое ограничение скорости, текущее использование и время сброса лимита.

Возвращаются следующие заголовки:

ЗаголовокОписание
retry-afterКоличество секунд ожидания до возможности повторить запрос. Более ранние повторные попытки завершатся неудачей. Не отправляется с ответом 429 при достижении предела расходов (см. Достижение предела расходов).
anthropic-ratelimit-requests-limitМаксимальное количество запросов, разрешённое в течение любого периода ограничения скорости.
anthropic-ratelimit-requests-remainingКоличество запросов, оставшихся до применения ограничения скорости.
anthropic-ratelimit-requests-resetВремя, когда ограничение скорости запросов будет полностью восстановлено, в формате RFC 3339.
anthropic-ratelimit-tokens-limitМаксимальное количество токенов, разрешённое в течение любого периода ограничения скорости.
anthropic-ratelimit-tokens-remainingКоличество токенов, оставшихся (с округлением до ближайшей тысячи) до применения ограничения скорости.
anthropic-ratelimit-tokens-resetВремя, когда ограничение скорости токенов будет полностью восстановлено, в формате RFC 3339.
anthropic-ratelimit-input-tokens-limitМаксимальное количество входных токенов, разрешённое в течение любого периода ограничения скорости.
anthropic-ratelimit-input-tokens-remainingКоличество входных токенов, оставшихся (с округлением до ближайшей тысячи) до применения ограничения скорости.
anthropic-ratelimit-input-tokens-resetВремя, когда ограничение скорости входных токенов будет полностью восстановлено, в формате RFC 3339.
anthropic-ratelimit-output-tokens-limitМаксимальное количество выходных токенов, разрешённое в течение любого периода ограничения скорости.
anthropic-ratelimit-output-tokens-remainingКоличество выходных токенов, оставшихся (с округлением до ближайшей тысячи) до применения ограничения скорости.
anthropic-ratelimit-output-tokens-resetВремя, когда ограничение скорости выходных токенов будет полностью восстановлено, в формате RFC 3339.
anthropic-priority-input-tokens-limitМаксимальное количество входных токенов Priority Tier, разрешённое в течение любого периода ограничения скорости. (Только Priority Tier)
anthropic-priority-input-tokens-remainingКоличество входных токенов Priority Tier, оставшихся (с округлением до ближайшей тысячи) до применения ограничения скорости. (Только Priority Tier)
anthropic-priority-input-tokens-resetВремя, когда ограничение скорости входных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier)
anthropic-priority-output-tokens-limitМаксимальное количество выходных токенов Priority Tier, разрешённое в течение любого периода ограничения скорости. (Только Priority Tier)
anthropic-priority-output-tokens-remainingКоличество выходных токенов Priority Tier, оставшихся (с округлением до ближайшей тысячи) до применения ограничения скорости. (Только Priority Tier)
anthropic-priority-output-tokens-resetВремя, когда ограничение скорости выходных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier)

Заголовки anthropic-ratelimit-tokens-* отображают значения для наиболее строгого лимита, действующего в данный момент. Например, если вы превысили поминутный лимит токенов рабочего пространства, заголовки будут содержать значения поминутного ограничения скорости токенов рабочего пространства. Если лимиты рабочего пространства не применяются, заголовки вернут общее количество оставшихся токенов, где общее количество — это сумма входных и выходных токенов. Такой подход гарантирует, что вы видите наиболее актуальное ограничение для вашего текущего использования API. Чтобы узнать, к какому рабочему пространству был отнесён запрос, прочитайте заголовок ответа anthropic-workspace-id, который содержит идентификатор рабочего пространства, к которому был сопоставлен ваш ключ API или токен доступа.

Was this page helpful?