Claude Platform на AWS: Ограничения скорости на этой странице применяются к Claude Platform на AWS. Биллинг и лимиты расходов отличаются: лимиты расходов недоступны, а оплата производится через AWS Marketplace (а не через покупку кредитов Anthropic). Организации на Claude Platform на AWS помещаются на уровень Start и не перемещаются между уровнями использования автоматически. Чтобы запросить более высокие лимиты, свяжитесь с вашим представителем Anthropic. Настройка ограничений скорости для отдельных рабочих пространств и быстрый режим недоступны на Claude Platform на AWS.
Существует два типа ограничений:
API применяет настроенные сервисом лимиты на уровне организации, но вы также можете установить настраиваемые пользователем лимиты для рабочих пространств вашей организации.
Каждый из уровней Start, Build и Scale имеет месячный предел расходов, который является максимумом, который ваша организация может потратить на API каждый календарный месяц. Как только вы достигнете предела расходов вашего уровня, использование API приостанавливается до следующего месяца, если вы не запросите более высокий лимит. Вы можете просмотреть месячный предел расходов вашей организации на странице Limits.
| Уровень использования | Месячный предел расходов |
|---|---|
| Start | $500 |
| Build | $1,000 |
| Scale | $200,000 |
Организации на уровне Custom не имеют месячного предела расходов; лимиты согласовываются с их командой по работе с клиентами.
Вы также можете установить собственный лимит расходов ниже предела вашего уровня для контроля затрат:
Перейдите на страницу Limits
Перейдите в Settings > Limits в Claude Console.
Откройте редактор лимита расходов
В разделе Spend limits нажмите Change Limit (или Set spend limit, если лимит в данный момент не установлен).
Настройте ваш лимит расходов
Введите новое значение. Ваш лимит расходов не может превышать предел вашего текущего уровня.
Ограничения скорости для Messages API измеряются в запросах в минуту (RPM), входных токенах в минуту (ITPM) и выходных токенах в минуту (OTPM) для каждого класса моделей.
Если вы превысите любое из ограничений скорости, вы получите ошибку 429, описывающую, какое ограничение скорости было превышено, вместе с заголовком retry-after, указывающим, сколько нужно подождать.
Вы также можете столкнуться с ошибками 429 из-за лимитов ускорения на API, если в вашей организации происходит резкое увеличение использования. Чтобы избежать достижения лимитов ускорения, наращивайте трафик постепенно и поддерживайте стабильные шаблоны использования.
Многие поставщики API используют комбинированный лимит «токенов в минуту» (TPM), который может включать все токены, как кэшированные, так и некэшированные, входные и выходные. Для большинства моделей Claude только некэшированные входные токены учитываются в ваших ограничениях скорости ITPM. Это ключевое преимущество, которое делает ограничения скорости фактически выше, чем они могут показаться на первый взгляд.
Ограничения скорости ITPM оцениваются в начале каждого запроса, и оценка корректируется во время запроса, чтобы отразить фактическое количество использованных входных токенов.
Вот что учитывается в ITPM:
input_tokens (токены после последней точки останова кэша) ✓ Учитываются в ITPMcache_creation_input_tokens (токены, записываемые в кэш) ✓ Учитываются в ITPMcache_read_input_tokens (токены, читаемые из кэша) ✗ НЕ учитываются в ITPM для большинства моделейПоле input_tokens представляет только токены, которые появляются после вашей последней точки останова кэша, а не все входные токены в вашем запросе. Чтобы вычислить общее количество входных токенов:
total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokensЭто означает, что при наличии кэшированного содержимого input_tokens обычно будет намного меньше, чем ваш общий ввод. Например, с кэшированным документом на 200 тыс. токенов и вопросом пользователя на 50 токенов вы увидите input_tokens: 50, хотя общий ввод составляет 200 050 токенов.
Для целей ограничения скорости на большинстве моделей только input_tokens + cache_creation_input_tokens учитываются в вашем лимите ITPM, что делает кэширование подсказок эффективным способом увеличения вашей фактической пропускной способности.
Пример: С лимитом ITPM в 2 000 000 и коэффициентом попадания в кэш 80% вы могли бы фактически обрабатывать 10 000 000 общих входных токенов в минуту (2 млн некэшированных + 8 млн кэшированных), потому что кэшированные токены не учитываются в вашем ограничении скорости.
Claude Haiku 3.5 (отмечен символом † в следующих таблицах ограничений скорости) также учитывает cache_read_input_tokens в ограничениях скорости ITPM.
Для всех моделей без маркера † кэшированные входные токены не учитываются в ограничениях скорости и тарифицируются по сниженной ставке (10% от базовой цены входного токена). Это означает, что вы можете достичь значительно более высокой фактической пропускной способности, используя кэширование подсказок.
Максимизируйте ваши ограничения скорости с помощью кэширования подсказок
Чтобы получить максимум от ваших ограничений скорости, используйте кэширование подсказок для повторяющегося содержимого, такого как:
При эффективном кэшировании вы можете значительно увеличить вашу фактическую пропускную способность без увеличения ограничений скорости. Отслеживайте коэффициент попадания в кэш на странице Usage, чтобы оптимизировать вашу стратегию кэширования.
Ограничения скорости OTPM оцениваются в реальном времени по мере создания выходных токенов, учитывая только фактически сгенерированные токены. Параметр max_tokens не учитывается в расчётах ограничения скорости OTPM, поэтому установка более высокого значения max_tokens не имеет недостатков с точки зрения ограничения скорости.
Ограничения скорости применяются отдельно для каждой модели; следовательно, вы можете использовать разные модели одновременно до их соответствующих лимитов. Вы можете проверить ваши текущие ограничения скорости и поведение в Claude Console или прочитать настроенные лимиты программно с помощью Rate Limits API.
Ограничения скорости в настоящее время являются общими для всех значений inference_geo. Запросы с inference_geo: "us" и inference_geo: "global" используют один и тот же пул ограничений скорости.
* - Ограничение скорости Opus является общим лимитом, который применяется к совокупному трафику по Claude Opus 4.8, Opus 4.7, Opus 4.6 и Opus 4.5.
** - Ограничение скорости Sonnet 4.x является общим лимитом, который применяется к совокупному трафику по Sonnet 4.6 и Sonnet 4.5. Claude Sonnet 5 имеет отдельное ограничение скорости и не входит в этот совокупный пул.
† - Лимит учитывает cache_read_input_tokens в использовании ITPM.
Message Batches API имеет собственный набор ограничений скорости, которые являются общими для всех моделей. Они включают лимит запросов в минуту (RPM) для всех конечных точек API и лимит на количество пакетных запросов, которые могут находиться в очереди обработки одновременно. «Пакетный запрос» здесь относится к части Message Batch. Вы можете создать Message Batch, содержащий тысячи пакетных запросов, каждый из которых учитывается в этом лимите. Пакетный запрос считается частью очереди обработки, когда он ещё не был успешно обработан моделью.
Конечные точки Claude Managed Agents имеют ограничения скорости на уровне организации. Эти лимиты отделены от ограничений скорости Messages API, указанных выше.
| Операция | Лимит |
|---|---|
| Конечные точки создания (например, агенты, сессии и окружения) | 300 запросов в минуту |
| Конечные точки чтения (например, получение, список и потоковая передача) | 1,200 запросов в минуту |
При использовании быстрого режима (исследовательская предварительная версия) с speed: "fast" на Claude Opus 4.8 или Opus 4.7 применяются выделенные ограничения скорости, которые отделены от стандартных ограничений скорости Opus. Когда ограничения скорости быстрого режима превышены, API возвращает ошибку 429 с заголовком retry-after. Быстрый режим недоступен на Claude Opus 4.6: запросы к claude-opus-4-6 с speed: "fast" выполняются со стандартной скоростью. См. Быстрый режим.
Ответ включает заголовки anthropic-fast-*, которые указывают статус вашего ограничения скорости быстрого режима. См. Быстрый режим для подробностей об этих заголовках.
Вы можете отслеживать использование ваших ограничений скорости на странице Usage в Claude Console.
Помимо графиков токенов и запросов, страница Usage предоставляет два отдельных графика ограничений скорости. Используйте эти графики, чтобы увидеть, какой запас у вас есть для роста, когда вы можете достигать пикового использования, лучше понять, какие ограничения скорости запрашивать, или как вы можете улучшить ваши показатели кэширования. Графики визуализируют ряд метрик для заданного ограничения скорости (например, для каждой модели):
Чтобы запросить более высокие ограничения скорости или более высокий месячный предел расходов, используйте Request rate limit increase на странице Limits.
Служба поддержки также может повысить лимиты. Для срочных нужд обратитесь в службу поддержки.
Подробнее о рабочих пространствах см. Рабочие пространства.
Чтобы защитить рабочие пространства в вашей организации от потенциального чрезмерного использования, вы можете установить пользовательские лимиты расходов и ограничения скорости для каждого рабочего пространства.
Пример: Если лимит вашей организации составляет 40 000 входных токенов в минуту и 8 000 выходных токенов в минуту, вы можете ограничить одно рабочее пространство до 30 000 входных токенов в минуту. Это защищает другие рабочие пространства от потенциального чрезмерного использования и обеспечивает более справедливое распределение ресурсов в вашей организации. Оставшиеся неиспользованные токены в минуту (или больше, если это рабочее пространство не использует лимит) затем доступны для использования другими рабочими пространствами.
Примечание:
Чтобы программно прочитать текущие ограничения скорости вашей организации и рабочих пространств, используйте Rate Limits API.
Ответ API включает заголовки, которые показывают вам применяемое ограничение скорости, текущее использование и когда лимит будет сброшен.
Возвращаются следующие заголовки:
| Заголовок | Описание |
|---|---|
retry-after | Количество секунд ожидания до повторной попытки запроса. Более ранние повторные попытки завершатся неудачей. |
anthropic-ratelimit-requests-limit | Максимальное количество запросов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-requests-remaining | Количество оставшихся запросов до применения ограничения скорости. |
anthropic-ratelimit-requests-reset | Время, когда ограничение скорости запросов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-tokens-limit | Максимальное количество токенов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-tokens-remaining | Количество оставшихся токенов (округлённое до ближайшей тысячи) до применения ограничения скорости. |
anthropic-ratelimit-tokens-reset | Время, когда ограничение скорости токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-input-tokens-limit | Максимальное количество входных токенов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-input-tokens-remaining | Количество оставшихся входных токенов (округлённое до ближайшей тысячи) до применения ограничения скорости. |
anthropic-ratelimit-input-tokens-reset | Время, когда ограничение скорости входных токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-output-tokens-limit | Максимальное количество выходных токенов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-output-tokens-remaining | Количество оставшихся выходных токенов (округлённое до ближайшей тысячи) до применения ограничения скорости. |
anthropic-ratelimit-output-tokens-reset | Время, когда ограничение скорости выходных токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-priority-input-tokens-limit | Максимальное количество входных токенов Priority Tier, разрешённых в течение любого периода ограничения скорости. (Только Priority Tier) |
anthropic-priority-input-tokens-remaining | Количество оставшихся входных токенов Priority Tier (округлённое до ближайшей тысячи) до применения ограничения скорости. (Только Priority Tier) |
anthropic-priority-input-tokens-reset | Время, когда ограничение скорости входных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier) |
anthropic-priority-output-tokens-limit | Максимальное количество выходных токенов Priority Tier, разрешённых в течение любого периода ограничения скорости. (Только Priority Tier) |
anthropic-priority-output-tokens-remaining | Количество оставшихся выходных токенов Priority Tier (округлённое до ближайшей тысячи) до применения ограничения скорости. (Только Priority Tier) |
anthropic-priority-output-tokens-reset | Время, когда ограничение скорости выходных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier) |
Заголовки anthropic-ratelimit-tokens-* отображают значения для наиболее ограничивающего лимита, действующего в данный момент. Например, если вы превысили лимит токенов в минуту для рабочего пространства, заголовки будут содержать значения ограничения скорости токенов в минуту для рабочего пространства. Если лимиты рабочего пространства не применяются, заголовки вернут общее количество оставшихся токенов, где общее количество — это сумма входных и выходных токенов. Такой подход обеспечивает вам видимость наиболее значимого ограничения для вашего текущего использования API.
Was this page helpful?