Claude Platform Docs
Справочник APIПоддержка и конфигурация

Уровни обслуживания

Различные уровни обслуживания позволяют вам сбалансировать доступность, производительность и предсказуемость затрат в зависимости от потребностей вашего приложения.

Anthropic предлагает три «service tiers» (уровня обслуживания):

  • Priority Tier: доступен только организациям с действующим обязательством по мощности
  • Standard: уровень по умолчанию как для пилотных проектов, так и для масштабирования повседневных сценариев использования
  • Batch: лучше всего подходит для асинхронных рабочих процессов, которые могут подождать или выигрывают от выполнения за пределами вашей обычной мощности

Стандартный уровень

Уровень Standard — это уровень обслуживания по умолчанию для всех запросов к API. API приоритизирует эти запросы наравне со всеми остальными запросами с доступностью по принципу «best-effort» (максимально возможных усилий).

Priority Tier

API приоритизирует запросы этого уровня над всеми остальными запросами. Такая приоритизация помогает свести к минимуму ошибки «server overloaded» (сервер перегружен) даже в периоды пиковой нагрузки.

Дополнительную информацию см. в разделе Действующие обязательства Priority Tier.

Как запросам назначаются уровни

При обработке запроса Anthropic принимает решение назначить запросу Priority Tier в следующих случаях:

  • У вашей организации достаточно мощности Priority Tier по входным токенам в минуту
  • У вашей организации достаточно мощности Priority Tier по выходным токенам в минуту

Anthropic учитывает использование в счёт мощности Priority Tier следующим образом:

Входные токены

  • Чтение из кэша — 0,1 токена за каждый токен, прочитанный из кэша
  • Запись в кэш — 1,25 токена за каждый токен, записанный в кэш с TTL 5 минут
  • Запись в кэш — 2,00 токена за каждый токен, записанный в кэш с TTL 1 час
  • Для запросов с инференсом только в США (inference_geo: "us") на моделях Claude 4.6 и более поздних входные токены учитываются как 1,1 токена за токен
  • Все остальные входные токены — 1 токен за токен

Выходные токены

  • Для запросов с инференсом только в США (inference_geo: "us") на моделях Claude 4.6 и более поздних выходные токены учитываются как 1,1 токена за токен
  • Все остальные выходные токены — 1 токен за токен

В противном случае запросы обрабатываются на уровне Standard.

Использование уровней обслуживания

Вы можете управлять тем, какие уровни обслуживания могут использоваться для запроса, задав параметр service_tier:

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello, Claude!"}],
    service_tier="auto",  # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)

Параметр service_tier принимает следующие значения:

  • "auto" (по умолчанию) — использует мощность Priority Tier, если она доступна, в противном случае переключается на вашу другую мощность
  • "standard_only" — использовать только мощность уровня Standard; полезно, если вы не хотите расходовать свою мощность Priority Tier

Объект usage в ответе также содержит уровень обслуживания, назначенный запросу:

{
  "usage": {
    "input_tokens": 410,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0,
    "output_tokens": 585,
    "service_tier": "priority"
  }
}

Это позволяет вам определить, какой уровень обслуживания был назначен запросу.

При запросе с service_tier="auto" для модели с обязательством Priority Tier следующие заголовки ответа предоставляют полезную информацию:

anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z

Вы можете использовать наличие этих заголовков, чтобы определить, подходил ли ваш запрос для Priority Tier, даже если он превысил лимит.

Действующие обязательства Priority Tier

Обязательство Priority Tier состоит из:

  • Количества входных токенов в минуту
  • Количества выходных токенов в минуту
  • Срока действия обязательства (1, 3, 6 или 12 месяцев)
  • Конкретной версии модели

Priority Tier нацелен на 99,5% времени безотказной работы с приоритетным выделением вычислительных ресурсов. Запросы, превышающие вашу зарезервированную мощность, автоматически переключаются на уровень Standard.

Поддерживаемые модели

Priority Tier поддерживается для всех доступных моделей Claude, кроме Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5.5 и Claude Sonnet 5.

Подробнее о доступных моделях см. в разделе Обзор моделей.

Was this page helpful?