서비스 티어
다양한 서비스 티어를 통해 애플리케이션의 요구 사항에 따라 가용성, 성능, 예측 가능한 비용 간의 균형을 맞출 수 있습니다.
Anthropic은 세 가지 "service tier"(서비스 티어)를 제공합니다:
- Priority Tier: 기존 용량 약정이 있는 조직만 사용 가능
- Standard: 일상적인 사용 사례의 파일럿 운영과 확장 모두를 위한 기본 티어
- Batch: 대기할 수 있거나 일반 용량 외부에서 처리되는 것이 유리한 비동기 워크플로에 가장 적합
Standard 티어
Standard 티어는 모든 API 요청에 대한 기본 서비스 티어입니다. API는 이러한 요청을 다른 모든 요청과 함께 최선 노력(best-effort) 가용성으로 우선순위를 지정합니다.
Priority Tier
API는 이 티어의 요청을 다른 모든 요청보다 우선적으로 처리합니다. 이러한 우선순위 지정은 피크 시간대에도 "서버 과부하" 오류를 최소화하는 데 도움이 됩니다.
자세한 내용은 기존 Priority Tier 약정을 참조하세요.
요청에 티어가 할당되는 방식
요청을 처리할 때 Anthropic은 다음 시나리오에서 요청을 Priority Tier에 할당하기로 결정합니다:
- 조직에 충분한 Priority Tier 용량의 분당 입력 토큰이 있는 경우
- 조직에 충분한 Priority Tier 용량의 분당 출력 토큰이 있는 경우
Anthropic은 Priority Tier 용량에 대한 사용량을 다음과 같이 계산합니다:
입력 토큰
- 캐시 읽기는 캐시에서 읽은 토큰당 0.1 토큰
- 캐시 쓰기는 5분 TTL로 캐시에 기록된 토큰당 1.25 토큰
- 캐시 쓰기는 1시간 TTL로 캐시에 기록된 토큰당 2.00 토큰
- Claude 4.6 이상 모델에서 미국 전용 추론(
inference_geo: "us") 요청의 경우, 입력 토큰은 토큰당 1.1 토큰 - 그 외 모든 입력 토큰은 토큰당 1 토큰
출력 토큰
- Claude 4.6 이상 모델에서 미국 전용 추론(
inference_geo: "us") 요청의 경우, 출력 토큰은 토큰당 1.1 토큰 - 그 외 모든 출력 토큰은 토큰당 1 토큰
그렇지 않은 경우 요청은 Standard 티어로 진행됩니다.
서비스 티어 사용하기
service_tier 파라미터를 설정하여 요청에 사용할 수 있는 서비스 티어를 제어할 수 있습니다:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)service_tier 파라미터는 다음 값을 허용합니다:
"auto"(기본값) - 사용 가능한 경우 Priority Tier 용량을 사용하고, 그렇지 않으면 다른 용량으로 대체합니다"standard_only"- Standard 티어 용량만 사용합니다. Priority Tier 용량을 사용하고 싶지 않은 경우에 유용합니다
응답의 usage 객체에는 요청에 할당된 서비스 티어도 포함됩니다:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}이를 통해 요청에 어떤 서비스 티어가 할당되었는지 확인할 수 있습니다.
Priority Tier 약정이 있는 모델로 service_tier="auto"를 요청하는 경우, 다음 응답 헤더가 유용한 정보를 제공합니다:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z이러한 헤더의 존재 여부를 사용하여 요청이 한도를 초과했더라도 Priority Tier 대상이었는지 감지할 수 있습니다.
기존 Priority Tier 약정
Priority Tier 약정은 다음으로 구성됩니다:
- 분당 입력 토큰 수
- 분당 출력 토큰 수
- 약정 기간(1, 3, 6 또는 12개월)
- 특정 모델 버전
Priority Tier는 우선순위가 지정된 컴퓨팅 리소스를 통해 99.5% 가동 시간을 목표로 합니다. 약정된 용량을 초과하는 요청은 자동으로 Standard 티어로 대체됩니다.
지원 모델
Priority Tier는 Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5, Claude Sonnet 5를 제외한 모든 사용 가능한 Claude 모델에서 지원됩니다.
사용 가능한 모델에 대한 자세한 내용은 모델 개요를 확인하세요.
Was this page helpful?