Livelli di servizio
Diversi livelli di servizio ti consentono di bilanciare disponibilità, prestazioni e costi prevedibili in base alle esigenze della tua applicazione.
Anthropic offre tre "service tiers" (livelli di servizio):
- Priority Tier: Disponibile solo per le organizzazioni con un impegno di capacità esistente
- Standard: Livello predefinito sia per la sperimentazione che per la scalabilità dei casi d'uso quotidiani
- Batch: Ideale per flussi di lavoro asincroni che possono attendere o trarre vantaggio dall'essere al di fuori della tua capacità normale
Livello standard
Lo standard tier (livello standard) è il livello di servizio predefinito per tutte le richieste API. L'API dà priorità a queste richieste insieme a tutte le altre richieste con disponibilità best-effort.
Priority Tier
L'API dà priorità alle richieste in questo livello rispetto a tutte le altre richieste. Questa prioritizzazione aiuta a ridurre al minimo gli errori "server overloaded", anche durante i periodi di picco.
Per maggiori informazioni, consulta Impegni Priority Tier esistenti.
Come vengono assegnati i livelli alle richieste
Quando gestisce una richiesta, Anthropic decide di assegnare una richiesta a Priority Tier nei seguenti scenari:
- La tua organizzazione dispone di sufficiente capacità Priority Tier di token di input al minuto
- La tua organizzazione dispone di sufficiente capacità Priority Tier di token di output al minuto
Anthropic conteggia l'utilizzo rispetto alla capacità Priority Tier come segue:
Token di input
- Letture dalla cache come 0,1 token per ogni token letto dalla cache
- Scritture nella cache come 1,25 token per ogni token scritto nella cache con un TTL di 5 minuti
- Scritture nella cache come 2,00 token per ogni token scritto nella cache con un TTL di 1 ora
- Per le richieste con inferenza solo negli Stati Uniti (
inference_geo: "us") sui modelli Claude 4.6 e successivi, i token di input valgono 1,1 token per token - Tutti gli altri token di input valgono 1 token per token
Token di output
- Per le richieste con inferenza solo negli Stati Uniti (
inference_geo: "us") sui modelli Claude 4.6 e successivi, i token di output valgono 1,1 token per token - Tutti gli altri token di output valgono 1 token per token
Altrimenti, le richieste procedono allo standard tier.
Utilizzo dei livelli di servizio
Puoi controllare quali livelli di servizio possono essere utilizzati per una richiesta impostando il parametro service_tier:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)Il parametro service_tier accetta i seguenti valori:
"auto"(predefinito) - Utilizza la capacità Priority Tier se disponibile, ripiegando sull'altra tua capacità in caso contrario"standard_only"- Utilizza solo la capacità dello standard tier, utile se non vuoi utilizzare la tua capacità Priority Tier
L'oggetto usage della risposta include anche il livello di servizio assegnato alla richiesta:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}Questo ti consente di determinare quale livello di servizio è stato assegnato alla richiesta.
Quando richiedi service_tier="auto" con un modello con un impegno Priority Tier, queste intestazioni di risposta forniscono informazioni utili:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21ZPuoi utilizzare la presenza di queste intestazioni per rilevare se la tua richiesta era idonea per Priority Tier, anche se superava il limite.
Impegni Priority Tier esistenti
Un impegno Priority Tier è composto da:
- Un numero di token di input al minuto
- Un numero di token di output al minuto
- Una durata dell'impegno (1, 3, 6 o 12 mesi)
- Una versione specifica del modello
Priority Tier punta a un uptime del 99,5% con risorse computazionali prioritarie. Le richieste che superano la capacità impegnata ripiegano automaticamente sullo standard tier.
Modelli supportati
Priority Tier è supportato su tutti i modelli Claude disponibili tranne Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5.5 e Claude Sonnet 5.
Consulta la Panoramica dei modelli per maggiori dettagli sui modelli disponibili.
Was this page helpful?