Ratenlimits
Um Missbrauch einzudämmen und die Kapazität der API zu steuern, gibt es Limits dafür, wie intensiv eine Organisation die Claude API nutzen kann.
Es gibt zwei Arten von Limits:
- „Spend limits“ (Ausgabenlimits) legen die maximalen monatlichen Kosten fest, die einer Organisation durch die API-Nutzung entstehen können.
- „Rate limits“ (Ratenlimits) legen die maximale Anzahl von API-Anfragen fest, die eine Organisation innerhalb eines definierten Zeitraums stellen kann.
Die API setzt dienstseitig konfigurierte Limits auf Organisationsebene durch, du kannst aber zusätzlich benutzerkonfigurierbare Limits für die Workspaces deiner Organisation festlegen.
Über Ratenlimits
- Limits sind so gestaltet, dass sie API-Missbrauch verhindern und gleichzeitig die Auswirkungen auf gängige Nutzungsmuster von Kunden minimieren.
- Limits werden durch die „usage tier“ (Nutzungsstufe) bestimmt. Organisationen werden basierend auf ihrer Nutzungshistorie und ihrem Kontostatus automatisch einer Stufe zugeordnet und können im Laufe der Zeit durch die Nutzung der API in eine höhere Stufe aufsteigen.
- Neue Organisationen und Organisationen mit begrenzter Nutzungshistorie beginnen möglicherweise in der Evaluation-Stufe, mit Limits unterhalb der auf dieser Seite gezeigten Standardlimits, während die Kontohistorie aufgebaut wird. Diese Anfangslimits sind Teil der Maßnahmen, mit denen Anthropic Betrug und Missbrauch verhindert, und sie erhöhen sich automatisch, sobald deine Organisation eine Nutzungshistorie aufbaut.
- Limits werden auf Organisationsebene festgelegt. Die Stufe und die aktuellen Limits deiner Organisation findest du auf der Seite Ratenlimits in der Claude Console.
- Du kannst Ratenlimits auch über kürzere Zeitintervalle erreichen. Beispielsweise kann eine Rate von 60 Anfragen pro Minute (RPM) als 1 Anfrage pro Sekunde durchgesetzt werden. Kurze Anfragespitzen können das Limit überschreiten und Ratenlimit-Fehler auslösen.
- Die folgenden Limits sind die Standardlimits für jede Stufe. Wenn du höhere Limits benötigst, siehe Höhere Limits anfordern.
- Die API verwendet den Token-Bucket-Algorithmus für das Rate-Limiting. Das bedeutet, dass deine Kapazität kontinuierlich bis zu deinem maximalen Limit aufgefüllt wird, anstatt in festen Intervallen zurückgesetzt zu werden.
- Alle hier beschriebenen Limits stellen die maximal zulässige Nutzung dar, keine garantierten Mindestwerte. Diese Limits sollen unbeabsichtigte Mehrausgaben reduzieren und eine faire Verteilung der Ressourcen unter den Nutzern sicherstellen.
Ausgabenlimits
Jede der Stufen Start, Build und Scale hat eine monatliche Ausgabenobergrenze, also den Höchstbetrag, den deine Organisation pro Kalendermonat für die API ausgeben kann. Du kannst die monatliche Ausgabenobergrenze deiner Organisation auf der Seite Abrechnung einsehen und dort ein eigenes Limit festlegen.
| Nutzungsstufe | Monatliche Ausgabenobergrenze |
|---|---|
| Start | 500 $ USD |
| Build | 1.000 $ USD |
| Scale | 200.000 $ USD |
Organisationen in der Custom-Stufe haben keine monatliche Ausgabenobergrenze; die Limits werden mit ihrem Account-Team vereinbart.
Erreichen deiner Ausgabenobergrenze
Sobald du die Ausgabenobergrenze deiner Stufe erreichst, wird die API-Nutzung bis 00:00 UTC am ersten Tag des nächsten Monats pausiert, sofern du nicht vorher ein höheres Limit anforderst. Während die Nutzung pausiert ist, geben API-Anfragen HTTP 429 zurück:
{
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
"details": { "error_code": "enforced_spend_limit_reached" }
},
"request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}- Der Fehlertyp ist
rate_limit_error, derselbe wie bei einem Ratenlimit, aber die Antwort enthält keinenretry-after-Header. Wiederholungsversuche, einschließlich der automatischen Wiederholungen der SDKs, schlagen fehl, bis der Zugriff wiederhergestellt ist. - In der Messages API ist
error.details.error_codegleichenforced_spend_limit_reached. Verwende diesen Wert, um diese Antwort von einem Ratenlimit zu unterscheiden. - Der Wechsel in eine höhere Stufe stellt den Zugriff wieder her; siehe Höhere Limits anfordern.
Ein eigenes Ausgabenlimit festlegen
Du kannst auch ein eigenes Ausgabenlimit unterhalb der Obergrenze deiner Stufe festlegen, um die Kosten zu kontrollieren:
Zur Abrechnungsseite navigieren
Gehe in der Claude Console zu Einstellungen > Abrechnung.
Den Editor für das Ausgabenlimit öffnen
Klicke im Abschnitt Spend limits (Ausgabenlimits) auf Adjust limit (Limit anpassen) (oder auf Set limit (Limit festlegen), falls derzeit kein Limit gesetzt ist).
Dein Ausgabenlimit anpassen
Gib einen neuen Wert ein. Dein Ausgabenlimit darf die Obergrenze deiner aktuellen Stufe nicht überschreiten.
Wenn die Nutzung ein von dir festgelegtes Ausgabenlimit erreicht, geben Anfragen HTTP 400 mit dem Fehlertyp invalid_request_error zurück. Die Meldung beginnt mit You have reached your specified API usage limits bzw. bei einem Workspace-Limit mit You have reached your specified workspace API usage limits und gibt an, wann der Zugriff wiederhergestellt wird. Erhöhe oder entferne das Limit, um den Zugriff früher wiederherzustellen.
Limits für den Claude Code Workspace werden separat geprüft: Claude Code-Anfragen, die das Limit dieses Workspace überschreiten, können stattdessen eine 429-Antwort erhalten, die einen retry-after-Header enthält.
Ratenlimits
Die Ratenlimits für die Messages API werden für jede Modellklasse in „requests per minute“ (Anfragen pro Minute), oder RPM, „input tokens per minute“ (Eingabe-Token pro Minute), oder ITPM, und „output tokens per minute“ (Ausgabe-Token pro Minute), oder OTPM, gemessen.
Wenn du eines der Ratenlimits überschreitest, erhältst du einen 429-Fehler, der beschreibt, welches Ratenlimit überschritten wurde, zusammen mit einem retry-after-Header, der angibt, wie lange du warten musst.
Cache-bewusstes ITPM
Viele API-Anbieter verwenden ein kombiniertes Limit für „tokens per minute“ (Token pro Minute), oder TPM, das alle Token umfassen kann, sowohl gecachte als auch ungecachte, Eingabe wie Ausgabe. Bei den meisten Claude-Modellen zählen nur ungecachte Eingabe-Token zu deinen ITPM-Ratenlimits. Das ist ein wesentlicher Vorteil, durch den die Ratenlimits effektiv höher sind, als sie zunächst erscheinen mögen.
ITPM-Ratenlimits werden zu Beginn jeder Anfrage geschätzt, und die Schätzung wird während der Anfrage angepasst, um die tatsächliche Anzahl der verwendeten Eingabe-Token widerzuspiegeln.
Folgendes zählt zum ITPM:
input_tokens(Token nach dem letzten Cache-Breakpoint) ✓ Zählen zum ITPMcache_creation_input_tokens(Token, die in den Cache geschrieben werden) ✓ Zählen zum ITPMcache_read_input_tokens(aus dem Cache gelesene Token) ✗ Zählen NICHT zum ITPM bei den meisten Modellen
Beispiel: Mit einem ITPM-Limit von 2.000.000 und einer Cache-Trefferquote von 80 % könntest du effektiv 10.000.000 Eingabe-Token pro Minute insgesamt verarbeiten (2 Mio. ungecacht + 8 Mio. gecacht), da gecachte Token nicht zu deinem Ratenlimit zählen.
Um deine Ratenlimits optimal zu nutzen, cache wiederholte Inhalte wie Systemanweisungen und Prompts, große Kontextdokumente, Tool-Definitionen und den Gesprächsverlauf; Hinweise dazu findest du unter Prompt-Caching. Mit effektivem Caching kannst du deinen tatsächlichen Durchsatz erheblich steigern, ohne deine Ratenlimits zu erhöhen. Überwache deine Cache-Trefferquote auf der Nutzungsseite, um deine Caching-Strategie zu optimieren.
OTPM-Ratenlimits werden in Echtzeit ausgewertet, während Ausgabe-Token erzeugt werden, und zählen nur die tatsächlich generierten Token. Der Parameter max_tokens fließt nicht in die Berechnung der OTPM-Ratenlimits ein, sodass ein höherer max_tokens-Wert keinen Nachteil beim Ratenlimit mit sich bringt.
Ratenlimits werden für jedes Modell separat angewendet; du kannst daher verschiedene Modelle gleichzeitig bis zu ihren jeweiligen Limits nutzen. Du kannst deine aktuellen Ratenlimits und deren Verhalten auf der Seite Ratenlimits in der Claude Console prüfen oder die konfigurierten Limits programmatisch mit der Rate Limits API auslesen.
| Modell | Maximale Anfragen pro Minute (RPM) | Maximale Eingabe-Token pro Minute (ITPM) | Maximale Ausgabe-Token pro Minute (OTPM) |
|---|---|---|---|
| Claude Fable 5.x1 | 1.000 | 500.000 | 100.000 |
| Claude Opus 5.5 | 1.000 | 2.000.000 | 400.000 |
| Claude Opus 5 | 1.000 | 2.000.000 | 400.000 |
| Claude Opus 4.x2 | 1.000 | 2.000.000 | 400.000 |
| Claude Sonnet 5.5 | 1.000 | 2.000.000 | 400.000 |
| Claude Sonnet 5 | 1.000 | 2.000.000 | 400.000 |
| Claude Sonnet 4.x3 | 1.000 | 2.000.000 | 400.000 |
| Claude Haiku 4.5 | 1.000 | 2.000.000 | 400.000 |
| Claude Haiku 3.5 (eingestellt, außer auf Bedrock und Google Cloud) | 1.000 | 100.0004 | 20.000 |
1 Das Fable-Ratenlimit ist ein Gesamtlimit, das für den kombinierten Traffic über Claude Fable 5.1 und Claude Fable 5 gilt. Claude Mythos 5.1 und Claude Mythos 5 teilen sich ein separates kombiniertes Limit zu denselben Bedingungen.
2 Das Opus-Ratenlimit ist ein Gesamtlimit, das für den kombinierten Traffic über Claude Opus 4.8, Opus 4.7, Opus 4.6 und Opus 4.5 gilt. Claude Opus 5.5 und Claude Opus 5 haben jeweils ein separates Ratenlimit und sind nicht Teil dieses kombinierten Buckets.
3 Das Sonnet 4.x-Ratenlimit ist ein Gesamtlimit, das für den kombinierten Traffic von Sonnet 4.6 und Sonnet 4.5 gilt. Claude Sonnet 5.5 und Claude Sonnet 5 haben jeweils ein eigenes Ratenlimit und gehören nicht zu diesem kombinierten Kontingent.
4 Das Limit zählt cache_read_input_tokens zur ITPM-Nutzung.
Message Batches API
Die Message Batches API hat eigene Ratenlimits, die über alle Modelle hinweg geteilt werden. Dazu gehören ein Limit für Anfragen pro Minute (RPM) für alle API-Endpunkte und ein Limit für die Anzahl der Batch-Anfragen, die sich gleichzeitig in der Verarbeitungswarteschlange befinden dürfen. Eine „Batch-Anfrage“ bezeichnet hier einen Teil eines Message Batch. Du kannst einen Message Batch mit Tausenden von Batch-Anfragen erstellen, von denen jede zu diesem Limit zählt. Eine Batch-Anfrage gilt als Teil der Verarbeitungswarteschlange, solange sie noch nicht erfolgreich vom Modell verarbeitet wurde.
| Maximale Anfragen pro Minute (RPM) | Maximale Batch-Anfragen in der Verarbeitungswarteschlange | Maximale Batch-Anfragen pro Batch |
|---|---|---|
| 1.000 | 200.000 | 100.000 |
Managed Agents
Die Endpunkte von Claude Managed Agents unterliegen Ratenlimits pro Organisation. Diese Limits sind von den oben genannten Ratenlimits der Messages API getrennt.
| Vorgang | Limit |
|---|---|
| Create-Endpunkte (zum Beispiel Agents, Sessions und Environments) | 300 Anfragen pro Minute |
| Read-Endpunkte (zum Beispiel Abrufen, Auflisten und Streamen) | 1.200 Anfragen pro Minute |
Files API
Anfragen an die Files API haben ein eigenes Limit pro Organisation, das über Upload-, Auflistungs-, Abruf-, Download- und Löschvorgänge hinweg geteilt wird und von den weiter oben auf dieser Seite beschriebenen Limits der Messages API getrennt ist. Den aktuellen Wert findest du unter Ratenlimits der Files API.
Ratenlimits im Fast Mode
Wenn du den Fast Mode (Research Preview) mit speed: "fast" auf Claude Opus 5.5, Claude Opus 5, oder Opus 4.8 verwendest, gelten eigene Ratenlimits, die von den Standard-Ratenlimits für Opus getrennt sind. Werden die Ratenlimits für den Fast Mode überschritten, gibt die API einen 429-Fehler mit einem retry-after-Header zurück. Der Fast Mode ist nicht verfügbar für Claude Opus 4.7 (Anfragen geben einen Fehler zurück) und Claude Opus 4.6 (Anfragen an claude-opus-4-6 mit speed: "fast" laufen mit Standardgeschwindigkeit). Siehe Fast Mode.
Die Antwort enthält anthropic-fast-*-Header, die den Status deines Fast-Mode-Ratenlimits angeben. Details zu diesen Headern findest du unter Ratenlimits im Fast Mode.
Deine Ratenlimits in der Console überwachen
Du kannst die Nutzung deiner Ratenlimits auf der Seite Nutzung der Claude Console überwachen.
Neben Token- und Anfragediagrammen bietet die Nutzungsseite zwei separate Ratenlimit-Diagramme. Nutze diese Diagramme, um zu sehen, wie viel Spielraum du zum Wachsen hast, um zu erkennen, wann du möglicherweise Spitzenlasten erreichst, um zu verstehen, welche Ratenlimits du anfordern solltest, und um zu lernen, wie du deine Caching-Raten verbessern kannst. Die Diagramme visualisieren eine Reihe von Metriken für ein bestimmtes Ratenlimit (zum Beispiel pro Modell):
- Das Diagramm Rate Limit - Input Tokens (Ratenlimit – Eingabe-Token) enthält:
- Das stündliche Maximum ungecachter Eingabe-Token pro Minute
- Dein aktuelles Ratenlimit für Eingabe-Token pro Minute
- Die Cache-Rate deiner Eingabe-Token (das heißt den Prozentsatz der aus dem Cache gelesenen Eingabe-Token)
- Das Diagramm Rate Limit - Output Tokens (Ratenlimit – Ausgabe-Token) enthält:
- Das stündliche Maximum der Ausgabe-Token pro Minute
- Dein aktuelles Ratenlimit für Ausgabe-Token pro Minute
Höhere Limits anfordern
Um höhere Ratenlimits oder eine höhere monatliche Ausgabenobergrenze anzufordern, verwende Request rate limit increase (Erhöhung des Ratenlimits anfordern) auf der Seite Ratenlimits. Auch der Anthropic-Support kann Limits erhöhen; bei dringendem Bedarf wende dich an den Anthropic-Support.
Niedrigere Limits für Workspaces festlegen
Mehr über Workspaces erfährst du unter Workspaces.
Um Workspaces in deiner Organisation vor möglicher Übernutzung zu schützen, kannst du pro Workspace eigene Ausgaben- und Ratenlimits festlegen.
Beispiel: Wenn das Limit deiner Organisation 40.000 Eingabe-Token pro Minute und 8.000 Ausgabe-Token pro Minute beträgt, könntest du einen Workspace auf 30.000 Eingabe-Token pro Minute begrenzen. Das schützt andere Workspaces vor möglicher Übernutzung und sorgt für eine gerechtere Verteilung der Ressourcen in deiner Organisation. Die verbleibenden ungenutzten Token pro Minute (oder mehr, falls dieser Workspace sein Limit nicht ausschöpft) stehen dann anderen Workspaces zur Verfügung.
Hinweis:
- Du kannst keine Limits für den Standard-Workspace festlegen.
- Wenn keine Limits gesetzt sind, entsprechen die Workspace-Limits dem Limit der Organisation.
- Workspace-Limits werden pro Limiter-Typ festgelegt (etwa Anfragen pro Minute, Eingabe-Token pro Minute oder Ausgabe-Token pro Minute).
- Organisationsweite Limits gelten immer, auch wenn die Workspace-Limits in Summe höher sind.
Um die aktuellen Ratenlimits deiner Organisation und deiner Workspaces programmatisch auszulesen, verwende die Rate Limits API.
Antwort-Header
Die API-Antwort enthält Header, die dir das durchgesetzte Ratenlimit, die aktuelle Nutzung und den Zeitpunkt der Zurücksetzung des Limits anzeigen.
Die folgenden Header werden zurückgegeben:
| Header | Beschreibung |
|---|---|
retry-after | Die Anzahl der Sekunden, die du warten musst, bis du die Anfrage wiederholen kannst. Frühere Wiederholungsversuche schlagen fehl. Wird nicht mit der 429-Antwort bei Erreichen der Ausgabenobergrenze gesendet (siehe Erreichen deiner Ausgabenobergrenze). |
anthropic-ratelimit-requests-limit | Die maximale Anzahl von Anfragen, die innerhalb eines Ratenlimit-Zeitraums zulässig sind. |
anthropic-ratelimit-requests-remaining | Die Anzahl der verbleibenden Anfragen, bevor das Ratenlimit greift. |
anthropic-ratelimit-requests-reset | Der Zeitpunkt, zu dem das Anfragen-Ratenlimit vollständig aufgefüllt sein wird, im RFC-3339-Format. |
anthropic-ratelimit-tokens-limit | Die maximale Anzahl von Token, die innerhalb eines Ratenlimit-Zeitraums zulässig sind. |
anthropic-ratelimit-tokens-remaining | Die Anzahl der verbleibenden Token (auf das nächste Tausend gerundet), bevor das Ratenlimit greift. |
anthropic-ratelimit-tokens-reset | Der Zeitpunkt, zu dem das Token-Ratenlimit vollständig aufgefüllt sein wird, im RFC-3339-Format. |
anthropic-ratelimit-input-tokens-limit | Die maximale Anzahl von Eingabe-Token, die innerhalb eines Ratenlimit-Zeitraums zulässig sind. |
anthropic-ratelimit-input-tokens-remaining | Die Anzahl der verbleibenden Eingabe-Token (auf das nächste Tausend gerundet), bevor das Ratenlimit greift. |
anthropic-ratelimit-input-tokens-reset | Der Zeitpunkt, zu dem das Eingabe-Token-Ratenlimit vollständig aufgefüllt sein wird, im RFC-3339-Format. |
anthropic-ratelimit-output-tokens-limit | Die maximale Anzahl von Ausgabe-Token, die innerhalb eines Ratenlimit-Zeitraums zulässig sind. |
anthropic-ratelimit-output-tokens-remaining | Die Anzahl der verbleibenden Ausgabe-Token (auf das nächste Tausend gerundet), bevor das Ratenlimit greift. |
anthropic-ratelimit-output-tokens-reset | Der Zeitpunkt, zu dem das Ausgabe-Token-Ratenlimit vollständig aufgefüllt sein wird, im RFC-3339-Format. |
anthropic-priority-input-tokens-limit | Die maximale Anzahl von Priority-Tier-Eingabe-Token, die innerhalb eines Ratenlimit-Zeitraums zulässig sind. (nur Priority Tier) |
anthropic-priority-input-tokens-remaining | Die Anzahl der verbleibenden Priority-Tier-Eingabe-Token (auf das nächste Tausend gerundet), bevor das Ratenlimit greift. (nur Priority Tier) |
anthropic-priority-input-tokens-reset | Der Zeitpunkt, zu dem das Priority-Tier-Eingabe-Token-Ratenlimit vollständig aufgefüllt sein wird, im RFC-3339-Format. (nur Priority Tier) |
anthropic-priority-output-tokens-limit | Die maximale Anzahl von Priority-Tier-Ausgabe-Token, die innerhalb eines Ratenlimit-Zeitraums zulässig sind. (nur Priority Tier) |
anthropic-priority-output-tokens-remaining | Die Anzahl der verbleibenden Priority-Tier-Ausgabe-Token (auf das nächste Tausend gerundet), bevor das Ratenlimit greift. (nur Priority Tier) |
anthropic-priority-output-tokens-reset | Der Zeitpunkt, zu dem das Priority-Tier-Ausgabe-Token-Ratenlimit vollständig aufgefüllt sein wird, im RFC-3339-Format. (nur Priority Tier) |
Die anthropic-ratelimit-tokens-*-Header zeigen die Werte für das restriktivste derzeit geltende Limit an. Wenn du beispielsweise das Token-Limit pro Minute eines Workspace überschritten hast, enthalten die Header die Werte des Token-Ratenlimits pro Minute dieses Workspace. Wenn keine Workspace-Limits gelten, geben die Header die insgesamt verbleibenden Token zurück, wobei die Gesamtsumme die Summe aus Eingabe- und Ausgabe-Token ist. Dieser Ansatz stellt sicher, dass du Einblick in die relevanteste Einschränkung deiner aktuellen API-Nutzung hast. Um zu sehen, welchem Workspace eine Anfrage zugerechnet wurde, lies den Antwort-Header anthropic-workspace-id, der die ID des Workspace enthält, zu dem dein API-Key oder Zugriffstoken aufgelöst wurde.
Was this page helpful?