Claude Platform on AWS: 本頁的速率限制適用於 Claude Platform on AWS。計費和支出限制有所不同:不提供支出限制,且計費是透過 AWS Marketplace(而非 Anthropic 點數購買)。Claude Platform on AWS 上的組織會被置於 Start 層級,且不會在用量層級之間自動移動。若要申請更高的限制,請聯絡您的 Anthropic 客戶代表。Claude Platform on AWS 不提供每個工作區的速率限制設定和快速模式。
限制有兩種類型:
API 在組織層級強制執行服務設定的限制,但您也可以為組織的工作區設定使用者可配置的限制。
Start、Build 和 Scale 層級各有每月支出上限,這是您的組織每個日曆月在 API 上可以花費的最高金額。一旦達到您層級的支出上限,API 使用將暫停至下個月,除非您申請更高的限制。您可以在限制頁面上查看您組織的每月支出上限。
| 用量層級 | 每月支出上限 |
|---|---|
| Start | $500 |
| Build | $1,000 |
| Scale | $200,000 |
Custom 層級的組織沒有每月支出上限;限制由其客戶團隊安排。
您也可以設定低於您層級上限的自訂支出限制來控制成本:
前往限制頁面
在 Claude Console 中前往設定 > 限制。
開啟支出限制編輯器
在支出限制(Spend limits)區段中,點擊變更限制(Change Limit)(如果目前未設定限制,則點擊設定支出限制(Set spend limit))。
調整您的支出限制
輸入新的值。您的支出限制不能超過您目前層級的上限。
Messages API 的速率限制是以每個模型類別的每分鐘請求數(RPM)、每分鐘輸入 token 數(ITPM)和每分鐘輸出 token 數(OTPM)來衡量的。
如果您超過任何速率限制,您將收到 429 錯誤,說明超過了哪個速率限制,以及一個 retry-after 標頭,指示需要等待多長時間。
如果您的組織用量急劇增加,您也可能因為 API 的加速限制而遇到 429 錯誤。為避免觸及加速限制,請逐步增加您的流量並保持一致的使用模式。
許多 API 供應商使用合併的「每分鐘 token 數」(TPM)限制,可能包括所有 token,無論是快取的還是未快取的、輸入的還是輸出的。對於大多數 Claude 模型,只有未快取的輸入 token 會計入您的 ITPM 速率限制。 這是一個關鍵優勢,使速率限制實際上比最初看起來更高。
ITPM 速率限制在每個請求開始時進行估算,並在請求期間調整估算值以反映實際使用的輸入 token 數量。
以下是計入 ITPM 的項目:
input_tokens(最後一個快取斷點之後的 token)✓ 計入 ITPMcache_creation_input_tokens(正在寫入快取的 token)✓ 計入 ITPMcache_read_input_tokens(從快取讀取的 token)✗ 對於大多數模型不計入 ITPMinput_tokens 欄位僅代表出現在您最後一個快取斷點之後的 token,而非請求中的所有輸入 token。要計算總輸入 token 數:
total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens這表示當您有快取內容時,input_tokens 通常會比您的總輸入小得多。例如,對於一個 200k token 的快取文件和一個 50 token 的使用者問題,即使總輸入是 200,050 個 token,您也會看到 input_tokens: 50。
就大多數模型的速率限制而言,只有 input_tokens + cache_creation_input_tokens 計入您的 ITPM 限制,這使得提示快取成為提高有效吞吐量的有效方法。
範例:在 2,000,000 ITPM 限制和 80% 快取命中率的情況下,您實際上每分鐘可以處理 10,000,000 個總輸入 token(2M 未快取 + 8M 快取),因為快取的 token 不計入您的速率限制。
Claude Haiku 3.5(在以下速率限制表格中以 † 標記)也會將 cache_read_input_tokens 計入 ITPM 速率限制。
對於所有沒有 † 標記的模型,快取的輸入 token 不計入速率限制,並以較低的費率計費(基本輸入 token 價格的 10%)。這表示您可以透過使用提示快取來實現顯著更高的有效吞吐量。
OTPM 速率限制會在產生輸出 token 時即時評估,僅計算實際產生的 token。max_tokens 參數不會影響 OTPM 速率限制的計算,因此設定較高的 max_tokens 值不會對速率限制造成不利影響。
速率限制是針對每個模型分別套用的;因此您可以同時使用不同的模型,直到達到各自的限制。 您可以在 Claude Console 中查看您目前的速率限制和行為,或使用速率限制 API 以程式化方式讀取已設定的限制。
速率限制目前在所有 inference_geo 值之間共享。使用 inference_geo: "us" 和 inference_geo: "global" 的請求會從同一個速率限制池中扣除。
* - Opus 速率限制是一個總限制,適用於 Claude Opus 4.8、Opus 4.7、Opus 4.6 和 Opus 4.5 的合併流量。
** - Sonnet 4.x 速率限制是一個總限制,適用於 Sonnet 4.6 和 Sonnet 4.5 的合併流量。Claude Sonnet 5 有獨立的速率限制,不屬於此合併配額。
† - 此限制將 cache_read_input_tokens 計入 ITPM 用量。
Message Batches API 有自己的一組速率限制,在所有模型之間共享。這些限制包括對所有 API 端點的每分鐘請求數(RPM)限制,以及可同時處於處理佇列中的批次請求數量限制。此處的「批次請求」是指 Message Batch 的一部分。您可以建立包含數千個批次請求的 Message Batch,每個批次請求都會計入此限制。當批次請求尚未被模型成功處理時,即被視為處理佇列的一部分。
Claude 受管代理端點的速率限制是以組織為單位。這些限制與上述 Messages API 速率限制是分開的。
| 操作 | 限制 |
|---|---|
| 建立端點(例如代理、工作階段和環境) | 每分鐘 300 個請求 |
| 讀取端點(例如擷取、列出和串流) | 每分鐘 1,200 個請求 |
在 Claude Opus 4.8 或 Opus 4.7 上使用 speed: "fast" 的快速模式(研究預覽)時,會套用與標準 Opus 速率限制分開的專用速率限制。當超過快速模式速率限制時,API 會回傳 429 錯誤以及 retry-after 標頭。快速模式在 Claude Opus 4.6 上不可用:對 claude-opus-4-6 使用 speed: "fast" 的請求會以標準速度執行。請參閱快速模式。
回應包含 anthropic-fast-* 標頭,指示您的快速模式速率限制狀態。有關這些標頭的詳細資訊,請參閱快速模式。
您可以在 Claude Console 的用量頁面上監控您的速率限制使用情況。
除了提供 token 和請求圖表外,用量頁面還提供兩個獨立的速率限制圖表。使用這些圖表可以查看您有多少成長空間、何時可能達到使用高峰、更好地了解應申請哪些速率限制,或如何改善您的快取率。這些圖表將給定速率限制(例如,每個模型)的多項指標視覺化:
若要申請更高的速率限制或更高的每月支出上限,請在限制頁面上使用申請速率限制提高(Request rate limit increase)。
支援團隊也可以提高限制。如有緊急需求,請聯絡支援團隊。
有關工作區的更多資訊,請參閱工作區。
為了保護您組織中的工作區免於潛在的過度使用,您可以為每個工作區設定自訂的支出和速率限制。
範例:如果您組織的限制是每分鐘 40,000 個輸入 token 和每分鐘 8,000 個輸出 token,您可以將一個工作區限制為每分鐘 30,000 個輸入 token。這可以保護其他工作區免於潛在的過度使用,並確保資源在整個組織中更公平地分配。剩餘未使用的每分鐘 token(或更多,如果該工作區未用完限制)則可供其他工作區使用。
注意:
若要以程式化方式讀取您目前的組織和工作區速率限制,請使用速率限制 API。
API 回應包含的標頭會顯示強制執行的速率限制、目前用量以及限制何時重置。
回傳以下標頭:
| 標頭 | 說明 |
|---|---|
retry-after | 在可以重試請求之前需要等待的秒數。提前重試將會失敗。 |
anthropic-ratelimit-requests-limit | 在任何速率限制期間內允許的最大請求數。 |
anthropic-ratelimit-requests-remaining | 在被速率限制之前剩餘的請求數。 |
anthropic-ratelimit-requests-reset | 請求速率限制將完全補充的時間,以 RFC 3339 格式提供。 |
anthropic-ratelimit-tokens-limit | 在任何速率限制期間內允許的最大 token 數。 |
anthropic-ratelimit-tokens-remaining | 在被速率限制之前剩餘的 token 數(四捨五入至最接近的千位)。 |
anthropic-ratelimit-tokens-reset | token 速率限制將完全補充的時間,以 RFC 3339 格式提供。 |
anthropic-ratelimit-input-tokens-limit | 在任何速率限制期間內允許的最大輸入 token 數。 |
anthropic-ratelimit-input-tokens-remaining | 在被速率限制之前剩餘的輸入 token 數(四捨五入至最接近的千位)。 |
anthropic-ratelimit-input-tokens-reset | 輸入 token 速率限制將完全補充的時間,以 RFC 3339 格式提供。 |
anthropic-ratelimit-output-tokens-limit | 在任何速率限制期間內允許的最大輸出 token 數。 |
anthropic-ratelimit-output-tokens-remaining | 在被速率限制之前剩餘的輸出 token 數(四捨五入至最接近的千位)。 |
anthropic-ratelimit-output-tokens-reset | 輸出 token 速率限制將完全補充的時間,以 RFC 3339 格式提供。 |
anthropic-priority-input-tokens-limit | 在任何速率限制期間內允許的最大 Priority Tier 輸入 token 數。(僅限 Priority Tier) |
anthropic-priority-input-tokens-remaining | 在被速率限制之前剩餘的 Priority Tier 輸入 token 數(四捨五入至最接近的千位)。(僅限 Priority Tier) |
anthropic-priority-input-tokens-reset | Priority Tier 輸入 token 速率限制將完全補充的時間,以 RFC 3339 格式提供。(僅限 Priority Tier) |
anthropic-priority-output-tokens-limit | 在任何速率限制期間內允許的最大 Priority Tier 輸出 token 數。(僅限 Priority Tier) |
anthropic-priority-output-tokens-remaining | 在被速率限制之前剩餘的 Priority Tier 輸出 token 數(四捨五入至最接近的千位)。(僅限 Priority Tier) |
anthropic-priority-output-tokens-reset | Priority Tier 輸出 token 速率限制將完全補充的時間,以 RFC 3339 格式提供。(僅限 Priority Tier) |
anthropic-ratelimit-tokens-* 標頭顯示目前生效的最嚴格限制的值。例如,如果您已超過工作區每分鐘 token 限制,標頭將包含工作區每分鐘 token 速率限制的值。如果工作區限制不適用,標頭將回傳剩餘的總 token 數,其中總數是輸入和輸出 token 的總和。這種方法可確保您能夠了解目前 API 使用中最相關的限制。
Was this page helpful?