快速模式(研究预览版)
从受支持的 Claude Opus 模型获得最高 2.5 倍的每秒输出令牌数。
快速模式(fast mode)以溢价定价为 Claude Opus 5.5、Claude Opus 5 和 Claude Opus 4.8 提供最高 2.5 倍的每秒输出令牌数。如需启用,请在请求中设置 speed: "fast" 并附带 fast-mode-2026-02-01 beta 标头。
支持的模型
以下模型支持快速模式:
- Claude Opus 5.5()
- Claude Opus 5()
- Claude Opus 4.8()
快速模式的工作原理
快速模式使用更快的推理配置运行同一模型。智能或能力没有任何变化。
- 与标准速度相比,每秒输出令牌数最高提升 2.5 倍
- 速度优势集中在"output tokens per second"(每秒输出令牌数),即 OTPS,而非"time to first token"(首令牌时间),即 TTFT
- 相同的模型权重和行为(不是不同的模型)
- 与 streaming(流式传输)兼容,在流式传输中 OTPS 的提升最为明显
基本用法
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)定价
快速模式的定价是在整个 context window(上下文窗口)范围内对标准费率乘以一个倍数,包括超过 200k 输入令牌的请求。下表显示了受支持模型的快速模式定价:
| 模型 | 输入 | 输出 |
|---|---|---|
| Claude Opus 5.5 | $8 USD / MTok | $40 USD / MTok |
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
快速模式定价可与其他定价修正项叠加:
有关完整的定价详情,请参阅定价页面。
速率限制
快速模式拥有专用的 rate limit(速率限制),与标准 Opus 速率限制相互独立。当超出您的快速模式速率限制时,API 会返回 429 错误,并附带 retry-after 标头,指示容量何时可用。
响应中包含指示您的快速模式速率限制状态的标头:
| 标头 | 描述 |
|---|---|
anthropic-fast-input-tokens-limit | 每分钟快速模式输入令牌的最大数量 |
anthropic-fast-input-tokens-remaining | 剩余的快速模式输入令牌数 |
anthropic-fast-input-tokens-reset | 快速模式输入令牌限制重置的时间 |
anthropic-fast-output-tokens-limit | 每分钟快速模式输出令牌的最大数量 |
anthropic-fast-output-tokens-remaining | 剩余的快速模式输出令牌数 |
anthropic-fast-output-tokens-reset | 快速模式输出令牌限制重置的时间 |
有关各层级的速率限制,请参阅速率限制页面。
检查使用了哪种速度
响应的 usage 对象包含一个 speed 字段,用于指示使用了哪种速度,值为 "fast" 或 "standard"。在不支持快速模式的模型上请求 speed: "fast" 会返回错误,超出快速模式的速率限制或容量(429 或 529)也会返回错误。当带有 speed: "fast" 的请求成功时,usage.speed 为 "fast"。如果您使用 Claude Opus 4.6 并请求快速模式,其行为是独特的。它不会像其他不支持快速模式的模型那样返回错误,而是静默切换到标准速度。尽管 Opus 4.6 不会报错,但 speed 字段会准确显示 "standard"。
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}要跟踪整个组织的快速模式使用情况和成本,请参阅使用量和成本 API。
重试与回退
自动重试
当超出快速模式速率限制时,API 会返回 429 错误,并附带 retry-after 标头。Anthropic SDK 默认会自动重试这些请求最多 2 次(可通过 max_retries 配置),每次重试前会等待服务器指定的延迟时间。由于快速模式采用持续的令牌补充机制,retry-after 延迟通常很短,一旦有可用容量,请求即可成功。
回退到标准速度
如果您希望回退到标准速度,而不是等待快速模式容量,请捕获速率限制错误,并在不带 speed: "fast" 的情况下重试。在初始快速请求上将 max_retries 设置为 0,以跳过自动重试,并在遇到速率限制错误时立即失败。
由于将 max_retries 设置为 0 也会禁用对其他瞬时错误(过载、内部服务器错误)的重试,以下示例会针对这些情况使用默认重试设置重新发出原始请求。
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)注意事项
- 提示缓存: 在快速速度和标准速度之间切换会使提示缓存失效。不同速度的请求不共享缓存的前缀。
- 支持的模型: 快速模式支持 Claude Opus 5.5、Claude Opus 5 和 Claude Opus 4.8。请参阅支持的模型。
- TTFT: 快速模式的优势集中在每秒输出令牌数(OTPS),而非首令牌时间(TTFT)。
- Batch API: 快速模式不适用于 Batch API。
- Priority Tier: 快速模式不适用于 Priority Tier 承诺。
- Claude Platform on AWS: 快速模式目前不适用于 Claude Platform on AWS。
后续步骤
Was this page helpful?