Claude Platform Docs
Messages模型能力

快速模式(研究预览版)

从受支持的 Claude Opus 模型获得最高 2.5 倍的每秒输出令牌数。

快速模式(fast mode)以溢价定价为 Claude Opus 5.5、Claude Opus 5 和 Claude Opus 4.8 提供最高 2.5 倍的每秒输出令牌数。如需启用,请在请求中设置 speed: "fast" 并附带 fast-mode-2026-02-01 beta 标头。

支持的模型

以下模型支持快速模式:

  • Claude Opus 5.5()
  • Claude Opus 5()
  • Claude Opus 4.8()

快速模式的工作原理

快速模式使用更快的推理配置运行同一模型。智能或能力没有任何变化。

  • 与标准速度相比,每秒输出令牌数最高提升 2.5 倍
  • 速度优势集中在"output tokens per second"(每秒输出令牌数),即 OTPS,而非"time to first token"(首令牌时间),即 TTFT
  • 相同的模型权重和行为(不是不同的模型)
  • 与 streaming(流式传输)兼容,在流式传输中 OTPS 的提升最为明显

基本用法

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[
        {"role": "user", "content": "Refactor this module to use dependency injection"}
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

定价

快速模式的定价是在整个 context window(上下文窗口)范围内对标准费率乘以一个倍数,包括超过 200k 输入令牌的请求。下表显示了受支持模型的快速模式定价:

模型输入输出
Claude Opus 5.5$8 USD / MTok$40 USD / MTok
Claude Opus 5 / Claude Opus 4.8$10 USD / MTok$50 USD / MTok

快速模式定价可与其他定价修正项叠加:

有关完整的定价详情,请参阅定价页面。

速率限制

快速模式拥有专用的 rate limit(速率限制),与标准 Opus 速率限制相互独立。当超出您的快速模式速率限制时,API 会返回 429 错误,并附带 retry-after 标头,指示容量何时可用。

响应中包含指示您的快速模式速率限制状态的标头:

标头描述
anthropic-fast-input-tokens-limit每分钟快速模式输入令牌的最大数量
anthropic-fast-input-tokens-remaining剩余的快速模式输入令牌数
anthropic-fast-input-tokens-reset快速模式输入令牌限制重置的时间
anthropic-fast-output-tokens-limit每分钟快速模式输出令牌的最大数量
anthropic-fast-output-tokens-remaining剩余的快速模式输出令牌数
anthropic-fast-output-tokens-reset快速模式输出令牌限制重置的时间

有关各层级的速率限制,请参阅速率限制页面。

检查使用了哪种速度

响应的 usage 对象包含一个 speed 字段,用于指示使用了哪种速度,值为 "fast" 或 "standard"。在不支持快速模式的模型上请求 speed: "fast" 会返回错误,超出快速模式的速率限制或容量(429 或 529)也会返回错误。当带有 speed: "fast" 的请求成功时,usage.speed 为 "fast"。如果您使用 Claude Opus 4.6 并请求快速模式,其行为是独特的。它不会像其他不支持快速模式的模型那样返回错误,而是静默切换到标准速度。尽管 Opus 4.6 不会报错,但 speed 字段会准确显示 "standard"。

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=1024,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "Hello"}],
)

print(response.usage.speed)  # "fast" or "standard"
Output
{
  "id": "msg_01XFDUDYJgAACzvnptvVoYEL",
  "type": "message",
  "role": "assistant",

  "usage": {
    "input_tokens": 8,
    "output_tokens": 12,
    "speed": "fast"
  }
}

要跟踪整个组织的快速模式使用情况和成本,请参阅使用量和成本 API。

重试与回退

自动重试

当超出快速模式速率限制时,API 会返回 429 错误,并附带 retry-after 标头。Anthropic SDK 默认会自动重试这些请求最多 2 次(可通过 max_retries 配置),每次重试前会等待服务器指定的延迟时间。由于快速模式采用持续的令牌补充机制,retry-after 延迟通常很短,一旦有可用容量,请求即可成功。

回退到标准速度

如果您希望回退到标准速度,而不是等待快速模式容量,请捕获速率限制错误,并在不带 speed: "fast" 的情况下重试。在初始快速请求上将 max_retries 设置为 0,以跳过自动重试,并在遇到速率限制错误时立即失败。

由于将 max_retries 设置为 0 也会禁用对其他瞬时错误(过载、内部服务器错误)的重试,以下示例会针对这些情况使用默认重试设置重新发出原始请求。

client = anthropic.Anthropic()


def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
    try:
        return client.with_options(max_retries=max_retries).beta.messages.create(
            **params
        )
    except anthropic.RateLimitError:
        if params.get("speed") == "fast":
            del params["speed"]
            return create_message_with_fast_fallback(max_retries=max_retries, **params)
        raise
    except (
        anthropic.APIStatusError,
        anthropic.APIConnectionError,
    ) as error:
        if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
            raise
        if max_attempts > 1:
            return create_message_with_fast_fallback(
                max_retries=max_retries, max_attempts=max_attempts - 1, **params
            )
        raise


message = create_message_with_fast_fallback(
    model="claude-opus-5-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello"}],
    betas=["fast-mode-2026-02-01"],
    speed="fast",
    max_retries=0,
)

注意事项

  • 提示缓存: 在快速速度和标准速度之间切换会使提示缓存失效。不同速度的请求不共享缓存的前缀。
  • 支持的模型: 快速模式支持 Claude Opus 5.5、Claude Opus 5 和 Claude Opus 4.8。请参阅支持的模型。
  • TTFT: 快速模式的优势集中在每秒输出令牌数(OTPS),而非首令牌时间(TTFT)。
  • Batch API: 快速模式不适用于 Batch API。
  • Priority Tier: 快速模式不适用于 Priority Tier 承诺。
  • Claude Platform on AWS: 快速模式目前不适用于 Claude Platform on AWS。

后续步骤

从智能体工作流中获取经过验证的 JSON 结果。

了解 Anthropic 针对模型和功能的定价结构。

使用 effort 参数控制 Claude 在响应时使用多少令牌,在响应的详尽程度与令牌效率之间进行权衡。

通过服务器发送事件以增量方式流式传输 Messages API 响应,包括文本、工具使用和扩展思考增量。

Was this page helpful?