Claude Platform Docs
Messages모델 기능

Fast mode (리서치 프리뷰)

지원되는 Claude Opus 모델에서 초당 출력 토큰을 최대 2.5배 더 높게 얻으세요.

"Fast mode"(고속 모드)는 Claude Opus 5.5, Claude Opus 5, 및 Claude Opus 4.8에서 프리미엄 가격으로 초당 출력 토큰을 최대 2.5배까지 높여 줍니다. 사용하려면 요청에 fast-mode-2026-02-01 베타 헤더와 함께 speed: "fast"를 설정하세요.

지원 모델

Fast mode는 다음 모델에서 지원됩니다:

  • Claude Opus 5.5 ()
  • Claude Opus 5 ()
  • Claude Opus 4.8 ()

Fast mode 작동 방식

Fast mode는 동일한 모델을 더 빠른 추론 구성으로 실행합니다. 지능이나 기능에는 변화가 없습니다.

  • 표준 속도 대비 초당 출력 토큰 최대 2.5배 향상
  • 속도 이점은 "time to first token"(첫 토큰까지의 시간), 즉 TTFT가 아닌 "output tokens per second"(초당 출력 토큰), 즉 OTPS에 집중됩니다
  • 동일한 모델 가중치 및 동작(다른 모델이 아님)
  • OTPS 향상이 가장 잘 드러나는 스트리밍과 호환

기본 사용법

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[
        {"role": "user", "content": "Refactor this module to use dependency injection"}
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

요금

Fast mode는 200k 입력 토큰을 초과하는 요청을 포함하여 전체 컨텍스트 윈도우에 걸쳐 표준 요금에 배수를 적용한 가격으로 책정됩니다. 다음 표는 지원 모델의 fast mode 요금을 보여줍니다:

모델입력출력
Claude Opus 5.5$8 USD / MTok$40 USD / MTok
Claude Opus 5 / Claude Opus 4.8$10 USD / MTok$50 USD / MTok

Fast mode 요금은 다른 요금 수정자와 중첩 적용됩니다:

전체 요금 세부 정보는 요금 페이지를 참조하세요.

속도 제한

Fast mode에는 표준 Opus 속도 제한과 별도인 전용 "rate limit"(속도 제한)이 있습니다. Fast mode 속도 제한을 초과하면 API는 용량이 언제 사용 가능해지는지를 나타내는 retry-after 헤더와 함께 429 오류를 반환합니다.

응답에는 fast mode 속도 제한 상태를 나타내는 헤더가 포함됩니다:

헤더설명
anthropic-fast-input-tokens-limit분당 최대 fast mode 입력 토큰
anthropic-fast-input-tokens-remaining남은 fast mode 입력 토큰
anthropic-fast-input-tokens-resetFast mode 입력 토큰 제한이 재설정되는 시간
anthropic-fast-output-tokens-limit분당 최대 fast mode 출력 토큰
anthropic-fast-output-tokens-remaining남은 fast mode 출력 토큰
anthropic-fast-output-tokens-resetFast mode 출력 토큰 제한이 재설정되는 시간

티어별 속도 제한은 속도 제한 페이지를 참조하세요.

사용된 속도 확인하기

응답 usage 객체에는 사용된 속도를 나타내는 speed 필드가 포함되며, 값은 "fast" 또는 "standard"입니다. Fast mode를 지원하지 않는 모델에 speed: "fast"를 요청하면 오류가 반환되며, fast mode의 속도 제한이나 용량을 초과하는 경우(429 또는 529)에도 마찬가지입니다. speed: "fast"를 포함한 요청이 성공하면 usage.speed는 "fast"입니다. Claude Opus 4.6을 사용하면서 fast mode를 요청하는 경우 동작이 독특합니다. Fast mode를 지원하지 않는 다른 모델처럼 오류를 반환하는 대신, 조용히 표준 속도로 전환됩니다. Opus 4.6에서는 오류가 발생하지 않지만 speed 필드는 정확하게 "standard"를 표시합니다.

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=1024,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "Hello"}],
)

print(response.usage.speed)  # "fast" or "standard"
Output
{
  "id": "msg_01XFDUDYJgAACzvnptvVoYEL",
  "type": "message",
  "role": "assistant",

  "usage": {
    "input_tokens": 8,
    "output_tokens": 12,
    "speed": "fast"
  }
}

조직 전체의 fast mode 사용량과 비용을 추적하려면 사용량 및 비용 API를 참조하세요.

재시도 및 폴백

자동 재시도

Fast mode 속도 제한을 초과하면 API는 retry-after 헤더와 함께 429 오류를 반환합니다. Anthropic SDK는 기본적으로 이러한 요청을 최대 2회 자동으로 재시도하며(max_retries로 구성 가능), 각 재시도 전에 서버가 지정한 지연 시간만큼 대기합니다. Fast mode는 지속적인 토큰 보충 방식을 사용하므로 retry-after 지연 시간은 일반적으로 짧으며, 용량을 사용할 수 있게 되면 요청이 성공합니다.

표준 속도로 폴백하기

Fast mode 용량을 기다리는 대신 표준 속도로 폴백하려면, 속도 제한 오류를 포착한 후 speed: "fast" 없이 재시도하세요. 초기 fast 요청에서 max_retries를 0으로 설정하면 자동 재시도를 건너뛰고 속도 제한 오류 발생 시 즉시 실패하도록 할 수 있습니다.

max_retries를 0으로 설정하면 다른 일시적 오류(과부하, 내부 서버 오류)에 대한 재시도도 비활성화되므로, 다음 예제에서는 이러한 경우 기본 재시도 설정으로 원래 요청을 다시 보냅니다.

client = anthropic.Anthropic()


def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
    try:
        return client.with_options(max_retries=max_retries).beta.messages.create(
            **params
        )
    except anthropic.RateLimitError:
        if params.get("speed") == "fast":
            del params["speed"]
            return create_message_with_fast_fallback(max_retries=max_retries, **params)
        raise
    except (
        anthropic.APIStatusError,
        anthropic.APIConnectionError,
    ) as error:
        if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
            raise
        if max_attempts > 1:
            return create_message_with_fast_fallback(
                max_retries=max_retries, max_attempts=max_attempts - 1, **params
            )
        raise


message = create_message_with_fast_fallback(
    model="claude-opus-5-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello"}],
    betas=["fast-mode-2026-02-01"],
    speed="fast",
    max_retries=0,
)

고려 사항

  • 프롬프트 캐싱: Fast 속도와 표준 속도 간에 전환하면 캐시가 무효화됩니다. 서로 다른 속도의 요청은 캐시된 접두사를 공유하지 않습니다.
  • 지원 모델: Fast mode는 Claude Opus 5.5, Claude Opus 5, 및 Claude Opus 4.8에서 지원됩니다. 지원 모델을 참조하세요.
  • TTFT: Fast mode의 이점은 TTFT가 아니라 OTPS에 집중됩니다.
  • Batch API: Fast mode는 Batch API와 함께 사용할 수 없습니다.
  • Priority Tier: Fast mode는 Priority Tier 약정과 함께 사용할 수 없습니다.
  • Claude Platform on AWS: Fast mode는 현재 Claude Platform on AWS에서 사용할 수 없습니다.

다음 단계

에이전트 워크플로에서 검증된 JSON 결과를 얻으세요.

모델 및 기능에 대한 Anthropic의 요금 구조를 알아보세요.

effort 매개변수로 Claude가 응답할 때 사용하는 토큰 수를 제어하여 응답의 철저함과 토큰 효율성 사이의 균형을 조정하세요.

텍스트, 도구 사용, 확장 사고 델타를 포함한 Messages API 응답을 서버 전송 이벤트로 점진적으로 스트리밍하세요.

Was this page helpful?