Fast mode (리서치 프리뷰)
지원되는 Claude Opus 모델에서 초당 출력 토큰을 최대 2.5배 더 높게 얻으세요.
"Fast mode"(고속 모드)는 Claude Opus 5.5, Claude Opus 5, 및 Claude Opus 4.8에서 프리미엄 가격으로 초당 출력 토큰을 최대 2.5배까지 높여 줍니다. 사용하려면 요청에 fast-mode-2026-02-01 베타 헤더와 함께 speed: "fast"를 설정하세요.
지원 모델
Fast mode는 다음 모델에서 지원됩니다:
- Claude Opus 5.5 ()
- Claude Opus 5 ()
- Claude Opus 4.8 ()
Fast mode 작동 방식
Fast mode는 동일한 모델을 더 빠른 추론 구성으로 실행합니다. 지능이나 기능에는 변화가 없습니다.
- 표준 속도 대비 초당 출력 토큰 최대 2.5배 향상
- 속도 이점은 "time to first token"(첫 토큰까지의 시간), 즉 TTFT가 아닌 "output tokens per second"(초당 출력 토큰), 즉 OTPS에 집중됩니다
- 동일한 모델 가중치 및 동작(다른 모델이 아님)
- OTPS 향상이 가장 잘 드러나는 스트리밍과 호환
기본 사용법
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)요금
Fast mode는 200k 입력 토큰을 초과하는 요청을 포함하여 전체 컨텍스트 윈도우에 걸쳐 표준 요금에 배수를 적용한 가격으로 책정됩니다. 다음 표는 지원 모델의 fast mode 요금을 보여줍니다:
| 모델 | 입력 | 출력 |
|---|---|---|
| Claude Opus 5.5 | $8 USD / MTok | $40 USD / MTok |
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
Fast mode 요금은 다른 요금 수정자와 중첩 적용됩니다:
- 프롬프트 캐싱 배수는 fast mode 요금 위에 추가로 적용됩니다
- 데이터 레지던시 배수는 fast mode 요금 위에 추가로 적용됩니다
전체 요금 세부 정보는 요금 페이지를 참조하세요.
속도 제한
Fast mode에는 표준 Opus 속도 제한과 별도인 전용 "rate limit"(속도 제한)이 있습니다. Fast mode 속도 제한을 초과하면 API는 용량이 언제 사용 가능해지는지를 나타내는 retry-after 헤더와 함께 429 오류를 반환합니다.
응답에는 fast mode 속도 제한 상태를 나타내는 헤더가 포함됩니다:
| 헤더 | 설명 |
|---|---|
anthropic-fast-input-tokens-limit | 분당 최대 fast mode 입력 토큰 |
anthropic-fast-input-tokens-remaining | 남은 fast mode 입력 토큰 |
anthropic-fast-input-tokens-reset | Fast mode 입력 토큰 제한이 재설정되는 시간 |
anthropic-fast-output-tokens-limit | 분당 최대 fast mode 출력 토큰 |
anthropic-fast-output-tokens-remaining | 남은 fast mode 출력 토큰 |
anthropic-fast-output-tokens-reset | Fast mode 출력 토큰 제한이 재설정되는 시간 |
티어별 속도 제한은 속도 제한 페이지를 참조하세요.
사용된 속도 확인하기
응답 usage 객체에는 사용된 속도를 나타내는 speed 필드가 포함되며, 값은 "fast" 또는 "standard"입니다. Fast mode를 지원하지 않는 모델에 speed: "fast"를 요청하면 오류가 반환되며, fast mode의 속도 제한이나 용량을 초과하는 경우(429 또는 529)에도 마찬가지입니다. speed: "fast"를 포함한 요청이 성공하면 usage.speed는 "fast"입니다. Claude Opus 4.6을 사용하면서 fast mode를 요청하는 경우 동작이 독특합니다. Fast mode를 지원하지 않는 다른 모델처럼 오류를 반환하는 대신, 조용히 표준 속도로 전환됩니다. Opus 4.6에서는 오류가 발생하지 않지만 speed 필드는 정확하게 "standard"를 표시합니다.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}조직 전체의 fast mode 사용량과 비용을 추적하려면 사용량 및 비용 API를 참조하세요.
재시도 및 폴백
자동 재시도
Fast mode 속도 제한을 초과하면 API는 retry-after 헤더와 함께 429 오류를 반환합니다. Anthropic SDK는 기본적으로 이러한 요청을 최대 2회 자동으로 재시도하며(max_retries로 구성 가능), 각 재시도 전에 서버가 지정한 지연 시간만큼 대기합니다. Fast mode는 지속적인 토큰 보충 방식을 사용하므로 retry-after 지연 시간은 일반적으로 짧으며, 용량을 사용할 수 있게 되면 요청이 성공합니다.
표준 속도로 폴백하기
Fast mode 용량을 기다리는 대신 표준 속도로 폴백하려면, 속도 제한 오류를 포착한 후 speed: "fast" 없이 재시도하세요. 초기 fast 요청에서 max_retries를 0으로 설정하면 자동 재시도를 건너뛰고 속도 제한 오류 발생 시 즉시 실패하도록 할 수 있습니다.
max_retries를 0으로 설정하면 다른 일시적 오류(과부하, 내부 서버 오류)에 대한 재시도도 비활성화되므로, 다음 예제에서는 이러한 경우 기본 재시도 설정으로 원래 요청을 다시 보냅니다.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)고려 사항
- 프롬프트 캐싱: Fast 속도와 표준 속도 간에 전환하면 캐시가 무효화됩니다. 서로 다른 속도의 요청은 캐시된 접두사를 공유하지 않습니다.
- 지원 모델: Fast mode는 Claude Opus 5.5, Claude Opus 5, 및 Claude Opus 4.8에서 지원됩니다. 지원 모델을 참조하세요.
- TTFT: Fast mode의 이점은 TTFT가 아니라 OTPS에 집중됩니다.
- Batch API: Fast mode는 Batch API와 함께 사용할 수 없습니다.
- Priority Tier: Fast mode는 Priority Tier 약정과 함께 사용할 수 없습니다.
- Claude Platform on AWS: Fast mode는 현재 Claude Platform on AWS에서 사용할 수 없습니다.
다음 단계
Was this page helpful?