高速モードは、Claude Opus 5およびClaude Opus 4.8において、プレミアム価格で1秒あたりの出力トークン数を最大2.5倍に向上させます。リクエストにfast-mode-2026-02-01ベータヘッダーとともにspeed: "fast"を設定することでオプトインできます。
高速モードは以下のモデルでサポートされています。
高速モードは、同じモデルをより高速な推論構成で実行します。知能や機能に変更はありません。
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)高速モードは、200k入力トークンを超えるリクエストを含むコンテキストウィンドウ全体にわたって、標準料金に対する倍率で価格設定されています。以下の表は、対応モデルの高速モード料金を示しています。
| モデル | 入力 | 出力 |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
高速モードの料金は、他の料金修飾子と重ねて適用されます。
料金の詳細については、料金ページを参照してください。
高速モードには、標準のOpusレート制限とは別の専用レート制限があります。高速モードのレート制限を超えると、APIは429エラーを返し、容量が利用可能になる時刻を示すretry-afterヘッダーを含めます。
レスポンスには、高速モードのレート制限ステータスを示すヘッダーが含まれます。
| ヘッダー | 説明 |
|---|---|
anthropic-fast-input-tokens-limit | 1分あたりの高速モード入力トークンの最大数 |
anthropic-fast-input-tokens-remaining | 残りの高速モード入力トークン数 |
anthropic-fast-input-tokens-reset | 高速モード入力トークン制限がリセットされる時刻 |
anthropic-fast-output-tokens-limit | 1分あたりの高速モード出力トークンの最大数 |
anthropic-fast-output-tokens-remaining | 残りの高速モード出力トークン数 |
anthropic-fast-output-tokens-reset | 高速モード出力トークン制限がリセットされる時刻 |
ティア別のレート制限については、レート制限ページを参照してください。
レスポンスのusageオブジェクトには、使用された速度を示すspeedフィールドが含まれており、"fast"または"standard"のいずれかです。高速モードをサポートしていないモデルでspeed: "fast"をリクエストするとエラーが返され、高速モードのレート制限または容量を超えた場合も同様です(429または529)。speed: "fast"を指定したリクエストが成功した場合、usage.speedは"fast"になります。Claude Opus 4.6を使用して高速モードをリクエストした場合、その動作は特殊です。高速モードをサポートしていない他のモデルのようにエラーを返すのではなく、暗黙的に標準速度に切り替わります。Opus 4.6ではエラーは発生しませんが、speedフィールドには正確に"standard"と表示されます。
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}組織全体での高速モードの使用状況とコストを追跡するには、Usage and Cost APIを参照してください。
高速モードのレート制限を超えると、APIはretry-afterヘッダーを含む429エラーを返します。Anthropic SDKは、デフォルトで最大2回(max_retriesで設定可能)これらのリクエストを自動的にリトライし、各リトライの前にサーバーが指定した遅延時間だけ待機します。高速モードは継続的なトークン補充を使用するため、retry-afterの遅延は通常短く、容量が利用可能になるとリクエストは成功します。
高速モードの容量を待つのではなく標準速度にフォールバックしたい場合は、レート制限エラーをキャッチし、speed: "fast"を指定せずにリトライしてください。最初の高速リクエストでmax_retriesを0に設定すると、自動リトライをスキップしてレート制限エラー時に即座に失敗します。
max_retriesを0に設定すると、他の一時的なエラー(過負荷、内部サーバーエラー)に対するリトライも無効になるため、以下の例ではそれらのケースに対してデフォルトのリトライで元のリクエストを再発行しています。
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)エージェントワークフローから検証済みのJSON結果を取得します。
モデルと機能に関するAnthropicの料金体系について学びます。
effortパラメータを使用して、Claudeが応答時に使用するトークン数を制御し、応答の網羅性とトークン効率のトレードオフを調整します。
テキスト、ツール使用、拡張思考のデルタを含むMessages APIレスポンスを、server-sent eventsで段階的にストリーミングします。
Was this page helpful?