Claude Platform Docs
Messagesモデルの機能

高速モード(リサーチプレビュー)

対応するClaude Opusモデルで、1秒あたりの出力トークン数を最大2.5倍に高めます。

「fast mode」(高速モード)は、Claude Opus 5.5、Claude Opus 5、およびClaude Opus 4.8において、プレミアム料金で1秒あたりの出力トークン数を最大2.5倍に高めます。利用するには、リクエストでfast-mode-2026-02-01ベータヘッダーとともにspeed: "fast"を設定してください。

対応モデル

高速モードは以下のモデルでサポートされています。

  • Claude Opus 5.5 ()
  • Claude Opus 5 ()
  • Claude Opus 4.8 ()

高速モードの仕組み

高速モードは、同じモデルをより高速な推論構成で実行します。知能や機能に変更はありません。

  • 標準速度と比較して、1秒あたりの出力トークン数が最大2.5倍
  • 速度のメリットは、「time to first token」(最初のトークンまでの時間)、すなわちTTFTではなく、「output tokens per second」(1秒あたりの出力トークン数)、すなわちOTPSに焦点を当てています
  • 同じモデルの重みと動作(別のモデルではありません)
  • ストリーミングと互換性があり、OTPSの向上が最も顕著に現れます

基本的な使い方

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[
        {"role": "user", "content": "Refactor this module to use dependency injection"}
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

料金

高速モードは、200k入力トークンを超えるリクエストを含め、コンテキストウィンドウ全体にわたって標準料金に対する倍率で価格設定されています。以下の表は、対応モデルの高速モード料金を示しています。

モデル入力出力
Claude Opus 5.5$8 USD / MTok$40 USD / MTok
Claude Opus 5 / Claude Opus 4.8$10 USD / MTok$50 USD / MTok

高速モードの料金は、他の料金修飾子と重ねて適用されます。

料金の詳細については、料金ページを参照してください。

レート制限

高速モードには、標準のOpusのレート制限とは別の専用のレート制限があります。高速モードのレート制限を超えると、APIは容量が利用可能になる時期を示すretry-afterヘッダーとともに429エラーを返します。

レスポンスには、高速モードのレート制限の状態を示すヘッダーが含まれます。

ヘッダー説明
anthropic-fast-input-tokens-limit1分あたりの高速モード入力トークンの最大数
anthropic-fast-input-tokens-remaining残りの高速モード入力トークン数
anthropic-fast-input-tokens-reset高速モード入力トークン制限がリセットされる時刻
anthropic-fast-output-tokens-limit1分あたりの高速モード出力トークンの最大数
anthropic-fast-output-tokens-remaining残りの高速モード出力トークン数
anthropic-fast-output-tokens-reset高速モード出力トークン制限がリセットされる時刻

ティア別のレート制限については、レート制限ページを参照してください。

使用された速度の確認

レスポンスのusageオブジェクトには、使用された速度("fast"または"standard"のいずれか)を示すspeedフィールドが含まれます。高速モードをサポートしていないモデルでspeed: "fast"をリクエストするとエラーが返され、高速モードのレート制限または容量を超えた場合(429または529)も同様です。speed: "fast"を指定したリクエストが成功すると、usage.speedは"fast"になります。Claude Opus 4.6を使用して高速モードをリクエストした場合、その動作は独特です。高速モードをサポートしていない他のモデルのようにエラーを返すのではなく、暗黙的に標準速度に切り替わります。Opus 4.6ではエラーは発生しませんが、speedフィールドには正確に"standard"と表示されます。

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=1024,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "Hello"}],
)

print(response.usage.speed)  # "fast" or "standard"
Output
{
  "id": "msg_01XFDUDYJgAACzvnptvVoYEL",
  "type": "message",
  "role": "assistant",

  "usage": {
    "input_tokens": 8,
    "output_tokens": 12,
    "speed": "fast"
  }
}

組織全体の高速モードの使用量とコストを追跡するには、Usage and Cost APIを参照してください。

リトライとフォールバック

自動リトライ

高速モードのレート制限を超えると、APIはretry-afterヘッダー付きの429エラーを返します。Anthropic SDKは、デフォルトでこれらのリクエストを最大2回自動的にリトライし(max_retriesで設定可能)、各リトライの前にサーバーが指定した遅延時間だけ待機します。高速モードではトークンが継続的に補充されるため、retry-afterの遅延は通常短く、容量が利用可能になるとリクエストは成功します。

標準速度へのフォールバック

高速モードの容量を待つよりも標準速度にフォールバックしたい場合は、レート制限エラーをキャッチし、speed: "fast"を指定せずにリトライしてください。最初の高速リクエストでmax_retriesを0に設定すると、自動リトライをスキップし、レート制限エラー時に即座に失敗させることができます。

max_retriesを0に設定すると、他の一時的なエラー(過負荷、内部サーバーエラー)に対するリトライも無効になるため、以下の例ではそれらのケースに対してデフォルトのリトライ設定で元のリクエストを再発行しています。

client = anthropic.Anthropic()


def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
    try:
        return client.with_options(max_retries=max_retries).beta.messages.create(
            **params
        )
    except anthropic.RateLimitError:
        if params.get("speed") == "fast":
            del params["speed"]
            return create_message_with_fast_fallback(max_retries=max_retries, **params)
        raise
    except (
        anthropic.APIStatusError,
        anthropic.APIConnectionError,
    ) as error:
        if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
            raise
        if max_attempts > 1:
            return create_message_with_fast_fallback(
                max_retries=max_retries, max_attempts=max_attempts - 1, **params
            )
        raise


message = create_message_with_fast_fallback(
    model="claude-opus-5-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello"}],
    betas=["fast-mode-2026-02-01"],
    speed="fast",
    max_retries=0,
)

考慮事項

  • プロンプトキャッシング: 高速と標準速度を切り替えると、プロンプトキャッシュが無効になります。異なる速度のリクエスト間では、キャッシュされたプレフィックスは共有されません。
  • 対応モデル: 高速モードはClaude Opus 5.5、Claude Opus 5、およびClaude Opus 4.8でサポートされています。対応モデルを参照してください。
  • TTFT: 高速モードの利点は、最初のトークンまでの時間(TTFT)ではなく、1秒あたりの出力トークン数(OTPS)に重点が置かれています。
  • Batch API: 高速モードはBatch APIでは利用できません。
  • Priority Tier: 高速モードはPriority Tierのコミットメントでは利用できません。
  • Claude Platform on AWS: 高速モードは現在、Claude Platform on AWSでは利用できません。

次のステップ

エージェントワークフローから検証済みのJSON結果を取得します。

モデルと機能に関するAnthropicの料金体系について学びます。

effortパラメータを使用して、Claudeが応答時に使用するトークン数を制御し、応答の徹底度とトークン効率のバランスを調整します。

テキスト、ツール使用、拡張思考のデルタを含むMessages APIのレスポンスを、サーバー送信イベントで段階的にストリーミングします。

Was this page helpful?