Claude Platform Docs
MessagesВозможности модели

Быстрый режим (исследовательская предварительная версия)

Получайте до 2,5 раз больше выходных токенов в секунду от поддерживаемых моделей Claude Opus.

«Fast mode» (быстрый режим) обеспечивает до 2,5 раза больше выходных токенов в секунду для Claude Opus 5.5, Claude Opus 5 и Claude Opus 4.8 по премиальным ценам. Чтобы включить его, укажите в запросе speed: "fast" вместе с «beta header» (бета-заголовком) fast-mode-2026-02-01.

Поддерживаемые модели

Быстрый режим поддерживается на следующих моделях:

  • Claude Opus 5.5 ()
  • Claude Opus 5 ()
  • Claude Opus 4.8 ()

Как работает быстрый режим

Быстрый режим запускает ту же модель с более быстрой конфигурацией инференса. Интеллект и возможности не меняются.

  • До 2,5 раз больше выходных токенов в секунду по сравнению со стандартной скоростью
  • Преимущества в скорости сосредоточены на «output tokens per second» (выходных токенах в секунду), или OTPS, а не на «time to first token» (времени до первого токена), или TTFT
  • Те же веса и поведение модели (это не другая модель)
  • Совместим с потоковой передачей (streaming), где прирост OTPS наиболее заметен

Базовое использование

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[
        {"role": "user", "content": "Refactor this module to use dependency injection"}
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

Цены

Цена быстрого режима определяется множителем к стандартным ставкам для всего контекстного окна (context window), включая запросы свыше 200 тыс. входных токенов. В следующей таблице приведены цены быстрого режима для поддерживаемых моделей:

МодельВходные токеныВыходные токены
Claude Opus 5.5$8 USD / MTok$40 USD / MTok
Claude Opus 5 / Claude Opus 4.8$10 USD / MTok$50 USD / MTok

Цены быстрого режима суммируются с другими ценовыми модификаторами:

Полную информацию о ценах см. на странице Цены.

Ограничения скорости

Быстрый режим имеет выделенное ограничение скорости (rate limit), отдельное от стандартных ограничений скорости Opus. Когда ваше ограничение скорости быстрого режима превышено, API возвращает ошибку 429 с заголовком retry-after, указывающим, когда ёмкость станет доступна.

Ответ включает заголовки, указывающие состояние вашего ограничения скорости быстрого режима:

ЗаголовокОписание
anthropic-fast-input-tokens-limitМаксимальное количество входных токенов быстрого режима в минуту
anthropic-fast-input-tokens-remainingОставшиеся входные токены быстрого режима
anthropic-fast-input-tokens-resetВремя сброса лимита входных токенов быстрого режима
anthropic-fast-output-tokens-limitМаксимальное количество выходных токенов быстрого режима в минуту
anthropic-fast-output-tokens-remainingОставшиеся выходные токены быстрого режима
anthropic-fast-output-tokens-resetВремя сброса лимита выходных токенов быстрого режима

Ограничения скорости для конкретных уровней см. на странице Ограничения скорости.

Проверка использованной скорости

Объект usage в ответе включает поле speed, указывающее, какая скорость была использована: "fast" или "standard". Запрос speed: "fast" к модели, не поддерживающей быстрый режим, возвращает ошибку, как и превышение ограничений скорости или ёмкости быстрого режима (429 или 529). Когда запрос с speed: "fast" выполняется успешно, usage.speed равно "fast". Если вы используете Claude Opus 4.6 и запрашиваете быстрый режим, его поведение уникально. Вместо возврата ошибки, как у других моделей, не поддерживающих быстрый режим, он незаметно переключается на стандартную скорость. Хотя с Opus 4.6 ошибки нет, поле speed точно показывает "standard".

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=1024,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "Hello"}],
)

print(response.usage.speed)  # "fast" or "standard"
Output
{
  "id": "msg_01XFDUDYJgAACzvnptvVoYEL",
  "type": "message",
  "role": "assistant",

  "usage": {
    "input_tokens": 8,
    "output_tokens": 12,
    "speed": "fast"
  }
}

Чтобы отслеживать использование и затраты быстрого режима в вашей организации, см. API использования и затрат.

Повторные попытки и резервный вариант

Автоматические повторные попытки

При превышении ограничений скорости быстрого режима API возвращает ошибку 429 с заголовком retry-after. SDK Anthropic по умолчанию автоматически повторяют такие запросы до 2 раз (настраивается с помощью max_retries), ожидая перед каждой повторной попыткой задержку, указанную сервером. Поскольку быстрый режим использует непрерывное пополнение токенов, задержка retry-after обычно невелика, и запросы выполняются успешно, как только ёмкость становится доступной.

Переключение на стандартную скорость

Если вы предпочитаете переключиться на стандартную скорость, а не ждать освобождения ёмкости быстрого режима, перехватите ошибку ограничения скорости и повторите запрос без speed: "fast". Установите max_retries в 0 для первоначального быстрого запроса, чтобы пропустить автоматические повторные попытки и сразу получить ошибку при превышении ограничения скорости.

Поскольку установка max_retries в 0 также отключает повторные попытки для других временных ошибок (перегрузка, внутренние ошибки сервера), в следующих примерах для таких случаев исходный запрос отправляется повторно с повторными попытками по умолчанию.

client = anthropic.Anthropic()


def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
    try:
        return client.with_options(max_retries=max_retries).beta.messages.create(
            **params
        )
    except anthropic.RateLimitError:
        if params.get("speed") == "fast":
            del params["speed"]
            return create_message_with_fast_fallback(max_retries=max_retries, **params)
        raise
    except (
        anthropic.APIStatusError,
        anthropic.APIConnectionError,
    ) as error:
        if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
            raise
        if max_attempts > 1:
            return create_message_with_fast_fallback(
                max_retries=max_retries, max_attempts=max_attempts - 1, **params
            )
        raise


message = create_message_with_fast_fallback(
    model="claude-opus-5-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello"}],
    betas=["fast-mode-2026-02-01"],
    speed="fast",
    max_retries=0,
)

Что следует учитывать

  • Кэширование подсказок: переключение между быстрой и стандартной скоростью делает кэш подсказок недействительным. Запросы с разной скоростью не используют общие кэшированные префиксы.
  • Поддерживаемые модели: быстрый режим поддерживается моделями Claude Opus 5.5, Claude Opus 5 и Claude Opus 4.8. См. Поддерживаемые модели.
  • TTFT: преимущества быстрого режима касаются выходных токенов в секунду (OTPS), а не времени до первого токена (TTFT).
  • Batch API: быстрый режим недоступен при использовании Batch API.
  • Priority Tier: быстрый режим недоступен при наличии обязательства Priority Tier.
  • Claude Platform on AWS: быстрый режим в настоящее время недоступен в Claude Platform on AWS.

Следующие шаги

Получайте проверенные результаты JSON из агентных рабочих процессов.

Узнайте о структуре цен Anthropic на модели и функции.

Управляйте количеством токенов, которые Claude использует при ответе, с помощью параметра effort, балансируя между тщательностью ответа и эффективностью использования токенов.

Передавайте ответы Messages API потоком по частям с помощью server-sent events, включая текст, использование инструментов и дельты расширенных размышлений.

Was this page helpful?