Быстрый режим (исследовательская предварительная версия)
Получайте до 2,5 раз больше выходных токенов в секунду от поддерживаемых моделей Claude Opus.
«Fast mode» (быстрый режим) обеспечивает до 2,5 раза больше выходных токенов в секунду для Claude Opus 5.5, Claude Opus 5 и Claude Opus 4.8 по премиальным ценам. Чтобы включить его, укажите в запросе speed: "fast" вместе с «beta header» (бета-заголовком) fast-mode-2026-02-01.
Поддерживаемые модели
Быстрый режим поддерживается на следующих моделях:
- Claude Opus 5.5 ()
- Claude Opus 5 ()
- Claude Opus 4.8 ()
Как работает быстрый режим
Быстрый режим запускает ту же модель с более быстрой конфигурацией инференса. Интеллект и возможности не меняются.
- До 2,5 раз больше выходных токенов в секунду по сравнению со стандартной скоростью
- Преимущества в скорости сосредоточены на «output tokens per second» (выходных токенах в секунду), или OTPS, а не на «time to first token» (времени до первого токена), или TTFT
- Те же веса и поведение модели (это не другая модель)
- Совместим с потоковой передачей (streaming), где прирост OTPS наиболее заметен
Базовое использование
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Цены
Цена быстрого режима определяется множителем к стандартным ставкам для всего контекстного окна (context window), включая запросы свыше 200 тыс. входных токенов. В следующей таблице приведены цены быстрого режима для поддерживаемых моделей:
| Модель | Входные токены | Выходные токены |
|---|---|---|
| Claude Opus 5.5 | $8 USD / MTok | $40 USD / MTok |
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
Цены быстрого режима суммируются с другими ценовыми модификаторами:
- Множители кэширования подсказок применяются поверх цен быстрого режима
- Множители резидентности данных применяются поверх цен быстрого режима
Полную информацию о ценах см. на странице Цены.
Ограничения скорости
Быстрый режим имеет выделенное ограничение скорости (rate limit), отдельное от стандартных ограничений скорости Opus. Когда ваше ограничение скорости быстрого режима превышено, API возвращает ошибку 429 с заголовком retry-after, указывающим, когда ёмкость станет доступна.
Ответ включает заголовки, указывающие состояние вашего ограничения скорости быстрого режима:
| Заголовок | Описание |
|---|---|
anthropic-fast-input-tokens-limit | Максимальное количество входных токенов быстрого режима в минуту |
anthropic-fast-input-tokens-remaining | Оставшиеся входные токены быстрого режима |
anthropic-fast-input-tokens-reset | Время сброса лимита входных токенов быстрого режима |
anthropic-fast-output-tokens-limit | Максимальное количество выходных токенов быстрого режима в минуту |
anthropic-fast-output-tokens-remaining | Оставшиеся выходные токены быстрого режима |
anthropic-fast-output-tokens-reset | Время сброса лимита выходных токенов быстрого режима |
Ограничения скорости для конкретных уровней см. на странице Ограничения скорости.
Проверка использованной скорости
Объект usage в ответе включает поле speed, указывающее, какая скорость была использована: "fast" или "standard". Запрос speed: "fast" к модели, не поддерживающей быстрый режим, возвращает ошибку, как и превышение ограничений скорости или ёмкости быстрого режима (429 или 529). Когда запрос с speed: "fast" выполняется успешно, usage.speed равно "fast". Если вы используете Claude Opus 4.6 и запрашиваете быстрый режим, его поведение уникально. Вместо возврата ошибки, как у других моделей, не поддерживающих быстрый режим, он незаметно переключается на стандартную скорость. Хотя с Opus 4.6 ошибки нет, поле speed точно показывает "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Чтобы отслеживать использование и затраты быстрого режима в вашей организации, см. API использования и затрат.
Повторные попытки и резервный вариант
Автоматические повторные попытки
При превышении ограничений скорости быстрого режима API возвращает ошибку 429 с заголовком retry-after. SDK Anthropic по умолчанию автоматически повторяют такие запросы до 2 раз (настраивается с помощью max_retries), ожидая перед каждой повторной попыткой задержку, указанную сервером. Поскольку быстрый режим использует непрерывное пополнение токенов, задержка retry-after обычно невелика, и запросы выполняются успешно, как только ёмкость становится доступной.
Переключение на стандартную скорость
Если вы предпочитаете переключиться на стандартную скорость, а не ждать освобождения ёмкости быстрого режима, перехватите ошибку ограничения скорости и повторите запрос без speed: "fast". Установите max_retries в 0 для первоначального быстрого запроса, чтобы пропустить автоматические повторные попытки и сразу получить ошибку при превышении ограничения скорости.
Поскольку установка max_retries в 0 также отключает повторные попытки для других временных ошибок (перегрузка, внутренние ошибки сервера), в следующих примерах для таких случаев исходный запрос отправляется повторно с повторными попытками по умолчанию.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Что следует учитывать
- Кэширование подсказок: переключение между быстрой и стандартной скоростью делает кэш подсказок недействительным. Запросы с разной скоростью не используют общие кэшированные префиксы.
- Поддерживаемые модели: быстрый режим поддерживается моделями Claude Opus 5.5, Claude Opus 5 и Claude Opus 4.8. См. Поддерживаемые модели.
- TTFT: преимущества быстрого режима касаются выходных токенов в секунду (OTPS), а не времени до первого токена (TTFT).
- Batch API: быстрый режим недоступен при использовании Batch API.
- Priority Tier: быстрый режим недоступен при наличии обязательства Priority Tier.
- Claude Platform on AWS: быстрый режим в настоящее время недоступен в Claude Platform on AWS.
Следующие шаги
Получайте проверенные результаты JSON из агентных рабочих процессов.
Узнайте о структуре цен Anthropic на модели и функции.
Управляйте количеством токенов, которые Claude использует при ответе, с помощью параметра effort, балансируя между тщательностью ответа и эффективностью использования токенов.
Передавайте ответы Messages API потоком по частям с помощью server-sent events, включая текст, использование инструментов и дельты расширенных размышлений.
Was this page helpful?