О том, как «zero data retention» (нулевое хранение данных), или ZDR, применяется к этой функции, см. API и хранение данных.
Мышление Claude адаптивно: модель оценивает каждый запрос и сама решает, думать ли и насколько глубоко. Вы задаёте намерение, при желании указываете усилие (effort), а модель распределяет рассуждения там, где, по её оценке, они помогут.
Это делает мышление отличным выбором для рабочих нагрузок, в которых смешаны тривиальные и сложные запросы, а также для долгосрочных агентных рабочих процессов, где нужный объём рассуждений меняется от шага к шагу.
О том, как включить мышление, как читать вывод мышления, и о выводе мышления в Claude Fable 5 и Claude Mythos 5, см. обзор Мышление. На этой странице рассматривается, как Claude решает, когда думать, как управлять этим решением, а также механика кэширования, стоимости и тарификации, которая из этого следует.
Мышление для модели необязательно. При каждом запросе Claude взвешивает сложность входных данных и решает, улучшат ли ответ более глубокие рассуждения. Простой фактический вопрос может получить прямой ответ вообще без блока мышления; многошаговая математическая задача или хитрая задача отладки запускает более глубокие рассуждения.
Решение принимается для каждого запроса. Один и тот же разговор может содержать ходы с мышлением и без него, а ход, на котором Claude решил не думать, не содержит блока мышления. Не стройте логику приложения, предполагающую, что каждый ход ассистента начинается с такого блока.
Основным средством управления этим решением является параметр effort, который действует как мягкое указание того, насколько охотно Claude должен думать и насколько глубоко; см. Уровни усилий на этой странице, чтобы узнать, что делает каждый уровень.
Если вы хотите, чтобы Claude думал реже, понизьте уровень усилий, прежде чем прибегать к управлению через подсказки.
Мышление также автоматически чередуется с использованием инструментов: Claude может думать между вызовами инструментов, осмысливая каждый результат инструмента перед тем, как решить, что делать дальше (чередующееся мышление). Для этого не нужен бета-заголовок или какая-либо дополнительная конфигурация.
Полную картину того, как взаимодействуют конфигурация мышления и параметр effort, см. в разделе Мышление и effort.
То, будет ли Claude думать на данном ходу, можно задавать через подсказки. Effort задаёт общую установку, но вы также можете напрямую влиять на решение с помощью указаний на естественном языке — либо глобально в системной подсказке, либо для каждого сообщения в ходе пользователя.
Используйте эти два рычага вместе в следующем порядке:
Более общие рекомендации по подсказкам с мышлением см. в разделе используйте возможности мышления и чередующегося мышления.
Effort — это основной рычаг управления мышлением. Каждый уровень задаёт своё значение по умолчанию для того, как часто Claude думает и насколько глубоко:
| Уровень effort | Поведение мышления |
|---|---|
max | Claude всегда думает без ограничений на глубину мышления. |
xhigh | Claude всегда думает глубоко с расширенным исследованием. |
high (по умолчанию) | Claude почти всегда думает. Обеспечивает глубокие рассуждения для сложных задач. |
medium | Claude использует умеренное мышление. Может пропускать мышление для простых запросов. |
low | Claude минимизирует мышление. Пропускает мышление для простых задач, где скорость важнее всего. |
Эта таблица описывает, как каждый уровень меняет поведение мышления. Рекомендации по выбору уровня для конкретной рабочей нагрузки, включая рекомендации для каждой модели, см. в разделе Когда настраивать параметр effort на странице effort.
Effort задаётся в output_config.effort, а не внутри объекта thinking; полные примеры для каждого языка см. в разделе Effort.
{
"model": "claude-opus-4-8",
"max_tokens": 4096,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Доступность уровней зависит от модели; таблица доступности effort на странице effort является авторитетным источником информации о том, какие уровни поддерживает каждая модель.
Указания в системной подсказке смещают порог мышления Claude для каждого запроса в разговоре. Если Claude думает чаще, чем нужно вашей рабочей нагрузке, добавьте в системную подсказку указание вроде этого:
Extended thinking adds latency and should only be used when it
will meaningfully improve answer quality, typically for problems
that require multistep reasoning. When in doubt, respond directly.Чтобы, наоборот, поощрить мышление, используйте фразу вроде:
This task involves multistep reasoning. Think carefully before responding.Эффективность управления может быть чувствительна к точной формулировке. Если одна формулировка не даёт желаемого поведения, попробуйте более прямой вариант.
Вы также можете управлять мышлением на уровне отдельных сообщений из хода пользователя, независимо от системной подсказки. Добавление "Please think hard before responding." к сообщению пользователя поощряет Claude думать на этом ходу; "Answer directly without deliberating." подавляет мышление.
Управление на уровне отдельных сообщений полезно, когда только некоторые запросы в разговоре требуют расширенных рассуждений. Например, агентная обвязка может добавлять поощряющую фразу на шагах планирования и подавляющую фразу на рутинных подтверждениях, не трогая системную подсказку и не меняя никаких параметров запроса между ходами.
Управление через подсказки меняет поведение модели, поэтому относитесь к нему как к любому другому изменению подсказки: измеряйте перед выпуском. Прогоните репрезентативную выборку вашего трафика с указаниями и без них и сравните, как часто срабатывает мышление (наличие блоков мышления в ответах), использование выходных токенов, задержку и качество ответов в важных для вас случаях.
Управление, побуждающее Claude думать реже, может снизить качество на задачах, которым рассуждения идут на пользу. Понижение уровня effort обычно является лучшим первым рычагом, поскольку это откалиброванный элемент управления, а не инструкция, чувствительная к формулировке. Измерьте влияние на ваши конкретные рабочие нагрузки, прежде чем развёртывать настройку через подсказки в продакшене.
Из того, что Claude сам управляет своим мышлением, следуют три механики: валидация ходов, кэширование подсказок и то, как вы ограничиваете стоимость.
Ходы ассистента не обязаны начинаться с блока мышления. (Модели, использующие устаревший ручной бюджет мышления, требуют, чтобы последний ход ассистента в запросе с включённым мышлением начинался с такого блока; см. Структура ходов в ручном режиме.)
Для многоходовых приложений это означает, что вы можете передавать историю разговора в том виде, в каком она у вас есть:
Это послабление касается валидации, а не того, что вам следует отправлять. Когда у вас есть блоки мышления, передавайте их обратно без изменений, особенно во время использования инструментов, где они содержат рассуждения, стоящие за вызовами инструментов Claude. Полные правила см. в обзоре Мышление.
Последовательные запросы, сохраняющие одну и ту же конфигурацию мышления и уровень усилий, сохраняют кэширование подсказок; полные правила см. в разделе Мышление и кэширование подсказок. Разрешённое значение effort встраивается в подсказку, поэтому его изменение между запросами инвалидирует точки останова кэша, точно так же, как изменение устаревшего параметра budget_tokens на моделях, которые его используют. Явная установка effort в значение по умолчанию для модели эквивалентна его отсутствию и не ломает кэш.
Практическое следствие: выберите конфигурацию мышления и уровень усилий для разговора и придерживайтесь их. Если некоторым ходам нужно больше или меньше мышления, управляйте с помощью подсказок на уровне отдельных сообщений: указание, добавленное к самому новому сообщению пользователя, оставляет более ранние точки останова кэша нетронутыми, тогда как изменение конфигурации или effort — нет.
Следующий пример демонстрирует инвалидацию с помощью многоходового скрипта, который вы можете запустить сами:
Вы не задаёте бюджет токенов мышления. Стоимость ограничивают два элемента управления:
max_tokens — это жёсткий предел общего вывода для запроса, включая мышление и текст ответа вместе. Claude никогда не генерирует сверх него. В цикле использования инструментов каждый запрос в ходе имеет свой собственный max_tokens, поэтому он не ограничивает расходы всего хода.effort — это мягкое указание того, какую часть этого вывода Claude выделяет на мышление. Оно формирует поведение, но не гарантирует количество токенов.Поскольку мышление учитывается в max_tokens, установите его достаточно высоким, чтобы оставить место и для рассуждений, и для ответа. max_tokens, рассчитанный на ответ без мышления, часто оказывается слишком маленьким, когда Claude начинает думать над сложными запросами.
При уровне усилий high и выше Claude может думать обширно и с большей вероятностью исчерпает бюджет. Если вы видите в ответах stop_reason: "max_tokens", у вас есть два средства:
max_tokens, чтобы дать модели больше места для мышления плюс ответа.Какой вариант правильный, зависит от того, нужны ли были рассуждения обрезанным ответам. Если качество этих запросов важно, повысьте предел; если они были «передуманы», понизьте effort.
Мышление влечёт за собой плату за:
Когда мышление активно, автоматически включается специализированная системная подсказка для поддержки этой функции.
То, за что вы платите, одинаково независимо от настройки display; меняется только то, что вы видите:
display: "summarized" | display: "omitted" | |
|---|---|---|
| Входные токены | Токены в вашем исходном запросе | То же, что и при summarized |
| Выходные токены (тарифицируемые) | Полные токены мышления, которые Claude сгенерировал внутренне | То же, что и при summarized |
| Выходные токены (видимые) | Суммаризированный текст мышления | Ноль токенов мышления (поле thinking пустое) |
| Генерация сводки | Без оплаты | Неприменимо |
Тарифицируемое количество выходных токенов не совпадает с видимым количеством токенов в ответе. Вы платите за полный процесс мышления, а не за содержимое мышления, видимое в ответе.
Чтобы узнать, сколько тарифицируемых выходных токенов было потрачено на внутренние рассуждения, прочитайте usage.output_tokens_details.thinking_tokens в ответе. Это значение отражает необработанные рассуждения, сгенерированные моделью (а не суммаризированный текст, возвращённый в теле), и всегда меньше или равно output_tokens. Вычтите его из output_tokens, чтобы приблизительно оценить часть вывода, не связанную с рассуждениями. При потоковой передаче эта разбивка появляется только в финальном событии message_delta.
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}output_tokens остаётся инклюзивным, авторитетным итогом, используемым для тарификации. output_tokens_details — это разбивка только для чтения, предназначенная для наблюдаемости. Полную информацию о ценах, включая базовые тарифы, записи в кэш, попадания в кэш и выходные токены, см. в разделе Цены.
Включите мышление, читайте вывод мышления и проверяйте поддержку для каждой модели.
Сохраняйте блоки мышления между вызовами инструментов и управляйте мышлением в многоходовых разговорах.
Управляйте тем, сколько мышления и вывода Claude выделяет на запрос.
Was this page helpful?