O parâmetro "effort" (esforço) permite controlar quantos tokens o Claude gasta ao responder a requisições. Você pode equilibrar entre a completude da resposta e a eficiência de tokens com um único modelo. O parâmetro effort está disponível em todos os modelos compatíveis, sem necessidade de cabeçalho beta.
Por padrão, o Claude usa effort alto, gastando quantos tokens forem necessários para obter resultados excelentes. Você pode aumentar o nível de effort para max para obter a capacidade máxima absoluta, ou reduzi-lo para ser mais conservador com o uso de tokens, otimizando para velocidade e custo enquanto aceita alguma redução na capacidade.
O parâmetro effort afeta todos os tokens na resposta, incluindo:
Essa abordagem tem duas vantagens principais:
| Nível | Descrição | Caso de uso típico |
|---|---|---|
max | Capacidade máxima absoluta sem restrições no gasto de tokens. Disponível no Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Mythos Preview, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5 e Claude Sonnet 4.6. | Tarefas que exigem o raciocínio mais profundo possível e a análise mais completa |
xhigh | Capacidade estendida para trabalho de longo horizonte. Disponível no Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7 e Claude Sonnet 5. | Tarefas agênticas e de codificação de longa duração (mais de 30 minutos) com orçamentos de tokens na casa dos milhões |
high | Alta capacidade. Equivalente a não definir o parâmetro. | Raciocínio complexo, problemas difíceis de codificação, tarefas agênticas |
medium | Abordagem equilibrada com economia moderada de tokens. | Tarefas agênticas que exigem equilíbrio entre velocidade, custo e desempenho |
low | Mais eficiente. Economia significativa de tokens com alguma redução de capacidade. | Tarefas mais simples que precisam da melhor velocidade e dos menores custos, como subagentes |
xhigh é um nível mais recente; alguns modelos que suportam max não suportam xhigh.
O Claude Sonnet 5 usa effort high por padrão na API do Claude e no Claude Code.
O Sonnet 4.6 usa effort high por padrão. Defina o effort explicitamente ao usar o Sonnet 4.6 para evitar latência inesperada:
Comece com xhigh para casos de uso de codificação e agênticos, e use high como mínimo para a maioria das cargas de trabalho sensíveis à inteligência. Reduza para medium em cargas de trabalho sensíveis a custo, ou aumente para max apenas quando suas avaliações mostrarem margem mensurável de melhoria em xhigh.
O padrão da API é high. Para usar xhigh, defina effort explicitamente; o valor que você passa substitui o padrão.
| Effort | Orientação para o Claude Opus 4.7 |
|---|---|
low | Eficiente, mas melhor para tarefas curtas e bem delimitadas. Combine low com checklists explícitas se sua tarefa tiver várias seções. |
medium | A opção direta para o fluxo de trabalho médio em que você quer bons resultados enquanto reduz custos. |
high | Casos de uso avançados que ainda precisam de equilíbrio entre inteligência e consumo de tokens. Este é frequentemente o melhor equilíbrio entre qualidade e eficiência de tokens. |
xhigh | O ponto de partida recomendado para trabalho de codificação e agêntico, e para tarefas exploratórias como chamadas repetidas de ferramentas, busca detalhada na web e busca em bases de conhecimento. Espere um uso de tokens significativamente maior do que em high. |
max | Reserve para problemas genuinamente de fronteira. Na maioria das cargas de trabalho, max adiciona custo significativo para ganhos de qualidade relativamente pequenos, e em algumas tarefas de saída estruturada ou menos sensíveis à inteligência pode levar a excesso de raciocínio. |
O Claude Opus 4.7 também respeita os níveis de effort de forma mais estrita do que o Claude Opus 4.6, especialmente em low e medium. Em níveis de effort mais baixos, o modelo limita seu trabalho ao que foi solicitado em vez de fazer mais do que o pedido. Se você observar raciocínio superficial em problemas complexos com o Claude Opus 4.7, aumente o effort em vez de tentar contornar isso via prompt. Se precisar manter o effort baixo por questões de latência, adicione orientação direcionada como "Esta tarefa envolve raciocínio em várias etapas. Pense cuidadosamente antes de responder."
Ao executar o Claude Opus 4.7 com effort xhigh ou max, defina um max_tokens grande para que o modelo tenha espaço para pensar e agir entre subagentes e chamadas de ferramentas. Começar com 64k tokens e ajustar a partir daí é um padrão razoável.
A orientação para o Claude Opus 4.7 também se aplica ao Claude Opus 4.8. Comece com xhigh para casos de uso de codificação e agênticos, use high para a maioria das outras cargas de trabalho sensíveis à inteligência, e reduza para medium ou low apenas quando tiver medido que o nível mais baixo mantém a qualidade nas suas avaliações.
O padrão da API é high. Defina effort explicitamente para usar um nível diferente; o valor que você passa substitui o padrão.
Ao executar o Claude Opus 4.8 com effort xhigh ou max, defina um max_tokens grande para que o modelo tenha espaço para pensar e agir entre subagentes e chamadas de ferramentas. Começar com 64k tokens e ajustar a partir daí é um padrão razoável.
O Claude Opus 5 suporta todos os cinco níveis de effort. Comece com high, o padrão, e ajuste com base nas suas avaliações: aumente para xhigh em trabalho exigente de codificação e agêntico, ou para max quando uma tarefa justificar gasto irrestrito de tokens, e use low e medium livremente como seu controle principal de custo de tokens e tempo de resposta sempre que suas avaliações mostrarem que a qualidade se mantém. Se você trouxe configurações de effort de um modelo anterior, execute uma nova varredura de effort nas suas avaliações em vez de reutilizá-las.
O effort controla o volume de thinking, não o comprimento visível da resposta: no Claude Opus 5, alterar o effort não encurta as respostas de forma confiável, então use o prompt para controlar o comprimento.
O padrão da API é high. Defina effort explicitamente para usar um nível diferente; o valor que você passa substitui o padrão.
No Claude Opus 5, o thinking não pode ser desabilitado com effort xhigh ou max: requisições que definem thinking: {"type": "disabled"} nesses níveis retornam um erro 400. Consulte Effort com thinking.
Ao executar o Claude Opus 5 com effort xhigh ou max, defina um max_tokens grande para que o modelo tenha espaço para pensar e agir entre subagentes e chamadas de ferramentas. Começar com 64k tokens e ajustar a partir daí é um padrão razoável.
O effort é o controle principal para equilibrar inteligência, latência e custo no Claude Fable 5. Comece com high, o padrão, para a maioria das tarefas, use xhigh para as cargas de trabalho mais sensíveis à capacidade, e reduza para medium ou low em trabalho rotineiro. Configurações de effort mais baixas no Claude Fable 5 ainda têm bom desempenho e frequentemente superam o desempenho de xhigh em modelos anteriores. Em high e xhigh, defina um max_tokens grande: ele é um limite rígido na saída total, thinking mais texto de resposta. Consulte Controle de custos.
Reduza o effort se uma tarefa for concluída mas demorar mais do que o necessário, ou se você quiser um estilo de trabalho mais rápido e interativo. As mesmas recomendações se aplicam ao Claude Mythos 5. Para orientação mais completa, consulte Prompting para o Claude Fable 5.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Analyze the trade-offs between microservices and monolithic architectures",
}
],
output_config={"effort": "medium"},
)
for block in response.content:
if block.type == "text":
print(block.text)Ao usar ferramentas, o parâmetro effort afeta tanto as explicações em torno das chamadas de ferramentas quanto as próprias chamadas de ferramentas. Níveis de effort mais baixos tendem a:
Níveis de effort mais altos podem:
O parâmetro thinking controla se Claude pensa em blocos de pensamento antes de responder; o parâmetro effort controla quanto trabalho Claude dedica à resposta como um todo, o que no modo adaptativo inclui com que frequência e com que profundidade ele pensa. Não passe adaptive como um valor de effort: adaptive é um modo de pensamento, não um nível de esforço.
Em níveis de effort mais altos, o Claude pensa na maioria das requisições e com maior extensão; em níveis mais baixos, ele pode pular o thinking completamente para problemas mais simples. Consulte Thinking e effort para orientação completa sobre como os dois controles funcionam juntos.
No Claude Opus 4.5, o único modelo exclusivamente de pensamento estendido que suporta effort, ele funciona junto com budget_tokens: defina o nível de effort para sua tarefa e, em seguida, defina o orçamento de tokens de thinking com base na profundidade de raciocínio que a tarefa precisa.
Para disponibilidade de thinking por modelo, consulte a tabela de configuração por modelo. O effort funciona com ou sem thinking; consulte Como o effort funciona.
output_config.effort é uma configuração no nível da requisição: cada requisição carrega seu próprio valor, então, para executar uma parte posterior de uma conversa em um nível de effort diferente, defina o novo valor na próxima requisição. O nível de effort se aplica à requisição inteira. Como o effort molda o prompt renderizado, alterá-lo entre requisições não preserva prefixos em cache de turnos anteriores; se você depende de cache de prompt ao longo de uma sessão longa, escolha um nível de effort no início e mantenha-o constante.
high, mas o ponto de partida certo depende do seu modelo e da sua carga de trabalho.Forneça ao Claude um orçamento consultivo de tokens para o loop agêntico completo, ajudando o modelo a se autorregular em tarefas agênticas longas.
Entenda o adaptive thinking, em que o Claude decide quando e quanto pensar, e direcione-o com effort e prompting.
Entenda como o thinking funciona, quando o Claude pensa por padrão e como o thinking interage com o effort.
| Supported models |
|
|---|---|
| Supported platforms |
|
Was this page helpful?