Este guia cobre a migração de código da Messages API. Se você usa Claude Managed Agents, nenhuma alteração além de atualizar o nome do modelo é necessária.
Automatize sua migração com a skill da Claude API. No Claude Code, execute /claude-api migrate para invocar a skill da Claude API incluída. Ela funciona para qualquer modelo de destino nesta página:
/claude-api migrate this project to claude-opus-5A skill aplica a troca do ID do modelo e, conforme necessário, alterações de parâmetros com quebra de compatibilidade, substituição de prefill e calibração de effort para o seu modelo de destino em toda a sua base de código, e então produz uma lista de verificação de itens para verificar manualmente. Ela pede que você confirme o escopo da migração (todo o diretório de trabalho, um subdiretório ou uma lista específica de arquivos) antes de editar quaisquer arquivos. A skill também detecta clientes do Amazon Bedrock e do Claude Platform na AWS e ajusta os formatos de ID de modelo e as mudanças de recursos para essas plataformas.
Claude Fable 5 é o modelo mais capaz amplamente lançado da Anthropic, disponível de forma geral na Claude API, Amazon Bedrock, Claude Platform na AWS, Google Cloud e Microsoft Foundry. Claude Mythos 5 compartilha as mesmas capacidades e é oferecido com disponibilidade limitada a clientes aprovados no Project Glasswing.
As configurações de base compartilhadas por claude-fable-5 e claude-mythos-5:
thinking é necessária. Tanto thinking: {type: "disabled"} quanto o pensamento estendido manual (thinking: {type: "enabled", budget_tokens: N}) retornam um erro 400.invalid_request_error. Organizações com um acordo de ZDR devem entrar em contato com sua equipe de conta da Anthropic para discutir a configuração de retenção de dados. Alternativamente, você pode configurar a retenção de dados por workspace. Consulte Requisitos de retenção de dados específicos por modelo para detalhes por plataforma.Onde os dois modelos divergem:
stop_reason: "refusal". Claude Mythos 5 não inclui esses classificadores. Consulte Recusas e fallback.Claude Mythos 5 é o sucessor com acesso restrito do Claude Mythos Preview, a prévia de pesquisa disponível apenas por convite. Claude Fable 5 é o modelo disponível de forma geral com as mesmas capacidades, e as mudanças nesta seção se aplicam igualmente a ambos os destinos.
A migração é, em grande parte, direta. Claude Mythos 5 e Claude Fable 5 usam a mesma Messages API e os mesmos padrões de uso de ferramentas que o Claude Mythos Preview, e as contagens de tokens permanecem aproximadamente inalteradas porque os três modelos usam o mesmo tokenizador. As principais mudanças a verificar são os recursos que não estão mais disponíveis (listados na próxima seção) e a saída de pensamento. Se você migrar para o Claude Fable 5, planeje também para as recusas dos classificadores de segurança, que o Claude Mythos Preview e o Claude Mythos 5 não têm; consulte Recusas e fallback.
Para o cronograma de aposentadoria do Claude Mythos Preview, consulte Descontinuações de modelos.
model = "claude-mythos-preview" # Before
model = "claude-mythos-5" # After
# Ou, para o modelo em disponibilidade geral com as mesmas capacidades:
model = "claude-fable-5" # AfterPensamento estendido e orçamentos de tokens de pensamento: O pensamento estendido manual (thinking: {type: "enabled", budget_tokens: N}) não é suportado no claude-mythos-5 nem no claude-fable-5 e retorna um erro 400. O pensamento adaptativo está sempre ativado: o modelo determina quando e quanto pensar em cada solicitação, e nenhuma configuração de thinking é necessária. thinking: {type: "disabled"} retorna um erro. budget_tokens não tem substituto direto: o pensamento é adaptativo, e o parâmetro effort é um controle separado no nível da saída, não um orçamento de pensamento.
Antes (Claude Mythos Preview):
client.messages.create(
model="claude-mythos-preview",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Depois (Claude Mythos 5):
client.messages.create(
model="claude-mythos-5",
max_tokens=16000,
messages=[{"role": "user", "content": "..."}],
)A mudança para o Claude Fable 5 é idêntica, com claude-fable-5 como o nome do modelo.
Prefill do assistente: Preencher previamente a mensagem do assistente não é suportado no claude-mythos-5 nem no claude-fable-5 e retorna um erro 400, o mesmo que no Claude Mythos Preview. Use instruções no prompt do sistema em vez disso.
Saída de pensamento: No claude-mythos-5 e no claude-fable-5, a cadeia de pensamento bruta nunca é retornada, mas os blocos de pensamento ainda carregam texto resumido legível quando thinking.display está definido como summarized. Passe os blocos de pensamento de volta sem alterações ao continuar uma conversa no mesmo modelo. Consulte Saída de pensamento no Claude Fable 5 e no Claude Mythos 5.
claude-mythos-5 e claude-fable-5 usam o mesmo tokenizador que o claude-mythos-preview (o tokenizador introduzido com o Claude Opus 4.7). As contagens de tokens permanecem aproximadamente inalteradas ao migrar do claude-mythos-preview. Em comparação com modelos anteriores ao Claude Opus 4.7, o mesmo conteúdo pode ser tokenizado em aproximadamente 30% mais tokens, variando conforme o conteúdo e o formato da carga de trabalho.
/v1/messages/count_tokens retorna valores aproximadamente inalterados para claude-mythos-5 e claude-fable-5 em comparação com claude-mythos-preview. Reestabeleça a linha de base de custo e latência nas suas próprias cargas de trabalho.
claude-mythos-preview para claude-mythos-5, ou para claude-fable-5 para o modelo disponível de forma geral.thinking: {type: "enabled", budget_tokens: N}). O pensamento adaptativo está sempre ativado, e nenhum campo thinking é necessário.thinking: {type: "disabled"}. Desativar o pensamento retorna um erro no claude-mythos-5 e no claude-fable-5.budget_tokens. Ele não tem substituto direto: o pensamento é adaptativo, e o parâmetro effort é um controle separado no nível da saída, não um orçamento de pensamento.thinking o trata apenas como texto de exibição e passa os blocos de pensamento de volta sem alterações ao continuar no mesmo modelo. thinking.display tem como padrão "omitted" no claude-mythos-5 e no claude-fable-5, o mesmo que no Claude Mythos Preview; defina display: "summarized" para receber resumos legíveis. Consulte Saída de pensamento no Claude Fable 5 e no Claude Mythos 5.thinking e redacted_thinking dos turnos anteriores do assistente. Os blocos de pensamento do claude-mythos-5 e do claude-fable-5 estão vinculados ao modelo que os produziu, e modelos diferentes do Claude Fable 5 e do Claude Mythos 5 os ignoram silenciosamente. A remoção mantém as solicitações entre modelos mínimas e uniformes.stop_reason: "refusal" e leia o campo stop_details.category. O Claude Fable 5 executa classificadores de segurança que o Claude Mythos Preview e o Claude Mythos 5 não têm. Consulte Recusas e fallback.claude-mythos-preview.Claude Fable 5 e Claude Mythos 5 usam a mesma Messages API e os mesmos padrões de uso de ferramentas que o Claude Opus 5, com a mesma janela de contexto de 1M de tokens por padrão e o mesmo máximo de 128k tokens de saída. As restrições de prefill e de parâmetros de amostragem, e o comportamento de exibição do pensamento, são mantidos do Claude Opus 5 sem alterações. As mudanças a verificar são o pensamento sempre ativado, os preços, o Priority Tier e a retenção de dados.
model = "claude-opus-5" # Before
model = "claude-fable-5" # After
# Ou, para o modelo do Project Glasswing com as mesmas capacidades:
model = "claude-mythos-5" # AfterO pensamento não pode mais ser desativado: No Claude Opus 5, o pensamento está ativado por padrão e pode ser desativado com thinking: {type: "disabled"} em um nível de effort high ou inferior. No claude-fable-5 e no claude-mythos-5, o pensamento adaptativo está sempre ativado, e thinking: {type: "disabled"} retorna um erro 400 em qualquer nível de effort. Remova a configuração thinking: {type: "disabled"} e use níveis de effort mais baixos para controlar o gasto de tokens em vez disso.
Preços: Claude Fable 5 e Claude Mythos 5 custam US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, em comparação com US$ 5 e US$ 25 para o Claude Opus 5. Consulte Preços do Claude.
Priority Tier: O Priority Tier não é suportado no Claude Opus 5, portanto nenhum tráfego existente é afetado. Se sua organização tem um compromisso de Priority Tier, o Claude Fable 5 o suporta; o Claude Mythos 5 não.
Retenção de dados: Claude Fable 5 e Claude Mythos 5 exigem retenção de dados de 30 dias e não estão disponíveis sob acordos de retenção zero de dados (ZDR); ambos são designados Covered Models. Consulte Requisitos de retenção de dados específicos por modelo.
claude-opus-5 para claude-fable-5 (ou claude-mythos-5).thinking: {type: "disabled"}; ela retorna um erro 400 no claude-fable-5 e no claude-mythos-5. Use níveis de effort mais baixos para controlar o gasto de tokens em vez disso, e revise max_tokens para cargas de trabalho que executavam com o pensamento desativado no Claude Opus 5.Se seu código está no Claude Opus 4.7 ou anterior, primeiro aplique a seção de origem relevante de Migrando para Claude Opus 5 para as mudanças no nível da API a partir do seu modelo atual, e depois o delta restante nesta seção.
A migração é, em grande parte, direta. Claude Fable 5 e Claude Mythos 5 usam a mesma Messages API e os mesmos padrões de uso de ferramentas que o Claude Opus 4.8, com a mesma janela de contexto de 1M de tokens por padrão e o mesmo máximo de 128k tokens de saída. As contagens de tokens permanecem aproximadamente inalteradas porque os modelos usam o mesmo tokenizador. As principais mudanças a verificar são o pensamento adaptativo sempre ativado, a saída de pensamento, as recusas dos classificadores de segurança (apenas Claude Fable 5) e os preços.
model = "claude-opus-4-8" # Before
model = "claude-fable-5" # After
# Ou, para o modelo do Project Glasswing com as mesmas capacidades:
model = "claude-mythos-5" # AfterOs itens nesta seção descrevem as diferenças de API e de comportamento que vale a pena verificar depois de trocar o ID do modelo. Exceto onde indicado, eles se aplicam igualmente ao claude-fable-5 e ao claude-mythos-5.
O pensamento adaptativo está sempre ativado: O pensamento adaptativo é o único modo de pensamento no claude-fable-5 e no claude-mythos-5. O modelo determina quando e quanto pensar em cada solicitação, e nenhuma configuração de thinking é necessária. thinking: {type: "disabled"} retorna um erro. Use o parâmetro effort para controlar a profundidade do pensamento.
A mudança de comportamento a verificar: no Claude Opus 4.8, solicitações sem um campo thinking são executadas sem pensamento; no claude-fable-5 e no claude-mythos-5, essas mesmas solicitações são executadas com pensamento adaptativo. max_tokens continua sendo um limite rígido na saída total, pensamento mais texto de resposta, portanto revise-o para cargas de trabalho que executavam sem pensamento no Claude Opus 4.8. Consulte Controle de custos.
Antes (Claude Opus 4.8):
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)Depois (Claude Fable 5):
client.messages.create(
model="claude-fable-5",
max_tokens=16000,
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)A mudança para o Claude Mythos 5 é idêntica, com claude-mythos-5 como o nome do modelo.
Pensamento estendido e orçamentos de pensamento (inalterado): O pensamento estendido manual (thinking: {type: "enabled", budget_tokens: N}) não é suportado no claude-fable-5 nem no claude-mythos-5 e retorna um erro 400, o mesmo que no Claude Opus 4.8. budget_tokens não tem substituto direto: o pensamento é adaptativo, e o parâmetro effort é um controle separado no nível da saída, não um orçamento de pensamento.
Prefill do assistente (inalterado): Preencher previamente a mensagem do assistente não é suportado no claude-fable-5 nem no claude-mythos-5 e retorna um erro 400, o mesmo que no Claude Opus 4.8. Use instruções no prompt do sistema em vez disso.
Saída de pensamento: No claude-fable-5 e no claude-mythos-5, a cadeia de pensamento bruta nunca é retornada, mas os blocos de pensamento ainda carregam texto resumido legível quando thinking.display está definido como summarized. Passe os blocos de pensamento de volta sem alterações ao continuar uma conversa no mesmo modelo. Consulte Saída de pensamento no Claude Fable 5 e no Claude Mythos 5.
Classificadores de segurança e o motivo de parada refusal (apenas Claude Fable 5): O claude-fable-5 executa classificadores de segurança nas solicitações e durante a geração da resposta. O Claude Mythos 5 não inclui esses classificadores. Quando um classificador recusa uma solicitação, a Messages API retorna stop_reason: "refusal" como uma resposta HTTP 200 bem-sucedida, não um erro. O campo stop_details.category informa qual classificador foi acionado, com categorias como "cyber", "bio" e "reasoning_extraction", ou null quando a recusa não corresponde a nenhuma categoria nomeada. Consulte a tabela de categorias de recusa para o conjunto completo.
Você não é cobrado pelos tokens de entrada de uma solicitação recusada antes de qualquer saída ser gerada. Quando um classificador é acionado no meio do stream, a entrada e a saída já transmitida são cobradas; descarte a saída parcial.
Para reexecutar automaticamente solicitações recusadas em outro modelo, passe o parâmetro opcional fallbacks, que está em beta na Claude API. O parâmetro não está disponível na Message Batches API nem no Amazon Bedrock, Google Cloud e Microsoft Foundry; nessas três plataformas, execute a nova tentativa no lado do cliente ou use o middleware de refusal-fallback do SDK. Consulte Recusas e fallback.
Comece com effort high: O padrão do parâmetro effort continua sendo high. No Claude Opus 4.8, a recomendação para trabalho de codificação e de alta autonomia é definir xhigh explicitamente. No claude-fable-5 e no claude-mythos-5, use high como padrão para a maioria das tarefas e reserve xhigh para as cargas de trabalho mais sensíveis à capacidade. Configurações de effort mais baixas ainda têm bom desempenho e frequentemente superam o desempenho de xhigh em modelos anteriores. Reduza o effort se uma tarefa for concluída, mas demorar mais do que o necessário. Consulte Prompting para Claude Fable 5.
Mínimo de cache de prompt mais baixo: O comprimento mínimo de prompt armazenável em cache no claude-fable-5 e no claude-mythos-5 é de 512 tokens, menor que os 1.024 tokens no Claude Opus 4.8. Prompts que eram curtos demais para serem armazenados em cache no Claude Opus 4.8 agora podem criar entradas de cache, sem necessidade de alterações no código. Consulte Cache de prompt para os mínimos por modelo.
claude-fable-5 e claude-mythos-5 exigem retenção de dados de 30 dias; na Claude API, solicitações ao claude-fable-5 que não atendem a esse requisito retornam um erro 400 invalid_request_error. O Claude Opus 4.8 continua disponível sob ZDR. Consulte Requisitos de retenção de dados específicos por modelo.claude-opus-4-8 para claude-fable-5 (ou claude-mythos-5).thinking: {type: "disabled"}. Desativar o pensamento retorna um erro no claude-fable-5 e no claude-mythos-5, e solicitações sem um campo thinking são executadas com pensamento adaptativo.claude-fable-5 e no claude-mythos-5.thinking o trata apenas como texto de exibição e passa os blocos de pensamento de volta sem alterações ao continuar no mesmo modelo. thinking.display tem como padrão "omitted" no claude-fable-5 e no claude-mythos-5, o mesmo que no Claude Opus 4.8; defina display: "summarized" para receber resumos legíveis. Consulte Saída de pensamento no Claude Fable 5 e no Claude Mythos 5.thinking e redacted_thinking dos turnos anteriores do assistente. Os blocos de pensamento do claude-fable-5 e do claude-mythos-5 estão vinculados ao modelo que os produziu, e modelos diferentes do Claude Fable 5 e do Claude Mythos 5 os ignoram silenciosamente. A remoção mantém as solicitações entre modelos mínimas e uniformes. A exceção é o resgate de um crédito de fallback, que exige que o corpo da solicitação seja ecoado sob as regras exatas desse recurso.stop_reason: "refusal" e leia o campo stop_details.category. Para reexecutar automaticamente solicitações recusadas em outro modelo, considere o parâmetro opcional fallbacks (beta). Consulte Recusas e fallback.effort. Comece com high para a maioria das tarefas, incluindo cargas de trabalho que executavam com xhigh no Claude Opus 4.8.claude-opus-4-8; o preço por token difere.Claude Opus 5 é uma melhoria significativa em relação ao Claude Opus 4.8, forte em raciocínio profundo, tarefas agênticas e de longo horizonte, e escalonamento de computação em tempo de teste. Para diferenças comportamentais e padrões de prompting específicos do modelo, consulte Prompting para Claude Opus 5.
Claude Opus 5 é uma atualização direta para o Claude Opus 4.8 com o mesmo preço de US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída; consulte Preços do Claude. Há duas mudanças com quebra de compatibilidade para código que já está em execução no Claude Opus 4.8, cobertas em Mudanças com quebra de compatibilidade abaixo. Claude Opus 5 suporta o mesmo conjunto de recursos que o Claude Opus 4.8, incluindo a janela de contexto de 1M de tokens (o padrão, sem cabeçalho beta), máximo de 128k tokens de saída, pensamento adaptativo, cache de prompt, processamento em lote, a Files API, suporte a PDF, visão e ferramentas do lado do servidor e do lado do cliente, com duas exceções: web fetch não está disponível no Claude Opus 5, e o Priority Tier não é suportado no Claude Opus 5. Consulte a página de cada ferramenta para a disponibilidade por modelo.
Esta seção cobre apenas o delta a partir do Claude Opus 4.8. Se seu código está no Claude Opus 4.7 ou anterior, use as seções abaixo em vez disso: Migrando para Claude Opus 5 a partir do Claude Opus 4.7 ou Migrando para Claude Opus 5 a partir do Claude Opus 4.6 e modelos Opus anteriores. Elas incluem este delta mais as mudanças com quebra de compatibilidade de modelos anteriores (parâmetros de amostragem rejeitados, pensamento estendido manual rejeitado, prefill removido, novo tokenizador).
# Migração do Opus
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # Afterclaude-opus-5 é um ID de modelo fixo sem sufixo de data, o mesmo esquema que claude-opus-4-8 e claude-sonnet-5.
Pensamento ativado por padrão: No Claude Opus 4.8, solicitações sem um campo thinking são executadas sem pensamento; no Claude Opus 5, as mesmas solicitações são executadas com pensamento adaptativo. max_tokens continua sendo um limite rígido na saída total, pensamento mais texto de resposta, portanto revise-o para cargas de trabalho que executavam sem pensamento no Claude Opus 4.8. Para preservar o comportamento antigo, passe thinking: {type: "disabled"}, sujeito ao limite de effort no próximo item; observe que, com o pensamento desativado, o modelo pode ocasionalmente emitir chamadas de ferramentas como texto simples ou incluir tags XML internas em sua saída visível, portanto prefira níveis de effort mais baixos com o pensamento ativado onde puder, e consulte Executando com o pensamento desativado para mitigações onde não puder.
Desativar o pensamento é limitado ao effort high: Você ainda pode desativar o pensamento com thinking: {type: "disabled"}, mas apenas em um nível de effort high ou inferior. Uma solicitação que combina thinking: {type: "disabled"} com effort xhigh ou max retorna um erro 400. O Claude Opus 4.8 aceita essa combinação, portanto audite as solicitações que desativam o pensamento antes de migrar.
A verificação é aplicada em cada solicitação: a configuração de effort e de pensamento de cada solicitação é validada independentemente, portanto uma solicitação que eleva o effort para xhigh ou max enquanto o pensamento está desativado é rejeitada mesmo que solicitações anteriores na conversa tenham sido aceitas.
Antes (aceito no Claude Opus 4.8, rejeitado no Claude Opus 5):
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Depois (Claude Opus 5), remova o campo thinking para reativar o pensamento:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)ou mantenha o pensamento desativado e reduza o effort:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Estas não são obrigatórias, mas melhorarão sua experiência:
Teste o effort max para trabalho crítico em capacidade: Claude Opus 5 suporta o conjunto completo de níveis de effort (low, medium, high, xhigh, max). Onde a capacidade máxima importa mais do que o gasto de tokens, teste o effort max. Ele pode trazer ganhos nas tarefas mais exigentes, mas pode apresentar retornos decrescentes com o aumento do uso de tokens e pode ser propenso a pensar demais em tarefas mais simples. Se você executar com effort xhigh ou max, defina um max_tokens grande para que o modelo tenha espaço para pensar e agir; comece com 64k tokens e ajuste a partir daí.
Considere fallbacks automáticos: Claude Opus 5 vem com classificadores de segurança de cibersegurança cujas recusas da categoria cyber podem fazer fallback para o Claude Opus 4.8. Para reexecutar automaticamente solicitações recusadas em outro modelo, considere o parâmetro fallbacks com o modo "default" (fallbacks: "default"), que seleciona um modelo de fallback recomendado com base na categoria da recusa em vez de uma lista de modelos mantida manualmente. O fallback do lado do servidor está em beta; o modo "default" requer o cabeçalho beta server-side-fallback-2026-07-01. Consulte Recusas e fallback.
Armazene em cache prompts mais curtos: O comprimento mínimo de prompt armazenável em cache no Claude Opus 5 é de 512 tokens, abaixo dos 1.024 tokens no Claude Opus 4.8. Prompts que eram curtos demais para serem armazenados em cache no Claude Opus 4.8 agora podem criar entradas de cache, sem necessidade de alterações no código. Consulte Cache de prompt para os mínimos por modelo.
Altere ferramentas no meio da conversa (beta): Você pode adicionar ou remover ferramentas entre turnos de uma conversa sem invalidar os acertos de cache de prompt em turnos anteriores. Envie o cabeçalho beta mid-conversation-tool-changes-2026-07-01. Isso é útil para cargas de trabalho agênticas que expõem ferramentas progressivamente ou as retiram conforme uma tarefa avança; sem isso, uma lista de ferramentas alterada invalida o prefixo em cache.
Reajuste os prompts de comprimento e verbosidade: As respostas visíveis padrão e os entregáveis escritos ficam mais longos no Claude Opus 5 do que no Claude Opus 4.8, e reduzir o effort diminui o volume de pensamento sem encurtar de forma confiável a resposta visível. Em vez disso, solicite explicitamente concisão ou um comprimento alvo. Consulte Comprimento e verbosidade da resposta e Comprimento do entregável escrito.
Remova instruções de verificação herdadas e restrinja o escopo: Claude Opus 5 verifica seu próprio trabalho sem que isso seja solicitado, portanto remova instruções explícitas de verificação ou autoverificação herdadas de prompts ajustados para modelos anteriores; mantê-las causa verificação excessiva. Para tarefas restritas, restrinja o escopo da tarefa explicitamente. Em frameworks multiagente, forneça orientação explícita sobre quais cenários justificam delegação ou limite o número de subagentes, porque o Claude Opus 5 delega com mais facilidade do que modelos anteriores. Consulte Escopo da tarefa e verificação excessiva e Controlando a criação de subagentes.
claude-opus-4-8 para claude-opus-5.thinking: elas são executadas com pensamento no Claude Opus 5. Revise max_tokens, que continua sendo um limite rígido na saída total (pensamento mais texto de resposta), ou passe thinking: {type: "disabled"} com effort high ou inferior para preservar o comportamento antigo. Se você desativar o pensamento, revise Executando com o pensamento desativado para os artefatos de saída que podem aparecer e suas mitigações via prompting.thinking: {type: "disabled"} com effort xhigh ou max retorna um erro 400, aplicado em cada solicitação. Reative o pensamento ou reduza o effort para high ou inferior.effort: execute uma nova varredura de effort nas suas próprias avaliações em vez de manter uma configuração ajustada para um modelo anterior. Os efforts low e medium valem a pena ser testados como controles de custo e latência, e teste o effort max onde a capacidade máxima importa mais do que o gasto de tokens. Se você executar com effort xhigh ou max, aumente max_tokens para pelo menos 64k como ponto de partida.stop_reason: "refusal" e considere fallbacks: "default" (beta) para reexecutar automaticamente solicitações recusadas em um modelo de fallback recomendado.O Claude Opus 5 deve ter um forte desempenho imediato em prompts e avaliações existentes do Claude Opus 4.7, com o mesmo preço de US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. Ele suporta o mesmo conjunto de recursos do Claude Opus 4.7, incluindo a janela de contexto de 1M de tokens, máximo de 128k tokens de saída, pensamento adaptativo, cache de prompt, processamento em lote, a API de Arquivos, suporte a PDF, visão e ferramentas do lado do servidor e do lado do cliente, com duas exceções: web fetch não está disponível no Claude Opus 5, e o Priority Tier não é suportado no Claude Opus 5. Ele também adiciona mensagens de sistema no meio da conversa e documenta publicamente os detalhes de parada por recusa.
Se seu código está no Claude Opus 4.6 ou anterior, use Migrando para o Claude Opus 5 a partir do Claude Opus 4.6 e modelos Opus anteriores em vez disso. Essa seção inclui mudanças incompatíveis (parâmetros de amostragem rejeitados, pensamento estendido manual rejeitado, novo tokenizador) que a atualização a partir do Claude Opus 4.7 sozinha não cobre.
# Migração do Opus
model = "claude-opus-4-7" # Before
model = "claude-opus-5" # AfterPensamento ativado por padrão: No Claude Opus 4.7, requisições sem um campo thinking são executadas sem pensamento; no Claude Opus 5, as mesmas requisições são executadas com pensamento adaptativo. max_tokens continua sendo um limite rígido sobre a saída total, pensamento mais texto de resposta, então revise-o para cargas de trabalho que eram executadas sem pensamento no Claude Opus 4.7. Para preservar o comportamento antigo, passe thinking: {type: "disabled"}, sujeito ao limite de esforço do próximo item; observe que com o pensamento desativado o modelo pode ocasionalmente emitir chamadas de ferramentas como texto simples ou incluir tags XML internas em sua saída visível, então prefira níveis de esforço mais baixos com o pensamento ativado onde puder, e consulte Executando com o pensamento desativado para mitigações onde não puder.
Desativar o pensamento é limitado ao esforço high: Você pode desativar o pensamento com thinking: {type: "disabled"}, mas apenas em um nível de esforço high ou inferior. Uma requisição que combina thinking: {type: "disabled"} com esforço xhigh ou max retorna um erro 400. O Claude Opus 4.7 aceita essa combinação, então audite as requisições que desativam o pensamento antes de migrar.
A verificação é aplicada em cada requisição: a configuração de esforço e pensamento de cada requisição é validada independentemente, então uma requisição que eleva o esforço para xhigh ou max enquanto o pensamento está desativado é rejeitada mesmo que requisições anteriores na conversa tenham sido aceitas.
Antes (aceito no Claude Opus 4.7, rejeitado no Claude Opus 5):
client.messages.create(
model="claude-opus-4-7",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Depois (Claude Opus 5), remova o campo thinking para executar com pensamento:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)ou mantenha o pensamento desativado e reduza o esforço:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Os itens a seguir não são mudanças incompatíveis; eles descrevem diferenças de comportamento que vale a pena verificar depois de trocar o ID do modelo.
Parâmetros de amostragem (inalterado): Definir temperature, top_p ou top_k com um valor não padrão retorna um erro 400 no Claude Opus 5, o mesmo que no Claude Opus 4.7. Os tipos de requisição do SDK ainda definem esses campos para compatibilidade com modelos anteriores, então o código que os define passa na verificação de tipos, mas a API rejeita a requisição no lado do servidor. Se você removeu esses parâmetros ao migrar para o Opus 4.7, nenhuma mudança adicional é necessária.
O padrão de esforço é high: O padrão do parâmetro effort no Claude Opus 5 é high na API do Claude e no Claude Code. Se você já define o esforço explicitamente, sua configuração permanece inalterada.
Níveis de esforço recalibrados: A alocação de tokens por trás de cada nível de esforço muda no Claude Opus 5 em comparação com o Claude Opus 4.7, e o Claude Opus 5 suporta o conjunto completo de níveis de esforço (low, medium, high, xhigh, max). Execute uma nova varredura de esforço em suas próprias avaliações em vez de reaproveitar uma configuração ajustada para o Claude Opus 4.7. Os esforços low e medium valem a pena ser testados como controles de custo e latência, e teste o esforço max onde a capacidade máxima importa mais do que o gasto de tokens. Se você executa com esforço xhigh ou max, defina um max_tokens grande para que o modelo tenha espaço para pensar e agir; comece com 64k tokens e ajuste a partir daí. Consulte Esforço.
A janela de contexto de 1M é o padrão: O Claude Opus 5 serve a janela de contexto completa de 1M de tokens por padrão, sem cabeçalho beta e sem tarifa premium de contexto longo. Se seu cliente passa um cabeçalho beta de janela de contexto para compatibilidade com modelos mais antigos, você pode removê-lo no Claude Opus 5.
Mensagens de sistema no meio da conversa: O Claude Opus 5 aceita mensagens role: "system" imediatamente após um turno do usuário no array messages (sujeito às regras de posicionamento). Use o campo system de nível superior para instruções que se aplicam desde o início. O Claude Opus 4.7 rejeita role: "system" em messages com um erro 400. Se você mantém caminhos de código que reconstroem todo o histórico de mensagens para atualizar instruções, pode simplificá-los e preservar os acertos de cache de prompt em turnos anteriores.
Detalhes de parada por recusa: O objeto stop_details em respostas de recusa (disponível desde o Claude Opus 4.7) agora está documentado publicamente. Quando o modelo recusa uma requisição, ele identifica a categoria da recusa, além do motivo de parada refusal existente. Nenhum cabeçalho beta é necessário, e não há como desativar. Consulte Lidando com motivos de parada.
Mínimo menor para cache de prompt: O comprimento mínimo de prompt armazenável em cache no Claude Opus 5 é de 512 tokens, menor do que no Claude Opus 4.7. Prompts que eram curtos demais para serem armazenados em cache no Claude Opus 4.7 agora podem criar entradas de cache, sem necessidade de mudanças no código. Consulte Cache de prompt para os mínimos por modelo.
Estas não são obrigatórias, mas melhorarão sua experiência:
Considere fallbacks automáticos: O Claude Opus 5 vem com classificadores de segurança de cibersegurança cujas recusas da categoria cibernética podem recorrer ao Claude Opus 4.8. Para reexecutar automaticamente requisições recusadas em outro modelo, considere o parâmetro fallbacks com o modo "default" (fallbacks: "default"), que seleciona um modelo de fallback recomendado com base na categoria da recusa em vez de uma lista de modelos mantida manualmente. O fallback do lado do servidor está em beta; o modo "default" requer o cabeçalho beta server-side-fallback-2026-07-01. Consulte Recusas e fallback.
Altere ferramentas no meio da conversa (beta): Você pode adicionar ou remover ferramentas entre turnos de uma conversa sem invalidar os acertos de cache de prompt em turnos anteriores. Envie o cabeçalho beta mid-conversation-tool-changes-2026-07-01. Isso é útil para cargas de trabalho agênticas que expõem ferramentas progressivamente ou as retiram conforme uma tarefa avança; sem isso, uma lista de ferramentas alterada invalida o prefixo em cache.
Reajuste prompts de comprimento e verbosidade: As respostas visíveis padrão e os entregáveis escritos são mais longos no Claude Opus 5 do que em modelos Opus anteriores, e reduzir o esforço diminui o volume de pensamento sem encurtar de forma confiável a resposta visível. Em vez disso, solicite explicitamente concisão ou um comprimento alvo no prompt. Consulte Comprimento e verbosidade da resposta e Comprimento de entregáveis escritos.
Remova instruções de verificação herdadas e restrinja o escopo: O Claude Opus 5 verifica seu próprio trabalho sem que isso seja solicitado, então remova instruções explícitas de verificação ou autoverificação herdadas de prompts ajustados para modelos anteriores; mantê-las causa verificação excessiva. Para tarefas restritas, restrinja o escopo da tarefa explicitamente. Em frameworks multiagente, forneça orientação explícita sobre quais cenários justificam delegação ou limite o número de subagentes, porque o Claude Opus 5 delega com mais facilidade do que modelos anteriores. Consulte Escopo da tarefa e verificação excessiva e Controlando a criação de subagentes.
claude-opus-4-7 para claude-opus-5 (ou atualize os aliases).thinking: elas são executadas com pensamento no Claude Opus 5. Revise max_tokens, que continua sendo um limite rígido sobre a saída total (pensamento mais texto de resposta), ou passe thinking: {type: "disabled"} com esforço high ou inferior para preservar o comportamento antigo. Se você desativar o pensamento, revise Executando com o pensamento desativado para conhecer os artefatos de saída que podem aparecer e suas mitigações via prompt.thinking: {type: "disabled"} com esforço xhigh ou max retorna um erro 400, aplicado em cada requisição. Reative o pensamento ou reduza o esforço para high ou inferior.effort: execute uma nova varredura de esforço em suas próprias avaliações em vez de reaproveitar uma configuração ajustada para o Claude Opus 4.7. Teste os esforços low e medium como controles de custo e latência, e o esforço max onde a capacidade máxima importa mais do que o gasto de tokens. Se você executa com esforço xhigh ou max, aumente max_tokens para pelo menos 64k como ponto de partida.stop_details em recusas (disponível desde o Claude Opus 4.7; agora documentado publicamente), e considere fallbacks: "default" (beta) para reexecutar automaticamente requisições recusadas em um modelo de fallback recomendado.Claude Opus 5 deve ter um forte desempenho imediato em prompts e avaliações existentes do Claude Opus 4.6 com o mesmo preço, mas há algumas mudanças comportamentais e de API que vale a pena conhecer durante a migração. A maioria dessas mudanças entrou em vigor no Claude Opus 4.7; outras duas, pensamento ativado por padrão e um limite de esforço ao desativar o pensamento, entram em vigor no Claude Opus 5. Todas elas são abordadas abaixo, portanto esta seção está completa para código vindo diretamente do Claude Opus 4.6. Claude Opus 5 suporta o mesmo conjunto de recursos do Claude Opus 4.6, incluindo:
Duas exceções: web fetch não está disponível no Claude Opus 5, e o Priority Tier não é suportado no Claude Opus 5.
# Migração do Opus
model = "claude-opus-4-6" # Before
model = "claude-opus-5" # AfterPensamento estendido removido: thinking: {type: "enabled", budget_tokens: N} não é mais suportado no Claude Opus 4.7 ou modelos posteriores e retorna um erro 400. Mude para o pensamento adaptativo (thinking: {type: "adaptive"}) e use o parâmetro effort para controlar a profundidade do pensamento. No Claude Opus 5, o pensamento adaptativo está ativado por padrão: thinking: {type: "adaptive"} é válido e equivalente a omitir o campo thinking inteiramente (veja o próximo item).
Antes (Claude Opus 4.6):
client.messages.create(
model="claude-opus-4-6",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Depois (Claude Opus 5):
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"}, # or "max", "xhigh", "medium", "low"
messages=[{"role": "user", "content": "..."}],
)O pensamento adaptativo é direcionável por meio de prompting e do parâmetro effort; veja Escolhendo um nível de esforço.
Pensamento ativado por padrão: No Claude Opus 4.6 e no Claude Opus 4.7, requisições sem um campo thinking são executadas sem pensamento; no Claude Opus 5, as mesmas requisições são executadas com pensamento adaptativo. max_tokens continua sendo um limite rígido sobre a saída total, pensamento mais texto de resposta, então revise-o para cargas de trabalho que eram executadas sem pensamento. Para preservar o comportamento antigo, passe thinking: {type: "disabled"}, sujeito ao limite de esforço do próximo item; observe que com o pensamento desativado o modelo pode ocasionalmente emitir chamadas de ferramentas como texto simples ou incluir tags XML internas em sua saída visível, então prefira níveis de esforço mais baixos com o pensamento ativado sempre que possível, e veja Executando com pensamento desativado para mitigações quando não for possível.
Desativar o pensamento é limitado ao esforço high: Você pode desativar o pensamento com thinking: {type: "disabled"}, mas apenas em um nível de effort high ou inferior. Uma requisição que combina thinking: {type: "disabled"} com effort xhigh ou max retorna um erro 400 no Claude Opus 5, aplicado em cada requisição. Audite as requisições que desativam o pensamento antes de migrar: reative o pensamento ou reduza o esforço para high ou inferior.
Parâmetros de amostragem removidos: Definir temperature, top_p ou top_k com qualquer valor não padrão no Claude Opus 4.7 ou modelos posteriores, incluindo o Claude Opus 5, retorna um erro 400. O caminho de migração mais seguro é omitir esses parâmetros inteiramente dos payloads das requisições. Prompting é a forma recomendada de guiar o comportamento do modelo no Claude Opus 5. Se você estava usando temperature = 0 para determinismo, observe que isso nunca garantiu saídas idênticas em modelos anteriores.
Conteúdo de pensamento omitido por padrão: Os blocos de pensamento ainda aparecem no stream de resposta no Claude Opus 4.7 e modelos posteriores, mas seu campo thinking fica vazio a menos que você opte explicitamente por recebê-lo. Esta é uma mudança silenciosa em relação ao Claude Opus 4.6, onde o padrão era retornar o texto de pensamento resumido. Para restaurar o conteúdo de pensamento resumido, defina thinking.display como "summarized":
thinking = {
"type": "adaptive",
"display": "summarized",
}O padrão é "omitted" no Claude Opus 4.7 e modelos posteriores. Se o seu produto transmite o raciocínio aos usuários via streaming, o novo padrão aparece como uma longa pausa antes do início da saída; defina display: "summarized" para restaurar o progresso visível durante o pensamento. Veja Controlando a exibição do pensamento para detalhes.
Contagem de tokens atualizada: O Claude Opus 4.7 introduziu um novo tokenizador, que os modelos Opus posteriores, incluindo o Claude Opus 5, também usam. Ele contribui para um desempenho aprimorado em uma ampla gama de tarefas e pode usar aproximadamente de 1x a 1,35x mais tokens ao processar texto em comparação com modelos anteriores ao Claude Opus 4.7 (até ~35% a mais, variando conforme o conteúdo).
/v1/messages/count_tokens retorna um número diferente de tokens para o Claude Opus 5 do que retornava para o Claude Opus 4.6. A eficiência de tokens pode variar conforme o formato da carga de trabalho.
Intervenções de prompting, task_budget e effort podem ajudar a controlar custos e garantir o uso apropriado de tokens. Esses controles podem comprometer a inteligência do modelo. Atualize seus parâmetros max_tokens para dar margem adicional, incluindo gatilhos de compactação. O Claude Opus 5 oferece uma janela de contexto de 1M com preço padrão da API, sem custo adicional de contexto longo.
Remoção de prefill (herdado do Opus 4.6): Preencher previamente mensagens do assistente retorna um erro 400 no Claude Opus 4.7 e modelos posteriores, incluindo o Claude Opus 5. Use saídas estruturadas, instruções no prompt do sistema ou output_config.format em vez disso.
O parâmetro effort permite ajustar a inteligência do Claude em relação ao gasto de tokens, trocando capacidade por maior velocidade e custos mais baixos. O Claude Opus 5 suporta o conjunto completo de níveis de esforço e usa high como padrão. Execute uma nova varredura de esforço em suas próprias avaliações em vez de reaproveitar uma configuração ajustada para um modelo anterior:
max: Pode trazer ganhos nas tarefas mais exigentes, mas pode apresentar retornos decrescentes com o aumento do uso de tokens e pode ser propenso a pensar demais em tarefas mais simples. Teste-o onde a capacidade máxima importa mais do que o gasto de tokens.xhigh: Capacidade estendida para trabalho agêntico e de codificação de longa duração que precisa de mais profundidade do que o padrão.high: O padrão. Equilibra uso de tokens e inteligência para a maioria das tarefas.medium: Redução de custo em relação ao padrão, vale a pena testar como controle de custo e latência.low: O mais eficiente. Reserve para tarefas curtas e bem delimitadas e cargas de trabalho sensíveis à latência.Se você executar com esforço xhigh ou max, defina um max_tokens grande para que o modelo tenha espaço para pensar e agir; comece com 64k tokens e ajuste a partir daí. O esforço é mais importante para este modelo do que para qualquer Opus anterior. Experimente-o ativamente ao fazer o upgrade.
O Claude Opus 4.7 introduziu várias diferenças comportamentais em relação ao Claude Opus 4.6 que não são mudanças incompatíveis de API, mas podem exigir atualizações de prompt ou remoção de scaffolding. Elas se mantêm no Claude Opus 5, com os ajustes indicados abaixo.
O comprimento da resposta varia conforme o caso de uso: O Claude Opus 4.7 calibra o comprimento da resposta de acordo com a complexidade que ele julga que a tarefa tem, em vez de usar uma verbosidade fixa por padrão. Isso geralmente significa respostas mais curtas em consultas simples e muito mais longas em análises abertas.
Se o seu produto depende de um certo estilo ou verbosidade de saída, você pode precisar ajustar seus prompts. Por exemplo, para diminuir a verbosidade, adicione: "Forneça respostas concisas e focadas. Pule contexto não essencial e mantenha os exemplos mínimos." Se você observar tipos específicos de explicações excessivas, adicione instruções direcionadas no seu prompt para evitá-las.
Exemplos positivos mostrando como Claude pode se comunicar com o nível apropriado de concisão tendem a ser mais eficazes do que exemplos negativos ou instruções que dizem ao modelo o que não fazer. No Claude Opus 5, as respostas visíveis padrão e os entregáveis escritos são mais longos do que em modelos Opus anteriores, e reduzir o esforço diminui o volume de pensamento sem encurtar de forma confiável a resposta visível; use prompts explícitos para concisão ou um comprimento alvo. Veja Comprimento da resposta e verbosidade.
Seguimento de instruções mais literal: O Claude Opus 4.7 interpreta prompts de forma mais literal e explícita do que o Claude Opus 4.6, particularmente em níveis de esforço mais baixos. Ele não generaliza silenciosamente uma instrução de um item para outro e não infere solicitações que você não fez. A vantagem desse literalismo é a precisão e menos retrabalho. Ele geralmente tem melhor desempenho em casos de uso de API com prompts cuidadosamente ajustados, extração estruturada e pipelines onde você deseja comportamento previsível. Uma revisão de prompt e harness pode ser especialmente útil para a migração para o Claude Opus 5.
Tom mais direto: Como em qualquer modelo novo, o estilo de prosa em textos longos pode mudar. O Claude Opus 4.7 é mais direto e opinativo, com menos frases de validação e menos emojis do que o estilo mais caloroso do Claude Opus 4.6. Se o seu produto depende de uma voz específica, reavalie os prompts de estilo em relação à nova linha de base.
Atualizações de progresso integradas em traces agênticos: O Claude Opus 4.7 fornece atualizações mais regulares e de maior qualidade ao usuário ao longo de traces agênticos longos. Se você adicionou scaffolding para forçar mensagens de status intermediárias ("Após cada 3 chamadas de ferramentas, resuma o progresso"), tente removê-lo. Se você achar que o comprimento ou o conteúdo das atualizações voltadas ao usuário do Claude Opus 4.7 não estão bem calibrados para o seu caso de uso, descreva explicitamente como essas atualizações devem ser no prompt e forneça exemplos.
Criação de subagentes alterada: O Claude Opus 4.7 tende a criar menos subagentes por padrão do que o Claude Opus 4.6, enquanto o Claude Opus 5 delega a subagentes com mais facilidade do que modelos anteriores. O comportamento é direcionável por prompting em qualquer direção; dê orientações explícitas sobre quando subagentes são desejáveis, ou limite o número de subagentes. Veja Controlando a criação de subagentes.
Calibração de esforço mais rigorosa: Mudando significativamente em relação ao Claude Opus 4.6, o Claude Opus 4.7 respeita os níveis de esforço de forma estrita, especialmente na extremidade inferior. Em low e medium, o modelo delimita seu trabalho ao que foi pedido em vez de fazer mais do que o solicitado.
Isso é bom para latência e custo, mas em tarefas moderadamente complexas executadas com esforço low há algum risco de raciocínio insuficiente. Se você observar raciocínio superficial em problemas complexos, aumente o esforço para high ou xhigh em vez de contornar com prompts.
Se você precisar manter o esforço em low por questões de latência, adicione orientação direcionada: "Esta tarefa envolve raciocínio em múltiplas etapas. Pense cuidadosamente sobre o problema antes de responder." Veja Níveis de esforço recomendados para o Claude Opus 4.7.
Menos chamadas de ferramentas por padrão: O Claude Opus 4.7 tem a tendência de usar ferramentas com menos frequência do que o Claude Opus 4.6 e de usar mais o raciocínio. Isso produz melhores resultados na maioria dos casos.
Para aumentar o uso de ferramentas, aumente a configuração de esforço. As configurações de esforço high ou xhigh mostram um uso substancialmente maior de ferramentas em busca agêntica e codificação. Você também pode ajustar seu prompt para instruir explicitamente o modelo sobre quando e como usar adequadamente suas ferramentas.
Salvaguardas de cibersegurança em tempo real: Recém-adicionadas no Claude Opus 4.7, requisições que envolvem tópicos proibidos ou de alto risco podem levar a recusas. Para trabalho de segurança legítimo, como testes de penetração, pesquisa de vulnerabilidades ou red-teaming, inscreva-se no Cyber Verification Program para solicitar restrições reduzidas. Veja Salvaguardas, avisos e apelações para contexto.
Suporte a imagens de alta resolução: O Claude Opus 4.7 é o primeiro modelo Claude com suporte a imagens de alta resolução. A resolução máxima de imagem é de 2.576 pixels no lado mais longo, acima dos 1.568 pixels em modelos anteriores. Isso desbloqueia ganhos em cargas de trabalho intensivas em visão e é particularmente valioso para uso de computador, compreensão de capturas de tela e análise de documentos.
O suporte a alta resolução é automático e não requer cabeçalho beta nem opt-in do lado do cliente. Duas coisas para planejar:
max_tokens e as expectativas de custo para cargas de trabalho intensivas em imagens, ou reduza a resolução antes de enviar se você não precisar da fidelidade adicional.Veja Suporte a imagens de alta resolução no Claude Opus 4.7 para detalhes.
Estas não são obrigatórias, mas melhorarão sua experiência:
Reavalie max_tokens: Como o mesmo texto produz uma contagem de tokens maior no Claude Opus 4.7 e modelos posteriores, atualize seus parâmetros max_tokens para dar margem adicional, incluindo gatilhos de compactação. Intervenções de prompting, task_budget e effort podem ajudar a controlar custos e garantir o uso apropriado de tokens.
Audite as expectativas de contagem de tokens: Qualquer caminho de código que estime tokens do lado do cliente ou assuma uma proporção fixa de tokens para caracteres deve ser testado novamente com o Claude Opus 5. Use o endpoint de contagem de tokens para verificar.
Adote orçamentos de tarefa (beta): O Claude Opus 4.7 introduz orçamentos de tarefa. Esses orçamentos permitem informar ao Claude quantos tokens ele tem para um loop agêntico completo, incluindo pensamento, chamadas de ferramentas, resultados de ferramentas e saída final. O modelo vê uma contagem regressiva em andamento e a usa para priorizar o trabalho e concluir a tarefa de forma adequada à medida que o orçamento é consumido. Para usar, defina o cabeçalho beta task-budgets-2026-03-13 e adicione o seguinte à sua configuração de saída:
output_config = {
"effort": "high",
"task_budget": {"type": "tokens", "total": 128000},
}Você pode precisar experimentar diferentes orçamentos de tarefa para o seu caso de uso. Se o modelo receber um orçamento de tarefa muito restritivo, ele pode concluir a tarefa de forma menos completa, referenciando seu orçamento como a restrição.
Para tarefas agênticas abertas onde a qualidade importa mais do que a velocidade, não defina um orçamento de tarefa. Reserve orçamentos de tarefa para cargas de trabalho onde você precisa que o modelo delimite seu trabalho a uma cota de tokens. O valor mínimo para um orçamento de tarefa é de 20k tokens.
Um orçamento de tarefa não é um limite rígido; é uma sugestão da qual o modelo está ciente. Ele difere de max_tokens:
task_budget: um limite consultivo ao longo de todo o loop agêntico. O modelo o vê e o usa para se regular.max_tokens: um teto rígido por requisição sobre os tokens gerados. Ele não é passado ao modelo, portanto o modelo não tem conhecimento dele.Use task_budget quando quiser que o modelo se autorregule, e max_tokens como um teto rígido para limitar o uso.
Defina um max_tokens grande com esforço max ou xhigh: Se você estiver executando o Claude Opus 4.7 ou um modelo posterior com esforço max ou xhigh, defina um orçamento grande de tokens máximos de saída para que o modelo tenha espaço para pensar e agir em seus subagentes e chamadas de ferramentas. Comece com 64k tokens e ajuste a partir daí.
Reduza a resolução das imagens se a alta resolução for desnecessária: O Claude Opus 4.7 e modelos posteriores suportam imagens de até 2576px / 3,75MP. Imagens de alta resolução usam mais tokens. Se a fidelidade adicional da imagem for desnecessária, reduza a resolução das imagens antes de enviá-las ao Claude para evitar aumentos no uso de tokens. Veja Imagens e visão.
Considere fallbacks automáticos: O Claude Opus 5 vem com classificadores de segurança de cibersegurança cujas recusas na categoria cibernética podem recorrer ao Claude Opus 4.8. Para reexecutar automaticamente requisições recusadas em outro modelo, considere o parâmetro fallbacks com o modo "default" (fallbacks: "default"), que seleciona um modelo de fallback recomendado com base na categoria da recusa em vez de uma lista de modelos mantida manualmente. O fallback do lado do servidor está em beta; o modo "default" requer o cabeçalho beta server-side-fallback-2026-07-01. Veja Recusas e fallback.
Faça cache de prompts mais curtos: O comprimento mínimo de prompt que pode ser armazenado em cache no Claude Opus 5 é de 512 tokens, menor do que em modelos Opus anteriores. Prompts que eram curtos demais para serem armazenados em cache agora podem criar entradas de cache, sem necessidade de alterações no código. Veja Cache de prompt para os mínimos por modelo.
Altere ferramentas no meio da conversa (beta): Você pode adicionar ou remover ferramentas entre turnos de uma conversa sem invalidar os acertos de cache de prompt em turnos anteriores. Envie o cabeçalho beta mid-conversation-tool-changes-2026-07-01. Isso é útil para cargas de trabalho agênticas que expõem ferramentas progressivamente ou as retiram à medida que uma tarefa avança; sem isso, uma lista de ferramentas alterada invalida o prefixo em cache.
Remova instruções de verificação herdadas e restrinja o escopo: O Claude Opus 5 verifica seu próprio trabalho sem que isso seja solicitado, então remova instruções explícitas de verificação ou autoverificação herdadas de prompts ajustados para modelos anteriores; mantê-las causa verificação excessiva. Para tarefas restritas, delimite o escopo da tarefa explicitamente. Veja Escopo da tarefa e verificação excessiva.
claude-opus-4-6 para claude-opus-5 (ou atualize os aliases).temperature, top_p e top_k dos payloads das requisições.thinking: {type: "enabled", budget_tokens: N} por thinking: {type: "adaptive"} mais o parâmetro effort, ou remova o campo thinking inteiramente; o pensamento adaptativo está ativado por padrão no Claude Opus 5.thinking: elas são executadas com pensamento no Claude Opus 5. Revise max_tokens, que continua sendo um limite rígido sobre a saída total (pensamento mais texto de resposta), ou passe thinking: {type: "disabled"} com esforço high ou inferior para preservar o comportamento antigo.thinking: {type: "disabled"} com effort xhigh ou max retorna um erro 400, aplicado em cada requisição. Reative o pensamento ou reduza o esforço para high ou inferior.max_tokens para levar em conta a tokenização atualizada.xhigh ou max, aumente max_tokens para pelo menos 64k como ponto de partida.stop_reason: "refusal" e considere fallbacks: "default" (beta) para reexecutar automaticamente requisições recusadas em um modelo de fallback recomendado.Se você está migrando do Claude Opus 4.5, Opus 4.1 (descontinuado) ou de um modelo anterior diretamente para o Claude Opus 5, aplique todas as mudanças anteriores desta seção mais as mudanças cumulativas abaixo, que entraram em vigor entre o Opus 4.5 e o Opus 4.7. Se você está migrando do Opus 4.6, as mudanças anteriores desta seção são tudo o que você precisa.
# Migração do Opus
model = "claude-opus-4-5" # Before
model = "claude-opus-5" # AfterA remoção de prefill é abordada nas mudanças incompatíveis para migração a partir do Claude Opus 4.6.
Escape de parâmetros de ferramentas: O Claude Opus 4.6 e modelos posteriores podem produzir escapes de strings JSON ligeiramente diferentes nos argumentos de chamadas de ferramentas (por exemplo, tratamento diferente de escapes Unicode ou escape de barras). Se você analisa o input da chamada de ferramenta como uma string bruta em vez de usar um parser JSON, verifique sua lógica de parsing. Parsers JSON padrão (como json.loads() ou JSON.parse()) lidam com essas diferenças automaticamente.
Essas mudanças melhoram sua experiência no Claude Opus 4.7 e modelos posteriores. Os itens marcados como (obrigatório no Opus 4.7) eram recomendações opcionais quando o Opus 4.6 foi lançado, mas agora são obrigatórios; os demais continuam sendo recomendados.
Migre para o pensamento adaptativo (obrigatório no Opus 4.7): thinking: {type: "enabled", budget_tokens: N} retorna um erro 400 no Claude Opus 4.7 e modelos posteriores. Mude para thinking: {type: "adaptive"} e use o parâmetro effort para controlar a profundidade do pensamento; no Claude Opus 5, thinking: {type: "adaptive"} é equivalente a omitir o campo thinking, que é executado com pensamento adaptativo por padrão. Veja Pensamento.
response = client.beta.messages.create(
model="claude-opus-4-5",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 32000},
betas=["interleaved-thinking-2025-05-14"],
messages=[{"role": "user", "content": "Your prompt here"}],
)Observe que a migração também muda de client.beta.messages.create para client.messages.create. O pensamento adaptativo e o effort são recursos GA e não requerem o namespace beta do SDK nem quaisquer cabeçalhos beta.
Remova o cabeçalho beta de effort: O parâmetro effort agora é GA. Remova betas=["effort-2025-11-24"] das suas requisições.
Remova o cabeçalho beta de streaming granular de ferramentas: O streaming granular de ferramentas agora é GA. Remova betas=["fine-grained-tool-streaming-2025-05-14"] das suas requisições.
Remova o cabeçalho beta de pensamento intercalado: O pensamento adaptativo habilita automaticamente o pensamento intercalado no Claude Opus 4.7, Opus 4.6 e Sonnet 4.6. Remova betas=["interleaved-thinking-2025-05-14"] das suas requisições. O cabeçalho ainda é funcional no Sonnet 4.6 com pensamento estendido manual, mas o modo manual está descontinuado.
Migre para output_config.format: Se estiver usando saídas estruturadas, atualize output_format={...} para output_config={"format": {...}}. O parâmetro antigo continua funcional, mas está descontinuado e será removido em um lançamento futuro de modelo.
Se você está migrando do Opus 4.1 (descontinuado) ou de modelos anteriores diretamente para o Claude Opus 5, aplique todas as mudanças anteriores desta seção, mais as mudanças adicionais desta subseção.
# Do Opus 4.1
model = "claude-opus-4-1-20250805" # Before
model = "claude-opus-5" # After
# Do Sonnet 3.7
model = "claude-3-7-sonnet-20250219" # Before
model = "claude-opus-5" # AfterRemova os parâmetros de amostragem
Esta é uma mudança incompatível ao migrar de modelos Claude 3.x.
A partir do Claude Opus 4.7, definir temperature, top_p ou top_k com qualquer valor não padrão retorna um erro 400. O caminho de migração mais seguro é omitir esses parâmetros inteiramente das requisições e usar prompting para guiar o comportamento do modelo. Se você estava usando temperature = 0 para determinismo, observe que isso nunca garantiu saídas idênticas.
# Antes - Isso causará erro nos modelos Claude 4+
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
temperature=0.7,
top_p=0.9, # Non-default sampling params return 400 on Opus 4.7
# ...
)
# Depois
response = client.messages.create(
model="claude-opus-5",
# ...
)Atualize as versões das ferramentas
Esta é uma mudança incompatível ao migrar de modelos Claude 3.x.
Atualize para as versões mais recentes das ferramentas. Remova qualquer código que use o comando undo_edit.
# Antes
tools = [{"type": "text_editor_20250124", "name": "str_replace_editor"}]
# Depois
tools = [{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"}]text_editor_20250728 e str_replace_based_edit_tool. Veja a documentação da ferramenta de editor de texto para detalhes.code_execution_20260521. Veja a documentação da ferramenta de execução de código para instruções de migração.Trate o motivo de parada refusal
Atualize sua aplicação para tratar motivos de parada refusal:
response = client.messages.create(...)
if response.stop_reason == "refusal":
# Trate a recusa adequadamente
passTrate o motivo de parada model_context_window_exceeded
Os modelos Claude 4.5+ retornam um motivo de parada model_context_window_exceeded quando a geração para por atingir o limite da janela de contexto, em vez do limite de max_tokens solicitado. Atualize sua aplicação para tratar esse novo motivo de parada:
response = client.messages.create(...)
if response.stop_reason == "model_context_window_exceeded":
# Trate o limite da janela de contexto adequadamente
passVerifique o tratamento de parâmetros de ferramentas (quebras de linha finais)
Os modelos Claude 4.5+ preservam quebras de linha finais em parâmetros de string de chamadas de ferramentas que anteriormente eram removidas. Se suas ferramentas dependem de correspondência exata de strings com os parâmetros de chamadas de ferramentas, verifique se sua lógica trata corretamente as quebras de linha finais.
Atualize seus prompts para as mudanças comportamentais
Os modelos Claude 4+ têm um estilo de comunicação mais conciso e direto e requerem direcionamento explícito. Revise as melhores práticas de prompting para orientações de otimização.
token-efficient-tools-2025-02-19 e output-128k-2025-02-19. Todos os modelos Claude 4+ têm uso de ferramentas eficiente em tokens integrado e esses cabeçalhos não têm efeito.claude-opus-5output_config.format em vez dissothinking: {type: "enabled", budget_tokens: N} por thinking: {type: "adaptive"} mais o parâmetro effort (retorna 400 no Opus 4.7)effort-2025-11-24 (effort agora é GA)fine-grained-tool-streaming-2025-05-14interleaved-thinking-2025-05-14 (o pensamento adaptativo habilita o pensamento intercalado automaticamente)output_format para output_config.format (se aplicável)temperature, top_p e top_k (valores não padrão retornam 400 no Opus 4.7)text_editor_20250728, code_execution_20260521)refusalmodel_context_window_exceededtoken-efficient-tools-2025-02-19, output-128k-2025-02-19)Claude Opus 5 e Claude Sonnet 5 compartilham a mesma superfície de API: ambos executam com pensamento adaptativo ativado por padrão, ambos têm o parâmetro effort padrão definido como high na Claude API e no Claude Code, ambos oferecem uma janela de contexto de 1M de tokens por padrão com máximo de 128k tokens de saída, e nenhum dos dois suporta Priority Tier. O pensamento estendido manual e parâmetros de amostragem não padrão retornam um erro 400 em ambos os modelos, assim como o prefill do assistente.
model = "claude-sonnet-5" # Before
model = "claude-opus-5" # AfterPreços: Claude Opus 5 tem preço de $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída. Para o Claude Sonnet 5, o preço introdutório de $2/$10 por milhão de tokens de entrada/saída está em vigor até 31 de agosto de 2026, após o qual o preço padrão de $3/$15 entra em vigor. Consulte Preços do Claude para preços completos.
Desativar o pensamento é limitado ao effort high: No Claude Sonnet 5, thinking: {type: "disabled"} é aceito em qualquer nível de effort. No Claude Opus 5, é aceito apenas em um nível de effort high ou inferior; uma requisição que combina thinking: {type: "disabled"} com effort xhigh ou max retorna um erro 400, aplicado em cada requisição. Audite as requisições que desativam o pensamento antes de migrar.
Mensagens de sistema no meio da conversa: Claude Opus 5 aceita mensagens role: "system" imediatamente após um turno do usuário no array messages (sujeito às regras de posicionamento); Claude Sonnet 5 não aceita. Se você mantém caminhos de código que reconstroem todo o histórico de mensagens para atualizar instruções, você pode simplificá-los e preservar os acertos de cache de prompt em turnos anteriores.
Web fetch não está disponível: A ferramenta web fetch está disponível no Claude Sonnet 5, mas não no Claude Opus 5.
claude-sonnet-5 para claude-opus-5.thinking: {type: "disabled"} com effort xhigh ou max retorna um erro 400 no Claude Opus 5. Reative o pensamento ou reduza o effort para high ou inferior.Claude Sonnet 5 oferece a melhor combinação de velocidade e inteligência na família de modelos Claude. Ele é construído sobre o Claude Sonnet 4.6.
Claude Sonnet 5 é uma atualização direta para o Claude Sonnet 4.6. O preço introdutório de $2/$10 USD por milhão de tokens de entrada/saída está em vigor até 31 de agosto de 2026, após o qual o preço padrão de $3/$15 USD por milhão de tokens de entrada/saída entrará em vigor; consulte Preços para detalhes. Há duas mudanças incompatíveis na API para código que já está em execução no Claude Sonnet 4.6: o pensamento estendido manual (thinking: {type: "enabled", budget_tokens: N}) e parâmetros de amostragem (temperature, top_p, top_k) definidos com valores não padrão não são mais aceitos e retornam um erro 400. Use pensamento adaptativo com o parâmetro effort em vez disso. Claude Sonnet 5 suporta o mesmo conjunto de recursos do Claude Sonnet 4.6, incluindo a janela de contexto de 1M de tokens, pensamento adaptativo, cache de prompt, processamento em lote, a Files API, suporte a PDF, visão e o conjunto completo de ferramentas do lado do servidor e do lado do cliente. Priority Tier não está disponível no Claude Sonnet 5. Claude Sonnet 5 também usa um novo tokenizador.
Se o seu código está no Claude Sonnet 4.5 ou anterior, aplique também Migrando para Claude Sonnet 5 a partir do Claude Sonnet 4.5 e modelos Sonnet anteriores. Essas etapas incluem mudanças incompatíveis (prefill de mensagem do assistente rejeitado, diferenças no escape de JSON em parâmetros de ferramentas) que esta seção sozinha não cobre.
# Migração para Sonnet
model = "claude-sonnet-4-6" # Before
model = "claude-sonnet-5" # AfterOs itens 4 e 5 na lista a seguir são mudanças incompatíveis. max_tokens continua sendo um limite rígido na saída total (pensamento mais texto de resposta), então revise-o para cargas de trabalho que executavam sem pensamento no Claude Sonnet 4.6.
Novo tokenizador: Claude Sonnet 5 usa um novo tokenizador. O mesmo texto de entrada produz aproximadamente 30% mais tokens do que no Claude Sonnet 4.6. O aumento exato depende do conteúdo. Requisições, respostas e eventos de streaming mantêm o mesmo formato, e nenhuma mudança de código é necessária, mas tudo o que você mede ou orça em tokens muda: os campos usage e os resultados de contagem de tokens para o mesmo texto são maiores, a janela de contexto de 1M de tokens comporta menos texto, e um limite de max_tokens ajustado para o Claude Sonnet 4.6 pode truncar uma saída equivalente. O preço por token não mudou, então o custo de uma requisição equivalente pode ser diferente. Execute novamente a contagem de tokens no Claude Sonnet 5 em vez de reutilizar contagens medidas em modelos anteriores.
Máximo de 128k tokens de saída (inalterado): Claude Sonnet 5 suporta até 128k tokens de saída, o mesmo que o Claude Sonnet 4.6. Os valores existentes de max_tokens continuam válidos. Leve em conta o novo tokenizador ao dimensioná-los.
Prefill de mensagem do assistente (inalterado): Fazer prefill da mensagem do assistente retorna um erro 400 no Claude Sonnet 5, o mesmo que no Claude Sonnet 4.6. Se você removeu o prefill ao migrar para o Claude Sonnet 4.6, nenhuma mudança adicional é necessária. Use saídas estruturadas, instruções no prompt do sistema ou output_config.format em vez disso.
Pensamento adaptativo ativado por padrão: No Claude Sonnet 4.6, requisições sem um campo thinking executam sem pensamento; no Claude Sonnet 5, as mesmas requisições executam com pensamento adaptativo. Para desativar o pensamento, passe thinking: {type: "disabled"}. O pensamento estendido manual (thinking: {type: "enabled", budget_tokens: N}) não é suportado e retorna um erro 400. Use o parâmetro effort (padrão high) para controlar a profundidade do pensamento.
O pensamento adaptativo está ativado por padrão no Claude Sonnet 5. O campo thinking é mostrado explicitamente aqui para definir display: "summarized"; se você omitir thinking, o Claude Sonnet 5 omite o conteúdo de pensamento da resposta por padrão. Para os padrões de cada modelo, consulte Configurações que cada modelo rejeita.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=16000,
thinking={"type": "adaptive", "display": "summarized"},
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Are there an infinite number of prime numbers such that n mod 4 == 3?",
}
],
)
# A resposta contém blocos de pensamento resumidos e blocos de texto
for block in response.content:
match block.type:
case "thinking":
print(f"\nThinking summary: {block.thinking}")
case "text":
print(f"\nResponse: {block.text}")Parâmetros de amostragem removidos: Parâmetros de amostragem (temperature, top_p, top_k) definidos com um valor não padrão não são aceitos e retornam um erro 400.
Salvaguardas de cibersegurança: Claude Sonnet 5 é o primeiro modelo da linha Sonnet com salvaguardas de cibersegurança em tempo real. Requisições que envolvem tópicos de cibersegurança proibidos ou de alto risco podem ser recusadas. As recusas retornam como uma resposta HTTP 200 bem-sucedida com stop_reason: "refusal", não como um erro. Consulte Salvaguardas, avisos e recursos para contexto.
claude-sonnet-4-6 para claude-sonnet-5.max_tokens dimensionados próximos ao comprimento de saída esperado, e aumente-os até o máximo de 128k (inalterado em relação ao Claude Sonnet 4.6) onde for útil.thinking: {type: "enabled", budget_tokens: N} (retorna um erro 400). O pensamento adaptativo está ativado por padrão; passe {type: "disabled"} para desativá-lo, ou use o parâmetro effort para controlar a profundidade.temperature, top_p e top_k definidos com valores não padrão (eles retornam um erro 400 no Claude Sonnet 5).stop_reason: "refusal" se sua carga de trabalho puder tocar em tópicos de cibersegurança.max_tokens para cargas de trabalho que anteriormente executavam sem pensamento.Se você está migrando do Claude Sonnet 4.5 ou de um modelo Sonnet anterior diretamente para o Claude Sonnet 5, aplique as mudanças de Migrando para Claude Sonnet 5 a partir do Claude Sonnet 4.6 mais as mudanças desta seção.
Claude Sonnet 5 tem como padrão um nível de effort high, em contraste com o Sonnet 4.5, que não tinha parâmetro effort. Considere ajustar o parâmetro effort ao migrar. Se não for definido explicitamente, você pode experimentar maior latência com o nível de effort padrão.
Prefill de mensagens do assistente não é mais suportado
Esta é uma mudança incompatível ao migrar do Sonnet 4.5 ou anterior.
Fazer prefill de mensagens do assistente retorna um erro 400 no Claude Sonnet 4.6 e modelos posteriores, incluindo o Claude Sonnet 5. Use saídas estruturadas, instruções no prompt do sistema ou output_config.format em vez disso.
Casos de uso comuns de prefill e migrações:
Controlar a formatação da saída (forçar saída JSON/YAML): Use saídas estruturadas ou ferramentas com campos enum para tarefas de classificação.
Eliminar preâmbulos (remover frases como "Aqui está..."): Adicione instruções diretas no prompt do sistema: "Responda diretamente sem preâmbulo. Não comece com frases como 'Aqui está...', 'Com base em...', etc."
Evitar recusas indevidas: Claude agora é muito melhor em recusas apropriadas. Um prompt claro na mensagem do usuário sem prefill deve ser suficiente.
Continuações (retomar respostas interrompidas): Mova a continuação para a mensagem do usuário: "Sua resposta anterior foi interrompida e terminou com [previous_response]. Continue de onde parou."
Hidratação de contexto / consistência de papel (atualizar o contexto em conversas longas): Injete o que antes eram lembretes via prefill do assistente no turno do usuário em vez disso.
O escape de JSON em parâmetros de ferramentas pode ser diferente
Esta é uma mudança incompatível ao migrar do Sonnet 4.5 ou anterior.
O escape de strings JSON em parâmetros de ferramentas pode ser diferente dos modelos anteriores. Parsers JSON padrão lidam com isso automaticamente, mas análises personalizadas baseadas em strings podem precisar de atualizações.
Mudanças no pensamento estendido: Configurações de budget_tokens do Claude Sonnet 4.5 (thinking: {type: "enabled", budget_tokens: N}) não são suportadas no Claude Sonnet 5 e retornam um erro 400. O pensamento adaptativo está ativado por padrão, então a maioria das cargas de trabalho não precisa de nenhuma configuração de thinking; use o parâmetro effort para controlar a profundidade do pensamento. Se você executava o Claude Sonnet 4.5 sem pensamento estendido, passe thinking: {type: "disabled"} para preservar esse comportamento.
Remova os parâmetros de amostragem
Esta é uma mudança incompatível ao migrar de modelos Claude 3.x.
Parâmetros de amostragem (temperature, top_p, top_k) definidos com um valor não padrão retornam um erro 400 no Claude Sonnet 5. Remova-os das requisições e use prompts para guiar o comportamento do modelo em vez disso.
Atualize as versões das ferramentas
Esta é uma mudança incompatível ao migrar de modelos Claude 3.x.
Atualize para as versões mais recentes das ferramentas (text_editor_20250728, code_execution_20260521). Remova qualquer código que use o comando undo_edit.
Trate o stop reason refusal
Atualize sua aplicação para tratar stop reasons refusal.
Atualize seus prompts para as mudanças de comportamento
Os modelos Claude 4 têm um estilo de comunicação mais conciso e direto. Revise as melhores práticas de prompting para orientações de otimização.
Claude Haiku 4.5 e Claude Sonnet 5 diferem mais no nível da API do que modelos adjacentes dentro de uma mesma classe: Claude Haiku 4.5 usa pensamento estendido manual (desativado por padrão), uma janela de contexto de 200k tokens e até 64k tokens de saída, enquanto o Claude Sonnet 5 executa com pensamento adaptativo ativado por padrão, oferece uma janela de contexto de 1M de tokens por padrão e suporta até 128k tokens de saída.
model = "claude-haiku-4-5-20251001" # Before
model = "claude-sonnet-5" # AfterConfiguração de pensamento: Claude Haiku 4.5 suporta pensamento estendido manual (thinking: {type: "enabled", budget_tokens: N}) e rejeita thinking: {type: "adaptive"}. No Claude Sonnet 5, o suporte é invertido: o pensamento adaptativo está ativado por padrão, e o pensamento estendido manual retorna um erro 400. Remova as configurações thinking: {type: "enabled", budget_tokens: N} e confie no padrão, ou passe thinking: {type: "disabled"} para desativar o pensamento. budget_tokens não tem substituto direto; use o parâmetro effort para controlar a profundidade do pensamento. O effort não está disponível no Claude Haiku 4.5 e tem como padrão high no Claude Sonnet 5.
Parâmetros de amostragem removidos: temperature e top_p funcionam no Claude Haiku 4.5 (um de cada vez, não ambos). No Claude Sonnet 5, definir temperature, top_p ou top_k com um valor não padrão retorna um erro 400. Remova esses parâmetros e use prompts para guiar o comportamento do modelo.
Prefill do assistente removido: Fazer prefill da mensagem do assistente funciona no Claude Haiku 4.5, mas retorna um erro 400 no Claude Sonnet 5. Use saídas estruturadas, instruções no prompt do sistema ou output_config.format em vez disso.
Janela de contexto e saída maiores: Claude Sonnet 5 oferece uma janela de contexto de 1M de tokens por padrão, acima dos 200k tokens do Claude Haiku 4.5, e suporta até 128k tokens de saída, acima de 64k. Claude Sonnet 5 também usa um tokenizador diferente, então execute novamente a contagem de tokens em vez de reutilizar contagens medidas no Claude Haiku 4.5.
Preços: Claude Haiku 4.5 tem preço de $1/$5 por milhão de tokens de entrada/saída. Para o Claude Sonnet 5, o preço introdutório de $2/$10 por milhão de tokens de entrada/saída está em vigor até 31 de agosto de 2026, após o qual o preço padrão de $3/$15 entra em vigor. Consulte Preços do Claude.
Salvaguardas de cibersegurança: Claude Sonnet 5 tem salvaguardas de cibersegurança em tempo real. Requisições que envolvem tópicos de cibersegurança proibidos ou de alto risco podem ser recusadas, retornadas como uma resposta HTTP 200 bem-sucedida com stop_reason: "refusal". Consulte Salvaguardas, avisos e recursos para contexto.
claude-haiku-4-5-20251001 (ou o alias claude-haiku-4-5) para claude-sonnet-5.thinking: {type: "enabled", budget_tokens: N} (retorna um erro 400). O pensamento adaptativo está ativado por padrão; passe thinking: {type: "disabled"} para preservar o comportamento sem pensamento, e revise max_tokens para cargas de trabalho que executavam sem pensamento.high) para controlar a profundidade do pensamento e o gasto de tokens; ele não está disponível no Claude Haiku 4.5, então nenhuma configuração existente é transferida.temperature e top_p (valores não padrão retornam um erro 400 no Claude Sonnet 5).max_tokens, que você pode aumentar até o máximo de 128k.stop_reason: "refusal" se sua carga de trabalho puder tocar em tópicos de cibersegurança.Claude Haiku 4.5 é o modelo Haiku mais rápido e inteligente, com desempenho próximo ao de fronteira, entregando qualidade de modelo premium para aplicações interativas e processamento de alto volume.
Para uma visão geral completa das capacidades, consulte a visão geral dos modelos.
Para os preços do Claude Haiku 4.5, consulte Preços do Claude.
Para melhorias significativas de desempenho em tarefas de codificação e raciocínio, considere habilitar o pensamento estendido com thinking: {type: "enabled", budget_tokens: N}.
O pensamento estendido impacta a eficiência do cache de prompt.
O pensamento estendido está descontinuado nos modelos Claude 4.6 e foi removido no Claude Opus 4.7. Se estiver usando modelos mais novos, use pensamento adaptativo em vez disso.
Atualize o nome do seu modelo:
# Do Haiku 3.5
model = "claude-3-5-haiku-20241022" # Before
model = "claude-haiku-4-5-20251001" # AfterRevise os novos limites de taxa: Haiku 4.5 tem limites de taxa separados do Haiku 3.5. Consulte a documentação de Limites de taxa para detalhes.
Explore novas capacidades: Consulte a visão geral dos modelos para detalhes sobre consciência de contexto, capacidade de saída aumentada (64k tokens), maior inteligência e velocidade aprimorada.
Estas mudanças incompatíveis se aplicam ao migrar de modelos Claude 3.x Haiku.
Atualize os parâmetros de amostragem
Esta é uma mudança incompatível ao migrar de modelos Claude 3.x.
Use apenas temperature OU top_p, não ambos. Definir ambos retorna um erro 400 no Claude Haiku 4.5.
Atualize as versões das ferramentas
Esta é uma mudança incompatível ao migrar de modelos Claude 3.x.
Atualize para as versões mais recentes das ferramentas (text_editor_20250728, code_execution_20250825). Remova qualquer código que use o comando undo_edit.
Trate o stop reason refusal
Atualize sua aplicação para tratar stop reasons refusal.
Atualize seus prompts para as mudanças de comportamento
Os modelos Claude 4 têm um estilo de comunicação mais conciso e direto. Revise as melhores práticas de prompting para orientações de otimização.
claude-haiku-4-5-20251001text_editor_20250728, code_execution_20250825); versões legadas não são suportadasundo_edit (se aplicável)temperature OU top_p, não ambos (definir ambos retorna um erro 400)refusal na sua aplicaçãoWas this page helpful?