O Claude Opus 5 representa uma melhoria significativa em relação ao Claude Opus 4.8, com os maiores ganhos em raciocínio profundo, tarefas agênticas e de longo horizonte, e escalonamento de computação em tempo de teste. Esta página resume tudo o que há de novo no Claude Opus 5, incluindo pensamento ativado por padrão, mudanças de ferramentas no meio da conversa e uma mudança incompatível relacionada a quando o pensamento pode ser desativado.
| Modelo | ID do modelo na API | Descrição |
|---|---|---|
| Claude Opus 5 | claude-opus-5 | Para codificação agêntica complexa e trabalho empresarial |
O Claude Opus 5 tem uma janela de contexto de 1M de tokens (1M de tokens é tanto o padrão quanto o máximo; não há variante de contexto menor), 128k tokens máximos de saída e pensamento ativado por padrão.
Para preços e especificações completas, consulte a visão geral dos modelos.
Você pode adicionar ou remover ferramentas entre turnos de uma conversa preservando o cache de prompt, em vez de reenviar uma lista fixa de ferramentas durante toda a sessão. As mudanças de ferramentas no meio da conversa estão em beta: inclua o cabeçalho beta mid-conversation-tool-changes-2026-07-01 em suas requisições. Consulte Mudanças de ferramentas no meio da conversa para uso.
O parâmetro fallbacks suporta um novo modo "default", que aplica os modelos de fallback recomendados pela Anthropic por categoria de recusa, em vez de uma lista de modelos que você mesmo mantém. Todo o parâmetro fallbacks está em beta. Use o cabeçalho beta server-side-fallback-2026-07-01, que suporta tanto o modo "default" quanto listas explícitas de modelos (o cabeçalho anterior server-side-fallback-2026-06-01 aceita apenas listas explícitas). Consulte Recusas e fallback.
O comprimento mínimo de prompt cacheável no Claude Opus 5 é de 512 tokens, reduzido de 1.024 tokens no Claude Opus 4.8. Prompts que eram curtos demais para cachear no Claude Opus 4.8 agora podem criar entradas de cache sem alterações de código. Consulte Cache de prompt para os mínimos por modelo.
O modo rápido (prévia de pesquisa) está disponível para o Claude Opus 5 apenas na API do Claude; atualmente não está disponível no Amazon Bedrock, Google Cloud ou Microsoft Foundry. O modo rápido para o Claude Opus 5 tem preço de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Consulte Modo rápido para acesso, modelos suportados e preços.
No Claude Opus 4.8, as requisições são executadas sem pensamento, a menos que você defina thinking: {"type": "adaptive"}. No Claude Opus 5, as mesmas requisições são executadas com pensamento ativado: o modelo decide quando e quanto pensar em cada turno, e o parâmetro de esforço é o controle para a profundidade do pensamento. O valor transmitido permanece inalterado; thinking: {"type": "adaptive"} continua válido e equivalente ao padrão.
Como max_tokens é um limite rígido para a saída total (pensamento mais texto de resposta), revise-o para cargas de trabalho que eram executadas sem pensamento no Claude Opus 4.8.
A API mantém a opção de desativar o pensamento, sujeita à restrição de esforço abaixo.
O Claude Opus 5 converte esforço adicional em melhores resultados de forma mais confiável do que qualquer modelo Opus anterior, então o nível de esforço que você escolhe tem mais peso. A escala completa está disponível: low, medium, high, xhigh e max, sendo max o nível mais alto para o raciocínio mais profundo possível. Comece no padrão, high, e ajuste em qualquer direção com base em suas avaliações: reduza onde a qualidade se mantém para economizar tokens e latência, ou aumente para o trabalho mais exigente. Ao executar com esforço xhigh ou max, defina um max_tokens grande para que o modelo tenha espaço para pensar e agir entre subagentes e chamadas de ferramentas.
Esta requisição aumenta o esforço até o máximo, max:
client = anthropic.Anthropic()
with client.messages.stream(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "max"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
) as stream:
response = stream.get_final_message()
print(response)O pensamento está ativado por padrão no Claude Opus 5, então nenhum campo thinking é necessário.
high ou inferiorNo Claude Opus 5, thinking: {"type": "disabled"} é aceito apenas quando o nível de esforço é high ou inferior. Definir thinking: {"type": "disabled"} com esforço xhigh ou max retorna um erro 400. Este é um comportamento geralmente disponível a partir do Claude Opus 5, aplicado em cada requisição, e é uma mudança incompatível em relação ao Claude Opus 4.8, onde desativar o pensamento era independente do nível de esforço. Se você desativa o pensamento em níveis altos de esforço atualmente, mantenha o pensamento desativado e defina o esforço como high ou inferior, ou mantenha o nível de esforço e remova o campo thinking.
Com o pensamento desativado, o Claude Opus 5 pode ocasionalmente escrever uma chamada de ferramenta em sua saída de texto em vez de emitir um bloco tool_use, ou incluir tags XML internas em sua resposta visível. Sempre que possível, mantenha o pensamento ativado e controle o custo de tokens com níveis de esforço mais baixos; para integrações que precisam manter o pensamento desativado, consulte Executando com pensamento desativado para mitigações de prompting.
Além das mudanças de API acima, o Claude Opus 5 se comporta de forma diferente do Claude Opus 4.8 de maneiras que você pode notar sem alterar nenhum código. As respostas padrão voltadas ao usuário e os entregáveis escritos são mais longos. Em sessões agênticas, o modelo narra seu progresso ao usuário com mais frequência. Em frameworks multiagente, ele delega a subagentes mais prontamente. Ele também verifica seu próprio trabalho sem ser instruído a fazê-lo, então remova instruções de verificação herdadas de modelos anteriores ("inclua uma etapa final de verificação", "use um subagente para verificar"); elas causam verificação excessiva no Claude Opus 5. Para padrões de prompting que ajustam cada um desses comportamentos, consulte Prompting do Claude Opus 5.
Comparado ao Claude Opus 4.8, o Claude Opus 5 representa uma melhoria significativa em vez de incremental, e oferece inteligência de fronteira pela metade do custo do Claude Fable 5. Os maiores ganhos estão em:
max) em melhores resultados.low e medium produzindo qualidade sólida com uma fração dos tokens e da latência de configurações mais altas.Para os padrões de prompting que aproveitam ao máximo essas capacidades, consulte Prompting do Claude Opus 5.
O Claude Opus 5 tem preço de US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída, inalterado em relação ao Claude Opus 4.8.
Consulte Preços para preços completos, incluindo processamento em lote, cache de prompt e taxas do modo rápido.
O Claude Opus 5 está disponível em:
claude-opus-5.anthropic.claude-opus-5. O Claude Opus 5 também é acessível através da API InvokeModel no bedrock-runtime, servido pela mesma infraestrutura; a integração Claude no Amazon Bedrock (legado) não o inclui em sua tabela de IDs de modelo versionados por ARN.claude-opus-5.O Claude Opus 4.8 permanece disponível em todas essas plataformas.
Para migrar do Claude Opus 4.8, atualize seu ID de modelo:
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # AfterEm seguida, revise as duas mudanças de comportamento: o pensamento está ativado por padrão, e desativar o pensamento com esforço xhigh ou max retorna um erro 400. Consulte o guia de migração para instruções passo a passo.
Especificações completas e preços de todos os modelos Claude atuais.
Diferenças comportamentais e padrões de prompting específicos do Claude Opus 5.
Controle quantos tokens o Claude usa ao responder, de low a max.
Como o pensamento funciona quando está ativado por padrão e quando pode ser desativado.
Forneça ao Claude um orçamento consultivo de tokens para ritmar seu trabalho.
Guia para migrar para os modelos Claude mais recentes a partir de versões anteriores do Claude.
Obtenha mais tokens de saída por segundo dos modelos Claude Opus com preço premium.
Was this page helpful?