Claude Platform Docs
Modelos e preçosModelos

Claude Sonnet 5.5Latest

The best combination of speed and intelligence

Try in playground
Context window
1Mtokens
Max output
128Ktokens
Input pricing
$2/ MTok
Output pricing
$10/ MTok

Visão geral

O Claude Sonnet 5.5 oferece a melhor combinação de velocidade e inteligência. Cinco "breaking changes" (mudanças incompatíveis) afetam código que já roda no Claude Sonnet 5:

Mais uma mudança altera o formato da resposta sem fazer nenhuma requisição falhar: o texto entre chamadas de ferramentas volta em blocos thinking. Uma aplicação que faz streaming desse texto para seus usuários fica em silêncio entre as chamadas de ferramentas até definir um valor de display que retorne o texto, ou até desativar o pensamento antecipado com between_tools.

Novidades do Claude Sonnet 5.5

Como ele se compara

ModelContextMax outputPrice / MTokLatencyThinkingDefault effortKnowledge cutoff
Claude Fable 5.11M128K$10 / $50SlowerAdaptive (always on)highJun 2026
Claude Opus 5.51M128K$4 / $20ModerateAdaptive (always on)mediumJun 2026
Claude Sonnet 5.5This model1M128K$2 / $10FastAdaptivehighJun 2026
Claude Haiku 4.5200K64K$1 / $5FastestExtended—Feb 2025

Especificações

Model IDs

Claude API
Amazon Bedrock
Google Cloud
Microsoft Foundry
Claude Platform on AWS

Pricing

Input
$2 / MTok
Output
$10 / MTok
5m cache write
$2.50 / MTok
Cache read
$0.20 / MTok
Batch API
50% discount on input and output

Full price list

Capabilities

Max output
128K tokens
Thinking
Adaptive
Comparative latency
Fast
Input → output
Text and images → text
Reliable knowledge cutoff
Jun 2026
Training data cutoff
Jun 2026

Availability

Status
Active (latest)
Released
September 28, 2026
Retirement
Not sooner than September 28, 2027

Bom saber

  • O "adaptive thinking" (pensamento adaptativo) está ativado por padrão. A configuração de pensamento mais baixa é between_tools, que desativa o pensamento antecipado. Ela funciona com "effort" (esforço) high ou inferior. Consulte Novidades no Claude Sonnet 5.5.
  • Definir temperature, top_p ou top_k com um valor diferente do padrão retorna um erro 400.
  • O comprimento mínimo de prompt para "prompt caching" (cache de prompt) é de 512 tokens. Consulte Cache de prompt.
  • Na Message Batches API, o Claude Sonnet 5.5 suporta até 300k tokens de saída com o cabeçalho beta output-300k-2026-03-24.
  • Consulte limites e recursos programaticamente com a Models API.

Recursos

Diferenças de comportamento e padrões de prompt específicos do Claude Sonnet 5.5.

O controle para profundidade de pensamento, "latency" (latência) e custo. Escolha um nível para cada carga de trabalho.

Como o pensamento adaptativo funciona, quais configurações de pensamento cada modelo aceita e como os blocos de pensamento são preservados.

Referência

Lista completa de preços, incluindo descontos de lote e tarifas de cache de prompt.

Como funcionam os IDs de modelo, os aliases e os snapshots fixados.

Status do ciclo de vida e compromissos de desativação para cada modelo Claude.

Was this page helpful?