Claude Platform Docs
Melhores práticasTestar e avaliar

Reduzindo a latência

Reduza a latência de resposta do Claude escolhendo um modelo mais rápido como o Claude Haiku 4.5, reduzindo os tokens de prompt e de saída e usando streaming de respostas.

"Latency" (latência) refere-se ao tempo que o modelo leva para processar um prompt e gerar uma saída. A latência pode ser influenciada por vários fatores, como o tamanho do modelo, a complexidade do prompt e a infraestrutura subjacente que dá suporte ao modelo e ao ponto de interação.


Como medir a latência

Ao discutir latência, você pode se deparar com vários termos e medidas:

  • Latência de base (baseline latency): É o tempo que o modelo leva para processar o prompt e gerar a resposta, sem considerar os tokens de entrada e saída por segundo. Fornece uma ideia geral da velocidade do modelo.
  • "Time to first token" (tempo até o primeiro token), ou TTFT: Essa métrica mede o tempo que o modelo leva para gerar o primeiro token da resposta, a partir do momento em que o prompt foi enviado. É particularmente relevante quando você está usando streaming (mais sobre isso adiante) e deseja oferecer uma experiência responsiva aos seus usuários.

Para uma compreensão mais aprofundada desses termos, confira o glossário.


Como reduzir a latência

1. Escolha o modelo certo

Uma das formas mais diretas de reduzir a latência é selecionar o modelo apropriado para o seu caso de uso. A Anthropic oferece uma variedade de modelos com diferentes capacidades e características de desempenho. Considere seus requisitos específicos e escolha o modelo que melhor atende às suas necessidades em termos de velocidade e qualidade de saída.

Para aplicações em que a velocidade é crítica, o Claude Haiku 4.5 oferece os tempos de resposta mais rápidos, mantendo alta inteligência:

client = anthropic.Anthropic()

# Para aplicações sensíveis ao tempo, use o Claude Haiku 4.5
message = client.messages.create(
    model="claude-haiku-4-5",
    max_tokens=100,
    messages=[
        {
            "role": "user",
            "content": "Summarize this customer feedback in 2 sentences: [feedback text]",
        }
    ],
)
print(message.content[0].text)

Para mais detalhes sobre as métricas dos modelos, consulte a página de visão geral dos modelos.

2. Otimize o comprimento do prompt e da saída

Minimize o número de tokens tanto no seu prompt de entrada quanto na saída esperada, mantendo ainda um alto desempenho. Quanto menos tokens o modelo tiver que processar e gerar, mais rápida será a resposta.

Aqui estão algumas dicas para ajudar você a otimizar seus prompts e saídas:

  • Seja claro, mas conciso: Procure transmitir sua intenção de forma clara e concisa no prompt. Evite detalhes desnecessários ou informações redundantes, tendo em mente que o Claude não tem contexto sobre o seu caso de uso e pode não fazer os saltos lógicos pretendidos se as instruções não forem claras.
  • Peça respostas mais curtas: Peça diretamente ao Claude que seja conciso. Se o Claude estiver gerando saídas mais longas do que o desejado, peça ao Claude para conter sua prolixidade.
  • Defina limites de saída apropriados: Use o parâmetro max_tokens para definir um limite rígido para o comprimento máximo da resposta gerada. Isso impede que o Claude gere saídas excessivamente longas.
  • Experimente com a temperatura: O parâmetro temperature controla a aleatoriedade da saída. Valores mais baixos (por exemplo, 0,2) podem às vezes levar a respostas mais focadas e curtas, enquanto valores mais altos (por exemplo, 0,8) podem resultar em saídas mais diversas, mas potencialmente mais longas.

Encontrar o equilíbrio certo entre clareza do prompt, qualidade da saída e contagem de tokens pode exigir alguma experimentação.

3. Use streaming de respostas

O "streaming" (envio contínuo) é um recurso que permite que o modelo comece a enviar sua resposta antes que a saída completa esteja concluída. Isso pode melhorar significativamente a responsividade percebida da sua aplicação, pois os usuários podem ver a saída do modelo em tempo real.

Com o streaming ativado, você pode processar a saída do modelo à medida que ela chega, atualizando sua interface de usuário ou executando outras tarefas em paralelo.

Visite Streaming de mensagens para saber como você pode implementar streaming para o seu caso de uso.


Próximos passos

Minimize alucinações nas saídas do Claude permitindo incerteza, fundamentando respostas em citações diretas e verificando afirmações com citações.

Faça streaming das respostas da Messages API de forma incremental com server-sent events, incluindo deltas de texto, uso de ferramentas e pensamento estendido.

Was this page helpful?