Claude Platform Docs
Mejores prácticasProbar y evaluar

Reducir la latencia

Reduce la latencia de respuesta de Claude eligiendo un modelo más rápido como Claude Haiku 4.5, recortando los tokens del prompt y de la salida, y usando streaming en las respuestas.

La "latency" (latencia) se refiere al tiempo que tarda el modelo en procesar un prompt y generar una salida. La latencia puede verse influida por varios factores, como el tamaño del modelo, la complejidad del prompt y la infraestructura subyacente que soporta el modelo y el punto de interacción.


Cómo medir la latencia

Al hablar de latencia, es posible que te encuentres con varios términos y mediciones:

  • Latencia base: Es el tiempo que tarda el modelo en procesar el prompt y generar la respuesta, sin considerar los tokens de entrada y salida por segundo. Proporciona una idea general de la velocidad del modelo.
  • "Time to first token" (tiempo hasta el primer token), o TTFT: Esta métrica mide el tiempo que tarda el modelo en generar el primer token de la respuesta, desde el momento en que se envió el prompt. Es particularmente relevante cuando usas streaming (más sobre esto más adelante) y quieres ofrecer una experiencia ágil a tus usuarios.

Para una comprensión más profunda de estos términos, consulta el glosario.


Cómo reducir la latencia

1. Elige el modelo adecuado

Una de las formas más directas de reducir la latencia es seleccionar el modelo apropiado para tu caso de uso. Anthropic ofrece una gama de modelos con diferentes capacidades y características de rendimiento. Considera tus requisitos específicos y elige el modelo que mejor se adapte a tus necesidades en términos de velocidad y calidad de salida.

Para aplicaciones donde la velocidad es crítica, Claude Haiku 4.5 ofrece los tiempos de respuesta más rápidos manteniendo una alta inteligencia:

client = anthropic.Anthropic()

# Para aplicaciones sensibles al tiempo, usa Claude Haiku 4.5
message = client.messages.create(
    model="claude-haiku-4-5",
    max_tokens=100,
    messages=[
        {
            "role": "user",
            "content": "Summarize this customer feedback in 2 sentences: [feedback text]",
        }
    ],
)
print(message.content[0].text)

Para más detalles sobre las métricas de los modelos, consulta la página de descripción general de modelos.

2. Optimiza la longitud del prompt y de la salida

Minimiza la cantidad de tokens tanto en tu prompt de entrada como en la salida esperada, manteniendo al mismo tiempo un alto rendimiento. Cuantos menos tokens tenga que procesar y generar el modelo, más rápida será la respuesta.

Aquí tienes algunos consejos para ayudarte a optimizar tus prompts y salidas:

  • Sé claro pero conciso: Procura transmitir tu intención de forma clara y concisa en el prompt. Evita detalles innecesarios o información redundante, teniendo en cuenta que Claude carece de contexto sobre tu caso de uso y podría no hacer los saltos lógicos previstos si las instrucciones no son claras.
  • Pide respuestas más cortas: Pídele directamente a Claude que sea conciso. Si Claude está generando una longitud no deseada, pídele a Claude que modere su locuacidad.
  • Establece límites de salida apropiados: Usa el parámetro max_tokens para establecer un límite estricto en la longitud máxima de la respuesta generada. Esto evita que Claude genere salidas excesivamente largas.
  • Experimenta con la temperatura: El parámetro temperature controla la aleatoriedad de la salida. Valores más bajos (por ejemplo, 0.2) a veces pueden producir respuestas más enfocadas y cortas, mientras que valores más altos (por ejemplo, 0.8) podrían dar lugar a salidas más diversas pero potencialmente más largas.

Encontrar el equilibrio adecuado entre la claridad del prompt, la calidad de la salida y la cantidad de tokens podría requerir cierta experimentación.

3. Usa streaming en las respuestas

El "streaming" (streaming) es una funcionalidad que permite al modelo comenzar a enviar su respuesta antes de que la salida completa esté terminada. Esto puede mejorar significativamente la capacidad de respuesta percibida de tu aplicación, ya que los usuarios pueden ver la salida del modelo en tiempo real.

Con el streaming habilitado, puedes procesar la salida del modelo a medida que llega, actualizando tu interfaz de usuario o realizando otras tareas en paralelo.

Visita Streaming de mensajes para aprender cómo puedes implementar streaming para tu caso de uso.


Próximos pasos

Minimiza las alucinaciones en las salidas de Claude permitiendo la incertidumbre, fundamentando las respuestas en citas directas y verificando las afirmaciones con citas.

Recibe las respuestas de la Messages API de forma incremental mediante eventos enviados por el servidor, incluyendo deltas de texto, uso de herramientas y pensamiento extendido.

Was this page helpful?