Claude Platform Docs
Mejores prácticasProbar y evaluar

Define criterios de éxito y crea evaluaciones

Define criterios de éxito medibles para tu aplicación basada en LLM y crea evaluaciones para probarla, desde verificaciones de coincidencia exacta hasta calificación basada en LLM.

Crear una aplicación exitosa basada en un "large language model" (modelo de lenguaje grande), o LLM, comienza con definir claramente tus criterios de éxito y luego diseñar evaluaciones para medir el rendimiento con respecto a ellos. Este ciclo es central para el "prompt engineering" (ingeniería de prompts).

Diagrama de flujo de prompt engineering (ingeniería de prompts): test cases (casos de prueba), preliminary prompt (prompt preliminar), iterative testing and refinement (pruebas y refinamiento iterativos), final validation (validación final), ship (lanzamiento)

Define tus criterios de éxito

Los buenos criterios de éxito son:

  • Específicos: Define claramente lo que quieres lograr. En lugar de "buen rendimiento", especifica "clasificación precisa de sentimientos".

  • Medibles: Usa métricas cuantitativas o escalas cualitativas bien definidas. Los números proporcionan claridad y escalabilidad, pero las medidas cualitativas pueden ser valiosas si se aplican de manera consistente junto con medidas cuantitativas.

    • Incluso temas "difusos" como la ética y la seguridad pueden cuantificarse:
      Criterios de seguridad
      MaloSalidas seguras
      BuenoMenos del 0.1% de las salidas de 10,000 pruebas marcadas por toxicidad por el filtro de contenido.

  • Alcanzables: Basa tus objetivos en benchmarks de la industria, experimentos previos, investigación en IA o conocimiento experto. Tus métricas de éxito no deben ser irreales respecto a las capacidades actuales de los modelos de frontera.

  • Relevantes: Alinea tus criterios con el propósito de tu aplicación y las necesidades de los usuarios. Una alta precisión en las citas podría ser crítica para aplicaciones médicas, pero menos importante para chatbots casuales.

Criterios de éxito comunes

Aquí hay algunos criterios que podrían ser importantes para tu caso de uso. Esta lista no es exhaustiva.

La mayoría de los casos de uso necesitan una evaluación multidimensional a lo largo de varios criterios de éxito.


Crea evaluaciones

Principios de diseño de evaluaciones

  1. Sé específico para la tarea: Diseña evaluaciones que reflejen la distribución de tareas del mundo real. ¡No olvides tener en cuenta los casos límite!

  2. Automatiza cuando sea posible: Estructura las preguntas para permitir la calificación automatizada (por ejemplo, opción múltiple, coincidencia de cadenas, calificación por código, calificación por LLM).
  3. Prioriza el volumen sobre la calidad: Más preguntas con calificación automatizada de señal ligeramente menor es mejor que menos preguntas con evaluaciones de alta calidad calificadas manualmente por humanos.

Ejemplos de evaluaciones


Califica tus evaluaciones

Al decidir qué método usar para calificar las evaluaciones, elige el método más rápido, más confiable y más escalable:

  1. Calificación basada en código: La más rápida y confiable, extremadamente escalable, pero también carece de matices para juicios más complejos que requieren menos rigidez basada en reglas.

    • Coincidencia exacta: output == golden_answer
    • Coincidencia de cadenas: key_phrase in output
  2. Calificación humana: La más flexible y de mayor calidad, pero lenta y costosa. Evítala si es posible.

  3. Calificación basada en LLM: Rápida y flexible, escalable y adecuada para juicios complejos. Prueba primero para asegurar la confiabilidad y luego escala.

Consejos para la calificación basada en LLM

  • Ten rúbricas detalladas y claras: "La respuesta siempre debe mencionar 'Acme Inc.' en la primera oración. Si no lo hace, la respuesta se califica automáticamente como 'incorrecta'."
  • Empírica o específica: Por ejemplo, indica al LLM que genere solo 'correct' o 'incorrect', o que juzgue en una escala de 1–5. Las evaluaciones puramente cualitativas son difíciles de valorar rápidamente y a escala.
  • Fomenta el razonamiento: Pídele al LLM que razone primero antes de producir una puntuación de evaluación, y luego descarta el razonamiento. Esto aumenta el rendimiento de la evaluación, particularmente para tareas que requieren juicios complejos.

Próximos pasos

Haz una lluvia de ideas sobre criterios de éxito para tu caso de uso con Claude en claude.ai.

Consejo: ¡Arrastra esta página al chat como guía para Claude!

Más ejemplos de código de evaluaciones calificadas por humanos, por código y por LLM.

Was this page helpful?