Claude Platform Docs
Best practiceTestare e valutare

Definisci i criteri di successo e costruisci le valutazioni

Definisci criteri di successo misurabili per la tua applicazione LLM e costruisci valutazioni per testarla, dai controlli di corrispondenza esatta alla valutazione basata su LLM.

Costruire un'applicazione di successo basata su un "large language model" (grande modello linguistico), o LLM, inizia con la definizione chiara dei tuoi criteri di successo e poi con la progettazione di valutazioni per misurare le prestazioni rispetto a essi. Questo ciclo è centrale nel prompt engineering.

Diagramma di flusso del prompt engineering: casi di test, prompt preliminare, test e perfezionamento iterativi, validazione finale, rilascio

Definisci i tuoi criteri di successo

I buoni criteri di successo sono:

  • Specifici: Definisci chiaramente cosa vuoi ottenere. Invece di "buone prestazioni", specifica "classificazione accurata del sentiment".

  • Misurabili: Usa metriche quantitative o scale qualitative ben definite. I numeri forniscono chiarezza e scalabilità, ma le misure qualitative possono essere preziose se applicate in modo coerente insieme alle misure quantitative.

    • Anche argomenti "nebulosi" come l'etica e la sicurezza possono essere quantificati:
      Criteri di sicurezza
      ScarsoOutput sicuri
      BuonoMeno dello 0,1% degli output su 10.000 prove segnalati per tossicità dal filtro dei contenuti.

  • Raggiungibili: Basa i tuoi obiettivi su benchmark di settore, esperimenti precedenti, ricerca sull'IA o conoscenze di esperti. Le tue metriche di successo non dovrebbero essere irrealistiche rispetto alle attuali capacità dei modelli di frontiera.

  • Rilevanti: Allinea i tuoi criteri con lo scopo della tua applicazione e le esigenze degli utenti. Un'elevata accuratezza delle citazioni potrebbe essere critica per le app mediche ma meno per i chatbot informali.

Criteri di successo comuni

Ecco alcuni criteri che potrebbero essere importanti per il tuo caso d'uso. Questo elenco non è esaustivo.

La maggior parte dei casi d'uso richiede una valutazione multidimensionale lungo diversi criteri di successo.


Costruisci le valutazioni

Principi di progettazione delle eval

  1. Sii specifico per il compito: Progetta eval che rispecchino la distribuzione dei tuoi compiti nel mondo reale. Non dimenticare di tenere conto dei casi limite!

  2. Automatizza quando possibile: Struttura le domande in modo da consentire una valutazione automatizzata (ad esempio, scelta multipla, corrispondenza di stringhe, valutazione tramite codice, valutazione tramite LLM).
  3. Dai priorità al volume rispetto alla qualità: Più domande con una valutazione automatizzata dal segnale leggermente inferiore sono meglio di meno domande con eval di alta qualità valutate manualmente da esseri umani.

Esempi di eval


Valuta le tue valutazioni

Quando decidi quale metodo usare per valutare le eval, scegli il metodo più veloce, più affidabile e più scalabile:

  1. Valutazione basata su codice: La più veloce e affidabile, estremamente scalabile, ma manca anche di sfumature per giudizi più complessi che richiedono una rigidità meno basata su regole.

    • Corrispondenza esatta: output == golden_answer
    • Corrispondenza di stringhe: key_phrase in output
  2. Valutazione umana: La più flessibile e di alta qualità, ma lenta e costosa. Evitala se possibile.

  3. Valutazione basata su LLM: Veloce e flessibile, scalabile e adatta a giudizi complessi. Testa prima per garantire l'affidabilità, poi scala.

Suggerimenti per la valutazione basata su LLM

  • Usa rubriche dettagliate e chiare: "La risposta dovrebbe sempre menzionare 'Acme Inc.' nella prima frase. Se non lo fa, la risposta viene automaticamente valutata come 'errata'."
  • Empirica o specifica: Ad esempio, istruisci l'LLM a produrre solo 'corretto' o 'errato', oppure a giudicare su una scala da 1 a 5. Le valutazioni puramente qualitative sono difficili da valutare rapidamente e su larga scala.
  • Incoraggia il ragionamento: Chiedi all'LLM di ragionare prima di produrre un punteggio di valutazione, e poi scarta il ragionamento. Questo aumenta le prestazioni della valutazione, in particolare per compiti che richiedono giudizi complessi.

Prossimi passi

Fai brainstorming sui criteri di successo per il tuo caso d'uso con Claude su claude.ai.

Suggerimento: Inserisci questa pagina nella chat come guida per Claude!

Altri esempi di codice di eval valutate da esseri umani, tramite codice e tramite LLM.

Was this page helpful?