Inference hooks
Invia ogni prompt governato al server di sicurezza AI della tua organizzazione per ottenere un verdetto di autorizzazione o rifiuto prima che l'inferenza proceda.
Gli "Inference hooks" (hook di inferenza) consentono a un'organizzazione Claude Enterprise di instradare ogni prompt governato attraverso un "AI security server" (server di sicurezza AI), un servizio HTTPS gestito dall'organizzazione o dal suo fornitore di sicurezza, prima che venga eseguita l'inferenza. Quando un utente invia un prompt, Anthropic invia la trascrizione della conversazione al tuo server di sicurezza AI e attende un verdetto di autorizzazione (allow) o rifiuto (deny); una richiesta rifiutata non raggiunge mai il modello. I team di sicurezza e conformità usano gli Inference hooks per applicare le policy sui dati in linea, e gli sviluppatori costruiscono il server di sicurezza AI che valuta ogni richiesta.
Poiché l'hook viene eseguito sui server di Anthropic, dopo che la richiesta ha lasciato il client e prima che il modello venga eseguito, si applica in modo uniforme a ogni richiesta governata, senza nulla da installare o distribuire sui dispositivi degli utenti.
Attualmente l'unico evento hook è prompt, che si attiva una volta per ogni richiesta di inferenza governata, prima che l'inferenza inizi. L'applicazione lato risposta è prevista come evento successivo.
Come funzionano gli Inference hooks
- Un utente invia un prompt su una superficie governata.
- Anthropic invia una richiesta HTTPS
POSTall'endpoint del server di sicurezza AI configurato dalla tua organizzazione. Il corpo della richiesta contiene la trascrizione della conversazione e ogni richiesta è firmata secondo la specifica Standard Webhooks una volta che la tua organizzazione ha generato il proprio segreto di firma, in modo che il tuo server possa verificare che provenga da Anthropic. - Il tuo server di sicurezza AI valuta il contenuto e risponde con un verdetto entro il timeout del verdetto configurato dalla tua organizzazione (5 secondi per impostazione predefinita).
- In caso di
allow, l'inferenza procede normalmente. In caso dideny, la richiesta viene respinta e l'utente vede un messaggio di blocco per policy composto da due parti: il motivo specifico della richiesta fornito dal tuo server di sicurezza AI nel campodeny_reasondel verdetto, seguito da un messaggio permanente configurato dai tuoi amministratori (ad esempio, chi contattare o dove richiedere un'eccezione). Se i tuoi amministratori non ne hanno configurato uno, un messaggio predefinito integrato indirizza l'utente a contattarli. Ogni rifiuto viene inoltre registrato nell'Activity Feed della tua organizzazione.
Il diagramma seguente traccia un esempio (una richiesta Cowork in cui Claude chiama anche uno strumento O365) per illustrare quali parti del flusso sono soggette a hook. I punti soggetti a hook sono i passaggi 1 e 5 del diagramma, dove arriva il prompt e ritorna il risultato dello strumento; ciascuno dà luogo allo scambio di validazione con il tuo server di sicurezza AI mostrato nei passaggi 2 e 6.
Un verdetto è un piccolo oggetto JSON: {"action": "allow"} consente alla richiesta di procedere, mentre un deny contiene il motivo mostrato all'utente. Per lo schema completo del verdetto, consulta Restituire un verdetto.
Il tuo server di sicurezza AI vede ciò che vede l'utente: il testo della trascrizione, le chiamate agli strumenti e i loro risultati, e il testo estratto dagli allegati. Non riceve mai i byte grezzi di file o immagini, i prompt di sistema o il contesto interno di Anthropic. Anthropic non memorizza il contenuto dei prompt o delle risposte come parte degli Inference hooks; registra solo metadati sull'attività degli hook, come verdetti, timestamp e identificatori delle richieste.
Se il tuo server di sicurezza AI non è raggiungibile, restituisce un errore o non risponde entro il timeout, l'impostazione di gestione degli errori della tua organizzazione decide l'esito: bloccare la richiesta oppure consentirle di procedere senza ispezione.
L'applicazione può essere introdotta al tuo ritmo, così nessuno deve essere bloccato fin dal primo giorno: la modalità shadow osserva i verdetti sul traffico reale senza bloccare nulla, una percentuale di rollout ispeziona una frazione scelta delle richieste e le esclusioni esentano completamente i membri dei ruoli scelti. Consulta Configurare gli Inference hooks.
Per gli schemi completi di richiesta e risposta, la verifica della firma e i dettagli operativi, consulta Sviluppare un'integrazione.
Casi d'uso
- Prevenzione della perdita di dati (DLP). Inoltra la trascrizione al tuo scanner di "data loss prevention" (prevenzione della perdita di dati), o DLP, e rifiuta i prompt che contengono materiale regolamentato o classificato. Questa è la distribuzione più comune.
- Archiviazione delle trascrizioni in tempo reale. Archivia ogni trascrizione al suo arrivo e restituisci sempre
allow, come alternativa basata su push al polling della Compliance API. - Telemetria dei prompt. Misura come la tua organizzazione usa Claude, nel momento dell'uso.
- Motori di policy. Applica le tue regole prima dell'inferenza: allowlist di modelli, restrizioni a livello di progetto o controlli sull'orario di lavoro.
Limitazioni attuali
- Gli allegati sono rappresentati da metadati e testo estratto. I byte grezzi di file e immagini non vengono mai inviati, quindi il contenuto costituito solo da immagini (ad esempio, lo screenshot di un documento) non viene ispezionato.
- I verdetti sono allow o deny. La riscrittura o la redazione di un prompt non è supportata.
- Le organizzazioni Platform (accesso API tramite la Claude Platform) sono fuori ambito.
Disponibilità
Gli Inference hooks sono disponibili per le organizzazioni Claude Enterprise. La loro configurazione richiede il permesso organization:manage, detenuto dai ruoli predefiniti Admin, Owner e Primary owner, così come da qualsiasi ruolo personalizzato a cui sia stato concesso.
Un unico hook governa le conversazioni su claude.ai, Cowork e le sessioni di Claude Code nella tua organizzazione Claude Enterprise, indipendentemente dal fatto che vengano eseguite sul web, nell'app desktop o nella CLI. Gli Inference hooks non sono disponibili su Amazon Bedrock o Google Cloud.
Le richieste governate sono le richieste di inferenza alla base della conversazione dell'utente. Le richieste accessorie, come la generazione del titolo della conversazione, non vengono inviate al tuo endpoint, e i prompt di sistema e le definizioni degli strumenti non sono mai inclusi in ciò che viene inviato. La modalità vocale non è coperta.
Inference hooks rispetto alla Compliance API
Entrambe le funzionalità servono i team di sicurezza, legali e di conformità delle organizzazioni Claude Enterprise.
| Inference hooks | Compliance API | |
|---|---|---|
| Quando agisce | In linea, prima che l'inferenza venga eseguita | A posteriori |
| Cosa fa | Autorizza o rifiuta ogni richiesta governata in tempo reale | Recupera attività, chat, file, progetti, trascrizioni di sessione e utenti per audit ed esportazione |
| Direzione | Anthropic chiama il tuo server di sicurezza AI | Tu chiami l'API di Anthropic |
Usa gli Inference hooks per fermare una richiesta prima che raggiunga il modello, e la Compliance API per verificare cosa è successo in seguito.
In questa sezione
Abilita gli Inference hooks per la tua organizzazione, configura e testa il tuo server di sicurezza AI, scegli la gestione degli errori e applica i verdetti.
Gli schemi di richiesta e verdetto, la verifica della firma, la semantica operativa e i pattern di integrazione per costruire il server di sicurezza AI.
Was this page helpful?