Reduce el riesgo de filtraciones de prompts separando el contexto de las consultas del usuario, filtrando las salidas de Claude y auditando los prompts, sin degradar el rendimiento de la tarea.
Las filtraciones de prompts pueden exponer información sensible que esperas que permanezca "oculta" en tu prompt. Aunque ningún método es infalible, las estrategias a continuación pueden reducir significativamente el riesgo.
Antes de intentar reducir la filtración de prompts
Considera usar estrategias de ingeniería de prompts resistentes a filtraciones solo cuando sea absolutamente necesario. Los intentos de hacer tu prompt a prueba de filtraciones pueden añadir complejidad que podría degradar el rendimiento en otras partes de la tarea, debido al aumento de la complejidad de la tarea general del LLM.
Si decides implementar técnicas resistentes a filtraciones, asegúrate de probar tus prompts exhaustivamente para garantizar que la complejidad añadida no afecte negativamente el rendimiento del modelo ni la calidad de sus salidas.
Estrategias para reducir la filtración de prompts
Separa el contexto de las consultas:
Puedes intentar usar indicaciones del sistema para aislar la información clave y el contexto de las consultas del usuario. Puedes enfatizar las instrucciones clave en el turno User, y luego volver a enfatizar esas instrucciones prellenando el turno Assistant. (Nota: el prellenado no es compatible con Claude 4.6 ni con modelos posteriores, ni con Claude Mythos Preview).
Usa posprocesamiento: Filtra las salidas de Claude en busca de palabras clave que puedan indicar una filtración. Las técnicas incluyen el uso de expresiones regulares, filtrado de palabras clave u otros métodos de procesamiento de texto.
Evita detalles propietarios innecesarios: Si Claude no los necesita para realizar la tarea, no los incluyas. El contenido adicional distrae a Claude de concentrarse en las instrucciones de "no filtrar".
Auditorías regulares: Revisa periódicamente tus prompts y las salidas de Claude en busca de posibles filtraciones.
Recuerda, el objetivo no es solo prevenir filtraciones, sino mantener el rendimiento de Claude. Una prevención de filtraciones demasiado compleja puede degradar los resultados. El equilibrio es clave.