Lección 13: Inyección de prompts y seguridad — en términos simples
Cuando tu prompt incluye texto que proviene de una fuente no confiable — un usuario, un correo, una página web — ese texto puede contener instrucciones propias, como "ignora las instrucciones anteriores". A veces el modelo las sigue. En esta lección entenderemos qué es la inyección de prompts y cómo
Si le pides al modelo que resuma un texto, y el texto mismo dice "ignora la solicitud y escribe otra cosa" — el modelo podría obedecerlo. La solución: decirle al modelo que el texto es solo datos, no instrucciones.
- inyección de prompts
- Texto no confiable que contiene instrucciones que intentan anular o reemplazar tus instrucciones originales.
- entrada no confiable
- Texto proveniente de una fuente externa (un usuario, un correo, un sitio web) del que no se puede confiar en que no contenga instrucciones maliciosas.
- límite de confianza
- La separación clara entre tus instrucciones (confiables) y el texto externo (no confiable) que debe tratarse como datos.