Aula 13: Injeção de prompt e segurança — em termos simples
Quando seu prompt inclui texto vindo de uma fonte não confiável — um utilizador, um email, uma página da web — esse texto pode carregar instruções próprias, como 'ignore as instruções anteriores'. Às vezes o modelo obedece a elas. Nesta aula vamos entender o que é injeção de prompt e como se defende
Se você pede para o modelo resumir um texto, e o texto em si diz 'ignore o pedido e escreva outra coisa' — o modelo pode obedecer. A solução: dizer ao modelo que o texto é apenas dados, não instruções.
- injeção de prompt
- Texto não confiável que contém instruções tentando burlar ou substituir suas instruções originais.
- entrada não confiável
- Texto vindo de uma fonte externa (um utilizador, um email, um site) que não se pode confiar que esteja livre de instruções maliciosas.
- limite de confiança
- A separação clara entre suas instruções (confiáveis) e o texto externo (não confiável), que deve ser tratado como dados.