Las aplicaciones de IA generativa traen nuevas superficies de ataque. Un modelo de lenguaje grande (LLM) sigue instrucciones escritas en lenguaje natural, así que un atacante puede intentar cambiar su comportamiento con palabras en lugar de código. Hay dos términos clave. Una inyección de prompt directa, a menudo llamada jailbreak, es un prompt del usuario diseñado para que el modelo ignore sus instrucciones del sistema o sus reglas de seguridad, por ejemplo pidiéndole que interprete a un personaje sin restricciones. Una inyección de prompt indirecta oculta instrucciones dentro de contenido que el modelo procesa, como una página web, un correo o un documento recuperado para fundamentar la respuesta (grounding), de modo que el modelo siga el texto oculto del atacante al resumirlo. Otros riesgos incluyen la filtración de datos confidenciales, el abuso de cartera (wallet abuse, disparar los costos de tokens) y el uso indebido de las herramientas conectadas.
Sigue leyendo gratis
Crea una cuenta gratis de StudyToCert para leer el resto de esta lección: 4 secciones más, 4 términos clave, un ejemplo real, un consejo para el examen y preguntas de repaso. Todas las lecciones, laboratorios y exámenes de práctica son gratis con una cuenta.