Durante las pruebas de seguridad de un modelo fundacional, los evaluadores omiten intencionadamente las protecciones de seguridad del modelo para producir contenido dañino. ¿Cómo se denomina este tipo de técnica?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Jailbreak.
Por qué esta es la respuesta
La técnica descrita, donde los evaluadores eluden intencionadamente las protecciones de seguridad de un modelo fundacional para generar contenido dañino, se conoce como "jailbreak". Este término se refiere a los métodos utilizados para hacer que un modelo de IA ignore sus restricciones de seguridad y genere respuestas que normalmente evitaría, como contenido inapropiado, sesgado o peligroso. "Fuzzing de datos de entrenamiento" implica introducir datos malformados o inesperados durante el entrenamiento para encontrar vulnerabilidades, no durante las pruebas de seguridad para eludir protecciones. La "Denegación de servicio (DoS)" es un ataque que busca hacer que un servicio no esté disponible, no eludir las protecciones de contenido de un modelo. Las "Pruebas de penetración autorizadas" son un concepto general de seguridad que incluye muchas técnicas, pero "jailbreak" es la técnica específica para eludir las salvaguardas de un modelo de IA.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta