Amazon AIF-C01: Ingeniería de Datos para ML — Guía de estudio

Forma parte de la AWS AI Practitioner AIF-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Recopilación, etiquetado, versionado y gobernanza de datos

La recopilación de conjuntos de datos representativos y auditables es el paso fundamental para todo el ML. Utilice Amazon S3 como el almacén central duradero con S3 Versioning y el bloqueo de objetos habilitados para preservar las entradas sin procesar y capturar la procedencia. Para la ingesta y catalogación estructurada, registre los conjuntos de datos en el AWS Glue Data Catalog y aplique un control de acceso detallado con Lake Formation. Cuando se requiere etiquetado humano, Amazon SageMaker Ground Truth proporciona flujos de trabajo integrados, una interfaz de usuario para anotaciones y bucles de aprendizaje activo que reducen el costo del etiquetado mientras crean metadatos para la concordancia y la confianza del etiquetador. Las trampas comunes incluyen la recopilación de muestras sesgadas o no representativas, no registrar el linaje y las reglas de etiquetado, y verificaciones insuficientes de la calidad de las etiquetas; mitigue esto almacenando auditorías de etiquetado, re-etiquetando a ciegas subconjuntos y utilizando heurísticas de consolidación de etiquetas. Las decisiones de privacidad y cumplimiento impulsan la arquitectura: utilice el cifrado del lado del servidor de S3 con CMK administradas por KMS, restrinja el acceso con políticas de IAM y puntos de conexión de VPC (AWS PrivateLink), y realice el descubrimiento y la redacción de PII con Amazon Comprehend antes de compartir los datos para el entrenamiento del modelo. Para programas de larga duración, capture instantáneas (snapshots) del conjunto de datos, etiquételas con ID de conjunto de datos y realice un seguimiento de los experimentos con Amazon SageMaker Experiments o una herramienta externa como DVC para permitir el entrenamiento reproducible y la generación de informes regulatorios.

Preprocesamiento, ingeniería de características y EDA

Las transformaciones y las características determinan la capacidad del modelo para generalizar. Utilice AWS Glue o Amazon SageMaker Data Wrangler para perfilar, limpiar y normalizar datos, y realice análisis exploratorio de datos (EDA) iterativo con Amazon QuickSight o cuadernos de Jupyter alojados en Amazon SageMaker Studio. Para la gestión de características en producción, adopte Amazon SageMaker Feature Store para garantizar un cómputo de características consistente tanto offline como online y para evitar el desfase entre entrenamiento y servicio (train/serve skew); almacene las características sin procesar y las derivadas por separado y registre la lógica de creación de características. Las canalizaciones (pipelines) de series temporales y de streaming deben aprovechar Amazon Kinesis o el ETL de streaming de AWS Glue para la actualización de características de baja latencia. Las trampas típicas incluyen la fuga de datos (data leakage) —donde la información futura se filtra en el entrenamiento—, el manejo inadecuado de valores faltantes y el desajuste entre las características de entrenamiento offline y las características de servicio online. Los criterios de decisión al diseñar las canalizaciones dependen de la frescura frente al costo: elija ETL por lotes (batch) para recálculos históricos pesados, streaming para personalización casi en tiempo real y arquitecturas híbridas cuando se requieran características online de baja latencia. Automatice las comprobaciones de validación y la aplicación de esquemas en Glue o como parte de los trabajos de SageMaker Processing para detectar la deriva del esquema (schema drift) de forma temprana.

Embeddings, aumento de datos, datos sintéticos y conjuntos de datos para modelos fundacionales

Los embeddings convierten texto, imágenes o entradas multimodales en vectores densos que capturan relaciones semánticas; impulsan la búsqueda semántica, la generación aumentada por recuperación (RAG) y la agrupación (clustering). Construya un patrón de generación aumentada por recuperación (RAG) donde genere embeddings con Amazon Bedrock o codificadores alojados en SageMaker, almacene los vectores en Amazon OpenSearch Service (k-NN), Amazon Kendra o un almacén de vectores gestionado, y recupere contexto para condicionar el modelo fundacional. El aumento de datos y la generación de datos sintéticos son prácticos cuando los ejemplos reales son escasos: utilice modelos generativos en SageMaker para crear paráfrasis, transformaciones de imágenes (a través de Albumentations o SageMaker Processing) o registros sintéticos que preserven la privacidad. Tenga cuidado con la dependencia excesiva de los datos sintéticos: una baja fidelidad puede introducir un cambio de distribución (distribution shift) y sobreajustar los modelos a artefactos. Para los conjuntos de datos de entrenamiento de FM, seleccione ejemplares de alta calidad, estandarice los formatos con plantillas de prompts y versione cada instantánea del conjunto de datos en S3. Para datos privados utilizados con FM de terceros, prefiera una ruta de ajuste fino (fine-tuning) privada (llevando el cómputo a una VPC) o despliegue canalizaciones de solo recuperación que únicamente envíen contexto no sensible al FM, manteniendo los documentos fuente en un almacén de vectores seguro; aplique redacción y enmascaramiento a nivel de token para evitar fugas. La ingeniería de prompts y las plantillas de instrucciones (prompts de sistema) son fundamentales para dar forma a las respuestas del modelo; ajuste la temperatura, top_k o top_p según el determinismo y la creatividad requeridos.


Seguridad y Privacidad de la IA · Todos los dominios · Entrenamiento

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo