Amazon MLS-C01: Ingeniería de Datos e Ingeniería de Características — Guía de estudio

Forma parte de la AWS Machine Learning Specialty MLS-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Ingesta de datos, almacenamiento y formatos de archivo

El diseño de un data lake preparado para ML comienza con la elección del patrón de ingesta y el formato de persistencia adecuados. Para la telemetría en tiempo real, utilice Kinesis Data Streams (procesamiento de baja latencia) o Kinesis Data Firehose (entrega gestionada). Firehose puede entregar datos directamente en Amazon S3 y realizar la conversión del formato de los registros del lado del servidor a Parquet/ORC cuando se combina con AWS Glue Schema Registry y una transformación de Lambda; elija Data Streams + Kinesis Data Analytics o Lambda si necesita un enriquecimiento personalizado o respuestas en menos de un segundo. Para la migración masiva, utilice AWS DataSync, Database Migration Service (DMS) para fuentes RDS/OLTP, o Snowball para transferencias sin conexión a escala de terabytes. En S3, almacene en formato columnar Parquet para cargas de trabajo analíticas (predicate pushdown, compresión como Snappy, claves de partición ajustadas a los patrones de consulta) y TFRecord para alimentar pipelines de TensorFlow que requieran lecturas secuenciales de alto rendimiento. Tenga cuidado con la explosión de archivos pequeños: utilice búferes de escritura (buffering de Firehose, procesamiento por lotes de Glue) para producir objetos de S3 con un tamaño adecuado para los frameworks de big data (decenas a cientos de MB). La evolución del esquema es común: utilice Glue Catalog y Schema Registry para versionar los esquemas; use particiones y convenciones de nomenclatura para evitar costosos escaneos de tablas completas (full-table scans). Un error común es usar el modo Archivo (File mode) en el procesamiento posterior, que copia conjuntos de datos completos a los nodos de cómputo; prefiera el streaming (modo Tubería o Pipe mode de SageMaker), Redshift Spectrum o Athena en lugar de la copia masiva cuando los conjuntos de datos contienen millones de registros.

ETL sin servidor y en clúster: Glue, EMR, Redshift y SageMaker

La elección de la herramienta de ETL depende de la escala, la personalización, el perfil de costos y las necesidades de librerías. AWS Glue proporciona ETL de Spark sin servidor (serverless) con catalogación, rastreadores (crawlers) y orquestación de trabajos integrada, lo que es excelente para transformaciones frecuentes e impulsadas por eventos donde se desea un escalado gestionado. EMR es preferible cuando se necesitan ecosistemas Spark/Hadoop personalizados, clústeres de larga duración o librerías especializadas (GraphX, compilaciones personalizadas de MLlib) y se puede usar S3 como el data lake subyacente. Para análisis sin ingesta de datos, utilice Redshift Spectrum o Athena para consultar Parquet/ORC directamente en S3; Redshift es mejor para joins complejos y cargas de trabajo de BI. Para la preparación de datos para modelos, los trabajos de SageMaker Processing proporcionan contenedores gestionados para ejecutar preprocesamiento escalable con Spark o Python, asegurando que el código de preprocesamiento se ejecute cerca del entrenamiento y pueda ser versionado junto con el trabajo de entrenamiento. Al lanzar un entrenamiento de SageMaker con algoritmos integrados, proporcione como mínimo la imagen de entrenamiento, el rol de IAM, el instance_type/count y el URI de S3 para los datos de entrenamiento; considere el modo Tubería (Pipe mode) para transmitir registros en streaming y evitar la copia a EBS para conjuntos de datos de millones de registros. Errores comunes: elegir Glue para transformaciones de latencia extremadamente baja (use Lambda/Kinesis en su lugar) o copiar datos de S3 a HDFS/EBS innecesariamente cuando Redshift Spectrum/Athena sería suficiente.

Ingeniería de características, pipelines de transformación y selección

La ingeniería de características (feature engineering) debe ser reproducible y estar aislada de la fuga de datos (leakage). Implemente el preprocesamiento como pipelines de nivel de producción (pipelines de scikit-learn, pipelines de Spark ML o SageMaker Processing + Feature Store) para que se apliquen transformaciones idénticas tanto en el entrenamiento como en la inferencia. Gestione los valores ausentes seleccionando una estrategia: imputación simple (media/mediana/moda) para huecos pequeños; métodos basados en modelos (KNN, MICE iterativo) cuando otras características pueden predecir los valores ausentes. Escale las características numéricas con StandardScaler o MinMax para modelos basados en gradiente; aplique un escalado robusto si predominan los valores atípicos (outliers). Para variables categóricas, elija one-hot encoding para baja cardinalidad, y target encoding o embeddings aprendidos para categorías de alta cardinalidad (use Embeddings en modelos profundos o feature hashing para controlar la dimensionalidad). Para texto, realice una normalización consistente (minúsculas, puntuación, tokenización); use Word2Vec/BlazingText para embeddings o pipelines TF-IDF/dispersos para modelos lineales; BlazingText en SageMaker soporta skip-gram/CBoW y es eficiente a escala. Para la selección de características, utilice regularización L1, importancia basada en árboles (XGBoost/RandomForest), información mutua o eliminación recursiva de características, y realice siempre la selección de características dentro de los pliegues de la validación cruzada (cross-validation) para evitar el sesgo de selección. El error práctico más grande es la fuga de datos (leakage): nunca derive características utilizando información futura del objetivo ni aplique el preprocesamiento utilizando el conjunto de datos completo antes de dividirlo.

Seguridad, control de acceso, gobernanza y monitoreo operativo

La ingeniería de datos segura y auditable es obligatoria. Cifre los datos en reposo usando SSE-KMS para volúmenes de S3 y EBS y utilice el cifrado del lado del cliente para un control adicional; gestione las claves con CMKs de AWS KMS y use políticas de claves y concesiones para el privilegio mínimo. Restrinja los conjuntos de datos de S3 a una VPC usando un S3 VPC endpoint y políticas de bucket precisas o S3 Access Points con alcance al principal de la VPC; combine esto con roles de IAM adjuntos a SageMaker, Glue, EMR o Lambda para aplicar el privilegio mínimo. Para PII sensible, use tokenización o cifrado a nivel de campo y asegúrese de que KMS rote las claves según la política. Operativamente, habilite CloudTrail para el registro de actividad de la API de SageMaker y Glue, y CloudWatch para las métricas de los trabajos; use SageMaker Model Monitor para la detección de deriva (drift) y configure alertas para reentrenar o verificar el sesgo de los modelos. La gobernanza de datos requiere el Glue Data Catalog o un almacén de metadatos empresarial, linaje de datos y etiquetado para políticas de ciclo de vida; implemente reglas de ciclo de vida de S3 (transición a Glacier) para los datos fríos. Los conceptos erróneos comunes incluyen asumir que los grupos de seguridad por sí solos son suficientes (también se necesita IAM, políticas de bucket y VPC endpoints), u olvidar habilitar el cifrado en los volúmenes de las instancias de entrenamiento; siempre incluya el cifrado de EBS en las definiciones de los trabajos de entrenamiento y valide el acceso con roles de privilegio mínimo.

Problema práctico: Escenario de caso de uso

Escenario: MetroRetail opera un entorno de ML en AWS donde el clickstream de los clientes se ingiere en Kinesis Data Streams, se almacena en S3 y los modelos se entrenan en SageMaker. El data lake utiliza Glue Catalog y Athena para los analistas.

Desafío: Convertir eventos de clic en formato CSV de streaming a Parquet en S3 con evolución del esquema, producir vectores de características confiables para un modelo de recomendación y asegurar que el pipeline escale sin copiar conjuntos de datos de varios gigabytes a las instancias de entrenamiento.

Enfoque recomendado:

  1. Use Kinesis Data Streams para la ingesta, adjunte un consumidor Lambda para realizar una validación ligera y reenviar los registros a un delivery stream de Kinesis Data Firehose configurado con Glue Schema Registry para convertir JSON/CSV a Parquet y escribir archivos Parquet particionados en S3 (con sugerencias de buffer ajustadas a ~64–128 MB).
  2. Catalogue los datos Parquet en AWS Glue; use trabajos de Glue ETL (Spark sin servidor) o SageMaker Processing (contenedor de Spark) para construir pipelines de características reproducibles, aplicando imputación (mediana para datos numéricos sesgados), StandardScaler e incrustaciones categóricas (embeddings) para el item_id de alta cardinalidad.
  3. Almacene los vectores de características en línea en SageMaker Feature Store (online store para búsquedas de baja latencia) y las características sin conexión en S3 (offline store del almacén de características a través de Parquet). Entrene en SageMaker usando el modo Pipe apuntando a los manifiestos Parquet de S3 para transmitir los datos en streaming y evitar copias completas.
  4. Asegure S3 con SSE-KMS, restrinja el acceso usando un S3 VPC endpoint y políticas de bucket estrictas para la VPC, y habilite CloudTrail + SageMaker Model Monitor para el registro de actividad y las alertas de deriva.

Justificación: Este enfoque aprovecha la conversión gestionada de streaming a Parquet y el ETL sin servidor para escalar, utiliza Feature Store para la consistencia entre el entrenamiento y la inferencia, evita el costoso movimiento de datos con el modo Pipe y aplica el cifrado y el acceso de privilegio mínimo para la preparación para producción.


Todos los dominios · Análisis Exploratorio de Datos y Visualización

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo