Amazon DEA-C01: Catalogación de datos y gestión de metadatos — Guía de estudio

Forma parte de la Amazon Data Engineer Associate DEA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Este dominio cubre la capa de metadatos que hace que los datos sean detectables, consultables y gobernables a través de una plataforma de datos de AWS. Una catalogación y gestión de metadatos eficaces reducen la fricción para el análisis y garantizan que los consumidores posteriores puedan encontrar esquemas, particiones, políticas de acceso y linaje de datos. Los servicios de AWS en esta área —Glue Data Catalog, Glue Schema Registry, Lake Formation, la integración con Athena y DataBrew— proporcionan herramientas complementarias para el descubrimiento, la evolución de esquemas, la gobernanza y la creación de perfiles. Comprender cómo interactúan estos servicios, sus detalles de configuración y los modos de fallo típicos es esencial para la fiabilidad operativa y la seguridad.

Estructura y operaciones de AWS Glue Data Catalog

El Glue Data Catalog es el repositorio de metadatos centralizado y regional para bases de datos, tablas, particiones, conexiones y clasificadores definidos por el usuario. Las primitivas principales son:

Patrones operativos:

Criterios de decisión:

Descubrimiento y evolución de esquemas

El Schema Registry y los esquemas de Glue soportan Avro, JSON y Protobuf para streaming y para contratos de productor/consumidor de larga duración. Capacidades clave:

Patrones prácticos de configuración y evolución:

Criterios de decisión:

Linaje de datos y gobernanza con Lake Formation

Lake Formation se basa en el Glue Data Catalog para proporcionar control de acceso de grano fino, auditoría y controles de linaje de datos. Características principales:

Patrones de configuración:

Criterios de decisión:

Integración de Athena y el catálogo de Glue

Athena depende del Glue Data Catalog para los metadatos. Puntos de integración comunes y ajustes operativos:

Complemento con Glue DataBrew:

Criterios de decisión:

Errores Comunes y Criterios de Decisión

Problema Práctico: Escenario de Caso de Uso

Acme Retail recibe archivos de ventas por hora en S3 con particiones de fecha/hora y los analistas consultan los datos en Athena; después de la carga, los usuarios experimentan fallos en las consultas y resultados obsoletos porque las particiones no son visibles en el Glue Data Catalog.

  1. Implementar una notificación de evento S3 PUT que invoque una función Lambda que llame a aws glue batch-create-partition para registrar la nueva partición inmediatamente.
  2. Para datos más antiguos o backfills, programar una consulta de Athena que ejecute MSCK REPAIR TABLE db.sales_hourly; o ejecutar un aws glue batch-create-partition específico para rangos conocidos.
  3. Si las particiones siguen una convención de nomenclatura estricta de fecha/hora, habilitar la proyección de particiones en la tabla de Glue (establecer projection.enabled=true y definir las propiedades de año/mes/día/hora) para eliminar los costos de actualización del catálogo.
  4. Añadir LF-Tags de sensibilidad a la tabla y conceder permisos de Lake Formation a los analistas para que las consultas de Athena estén permitidas y gobernadas.
  5. Usar Glue DataBrew para perfilar los nuevos archivos horarios en un entorno de staging para detectar derivas de esquema (schema drift); si se encuentran cambios en el esquema, registrar nuevas versiones del esquema en Glue Schema Registry y validar la compatibilidad antes del despliegue a producción.

Justificación: el registro automático de particiones o la proyección elimina el desfase de metadatos que rompe las consultas de Athena; combinar esto con la gobernanza de Lake Formation asegura un acceso seguro, y el perfilado impulsado por DataBrew detecta la deriva del esquema tempranamente, mientras que Glue Schema Registry protege a los consumidores de streaming y batch de cambios de esquema incompatibles.


Almacenamiento de datos y arquitectura de Data Lake · Todos los dominios · Transformación y procesamiento de datos

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo