Amazon DEA-C01: Datacatalogisering en metadatabeheer — Studiegids

Onderdeel van de Amazon Data Engineer Associate DEA-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Dit domein behandelt de metadatalag die data vindbaar, bevraagbaar en beheerbaar maakt binnen een AWS-dataplatform. Effectieve catalogisering en metadatabeheer verminderen frictie voor analytics en zorgen ervoor dat downstream-consumenten schema’s, partities, toegangsbeleid en lineage kunnen vinden. AWS-services op dit gebied—Glue Data Catalog, Glue Schema Registry, Lake Formation, Athena-integratie en DataBrew—bieden complementaire tools voor discovery, schema-evolutie, governance en profilering. Begrijpen hoe deze services samenwerken, hun configuratiedetails en typische faalscenario’s is essentieel voor operationele betrouwbaarheid en beveiliging.

Structuur en operaties van de AWS Glue Data Catalog

De Glue Data Catalog is de regionale, gecentraliseerde metadata-repository voor databases, tabellen, partities, connecties en door de gebruiker gedefinieerde classifiers. De kernprimitieven zijn:

Operationele patronen:

Beslissingscriteria:

Schemadiscovery en -evolutie

Schema Registry en Glue-schema’s ondersteunen Avro, JSON en Protobuf voor streaming en langdurige producer/consumer-contracten. Belangrijkste mogelijkheden:

Praktische configuratie- en evolutiepatronen:

Beslissingscriteria:

Datalineage en governance met Lake Formation

Lake Formation bouwt voort op de Glue Data Catalog om fijnmazige toegangscontrole, auditing en lineage-controles te bieden. Kernfuncties:

Configuratiepatronen:

Beslissingscriteria:

Integratie van Athena en de Glue-catalogus

Athena is voor metadata afhankelijk van de Glue Data Catalog. Veelvoorkomende integratiepunten en operationele instellingen:

undefined

uit vanuit Athena of gebruik

undefined

met die SQL om partities te vernieuwen die onder de locatie van de tabel zijn gevonden.

undefined

om partities programmatisch toe te voegen bij S3 PUT-events (aanbevolen voor event-driven flows).

undefined

,

undefined

,

undefined

en

undefined

— dit vermijdt Glue-lookups volledig en is essentieel voor zeer grote aantallen partities.

undefined

is eenvoudig voor incidentele ad-hoc toevoegingen, maar kan traag zijn voor grote datasets.

Aanvulling met Glue DataBrew:

Beslissingscriteria:

undefined

alleen uit voor incidentele backfills of wanneer automatisering niet beschikbaar is.

Veelvoorkomende valkuilen en beslissingscriteria

undefined

uit voor incidentele updates, roep

undefined

aan bij S3-events, of implementeer ‘partition projection’ voor grote, voorspelbare partitiesets.

undefined

, S3 lees/schrijf-rechten en

undefined

heeft als datasets versleuteld zijn.

Praktijkprobleem: Gebruiksscenario

Acme Retail ontvangt elk uur verkoopbestanden in S3 met datum/uur-partities en analisten voeren query’s uit op de data in Athena; na het laden zien gebruikers mislukte query’s en verouderde resultaten omdat partities niet zichtbaar zijn in de Glue Data Catalog.

  1. Implementeer een S3 PUT-eventnotificatie die een Lambda-functie aanroept die

undefined

uitvoert om de nieuwe partitie onmiddellijk te registreren. 2. Plan voor oudere data of backfills een Athena-query die

undefined

uitvoert; of voer een gerichte

undefined

uit voor bekende reeksen. 3. Als partities een strikte naamgevingsconventie voor datum/uur volgen, activeer dan ‘partition projection’ op de Glue-tabel (stel

undefined

in en definieer jaar/maand/dag/uur-eigenschappen) om de kosten voor het vernieuwen van de catalogus te elimineren. 4. Voeg LF-Tags voor gevoeligheid toe aan de tabel en verleen analisten Lake Formation-permissies zodat Athena-query’s zijn toegestaan en beheerd worden. 5. Gebruik Glue DataBrew om nieuwe uurbestanden in een staging-omgeving te profileren om schema-afwijkingen (schema drift) te detecteren; als schemawijzigingen worden gevonden, registreer dan nieuwe schemaversies in de Glue Schema Registry en valideer de compatibiliteit vóór de uitrol naar productie.

Rationale: automatische partitieregistratie of -projectie elimineert de metadatavertraging die Athena-query’s breekt; het koppelen hiervan aan Lake Formation-governance zorgt voor veilige toegang en profilering via DataBrew detecteert schema-afwijkingen vroegtijdig, terwijl de Glue Schema Registry streaming- en batch-consumers beschermt tegen incompatibele schemawijzigingen.


Dataopslag en Lake-architectuur · Alle domeinen · Datatransformatie en -verwerking

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product