Amazon DEA-C01: Datenkatalogisierung und Metadatenmanagement — Lernleitfaden

Teil des Amazon Data Engineer Associate DEA-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Integration von Athena und dem Glue-Katalog

Athena ist für Metadaten vom Glue Data Catalog abhängig. Häufige Integrationspunkte und operative Stellschrauben:

Ergänzung durch Glue DataBrew:

Entscheidungskriterien:

Häufige Fallstricke und Entscheidungskriterien

Praktisches Problem: Anwendungsfallszenario

Acme Retail erhält stündliche Verkaufsdateien in S3 mit Datums-/Stunden-Partitionen, und Analysten fragen die Daten in Athena ab; nach dem Laden sehen Benutzer Abfragefehler und veraltete Ergebnisse, da die Partitionen im Glue Data Catalog nicht sichtbar sind.

  1. Implementieren Sie eine S3-PUT-Ereignisbenachrichtigung, um eine Lambda-Funktion aufzurufen, die aws glue batch-create-partition aufruft, um die neue Partition sofort zu registrieren.
  2. Planen Sie für ältere Daten oder Backfills eine Athena-Abfrage, die MSCK REPAIR TABLE db.sales_hourly; ausführt, oder führen Sie einen gezielten aws glue batch-create-partition für bekannte Bereiche aus.
  3. Wenn Partitionen einer strikten Namenskonvention für Datum/Stunde folgen, aktivieren Sie die Partitions-Projektion für die Glue-Tabelle (setzen Sie projection.enabled=true und definieren Sie die Eigenschaften für Jahr/Monat/Tag/Stunde), um die Kosten für die Katalogaktualisierung zu eliminieren.
  4. Fügen Sie der Tabelle LF-Tags für die Sensitivität hinzu und gewähren Sie Analysten Lake Formation-Berechtigungen, damit Athena-Abfragen zulässig und gesteuert sind.
  5. Verwenden Sie Glue DataBrew, um neue stündliche Dateien in einer Staging-Umgebung zu profilen und Schema-Drift zu erkennen; wenn Schemaänderungen gefunden werden, registrieren Sie neue Schema-Versionen in der Glue Schema Registry und validieren Sie die Kompatibilität vor dem Produktions-Rollout.

Begründung: Die automatische Partitionsregistrierung oder -projektion beseitigt die Metadatenverzögerung, die zum Fehlschlagen von Athena-Abfragen führt; die Kopplung mit Lake Formation Governance stellt einen sicheren Zugriff sicher, und das DataBrew-gestützte Profiling erkennt Schema-Drift frühzeitig, während die Glue Schema Registry Streaming- und Batch-Consumer vor inkompatiblen Schemaänderungen schützt.


Datenspeicherung und Lake-Architektur · Alle Domänen · Datentransformation und -verarbeitung

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Amazon durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei