Amazon DEA-C01: Datenabfrage und -analyse — Lernleitfaden

Teil des Amazon Data Engineer Associate DEA-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Dieser Bereich behandelt das Design, die Optimierung und den Betrieb von AWS-Services, die analytische Abfragen und BI auf großen Datensätzen unterstützen. Der Fokus liegt auf kosteneffizienten, hochleistungsfähigen Abfragemustern für Athena, Redshift, OpenSearch und QuickSight und wie diese mit S3, Glue und transaktionalen Speichern zusammenarbeiten. Die Beherrschung erfordert das Abwägen von Speicherformat, Partitionierung, Computetyp und Datenplatzierung, um gescannte Bytes und Netzwerk-Skew zu minimieren und gleichzeitig Einblicke mit geringer Latenz zu liefern.

Amazon Athena-Abfrageoptimierung

Die Preisgestaltung von Athena basiert auf gescannten Bytes, daher sind das physische Datenlayout und die Metadaten die wichtigsten Hebel. Verwenden Sie spaltenbasierte Formate (Parquet oder ORC) mit Komprimierung (Snappy für Parquet, Zlib/ORC-Optionen), um Größe und CPU-Auslastung zu reduzieren. Partitionieren Sie Daten nach Spalten mit hoher Kardinalität, die in Abfragen gefiltert werden (Datum, Region), und registrieren Sie die Partitionen im Glue Data Catalog. Typische Muster:

undefined

, um die Partitionen zu füllen.

undefined

, um die spaltenbasierte Komprimierung zu erzwingen.

Wenn Abfragen Joins mit transaktionalen Speichern erfordern, verwenden Sie Athena Federated Query (Lambda-Konnektoren), um quellenübergreifende Joins mit RDS, DynamoDB oder Redshift durchzuführen. Konnektoren werden als Lambda-Funktionen bereitgestellt und als Datenquellen in Athena registriert; Beispiel-Konsolenablauf: Athena > Datenquellen > Konnektoren > Neu. Entscheidungskriterien:

Amazon Redshift-Abfragetuning und -verteilung

Die Leistung von Redshift hängt vom Verteilungsstil (Distribution Style) und den Sortierschlüsseln (Sort Keys) ab, um Datenbewegungen zu minimieren und Zone Mapping zu ermöglichen. Wählen Sie DIST-Stile anhand dieser Entscheidungspunkte:

Definieren Sie SORTKEYs für Spalten, die in Bereichsfiltern oder ORDER BY verwendet werden, um Zone Maps zu aktivieren und Festplattenlesevorgänge zu reduzieren. Gängige operative Befehle:

undefined

;

undefined

und

undefined

regelmäßig:

undefined

; überwachen Sie

undefined

und

undefined

auf Skew- und Verteilungsmetriken. Mit Redshift Spectrum können Sie externe S3-Tabellen über den Glue Data Catalog abfragen. Erstellen Sie das externe Schema mit:

undefined

; Entscheidungskriterien für Spectrum im Vergleich zu nativem Redshift:

Amazon OpenSearch Service für die Log-Analyse

OpenSearch ist für die Aufnahme und schnelle Ad-hoc-Log-Analyse optimiert; seine Index- und Cluster-Konfiguration bestimmt den Durchsatz und die Kosten. Indexdesign und Lebenszyklus:

undefined

und eine Indexvorlage, um

undefined

(kleine Indizes: 1 Shard; große: mehrere Shards mit einer Größe von ~10–50 GB) und

undefined

für die Verfügbarkeit festzulegen.

QuickSight für BI und Visualisierung

QuickSight bietet schnelle Dashboards mit zwei Hauptmodi für die Datenaufnahme: SPICE (In-Memory) und Direktabfrage (Direct Query). SPICE bietet eine Leistung im Subsekundenbereich für Dashboards und eignet sich für wiederholte Lesevorgänge; direkte SQL-Abfragen (an Athena, Redshift, RDS) sind für sehr große Datensätze oder sich häufig ändernde Daten vorzuziehen. Wichtige Konfigurationen und Best Practices:

Häufige Fallstricke und Entscheidungskriterien

Praktisches Problem: Anwendungsszenario

Acme Retail benötigt tägliche BI-Berichte, die Transaktionsbestellungen aus Amazon RDS, Clickstream-Ereignisse aus S3 und Benutzerprofile aus DynamoDB kombinieren, unter Einhaltung von Kostengrenzen und mit Dashboard-Aktualisierungen im Sub-Minuten-Bereich für aktuelle Daten.

  1. Konvertieren Sie die Clickstream-Daten in S3 in partitioniertes Parquet (datumsbasiert), komprimieren Sie sie mit Snappy und registrieren Sie die Metadaten über einen Crawler in AWS Glue.
  2. Verwenden Sie Athena für Ad-hoc-Abfragen auf S3 und stellen Sie Federated-Query-Konnektoren für RDS und DynamoDB bereit, um Joins mit kleinen Dimensionen durchzuführen; materialisieren Sie häufige Join-Ergebnisse als Parquet, wenn Abfragen wiederholt werden.
  3. Stellen Sie Redshift für aufwendige analytische Joins bereit: Laden Sie aggregierte Snapshots in Redshift, setzen Sie den DISTKEY auf die customer_id mit hoher Kardinalität und definieren Sie den SORTKEY auf order_date; verwenden Sie Spectrum für kalte historische S3-Daten.
  4. Nehmen Sie Anwendungs-Logs mit täglichen Indexmustern in OpenSearch auf; wenden Sie ILM an, um aktuelle Indizes auf Hot Nodes zu halten und ältere Indizes zur Kostenersparnis auf UltraWarm zu verschieben.
  5. Erstellen Sie QuickSight-Dashboards: Importieren Sie aktuelle Aggregate mit geplanten inkrementellen Aktualisierungen in SPICE für eine wahrgenommene Reaktionsfähigkeit im Sub-Minuten-Bereich und verwenden Sie direkte Abfragen (Direct Queries) für stets aktuelle Metriken.

Begründung: Dieser Ansatz minimiert die Scankosten von Athena durch Partitionierung und spaltenbasierte Formate, reduziert den Network Shuffle in Redshift durch korrekte Verteilungs- und Sortierschlüssel, nutzt Spectrum, um die Speicherung kalter Daten in Redshift zu vermeiden, wendet OpenSearch ILM an, um die Speicherkosten zu optimieren, und setzt SPICE für reaktionsschnelle Dashboards ein, während die kritische Aktualität durch direkte Abfragen (Direct Queries) erhalten bleibt.


Datenorchestrierung und Workflow-Management · Alle Domänen · Datensicherheit

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Amazon durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei