Amazon DEA-C01: Datenerfassung und -sammlung — Lernleitfaden

Teil des Amazon Data Engineer Associate DEA-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Dieser Bereich behandelt die Muster, AWS-Services und operativen Details, die verwendet werden, um Rohdaten zuverlässig und skaliert in eine Datenplattform zu bringen. Data Engineers müssen zwischen Batch- und Streaming-Einstiegspunkten wählen, die Datenkatalogisierung und Auffindbarkeit sicherstellen und für Durchsatz, Wiederholbarkeit und Fehlermodi planen. Wichtige AWS-Bausteine sind S3 und Glue für Batch, Kinesis und Firehose für Streaming, DMS für Datenbankmigration und CDC sowie API-/ereignisgesteuerte Komponenten (API Gateway, Lambda, SNS, SQS, S3-Events) für Ad-hoc- und Push-basierte Ingestion.

Batch-Ingestion mit AWS Glue und S3

Glue ist die primäre verwaltete ETL- und Metadatenlösung für die Batch-Ingestion in S3 und Ihren Datenkatalog. Typisches Muster: Rohdateien in S3 ablegen (getrennte Präfixe für Raw/Zone), einen Glue-Crawler ausführen, um das Schema abzuleiten und den Glue Data Catalog zu befüllen, und dann Glue-ETL-Jobs (Spark) ausführen, um die Daten zu transformieren, zu partitionieren, in spaltenbasierte Formate (Parquet/ORC) zu konvertieren und optimierte Daten zurück nach S3 zu schreiben. Konfigurieren Sie Crawler mit geeigneten Klassifikatoren (integriert für CSV/JSON/Parquet oder benutzerdefiniert mit Grok/Regex) und weisen Sie dem Crawler eine IAM-Rolle mit den Berechtigungen s3:GetObject/s3:ListBucket und glue:catalog zu – das Fehlen dieser Berechtigungen ist ein häufiger Betriebsfehler.

Verwenden Sie bei der Konfiguration von Glue-Jobs und Crawlern diese Konsolen-/CLI-Muster und Schalter:

undefined

und starten mit

undefined

.

undefined

; aktivieren Sie Job-Lesezeichen (Job Bookmarks), um eine erneute Verarbeitung zu vermeiden. Entscheidungskriterien für Glue im Vergleich zu Alternativen:

Streaming-Ingestion mit Kinesis Data Streams und Firehose

Kinesis Data Streams (KDS) dient der Echtzeit-Ingestion mit Wiederholbarkeit, Consumer-Steuerung und feingranularer Skalierung. Ein Kinesis-Shard bietet 1 MB/s oder 1.000 Datensätze/s Schreibkapazität und 2 MB/s Lesekapazität; verwenden Sie

undefined

und fügen Sie Daten mit

undefined

hinzu. Partition Keys bestimmen die Zuweisung zu den Shards; eine niedrige Kardinalität der Partition Keys verursacht „Hot Shards“ – vermeiden Sie dies, indem Sie die Entropie des Schlüssels erhöhen oder einen Hash als Suffix anhängen. Skalieren Sie Shards mit

undefined

oder aktivieren Sie den On-Demand-Modus für automatische Skalierung.

Firehose ist ein Delivery-Stream-Dienst, der für die Bereitstellung in Nahezu-Echtzeit (S3, Redshift, OpenSearch, Splunk) optimiert ist, mit integrierter Pufferung, Komprimierung und optionaler Lambda-Transformation. Konfigurieren Sie die Pufferung mit BufferingHints: buffer_size (MB) und buffer_interval (Sekunden), um die Lieferlatenz im Verhältnis zu den Kosten abzustimmen; aktivieren Sie die Komprimierung (GZIP, Snappy) und legen Sie eine verarbeitende Lambda-Funktion für Transformationen auf Datensatzebene fest. Wesentliche Unterschiede:

Wählen Sie KDS, wenn Sie Wiederholbarkeit, starke Consumer-Kontrolle oder mehrere nachgelagerte Consumer benötigen; wählen Sie Firehose, wenn Sie eine einfache Lieferung und Transformation nach S3/Redshift/OpenSearch mit minimalem Betriebsaufwand benötigen.

Datenbankmigration und CDC mit DMS

AWS DMS wird für homogene/heterogene Migrationen und kontinuierliche Replikation (CDC) verwendet. Stellen Sie eine Replikationsinstanz bereit (

undefined

), die für den erforderlichen Durchsatz dimensioniert ist, wobei die Dimensionierung von der Änderungsrate, dem Volumen des Full-Loads und der Aufgabenparallelität abhängt. DMS-Aufgabentypen:

Entscheidungskriterien zwischen Full-Load und CDC: verwenden Sie full-load+CDC, wenn Sie eine Migration mit minimaler Ausfallzeit benötigen; verwenden Sie nur CDC für die laufende Replikation, nachdem eine initiale Ladung durch einen anderen Mechanismus abgeschlossen wurde. Validieren Sie immer das Schema-Mapping und führen Sie Testmigrationen mit repräsentativen Datenmengen durch.

API-basierte und ereignisgesteuerte Ingestionsmuster

APIs und Events sind für Push-basierte Ingestion und Orchestrierung. Gängige Muster:

undefined

an Lambda, SQS oder SNS zu senden; verwenden Sie Präfix-/Suffix-Filter, um Auslöser einzuschränken. Für Fan-Out leiten Sie S3 -> SNS-Topic -> mehrere SQS-Queues/Lambda-Subscriber weiter, um dasselbe Ereignis an mehrere Konsumenten ohne Kopplung zu liefern.

Betriebliche Aspekte und CLI-Muster:

Häufige Fallstricke und Entscheidungskriterien

Praktisches Problem: Anwendungsfall-Szenario

RetailCo sammelt mobile Clickstreams (hohes Volumen, Echtzeit) und nächtliche Produktkatalogdateien; sie benötigen Echtzeit-Dashboards und einen konsolidierten Analytics Lake.

  1. Ingestieren Sie Clickstreams in Kinesis Data Streams mit Partitionsschlüsseln, die aus der Benutzersitzung + einem gehashten Shard-Suffix abgeleitet sind; erstellen Sie Konsumenten mit Kinesis Data Analytics oder Lambda/Kinesis Client Library für die Echtzeitverarbeitung.
  2. Verwenden Sie Kinesis Data Firehose mit einer Transformations-Lambda, um angereicherte Streaming-Ausgaben in S3 (Parquet) zu persistieren, mit Snappy zu komprimieren und optional zur Analyse in Redshift Spectrum zu laden.
  3. Legen Sie die nächtlichen Katalogdateien in S3 raw/ ab und führen Sie einen geplanten Glue-Crawler aus, um den Glue Data Catalog zu aktualisieren. Führen Sie anschließend Glue-ETL-Jobs aus, um sie in partitioniertes Parquet in der Curated Zone zu konvertieren.
  4. Verwenden Sie S3-Event-Benachrichtigungen -> SNS -> Lambda, um schlanke Metadaten-Updates auszulösen oder Caches zu invalidieren; leiten Sie die Zustellung an SQS für eine dauerhafte nachgelagerte Verarbeitung weiter.
  5. Überwachen Sie Kinesis-Shard-Metriken (IncomingBytes, IncomingRecords, PutRecords.Success) und verwenden Sie UpdateShardCount oder On-Demand-Streams, um Wachstum zu bewältigen; aktivieren Sie CloudWatch-Alarme.

Begründung der AWS Best Practice: Trennen Sie Echtzeit- und Batch-Pfade, verwenden Sie Kinesis Data Streams, wenn Replay und Konsumenten-Isolation erforderlich sind, nutzen Sie Firehose für die verwaltete Zustellung an S3/Ziele und pflegen Sie einen Glue Data Catalog für Discovery und Abfrageintegration mit Athena/Redshift.


Alle Domänen · Datenspeicherung und Lake-Architektur

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Amazon durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei