Amazon DEA-C01: Datenspeicherung und Lake-Architektur — Lernleitfaden

Teil des Amazon Data Engineer Associate DEA-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Dieser Bereich behandelt, wie AWS-Speicherdienste und Datenbank-Engines die Aufnahme großer Datenmengen, langlebige Archivierung, Abfrageleistung und sichere Governance in modernen Datenplattformen unterstützen. Data Engineers müssen Kosten, Zugriffslatenz, Langlebigkeit und granulare Zugriffskontrolle abwägen, während sie Dienste wie S3, Lake Formation, Redshift und DynamoDB in Pipelines integrieren. Das Verständnis der Kompromisse bei Speicherklassen, der Automatisierung von Lebenszyklen, von verwaltetem gegenüber lokalem Speicher und von Partitionierungsmustern verhindert Leistungs- und Kostenüberraschungen in der Produktion.

Amazon S3-Speicherklassen und Lebenszyklusrichtlinien

S3 bietet mehrere Speicherklassen und Lebenszykluskontrollen zur Optimierung von Kosten und Zugriffsmustern. Konfigurieren Sie die Speicherklasse beim Hochladen (Konsole oder CLI: aws s3 cp file s3://bucket/key –storage-class INTELLIGENT_TIERING) oder verwenden Sie Bucket-Lebenszyklusregeln (aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json). Intelligent-Tiering verschiebt Objekte automatisch zwischen Ebenen für häufigen und seltenen Zugriff und hat eine geringe Überwachungsgebühr; aktivieren Sie es für unbekannte oder sich ändernde Zugriffsmuster. Verwenden Sie Lebenszyklusregeln, um Objekte zur langfristigen Aufbewahrung nach GLACIER oder DEEP_ARCHIVE zu überführen und um alte Versionen ablaufen zu lassen/zu löschen.

Entscheidungskriterien und Kompromisse:

Betriebliche Hinweise:

Data-Lake-Design mit S3 und Lake Formation

Entwerfen Sie einen Data Lake mit S3 als zentralem Objektspeicher und Lake Formation für die zentralisierte Zugriffskontrolle und Katalogisierung. Registrieren Sie S3-Speicherorte als Lake Formation-Ressourcen, richten Sie einen AWS Glue Data Catalog ein und verwenden Sie Lake Formation-Berechtigungen für Datenbanken/Tabellen (aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’). Lake Formation kann granulare Kontrollen durchsetzen: auf Spaltenebene, auf Zeilenebene (Filterausdrücke) und Maskierung auf Zellenebene mithilfe von LF-Tags und Datenfiltern, die auf Glue/Athena-Abfragen angewendet werden.

Wichtige Konfigurations- und Governance-Muster:

Entscheidungspunkte:

Amazon Redshift-Architektur und -Speicher

Redshift trennt Rechenleistung und verwalteten Speicher auf RA3-Knoten im Gegensatz zu lokalen, SSD-gestützten DS2-Knoten. RA3-Knoten verwenden Redshift Managed Storage (RMS), bei dem die Daten auf von dem Cluster verwaltetem Amazon S3 liegen; wählen Sie RA3 für skalierbaren Speicher mit konsistenter Abfrageleistung und der Möglichkeit, die Rechenleistung separat zu bezahlen. DS2-Knoten speichern Daten auf instanzlokalen Festplatten, was eine sorgfältige Dimensionierung und Größenanpassung erfordert, wenn die Datenmenge wächst.

Konfigurations- und Betriebsdetails:

Vergleich (RA3 vs. DS2):

DynamoDB und die Auswahl zweckgebundener Datenbanken

Wählen Sie DynamoDB für hochskalierbare Key-Value- und Dokumenten-Workloads, die eine Latenz im einstelligen Millisekundenbereich erfordern. Das Tabellendesign hängt von der Wahl des Partitionsschlüssels (und des optionalen Sortierschlüssels) ab: Verwenden Sie Schlüssel mit hoher Kardinalität und guter Verteilung, um Hot Partitions zu vermeiden. Für sequenzielle oder zeitstempelbasierte Schlüssel implementieren Sie zufällige Präfixe (Sharding) oder verwenden Sie UUIDs, um Schreibvorgänge zu verteilen. Nutzen Sie On-Demand-Kapazität, um die Bereitstellung zu vermeiden, aber ziehen Sie bereitgestellte Kapazität mit Autoscaling für vorhersagbare Workloads in Betracht, um die adaptive Kapazität bei Hot Partitions zu nutzen.

Praktische Konfigurationshinweise:

undefined

.

Entscheidungskriterien für die Wahl der Engine:

Häufige Fallstricke und Entscheidungskriterien

Praktisches Problem: Anwendungsfallszenario

Acme Media muss 50 TB an rohen Video-Ingests speichern, Analysten Abfragezugriff auf transformierte Metadaten gewähren und den Zugriff auf Zeilen- und Spaltenebene für verschiedene Geschäftsbereiche durchsetzen, während die Speicherkosten minimiert werden.

  1. Ingest von Rohvideos in S3 mittels Multipart-Upload, Taggen der Objekte nach Ingest-Datum und Datensatz, Verwendung von Intelligent-Tiering für anfänglich unbekannte Zugriffsmuster.
  2. Konfigurieren von Lifecycle-Regeln, um Medien nach einer konfigurierbaren Aufbewahrungsfrist nach GLACIER oder DEEP_ARCHIVE zu verschieben (stellen Sie eine Übereinstimmung von 30+ Tagen für Standard-IA sicher, falls dies in Betracht gezogen wird).
  3. Registrieren der S3-Speicherorte in Lake Formation, Erstellen von Glue Crawlern zum Füllen des Data Catalog und Gewähren von LF-Tag-basierten Berechtigungen auf Zeilen- und Spaltenebene für Geschäftsbereiche.
  4. Speichern kuratierter Metadaten in Redshift RA3 für Analysen; Anhängen einer IAM-Rolle an den Cluster für COPY aus S3 und Verwendung von VACUUM/ANALYZE-Operationen in Wartungsfenstern.
  5. Verwendung von DynamoDB mit gehashten UUID-Schlüsseln für eine Nachschlagetabelle mit hohem Durchsatz für Videomanifeste und Aktivierung der On-Demand-Kapazität, um Verkehrsspitzen abzufangen.

Begründung: Dieser Ansatz isoliert die Kosten für Cold Storage mit Glacier-Klassen, verwendet Intelligent-Tiering für unbekannte Muster, wendet Lake Formation für eine sichere, feingranulare Zugriffskontrolle über Analyse-Engines hinweg an und wählt RA3 für skalierbaren Analysespeicher, während DynamoDB operative Nachschlagevorgänge mit geringer Latenz übernimmt.


Datenerfassung und -sammlung · Alle Domänen · Datenkatalogisierung und Metadatenmanagement

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Amazon durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei