Amazon DEA-C01: Kostenoptimierung für Daten-Workloads — Lernleitfaden

Teil des Amazon Data Engineer Associate DEA-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Die Kostenoptimierung für Daten-Workloads stellt sicher, dass Speicher-, Rechen- und Datenverarbeitungspipelines einen Mehrwert liefern, ohne dass die Kosten ausufern. Data Engineers müssen die Abfrageleistung, Datendurabilität und Verfügbarkeit gegen Preismodelle abwägen, die je nach Service und Nutzungsmuster variieren. Dieser Bereich erfordert Kenntnisse über Speicherklassen und Lebenszyklusrichtlinien, Kontrollen auf Abfrage- und Cluster-Ebene, Spot- und reservierte Kapazitäten sowie die Abwägung zwischen Serverless- und Provisioned-Modellen.

S3-Speicherkostenoptimierung

S3 Intelligent-Tiering ist die empfohlene Standardeinstellung für Datensätze mit unvorhersehbaren Zugriffsmustern: Aktivieren Sie Intelligent-Tiering über die Konsole oder die AWS CLI, wenn die Zugriffshäufigkeit auf Objekte nicht zuverlässig vorhergesagt werden kann. Konfigurieren Sie Intelligent-Tiering unter Berücksichtigung der anfallenden Gebühr für Überwachung/Automatisierung (es gibt eine geringe monatliche Überwachungsgebühr pro Objekt) und mit der korrekten Mindestanzahl an Tagen für automatische Tier-Übergänge (30 Tage für den Übergang von häufig zu selten genutzten Tiers). Verwenden Sie Objekt-Tags und Lebenszyklusregeln, um kleine Objekte mit hoher Anfragerate auszuschließen, bei denen die Überwachungsgebühren die Einsparungen übersteigen würden.

Nutzen Sie diese operativen Muster, um die S3-Ausgaben zu reduzieren:

Entscheidungskriterien:

Kostenmanagement für Athena und Redshift

Die Kosten für Athena skalieren mit der Menge der gescannten Bytes. Erzwingen Sie Workgroup-Kontrollen (Konsole oder aws athena create-work-group), um Limits für gescannte Daten pro Abfrage und monatliche Budgets pro Workgroup zu implementieren; aktivieren Sie „Enforce workgroup settings“, damit Abfragen, die das Datenlimit pro Abfrage überschreiten, fehlschlagen, anstatt ausgeführt zu werden. Reduzieren Sie die gescannten Bytes, indem Sie Quelldateien in spaltenbasierte komprimierte Formate (Parquet/ORC) konvertieren, nach Datum oder gängigen Filterspalten partitionieren, Predicate Pushdown anwenden und CTAS oder CREATE TABLE AS verwenden, um optimierte Datensätze zu materialisieren. Nutzen Sie die Wiederverwendung von Abfrageergebnissen und die Isolierung von Workloads in separaten Workgroups, um Kostenübertragungen zwischen Teams zu vermeiden.

Kostenentscheidungen bei Redshift hängen von der Vorhersehbarkeit des Workloads und der Wahl des Speichers ab. Für eine stabile, vorhersagbare Nutzung der Data-Warehouse-Rechenleistung kaufen Sie Reserved Nodes (Laufzeiten von einem oder drei Jahren, Optionen mit teilweiser/vollständiger Vorauszahlung), um sich Rabatte gegenüber On-Demand zu sichern. Für variable Workloads:

Vergleichspunkte:

Reservierte Kapazität und Savings Plans für Datendienste

Reservierte Kapazität und Savings Plans werden bei den verschiedenen Datendiensten unterschiedlich angewendet. Für EC2-gestützte Dienste (EMR, selbstverwaltetes HBase, benutzerdefiniertes Hadoop) verwenden Sie EC2 Savings Plans oder Reserved Instances, um die Rechenkosten zu decken; wählen Sie je nach Mobilitätsanforderungen regionale oder zonale Optionen. Redshift unterstützt den Kauf von reservierten Knoten für provisionierte Cluster, um die stündlichen Kosten für vorhersagbare Warehouse-Workloads zu senken. Serverless-Dienste (Glue, Athena) haben keine Ressourcenreservierungen; optimieren Sie stattdessen durch die Planung von Workloads und Änderungen am Datenformat.

Praktische Anleitung zum Kauf:

Häufige Fallstricke und Entscheidungskriterien

undefined

) und wählen Sie geeignete Worker-Typen, um die Kosten vorhersagbar zu halten.

Praktisches Problem: Kostenreduzierung für den nächtlichen ETL-Lauf bei Acme Analytics

Acme Analytics führt nächtliche ETL-Läufe und tägliche Ad-hoc-Analysen durch; die monatlichen Cloud-Ausgaben sind aufgrund des wachsenden Rohdatenspeichers in S3 und der On-Demand-Stunden von Redshift stark angestiegen. Das Unternehmen benötigt eine Reduzierung um 35 %, ohne die nächtlichen SLAs zu beeinträchtigen.

  1. Führen Sie eine S3 Storage Class Analysis durch und erstellen Sie Lebenszyklusregeln, um kalte Rohdaten, die älter als 90 Tage sind, nach Glacier Flexible Retrieval zu verschieben (planen Sie Bulk/Standard-Abrufe).
  2. Konvertieren Sie rohe CSV-Dateien in partitioniertes, komprimiertes Parquet und fassen Sie kleine Dateien zusammen; speichern Sie die optimierten Datensätze unter separaten Präfixen für Athena/Redshift Spectrum.
  3. Erstellen Sie Athena-Arbeitsgruppen (Workgroups) mit Limits für die pro Abfrage gescannten Daten und erzwingen Sie die Arbeitsgruppen-Einstellungen; aktivieren Sie die Wiederverwendung von Abfrageergebnissen und legen Sie ein monatliches Budget pro Arbeitsgruppe fest.
  4. Migrieren Sie Batch-ETL-Prozesse für nicht dringende Transformationen zu Glue Flex-Jobs, legen Sie maximale DPU-Obergrenzen fest und planen Sie deren Ausführung außerhalb der Spitzenzeiten; behalten Sie eine kleinere Standard-Glue-Flotte für dringende Jobs bei.
  5. Passen Sie die Größe von Redshift an (Right-Sizing): Kaufen Sie 1-Jahres-Reserved-Nodes für die konstante Basis-Rechenleistung, verschieben Sie historische Daten nach S3 und verwenden Sie Spectrum für seltene Abfragen, und aktivieren Sie Concurrency Scaling nur mit Überwachung.

Begründung: Die Strategie kombiniert die Optimierung von Datenformat und Lebenszyklus (Reduzierung der Speicher- und Scankosten), eine kostengünstigere Serverless-Ausführung für flexible Jobs (Glue Flex), Query Governance (Athena-Arbeitsgruppen) und reservierte Kapazität für dauerhafte Rechenleistung, um Rabatte zu maximieren und gleichzeitig Verfügbarkeit und Leistung zu erhalten.


Überwachung und Fehlerbehebung von Datenpipelines · Alle Domänen · Datenqualität

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Amazon durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei