Amazon DEA-C01: Kostenoptimalisatie voor dataworkloads — Studiegids

Onderdeel van de Amazon Data Engineer Associate DEA-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Kostenoptimalisatie voor data workloads zorgt ervoor dat opslag-, compute- en dataverwerkingspipelines waarde leveren zonder onbeheersbare uitgaven. Data engineers moeten een balans vinden tussen queryprestaties, dataduurzaamheid en beschikbaarheid, en prijsmodellen die variëren per service en gebruikspatroon. Dit domein vereist bekendheid met opslagklassen en lifecycle-beleid, controles op query- en clusterniveau, spot- en gereserveerde capaciteit, en de afwegingen tussen serverless en provisioned.

Kostenoptimalisatie voor S3-opslag

S3 Intelligent-Tiering is de aanbevolen standaard voor datasets met onvoorspelbare toegangspatronen: activeer Intelligent-Tiering via de console of AWS CLI wanneer de toegangsfrequentie tot objecten niet betrouwbaar kan worden voorspeld. Configureer Intelligent-Tiering met bewustzijn van de bijbehorende monitoring-/automatiseringskosten (er is een kleine maandelijkse monitoringkost per object) en het juiste minimumaantal dagen voor automatische overgangen naar een andere tier (30 dagen voor de overgang van frequent naar infrequent gebruikte tiers). Gebruik object-tags en lifecycle-regels om kleine objecten met veel requests uit te sluiten, waarbij de monitoringkosten hoger zouden zijn dan de besparingen.

Gebruik deze operationele patronen om S3-uitgaven te verminderen:

undefined

) om toegangspatronen op prefix-/tag-niveau te identificeren voordat je lifecycle-regels aanmaakt.

Beslissingscriteria:

Kostenbeheer voor Athena en Redshift

Athena-kosten schalen met het aantal gescande bytes. Dwing workgroup-controles af (console of

undefined

) om limieten voor gescande data per query en maandelijkse budgetten per workgroup te implementeren; activeer “Enforce workgroup settings” zodat queries die de datalimiet per query overschrijden, mislukken in plaats van worden uitgevoerd. Verminder het aantal gescande bytes door bronbestanden te converteren naar kolomgeoriënteerde, gecomprimeerde formaten (Parquet/ORC), te partitioneren op datum of veelgebruikte filterkolommen, predicate pushdown toe te passen en CTAS of CREATE TABLE AS te gebruiken om geoptimaliseerde datasets te materialiseren. Gebruik hergebruik van queryresultaten en isolatie van workloads in afzonderlijke workgroups om kostenoverschrijdingen tussen teams te voorkomen.

Kostenbeslissingen voor Redshift hangen af van de voorspelbaarheid van de workload en de opslagkeuzes. Voor stabiel, voorspelbaar datawarehouse-computegebruik, schaf Reserved Nodes aan (termijnen van één of drie jaar, met gedeeltelijke/volledige vooruitbetaling) om kortingen vast te leggen ten opzichte van on-demand. Voor variabele workloads:

Vergelijkingspunten:

Kostenstrategieën voor Glue en EMR

AWS Glue biedt serverless ETL met meerdere hefbomen voor kostenbeheersing. Gebruik voor batch-jobs die niet latentiegevoelig zijn Glue flexible execution (Glue Flex jobs), wat de kosten tot ~34% kan verlagen in vergelijking met de standaard Glue-uitvoering. Configureer Glue job-parameters in Glue Studio of de CLI (

undefined

) om het workertype en het maximale aantal DPU’s te selecteren, stel een verstandige maximale DPU-limiet in om onbeperkte auto-scaling te voorkomen, en gebruik job bookmarks om volledige herverwerking te vermijden. Kies voor interactieve of latentiegevoelige workloads de juiste workertypes (Standard/G.1X/G.2X) en stem de parallellisatie verantwoord af.

Kostenreductie bij EMR is afhankelijk van het gebruik van Spot Instances voor task nodes, terwijl de master- en core-nodes On-Demand blijven (configureer instance fleets of instance groups in de console of via

undefined

). Gebruik Spot alleen voor task nodes, selecteer de ‘capacity-optimized’ allocatiestrategie en stel een passend bod/maximale prijs in als je Spot met biedingen gebruikt. Bescherm de clusterstatus en de veerkracht van jobs door:

Beslissingscriteria:

Gereserveerde capaciteit en Savings Plans voor dataservices

Gereserveerde capaciteit en Savings Plans zijn verschillend van toepassing op dataservices. Voor services die op EC2 draaien (EMR, zelfbeheerde HBase, custom Hadoop), gebruik EC2 Savings Plans of Reserved Instances om de computekosten te dekken; selecteer regionale of zonale opties op basis van mobiliteitsbehoeften. Redshift ondersteunt de aankoop van gereserveerde nodes voor geprovisioneerde clusters om de uurkosten voor voorspelbare warehouse-workloads te verlagen. Serverless services (Glue, Athena) hebben geen resource-reserveringen; optimaliseer in plaats daarvan door de planning van workloads en wijzigingen in het dataformaat.

Praktische aankooprichtlijnen:

Veelvoorkomende valkuilen en beslissingscriteria

undefined

) en kies de juiste worker-types om de kosten voorspelbaar te houden.

Praktijkprobleem: Kostenreductie voor de nachtelijke ETL van Acme Analytics

Acme Analytics voert nachtelijke ETL en dagelijkse ad-hoc analyses uit; de maandelijkse clouduitgaven zijn sterk gestegen door groeiende onbewerkte S3-opslag en on-demand Redshift-uren. Het bedrijf heeft een reductie van 35% nodig zonder de nachtelijke SLA’s te beïnvloeden.

  1. Voer S3 Storage Class Analysis en lifecycle-regels uit om ‘koude’ onbewerkte bestanden ouder dan 90 dagen te verplaatsen naar Glacier Flexible Retrieval (plan Bulk/Standard retrievals).
  2. Converteer onbewerkte CSV’s naar gepartitioneerde, gecomprimeerde Parquet en comprimeer kleine bestanden; sla geoptimaliseerde datasets op onder afzonderlijke prefixes voor Athena/Redshift Spectrum.
  3. Maak Athena-werkgroepen aan met limieten voor gescande data per query en dwing werkgroepinstellingen af; activeer hergebruik van queryresultaten en stel een maandelijks budget per werkgroep in.
  4. Migreer batch-ETL naar Glue Flex-jobs voor niet-urgente transformaties, stel maximale DPU-limieten in en plan ze tijdens daluren; behoud een kleinere standaard Glue-vloot voor urgente jobs.
  5. Right-size Redshift: koop 1-jarige Reserved Nodes voor een stabiele basis-compute, verplaats historische data naar S3 en gebruik Spectrum voor incidentele query’s, en activeer concurrency scaling alleen met monitoring.

Rationale: De strategie combineert optimalisatie van dataformaat en lifecycle (wat opslag- en scankosten verlaagt), serverless, goedkopere uitvoering voor flexibele jobs (Glue Flex), query governance (Athena-werkgroepen), en gereserveerde capaciteit voor aanhoudende compute om kortingen te maximaliseren met behoud van beschikbaarheid en prestaties.


Monitoring en probleemoplossing van datapipelines · Alle domeinen · Datakwaliteit

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product