Amazon DEA-C01: Dataquery en -analyse — Studiegids

Onderdeel van de Amazon Data Engineer Associate DEA-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Dit domein omvat het ontwerpen, afstemmen en beheren van AWS-services die analytische query’s en BI op grote datasets ondersteunen. Het richt zich op kostenefficiënte, high-performance querypatronen voor Athena, Redshift, OpenSearch en QuickSight, en hoe deze samenwerken met S3, Glue en transactionele opslag. Beheersing vereist het balanceren van opslagformaat, partitionering, compute-type en datalocatie om gescande bytes en netwerk-skew te minimaliseren en tegelijkertijd inzichten met lage latentie te leveren.

Amazon Athena query-optimalisatie

De prijs van Athena is gebaseerd op gescande bytes, dus de fysieke data-indeling en metadata zijn de belangrijkste hefbomen. Gebruik kolomgeoriënteerde formaten (Parquet of ORC) met compressie (Snappy voor Parquet, Zlib/ORC-opties) om de omvang en het CPU-gebruik te verminderen. Partitioneer data op kolommen met een hoge kardinaliteit waarop gefilterd wordt in query’s (datum, regio) en registreer partities in de Glue Data Catalog. Typische patronen:

Wanneer query’s joins met transactionele opslag vereisen, gebruik dan Athena Federated Query (Lambda connectors) om cross-source joins uit te voeren met RDS, DynamoDB of Redshift. Connectors worden geïmplementeerd als Lambda-functies en geregistreerd als databronnen in Athena; een voorbeeld van de console-flow is: Athena > Data sources > Connectors > New. Beslissingscriteria:

Amazon Redshift query-tuning en distributie

De prestaties van Redshift zijn afhankelijk van de ‘distribution style’ en ‘sort keys’ om dataverplaatsing te minimaliseren en ‘zone mapping’ mogelijk te maken. Kies DIST-stijlen op basis van deze beslispunten:

Definieer SORTKEYs op kolommen die worden gebruikt in ‘range filters’ of ORDER BY om ‘zone maps’ mogelijk te maken en schijfleesacties te verminderen. Veelvoorkomende operationele commando’s:

Amazon OpenSearch Service voor log-analyse

OpenSearch is geoptimaliseerd voor ‘ingest’ en snelle, ad-hoc log-analyse; de index- en clusterconfiguratie bepalen de doorvoer en kosten. Indexontwerp en lifecycle:

QuickSight voor BI en visualisatie

QuickSight levert snelle dashboards met twee belangrijke ‘ingestion modes’: SPICE (in-memory) en ‘direct query’. SPICE biedt prestaties van minder dan een seconde voor dashboards en is geschikt voor herhaalde leesacties; directe SQL-query’s (naar Athena, Redshift, RDS) hebben de voorkeur voor zeer grote datasets of vaak veranderende data. Belangrijke configuratie en best practices:

Veelvoorkomende Valkuilen en Beslissingscriteria

Praktijkprobleem: Gebruikersscenario

Acme Retail heeft dagelijkse BI-rapporten nodig die transactionele bestellingen in Amazon RDS, clickstream-events in S3 en gebruikersprofielen in DynamoDB combineren, met kostenlimieten en dashboard-refreshes van minder dan een minuut voor recente data.

  1. Converteer clickstream-data in S3 naar gepartitioneerde Parquet (op basis van datum), comprimeer met Snappy en registreer de metadata in AWS Glue via een crawler.
  2. Gebruik Athena voor ad-hoc-query’s op S3 en implementeer Federated Query-connectoren voor RDS en DynamoDB om joins met kleine dimensies uit te voeren; materialiseer veelgebruikte join-resultaten als Parquet als query’s worden herhaald.
  3. Provisioneer Redshift voor zware analytische joins: laad geaggregeerde snapshots in Redshift, stel DISTKEY in op een customer_id met hoge kardinaliteit en definieer SORTKEY op order_date; gebruik Spectrum voor koude, historische S3-data.
  4. Neem applicatielogs op in OpenSearch met dagelijkse indexpatronen; pas ILM toe om recente indices op hot nodes te houden en verplaats oudere indices naar UltraWarm voor kostenbesparingen.
  5. Bouw QuickSight-dashboards: importeer recente aggregaties in SPICE met ingeplande incrementele refreshes voor een waargenomen responsiviteit van minder dan een minuut, en gebruik direct queries voor statistieken die altijd actueel zijn.

Rationale: Deze aanpak minimaliseert de scankosten van Athena door partitionering en kolommige formaten, vermindert Redshift network shuffle met de juiste distributie- en sorteersleutels, gebruikt Spectrum om te voorkomen dat koude data in Redshift wordt opgeslagen, past OpenSearch ILM toe om opslagkosten te optimaliseren en benut SPICE voor responsieve dashboards terwijl kritieke actualiteit wordt behouden via direct queries.


Data-orkestratie en workflowbeheer · Alle domeinen · Databeveiliging

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product