Amazon DEA-C01: Dataopslag en Lake-architectuur — Studiegids
Onderdeel van de Amazon Data Engineer Associate DEA-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.
Dit domein behandelt hoe AWS-opslagdiensten en database-engines grootschalige data-ingestie, duurzame archivering, queryprestaties en veilige governance in moderne dataplatforms ondersteunen. Data engineers moeten een balans vinden tussen kosten, toegangslatency, duurzaamheid en fijngranulaire toegangscontrole bij het integreren van services zoals S3, Lake Formation, Redshift en DynamoDB in pipelines. Inzicht in de afwegingen tussen opslagklassen, lifecycle-automatisering, beheerde versus lokale opslag en partitioneringspatronen voorkomt verrassingen op het gebied van prestaties en kosten in productie.
Amazon S3-opslagklassen en lifecycle-beleid
S3 biedt meerdere opslagklassen en lifecycle-controles om kosten en toegangspatronen te optimaliseren. Configureer de opslagklasse bij het uploaden (console of CLI: aws s3 cp file s3://bucket/key –storage-class INTELLIGENT_TIERING) of gebruik bucket lifecycle-regels (aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json). Intelligent-Tiering verplaatst objecten automatisch tussen frequent en infrequent benaderde tiers en heeft een kleine monitoringkost; schakel dit in voor onbekende of veranderende toegangspatronen. Gebruik lifecycle-regels om objecten over te zetten naar GLACIER of DEEP_ARCHIVE voor langetermijnbewaring en om oude versies te laten verlopen/verwijderen.
Beslissingscriteria en afwegingen:
- Intelligent-Tiering: lage operationele overhead voor variabele toegang, maandelijkse monitoringkosten per object; het beste wanneer het toegangspatroon onvoorspelbaar is.
- Glacier vs Glacier Deep Archive: Glacier biedt snellere standaard en versnelde ophaalopties tegen hogere opslagkosten; Deep Archive is het goedkoopst voor jarenlange bewaring met bulk/standaard ophaaltijden (uren).
- Standard-IA vs Intelligent-Tiering: Standard-IA heeft minimale kosten voor 30 dagen en ophaalkosten — vermijd dit voor frequent benaderde data of kortlevende objecten.
Operationele opmerkingen:
- Schakel versioning in (aws s3api put-bucket-versioning –bucket my-bucket –versioning-configuration Status=Enabled) en object lock (aws s3api put-object-lock-configuration –bucket my-bucket –object-lock-configuration file://lock.json) voor onveranderlijkheid; het inschakelen van MFA Delete vereist speciale CLI-operaties en het bucket-eigenaaraccount met MFA.
- Lifecycle-transities zijn van toepassing op objectversies en kunnen worden afgebakend per prefix/tags; gebruik abort-incomplete-multipart-upload om opslaglekken te voorkomen.
Data lake-ontwerp met S3 en Lake Formation
Ontwerp een data lake met S3 als de centrale object store en Lake Formation voor gecentraliseerde toegangscontrole en catalogisering. Registreer S3-locaties als Lake Formation-resources, zet een AWS Glue Data Catalog op en gebruik Lake Formation-grants voor databases/tabellen (aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’). Lake Formation kan fijngranulaire controles afdwingen: op kolomniveau, rijniveau (filterexpressies) en celniveau-masking met behulp van LF-tags en datafilters die worden toegepast op Glue/Athena-query’s.
Belangrijke configuratie- en governance-patronen:
- Locatie registreren: gebruik de Lake Formation-console om s3://bucket/path te registreren en koppel een IAM-rol die Lake Formation toestaat om te crawlen/lezen.
- Fijngranulaire policies: definieer LF-tags en koppel ze aan tabellen/kolommen; verleen permissies met een column-list om kolommen te beperken, en gebruik row-filter-expressies om het aantal rijen te limiteren dat voor een principal wordt geretourneerd.
- Onthoud dat Lake Formation-permissies de IAM S3-permissies voor Glue/Athena-toegang kunnen overschrijven of blokkeren — verleen waar nodig zowel Lake Formation- als S3-niveau-toegang.
Beslispunten:
- Gebruik Lake Formation wanneer je gecentraliseerde catalogisering, LF-tags en fijngranulaire handhaving over meerdere analytics-engines nodig hebt.
- Voor eenvoudige toegangscontrole of toegang door externe tools, overweeg S3 bucket policies en IAM, maar wees voorzichtig: analytics-engines die door Lake Formation worden beheerd, kunnen IAM-only grants negeren.
Amazon Redshift-architectuur en -opslag
Redshift scheidt compute en beheerde opslag op RA3-nodes versus lokale, met SSD ondersteunde DS2-nodes. RA3-nodes gebruiken Redshift Managed Storage (RMS), waarbij data op Amazon S3 staat die door het cluster wordt beheerd; kies RA3 voor schaalbare opslag met consistente queryprestaties en de mogelijkheid om apart voor compute te betalen. DS2-nodes slaan data op, op instance-lokale schijven, wat zorgvuldige dimensionering en schaling vereist wanneer de data groeit.
Configuratie en operationele details:
- Creëer een RA3-cluster via de console of CLI: aws redshift create-cluster –cluster-identifier my-cluster –node-type ra3.xlplus –number-of-nodes 2 –master-username admin –master-user-password Passw0rd.
- COPY-commando: moet worden uitgevoerd op een cluster met een gekoppelde IAM-rol die S3-leestoegang verleent. Koppel de rol bij het aanmaken van het cluster of wijzig het cluster om IAM-rollen toe te voegen; de rol-ARN (arn:aws:iam::acct:role/RedshiftS3Role) wordt in COPY gerefereerd als credentials ‘aws_iam_role=arn:…’.
- Monitor WLM-wachtrijen, short query acceleration, automatic vacuuming, en gebruik SORT/ENCODE om opslag en prestaties te optimaliseren.
Vergelijking (RA3 vs DS2):
- RA3: ontkoppelde opslag, automatische data tiering naar S3, minder opslagbeheer, het beste voor groeiende datasets.
- DS2: lokale SSD-opslag, lagere latency voor lokale data maar beperkte capaciteit en moeilijker te schalen.
DynamoDB en de selectie van doelgerichte databases
Kies DynamoDB voor grootschalige key-value en document workloads die een latentie van enkele milliseconden vereisen. Het tabelontwerp hangt af van de selectie van de partitiesleutel (en optionele sorteersleutel): gebruik sleutels met een hoge cardinaliteit en een goede distributie om ‘hot partitions’ te vermijden. Voor sequentiële of op tijdstempels gebaseerde sleutels, implementeer willekeurige prefixing (sharding) of gebruik UUID’s om schrijfacties te spreiden. Gebruik on-demand capaciteit om provisioning te vermijden, maar overweeg geprovisioneerde capaciteit met autoscaling voor voorspelbare workloads en om te profiteren van adaptieve capaciteit op ‘hot partitions’.
Praktische configuratie-opmerkingen:
- CLI voor het aanmaken van een tabel:
undefined
.
- Gebruik GSI’s voor alternatieve toegangspatronen, schakel TTL in voor automatische vervaldatum, en gebruik DynamoDB Streams + Lambda voor change-data-capture patronen.
- Voor het cachen van leesintensieve workloads, voeg DAX toe; voor complexe query’s of relationele behoeften, kies Aurora of Redshift Spectrum afhankelijk van de complexiteit van de query’s en de consistentievereisten.
Beslissingscriteria voor de selectie van de engine:
- Gebruik DynamoDB voor voorspelbare single-table toegangspatronen en enorme schaal met lage latentie.
- Gebruik Redshift voor complexe analytics en grootschalige OLAP.
- Gebruik Aurora voor transactionele relationele workloads.
Veelvoorkomende valkuilen en beslissingscriteria
- S3 Standard-IA gebruiken voor frequent benaderde data — Standard-IA heeft minimale kosten voor 30 dagen; gebruik Standard of Intelligent-Tiering voor kortstondige of frequent benaderde objecten.
- Vergeten dat Lake Formation-permissies de IAM S3-permissies voor Glue/Athena overschrijven — verleen zowel Lake Formation- als S3-toegang wanneer u Glue/Athena gebruikt en verifieer de effectieve permissies in de Lake Formation-console.
- Redshift COPY vereist een IAM-rol die aan het cluster is gekoppeld, niet alleen gebruikerspermissies — koppel een IAM-rol met S3-toegang aan het cluster en verwijs naar de ARN ervan in COPY-operaties.
- DynamoDB ‘hot partitions’ door sequentiële sleutels — vermijd monotone sleutels; gebruik hashed sleutels, willekeurige prefixes of UUID’s en overweeg on-demand of automatisch geschaalde geprovisioneerde capaciteit.
- Onjuist inschakelen van S3 Object Lock en MFA Delete — object lock vereist dat versioning is ingeschakeld en de juiste permissies; MFA Delete kan alleen worden in- of uitgeschakeld via de CLI met MFA en heeft strikte vereisten voor de bucketeigenaar.
- Onjuiste lifecycle-transities zonder de ophaalkosten en -tijden te testen — test ophaalworkflows voor Glacier-klassen om onverwachte ophaallatentie en -kosten te vermijden.
Praktisch probleem: Use-case scenario
Acme Media moet 50 TB aan onbewerkte video-opnames opslaan, analisten querytoegang geven tot getransformeerde metadata, en toegang op rij- en kolomniveau afdwingen voor verschillende bedrijfsonderdelen, terwijl de opslagkosten worden geminimaliseerd.
- Neem onbewerkte video op in S3 met behulp van multipart upload, tag objecten op basis van opnamedatum en dataset, gebruik Intelligent-Tiering voor initiële onbekende toegangspatronen.
- Configureer lifecycle-regels om media over te zetten naar GLACIER of DEEP_ARCHIVE na een configureerbare bewaarperiode (zorg voor afstemming op 30+ dagen indien Standard-IA wordt overwogen).
- Registreer S3-locaties in Lake Formation, bouw Glue-crawlers om de Data Catalog te vullen, en verleen op LF-tags gebaseerde permissies op rij- en kolomniveau aan bedrijfsonderdelen.
- Sla gecureerde metadata op in Redshift RA3 voor analytics; koppel een IAM-rol aan het cluster voor COPY vanuit S3 en gebruik VACUUM/ANALYZE-operaties in onderhoudsvensters.
- Gebruik DynamoDB met gehashte UUID-sleutels voor een lookup-tabel met hoge doorvoersnelheid van videomanifesten en schakel on-demand capaciteit in om verkeerspieken op te vangen.
Rationale: Deze aanpak isoleert de kosten voor cold storage met Glacier-klassen, gebruikt Intelligent-Tiering voor onbekende patronen, past Lake Formation toe voor veilige, fijngranulaire toegangscontrole over analytics-engines heen, en selecteert RA3 voor schaalbare analytics-opslag, terwijl DynamoDB operationele lookups met lage latentie verwerkt.
← Data-ingestie en verzameling · Alle domeinen · Datacatalogisering en metadatabeheer →
Oefen deze vragen → · Getimede oefening op ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Slaag voor je examen →