Amazon DEA-C01: Stockage des données et architecture de lac de données — Guide d'étude

Fait partie du Amazon Data Engineer Associate DEA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Ce domaine couvre la manière dont les services de stockage et les moteurs de base de données AWS prennent en charge l’ingestion de données à grande échelle, l’archivage durable, les performances des requêtes et la gouvernance sécurisée dans les plateformes de données modernes. Les ingénieurs de données doivent trouver un équilibre entre le coût, la latence d’accès, la durabilité et le contrôle d’accès affiné lors de l’intégration de services tels que S3, Lake Formation, Redshift et DynamoDB dans les pipelines. La compréhension des compromis entre les classes de stockage, de l’automatisation du cycle de vie, du stockage géré par rapport au stockage local et des schémas de partitionnement permet d’éviter les surprises en matière de performances et de coûts en production.

Classes de stockage et politiques de cycle de vie Amazon S3

S3 propose plusieurs classes de stockage et contrôles de cycle de vie pour optimiser les coûts et les modèles d’accès. Configurez la classe de stockage lors du chargement (console ou CLI :

undefined

) ou utilisez des règles de cycle de vie de compartiment (

undefined

). Intelligent-Tiering déplace automatiquement les objets entre les niveaux d’accès fréquent et peu fréquent et entraîne de légers frais de surveillance ; activez-le pour les modèles d’accès inconnus ou changeants. Utilisez les règles de cycle de vie pour faire passer les objets à GLACIER ou DEEP_ARCHIVE pour une conservation à long terme et pour faire expirer/supprimer les anciennes versions.

Critères de décision et compromis :

Notes opérationnelles :

undefined

) et le verrouillage d’objet (

undefined

) pour l’immuabilité ; l’activation de MFA Delete nécessite des opérations CLI spéciales et le compte propriétaire du compartiment avec MFA.

Conception de data lake avec S3 et Lake Formation

Concevez un data lake avec S3 comme magasin d’objets central et Lake Formation pour le contrôle d’accès centralisé et le catalogage. Enregistrez les emplacements S3 en tant que ressources Lake Formation, configurez un AWS Glue Data Catalog et utilisez les autorisations Lake Formation pour les bases de données/tables (

undefined

). Lake Formation peut appliquer des contrôles affinés : au niveau de la colonne, au niveau de la ligne (expressions de filtre) et masquage au niveau de la cellule à l’aide de LF-tags et de filtres de données appliqués aux requêtes Glue/Athena.

Principaux schémas de configuration et de gouvernance :

undefined

et attachez un rôle IAM qui permet à Lake Formation d’explorer/lire.

Points de décision :

Architecture et stockage Amazon Redshift

Redshift sépare le calcul (compute) et le stockage géré sur les nœuds RA3 par opposition aux nœuds DS2 basés sur des SSD locaux. Les nœuds RA3 utilisent le Redshift Managed Storage (RMS) où les données résident sur Amazon S3 géré par le cluster ; choisissez RA3 pour un stockage évolutif avec des performances de requête constantes et la possibilité de payer le calcul séparément. Les nœuds DS2 stockent les données sur des disques locaux à l’instance, ce qui nécessite un dimensionnement et un redimensionnement minutieux lorsque les données augmentent.

Détails de configuration et opérationnels :

undefined

.

undefined

) est référencé dans la commande COPY en tant que credentials

undefined

.

Comparaison (RA3 vs DS2) :

DynamoDB et sélection de bases de données spécialisées

Choisissez DynamoDB pour les charges de travail clé-valeur et de documents à grande échelle nécessitant une latence de l’ordre de la milliseconde (single-digit). La conception de la table repose sur la sélection de la clé de partition (et de la clé de tri optionnelle) : utilisez des clés à haute cardinalité et bien distribuées pour éviter les partitions surchargées (hot partitions). Pour les clés séquentielles ou basées sur des horodatages, implémentez un préfixage aléatoire (sharding) ou utilisez des UUID pour répartir les écritures. Utilisez la capacité à la demande pour éviter le provisionnement, mais envisagez la capacité provisionnée avec autoscaling pour les charges de travail prévisibles et pour tirer parti de la capacité adaptative sur les partitions surchargées.

Notes de configuration pratiques :

undefined

.

Critères de décision pour la sélection du moteur :

Pièges courants et critères de décision

Problème pratique : Scénario d’utilisation

Acme Media doit stocker 50 To de vidéos brutes ingérées, fournir aux analystes un accès par requête aux métadonnées transformées, et appliquer un accès au niveau des lignes et des colonnes pour différentes unités commerciales tout en minimisant les coûts de stockage.

  1. Ingérer les vidéos brutes dans S3 en utilisant le chargement partitionné (multipart upload), étiqueter les objets par date d’ingestion et par jeu de données, utiliser Intelligent-Tiering pour les modèles d’accès initiaux inconnus.
  2. Configurer des règles de cycle de vie pour faire passer les médias vers GLACIER ou DEEP_ARCHIVE après une période de rétention configurable (s’assurer d’un alignement de plus de 30 jours pour Standard-IA si cette classe est envisagée).
  3. Enregistrer les emplacements S3 dans Lake Formation, créer des crawlers Glue pour peupler le Data Catalog, et accorder des autorisations au niveau des lignes et des colonnes basées sur les étiquettes LF aux unités commerciales.
  4. Stocker les métadonnées organisées dans Redshift RA3 pour l’analytique ; attacher un rôle IAM au cluster pour les opérations COPY depuis S3 et utiliser les opérations VACUUM/ANALYZE pendant les fenêtres de maintenance.
  5. Utiliser DynamoDB avec des clés UUID hachées pour une table de consultation à haut débit des manifestes vidéo et activer la capacité à la demande pour absorber les pics de trafic.

Justification : Cette approche isole les coûts de stockage à froid avec les classes Glacier, utilise Intelligent-Tiering pour les modèles d’accès inconnus, applique Lake Formation pour un contrôle d’accès sécurisé et granulaire sur les moteurs d’analytique, et sélectionne RA3 pour un stockage analytique évolutif tandis que DynamoDB gère les consultations opérationnelles à faible latence.


Ingestion et collecte des données · Tous les domaines · Catalogage des données et gestion des métadonnées

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet