Amazon DEA-C01: Ingestion et collecte des données — Guide d'étude

Fait partie du Amazon Data Engineer Associate DEA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Ce domaine couvre les modèles, les services AWS et les détails opérationnels utilisés pour intégrer des données brutes dans une plateforme de données de manière fiable et à grande échelle. Les ingénieurs de données doivent choisir entre des points d’entrée par lots (batch) et en streaming, assurer le catalogage et la découvrabilité des données, et concevoir en fonction du débit, de la rejouabilité et des modes de défaillance. Les composants AWS clés sont S3 et Glue pour le traitement par lots, Kinesis et Firehose pour le streaming, DMS pour la migration de bases de données et le CDC, ainsi que les composants pilotés par API/événements (API Gateway, Lambda, SNS, SQS, événements S3) pour l’ingestion ad-hoc et basée sur des notifications (push).

Ingestion par lots avec AWS Glue et S3

Glue est la principale solution gérée d’ETL et de métadonnées pour l’ingestion par lots dans S3 et votre catalogue de données. Modèle typique : déposer les fichiers bruts dans S3 (avec des préfixes distincts pour les zones brutes/raw), exécuter un crawler Glue pour inférer le schéma et remplir le Glue Data Catalog, puis exécuter des tâches ETL Glue (Spark) pour transformer, partitionner, convertir en formats colonnaires (Parquet/ORC) et réécrire les données optimisées dans S3. Configurez les crawlers avec les classifieurs appropriés (intégrés pour CSV/JSON/Parquet ou personnalisés avec grok/regex) et attribuez au crawler un rôle IAM disposant des autorisations s3:GetObject/s3:ListBucket et glue:catalog — l’absence de ces autorisations est une erreur opérationnelle courante.

Lors de la configuration des tâches et des crawlers Glue, utilisez ces modèles et options de la console/CLI :

undefined

et le démarrer avec

undefined

.

undefined

; activez les signets de tâche (job bookmarks) pour éviter le retraitement. Critères de décision pour Glue par rapport aux alternatives :

Ingestion en streaming avec Kinesis Data Streams et Firehose

Kinesis Data Streams (KDS) est destiné à l’ingestion en temps réel avec rejouabilité, contrôle des consommateurs et mise à l’échelle fine. Un shard Kinesis fournit une capacité d’écriture de 1 Mo/s ou 1 000 enregistrements/s et une capacité de lecture de 2 Mo/s ; utilisez

undefined

et insérez des données avec

undefined

. Les clés de partition déterminent l’affectation des shards ; une faible cardinalité des clés de partition provoque des shards saturés (hot shards) — évitez cela en augmentant l’entropie de la clé ou en la suffixant avec un hachage. Mettez à l’échelle les shards en utilisant

undefined

ou activez le mode On-Demand pour une mise à l’échelle automatique.

Firehose est un service de flux de livraison optimisé pour la livraison en quasi-temps réel (vers S3, Redshift, OpenSearch, Splunk) avec mise en mémoire tampon (buffering), compression et transformation Lambda optionnelle intégrées. Configurez la mise en mémoire tampon avec BufferingHints : buffer_size (Mo) et buffer_interval (secondes) pour ajuster la latence de livraison par rapport au coût ; activez la compression (GZIP, Snappy) et définissez une fonction Lambda de traitement pour les transformations au niveau de l’enregistrement. Différences clés :

Choisissez KDS lorsque vous avez besoin de rejouabilité, d’un contrôle strict des consommateurs ou de plusieurs consommateurs en aval ; choisissez Firehose lorsque vous avez besoin d’une livraison et d’une transformation simples vers S3/Redshift/OpenSearch avec une surcharge opérationnelle minimale.

Migration de bases de données et CDC avec DMS

AWS DMS est utilisé pour les migrations homogènes/hétérogènes et la réplication continue (CDC - Change Data Capture). Déployez une instance de réplication (

undefined

) dimensionnée pour le débit, les décisions de dimensionnement étant basées sur le taux de changement, le volume du chargement complet et le parallélisme des tâches. Types de tâches DMS :

Critères de décision entre le chargement complet et le CDC : utilisez full-load+CDC lorsque vous avez besoin d’une migration avec un temps d’arrêt minimal ; utilisez CDC seul pour une réplication continue après qu’un chargement initial a été effectué par un autre mécanisme. Validez toujours le mappage de schéma et effectuez des migrations de test sur des volumes de données représentatifs.

Modèles d’ingestion basés sur les API et les événements

Les API et les événements sont utilisés pour l’ingestion et l’orchestration de type push. Modèles courants :

Considérations opérationnelles et modèles CLI :

Pièges courants et critères de décision

Problème pratique : Scénario d’utilisation

RetailCo collecte des flux de clics mobiles (temps réel à haut volume) et des fichiers de catalogue de produits nocturnes ; ils ont besoin de tableaux de bord en temps réel et d’un lac d’analytique consolidé.

  1. Ingérer les flux de clics dans Kinesis Data Streams avec des clés de partition dérivées de la session utilisateur + un suffixe de partition (shard) haché ; créer des consommateurs utilisant Kinesis Data Analytics ou Lambda/Kinesis Client Library pour le traitement en temps réel.
  2. Utiliser Kinesis Data Firehose avec une Lambda de transformation pour persister les sorties de streaming enrichies vers S3 (Parquet), compresser avec Snappy, et éventuellement charger dans Redshift Spectrum pour l’analytique.
  3. Placer les fichiers de catalogue nocturnes dans s3://raw/ et exécuter un crawler Glue planifié pour mettre à jour le Glue Data Catalog, puis exécuter des tâches Glue ETL pour convertir en Parquet partitionné dans la zone organisée (curated).
  4. Utiliser les notifications d’événements S3 -> SNS -> Lambda pour déclencher des mises à jour de métadonnées légères ou invalider les caches ; router la livraison vers SQS pour un traitement durable en aval.
  5. Surveiller les métriques de partition (shard) Kinesis (IncomingBytes, IncomingRecords, PutRecords.Success) et utiliser UpdateShardCount ou les flux On-Demand pour gérer la croissance ; activer les alarmes CloudWatch.

Justification des bonnes pratiques AWS : séparer les chemins temps réel et batch, utiliser Kinesis Data Streams lorsque la relecture et l’isolation des consommateurs sont requises, utiliser Firehose pour la livraison gérée vers S3/destinations, et maintenir un Glue Data Catalog pour l’intégration pour la découverte et les requêtes avec Athena/Redshift.


Tous les domaines · Stockage des données et architecture de lac de données

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet