Amazon DEA-C01: Requêtage et analyse des données — Guide d'étude

Fait partie du Amazon Data Engineer Associate DEA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Ce domaine couvre la conception, l’optimisation et l’exploitation des services AWS qui prennent en charge les requêtes analytiques et la BI sur de grands ensembles de données. Il se concentre sur les modèles de requêtes rentables et à haute performance sur Athena, Redshift, OpenSearch et QuickSight, et sur la manière dont ils interagissent avec S3, Glue et les bases de données transactionnelles. La maîtrise exige d’équilibrer le format de stockage, le partitionnement, le type de calcul et l’emplacement des données afin de minimiser les octets analysés et l’asymétrie réseau (network skew) tout en fournissant des informations à faible latence.

Optimisation des requêtes Amazon Athena

La tarification d’Athena est basée sur les octets analysés, donc la disposition physique des données et les métadonnées sont les principaux leviers. Utilisez des formats colonnaires (Parquet ou ORC) avec compression (Snappy pour Parquet, options Zlib/ORC) pour réduire la taille et l’utilisation du CPU. Partitionnez les données par colonnes à haute cardinalité filtrées dans les requêtes (date, région) et enregistrez les partitions dans le Glue Data Catalog. Modèles typiques :

undefined

pour imposer la compression colonnaire.

Lorsque les requêtes nécessitent des jointures avec des bases de données transactionnelles, utilisez Athena Federated Query (connecteurs Lambda) pour effectuer des jointures inter-sources avec RDS, DynamoDB ou Redshift. Les connecteurs sont déployés en tant que fonctions Lambda et enregistrés comme sources de données dans Athena ; exemple de flux dans la console : Athena > Sources de données > Connecteurs > Nouveau. Critères de décision :

Optimisation des requêtes et distribution Amazon Redshift

La performance de Redshift dépend du style de distribution (distribution style) et des clés de tri (sort keys) pour minimiser les déplacements de données et permettre le mappage de zones (zone mapping). Choisissez les styles DIST en utilisant ces points de décision :

Définissez des SORTKEYs sur les colonnes utilisées dans les filtres de plage ou les clauses ORDER BY pour activer les zone maps et réduire les lectures sur disque. Commandes opérationnelles courantes :

undefined

;

undefined

; surveillez SVV_TABLE_INFO et STL_QUERY pour les métriques d’asymétrie (skew) et de distribution. Redshift Spectrum vous permet d’interroger des tables externes S3 via le Glue Data Catalog. Créez le schéma externe avec :

undefined

; Critères de décision pour Spectrum par rapport à Redshift natif :

Amazon OpenSearch Service pour l’analyse de logs

OpenSearch est optimisé pour l’ingestion et l’analyse rapide et ad-hoc de logs ; sa configuration d’index et de cluster détermine le débit et le coût. Conception et cycle de vie des index :

QuickSight pour la BI et la visualisation

QuickSight fournit des tableaux de bord rapides avec deux modes d’ingestion principaux : SPICE (en mémoire) et la requête directe (direct query). SPICE offre des performances inférieures à la seconde pour les tableaux de bord et est adapté aux lectures répétées ; les requêtes SQL directes (vers Athena, Redshift, RDS) sont préférables pour les très grands ensembles de données ou les données qui changent fréquemment. Configuration clé et meilleures pratiques :


Orchestration des données et gestion des flux de travail · Tous les domaines · Sécurité

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet