Amazon DEA-C01: Optimisation des coûts pour les charges de travail de données — Guide d'étude

Fait partie du Amazon Data Engineer Associate DEA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

L’optimisation des coûts pour les charges de travail de données garantit que les pipelines de stockage, de calcul et de traitement des données apportent de la valeur sans dépenses excessives. Les ingénieurs de données doivent équilibrer les performances des requêtes, la durabilité des données et la disponibilité par rapport à des modèles de tarification qui varient selon le service et le modèle d’utilisation. Ce domaine exige une connaissance des classes de stockage et des politiques de cycle de vie, des contrôles au niveau des requêtes et des clusters, de la capacité Spot et réservée, ainsi que des compromis entre le serverless et le provisionné.

Optimisation des coûts de stockage S3

S3 Intelligent-Tiering est la classe de stockage recommandée par défaut pour les jeux de données avec des modèles d’accès imprévisibles : activez Intelligent-Tiering via la console ou l’AWS CLI lorsque la fréquence d’accès aux objets ne peut pas être prévue de manière fiable. Configurez Intelligent-Tiering en tenant compte des frais de surveillance/automatisation (il y a de faibles frais de surveillance mensuels par objet) et du nombre minimum de jours approprié pour les transitions automatiques de niveau (30 jours pour les niveaux d’accès fréquent à peu fréquent). Utilisez des balises d’objet et des règles de cycle de vie pour exclure les petits objets à forte sollicitation pour lesquels les frais de surveillance dépasseraient les économies réalisées.

Utilisez ces modèles opérationnels pour réduire les dépenses S3 :

undefined

) pour identifier les modèles d’accès au niveau des préfixes/balises avant de créer des règles de cycle de vie.

Critères de décision :

Gestion des coûts d’Athena et de Redshift

Les coûts d’Athena sont proportionnels au volume de données analysées (bytes scanned). Appliquez des contrôles de groupe de travail (console ou

undefined

) pour mettre en œuvre des limites de données analysées par requête et des budgets mensuels par groupe de travail ; activez « Enforce workgroup settings » pour que les requêtes dépassant la limite de données par requête échouent au lieu de s’exécuter. Réduisez le volume de données analysées en convertissant les fichiers source en formats colonnaires compressés (Parquet/ORC), en partitionnant par date ou par colonnes de filtre courantes, en appliquant le predicate pushdown et en utilisant CTAS ou CREATE TABLE AS pour matérialiser des jeux de données optimisés. Utilisez la réutilisation des résultats de requêtes et l’isolation des charges de travail dans des groupes de travail distincts pour éviter les fuites de coûts entre équipes.

Les décisions de coût pour Redshift dépendent de la prévisibilité de la charge de travail et des choix de stockage. Pour une utilisation de calcul de data warehouse stable et prévisible, achetez des Nœuds Réservés (engagement d’un ou trois ans, options de paiement partiel/total initial) pour bénéficier de remises par rapport au modèle à la demande. Pour les charges de travail variables :

Points de comparaison :

Stratégies de coût pour Glue et EMR

AWS Glue fournit un ETL serverless avec plusieurs leviers de coût. Pour les tâches batch qui ne sont pas sensibles à la latence, utilisez l’exécution flexible de Glue (tâches Glue Flex) qui peut réduire les coûts jusqu’à environ 34 % par rapport à l’exécution standard de Glue. Configurez les paramètres des tâches Glue dans Glue Studio ou la CLI (

undefined

) pour sélectionner le type de worker et le nombre maximum de DPU, définissez un plafond de DPU maximum raisonnable pour empêcher l’auto-scaling illimité, et utilisez les signets de tâche (job bookmarks) pour éviter un retraitement complet. Pour les charges de travail interactives ou sensibles à la latence, choisissez les types de workers (Standard/G.1X/G.2X) et ajustez le parallélisme de manière responsable.

La réduction des coûts EMR repose sur l’utilisation d’Instances Spot pour les nœuds de tâches (task nodes) tout en conservant les nœuds maîtres (master) et principaux (core) en mode À la demande (configurez des flottes d’instances ou des groupes d’instances dans la console ou via

undefined

). Utilisez Spot uniquement pour les nœuds de tâches, sélectionnez la stratégie d’allocation optimisée pour la capacité (capacity-optimized), et définissez un prix d’enchère/maximum approprié si vous utilisez Spot avec enchères. Protégez l’état du cluster et la résilience des tâches en :

Critères de décision :

Capacité réservée et Savings Plans pour les services de données

La capacité réservée et les Savings Plans s’appliquent différemment selon les services de données. Pour les services basés sur EC2 (EMR, HBase autogéré, Hadoop personnalisé), utilisez les EC2 Savings Plans ou les Instances Réservées pour couvrir les dépenses de calcul ; sélectionnez des options régionales ou zonales en fonction des besoins de mobilité. Redshift prend en charge l’achat de nœuds réservés pour les clusters provisionnés afin de réduire les coûts horaires pour les charges de travail de data warehouse prévisibles. Les services serverless (Glue, Athena) n’ont pas de réservation de ressources ; optimisez plutôt par la planification des charges de travail et les changements de format de données.

Guide d’achat pratique :

Pièges courants et critères de décision

undefined

) et choisissez des types de workers appropriés pour garder des coûts prévisibles.

Problème pratique : Réduction des coûts de l’ETL nocturne d’Acme Analytics

Acme Analytics exécute un ETL nocturne et des analyses ad-hoc quotidiennes ; les dépenses cloud mensuelles ont grimpé en flèche en raison de l’augmentation du stockage S3 brut et des heures Redshift à la demande. L’entreprise a besoin d’une réduction de 35 % sans impacter les SLAs nocturnes.

  1. Exécutez S3 Storage Class Analysis et appliquez des règles de cycle de vie pour déplacer les fichiers bruts froids de plus de 90 jours vers Glacier Flexible Retrieval (planifiez des récupérations en masse/Standard).
  2. Convertissez les CSV bruts en Parquet partitionné et compressé et compactez les petits fichiers ; stockez les jeux de données optimisés sous des préfixes distincts pour Athena/Redshift Spectrum.
  3. Créez des groupes de travail (workgroups) Athena avec des limites de données analysées par requête et appliquez les paramètres des groupes de travail ; activez la réutilisation des résultats de requête et définissez un budget mensuel par groupe de travail.
  4. Migrez l’ETL par lots vers des tâches Glue Flex pour les transformations non urgentes, définissez des plafonds de DPU maximaux et planifiez-les pendant les heures creuses ; conservez une flotte Glue standard plus petite pour les tâches urgentes.
  5. Redimensionnez (Right-size) Redshift : achetez des Nœuds Réservés sur 1 an pour le calcul de base stable, déplacez les données historiques vers S3 et utilisez Spectrum pour les requêtes peu fréquentes, et n’activez la mise à l’échelle de la simultanéité (concurrency scaling) qu’avec une surveillance.

Justification : La stratégie combine l’optimisation du format des données et du cycle de vie (réduisant les coûts de stockage et d’analyse), l’exécution serverless à moindre coût pour les tâches flexibles (Glue Flex), la gouvernance des requêtes (groupes de travail Athena) et la capacité réservée pour le calcul soutenu afin de maximiser les remises tout en préservant la disponibilité et la performance.


Surveillance et dépannage des pipelines de données · Tous les domaines · Qualité

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet