Amazon DEA-C01: データ品質、検証、可観測性 — 学習ガイド

こちらの一部です: Amazon Data Engineer Associate DEA-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

このドメインは、データの正確性を保証し、異常を検出し、パイプラインの信頼性を維持するために使用されるエンドツーエンドのプラクティスとAWSサービスを対象としています。強力な検証と可観測性により、下流工程での不具合を減らし、SLAを遵守し、安全な再処理を可能にします。データエンジニアは、Glue Data Quality、検証フレームワーク、CloudWatchの異常検知、DLQ、べき等な設計を組み合わせて、堅牢なパイプラインを構築する必要があります。

AWS Glue Data Qualityのルールと評価

Glue Data Qualityは、Data Quality Definition Language (DQDL) のルールセットを使用して、データセットに関するアサーション(行数、NULLのしきい値、一意性、カスタムSQLチェックなど)を定義します。ルールセットは、コンソールまたはCLI(例:aws glue create-data-quality-ruleset --name MyRuleset --rules file://dqdl.json)で作成します。ルールセットは、Glue ETLジョブにアタッチするか、StartDataQualityRuleRecommendationRun / StartDataQualityRulesetEvaluationRun APIを通じて独立して実行し、S3、カタログテーブル、またはGlue DynamicFramesに保存されたデータセットを評価できます。

主要な設定詳細と決定基準:

Glue Data Qualityと外部フレームワークの使い分け:

パイプラインにおけるデータ検証パターン

検証は、イングレス、変換、シンクといった複数のタッチポイントで行われます。一般的なパターンは次のとおりです。

検証オプションの比較:

ストリーミングの場合、処理中のレコードを検証し、失敗した場合は破棄するのではなく、SQS DLQ(AWS CLIまたはコンソールでmaxReceiveCountを持つRedrivePolicyを設定)にプッシュします。バッチの場合、検証レポートのアーティファクトを生成し、ポリシーに基づいて出力を失敗させるか隔離します。

異常検知とデータドリフトのモニタリング

オペレーショナルメトリクス(処理済みレコード数、エラー率、ジョブ実行時間)には、CloudWatchの異常検知を使用します。CLIで aws cloudwatch put-anomaly-detector --namespace "Glue" --metric-name "JobRunTime" --statistic "Average" --single-metric-anomaly-detector '{"MetricName":"JobRunTime","Namespace":"Glue","Stat":"Average","Dimensions":[...]}' を使用してディテクターを作成し、その異常検知帯を参照するCloudWatchアラームを作成します。データレベルのドリフト(分布の変化、NULL率の変動)については、Glue DataBrewのプロファイルジョブ(aws databrew create-profile-job)をスケジュール実行して統計、ヒストグラム、分位数を計算し、そのプロファイルをベースラインとしてS3に保存します。

異常検知アラームと静的しきい値アラームの決定基準:

自動ドリフト検出の場合:

SLA管理とパイプラインの信頼性

SLA管理は、可観測性を修復と信頼性エンジニアリングに結びつけます。すべてのパイプラインに、スループット(レコード/秒)、レイテンシー(取り込み→シンク)、エラーレート、ジョブ/ランタイム、ダウンストリームのカウントといったベースラインメトリクスを実装してください。Glueジョブ(ジョブ実行メトリクス)、Kinesis/Kafkaのコンシューマーラグ、およびPutMetricData経由のカスタムアプリケーションメトリクスにはCloudWatch Metricsを使用します。

信頼性パターンと設定の詳細:

リトライ vs フェイルファストの判断基準:

一般的な落とし穴と判断基準

実践的な問題:ユースケースシナリオ

Streamline Retail社は、夜間のETL後に頻繁にダウンストリームのレポートエラーに直面しています。具体的には、時折発生するスキーマの急な変化、サイレントなルール違反、失敗した実行を再処理した際の重複注文などです。

  1. スキーマ、nullのしきい値、order_idの一意性について、Glue Data Qualityルール(DQDL)を実装します。失敗時のアクションをジョブをFAILさせるように設定し、評価アーティファクトをS3に発行します。
  2. 複雑なビジネスチェック(テーブル間の注文の整合性など)のために、Glue Python ShellステップにGreat Expectationsを追加します。expectationをS3に保存し、パイプラインでチェックポイントを実行します。
  3. DataBrewのプロファイルジョブをスケジュールして、毎日のベースライン(カーディナリティ、null率、パーセンタイル)をキャプチャし、自動比較を使用してドリフトを検出します。
  4. ストリーミング注文イベントに対して、適切なRedrivePolicyを持つSQS DLQを設定し、DLQメッセージをべき等に(order_idを重複排除キーとして使用して)処理するためのリプレイジョブを作成します。
  5. ジョブのランタイムとエラーカウントに対してCloudWatchの異常検知器を実装します。異常ベースのアラームをSNSにアタッチして、オンコールエスカレーションを行います。

AWSのベストプラクティスの論理的根拠:迅速な統合のためのネイティブなGlueの品質管理、表現力のためのGreat Expectations、ベースライン統計のためのDataBrew、そして適応的なモニタリングのためのCloudWatch異常検知器を組み合わせます。DLQとべき等なシンクは、SLAを維持しながら安全なリトライと再処理のループを完成させます。


データワークロードのコスト最適化 · すべてのドメイン

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能