Amazon DEA-C01: データ変換と処理 — 学習ガイド

こちらの一部です: Amazon Data Engineer Associate DEA-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

大規模処理のためのAmazon EMR

EMRは、カスタマイズ可能で大規模なビッグデータ処理(Spark、Hadoop、Presto、Flink)に最適なサービスです。クラスタレベルの制御、カスタムブートストラップアクション、または特殊なライブラリが必要な場合に使用されます。クラスタはCLIのaws emr create-clusterで作成し、--instance-groupsまたは--instance-fleetsのいずれかを選択します。インスタンスフリートは、柔軟なインスタンスタイプの組み合わせとスポット/オンデマンドの組み合わせを提供します。インスタンスグループは、よりシンプルで固定サイズのグループです。

考慮すべきEMRクラスタのパターン:

設定例:

Hadoopエコシステムコンポーネントに対する完全な制御、カスタムブートストラップスクリプト、または中間データのための永続的なHDFSが必要な場合はEMRを使用してください。それ以外の場合、Glueデータカタログと統合されたマネージドSpark ETLには、よりシンプルなGlue Sparkが適しています。

Glue DataBrewとビジュアルな変換

Glue DataBrewは、対話的に作業するデータアナリストやエンジニアを対象とした、データプロファイリング、クレンジング、変換のための視覚的なノーコード/ローコードツールです。S3またはGlueカタログからデータセットを作成し、コンソールで変換のレシピを構築し、サンプルでプレビューした後、ジョブを実行してレシピを大規模に適用します。DataBrewジョブはスケジュール実行するか、CLIのaws databrew start-job-run --name my-databrew-jobで実行できます。

DataBrewは、標準化、重複排除、型変換、組み込み関数による列レベルの変換といったデータ準備タスクに最適化されています。Glueカタログと統合され、出力はS3に書き込まれます。ビジネスユーザーがセルフサービスでのクリーニングや迅速なプロファイリングを必要とする場合はDataBrewを選択してください。重い変換ロジック、複雑な結合、または非常に大規模なデータセットには、Glue SparkまたはEMRが適しています。

ビジュアルベースとコードベースの変換の比較:

よくある落とし穴と判断基準

実践的な問題:ユースケースシナリオ

AcmeRetail社は、夜間のクリックストリームParquetファイルを統合された顧客アクティビティテーブルに処理しており、緊急でないバックフィル(履歴データ補填)のコストを低く抑えつつ、何ヶ月分ものデータを再処理することを避けるために増分処理を望んでいます。

  1. S3のパーティションレイアウト(year=/month=/day=)を使用し、Glueデータカタログにデータセットを登録します。
  2. スキーマの柔軟性のためにDynamicFrame.from_catalogを読み取り、マッピングを適用し、複雑な結合のためにDataFrameに変換し、パーティション化されたParquetをS3に書き戻すGlue Sparkジョブ(glueetl)を作成します。
  3. 夜間実行のためにGlueジョブブックマーク(job-bookmark-enable)を有効にし、新しいパーティションのみを処理します。JDBCによるエンリッチメントソースについては、処理済みの最大タイムスタンプを追跡するために、DynamoDBに永続化されたウォーターマーク列を実装します。
  4. 定期的な夜間実行にはExecutionClass=STANDARDを使用します。緊急でない履歴データの再処理には、--execution-class FLEXで実行をサブミットしてコストを節約します。
  5. CloudWatchメトリクスで監視し、ジョブの失敗に対してアラームを設定します。非常に大規模な処理やカスタムライブラリが必要な場合は、中間結果をS3に書き込み、自動終了するEMRの一時的なクラスタを検討します。

根拠: このアプローチは、スケーラブルな変換のためにGlueのマネージドSparkと半構造化入力のためのDynamicFrameを活用し、S3の増分処理にジョブブックマークを使用し、バックフィルのコストを削減するためにFLEXを使用することで、コスト、信頼性、運用上のシンプルさを維持します。


データカタログ化とメタデータ管理 · すべてのドメイン · データオーケストレーションとワークフロー管理

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能