Amazon DEA-C01: データストレージとレイクアーキテクチャ — 学習ガイド

こちらの一部です: Amazon Data Engineer Associate DEA-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

このドメインでは、AWSのストレージサービスとデータベースエンジンが、現代のデータプラットフォームにおける大規模なデータ取り込み、耐久性のあるアーカイブ、クエリパフォーマンス、そして安全なガバナンスをどのようにサポートするかを扱います。データエンジニアは、S3、Lake Formation、Redshift、DynamoDBなどのサービスをパイプラインに統合する際に、コスト、アクセスレイテンシー、耐久性、そしてきめ細かなアクセス制御のバランスを取る必要があります。ストレージクラスのトレードオフ、ライフサイクルの自動化、マネージドストレージとローカルストレージの比較、パーティショニングパターンを理解することで、本番環境でのパフォーマンスやコストの予期せぬ問題を回避できます。

Amazon S3ストレージクラスとライフサイクルポリシー

S3は、コストとアクセスパターンを最適化するために、複数のストレージクラスとライフサイクルコントロールを提供します。ストレージクラスは、アップロード時に設定するか(コンソールまたはCLI:

undefined

)、バケットのライフサイクルルール(

undefined

)を使用して設定します。Intelligent-Tieringは、オブジェクトを頻繁アクセス階層と低頻度アクセス階層の間で自動的に移動させ、少額のモニタリング料金がかかります。アクセスパターンが不明または変化する場合に有効化します。ライフサイクルルールを使用して、オブジェクトを長期保存のためにGLACIERやDEEP_ARCHIVEに移行したり、古いバージョンを失効/削除したりします。

決定基準とトレードオフ:

運用上の注意点:

undefined

)とオブジェクトロック(

undefined

)を有効にします。MFA Deleteの有効化には、特別なCLI操作とMFAを持つバケット所有者アカウントが必要です。

S3とLake Formationによるデータレイク設計

S3を中央オブジェクトストアとして、Lake Formationを中央集権的なアクセス制御とカタログ作成のために使用してデータレイクを設計します。S3のロケーションをLake Formationのリソースとして登録し、AWS Glueデータカタログをセットアップし、データベース/テーブルに対してLake Formationの許可を使用します(

undefined

)。Lake Formationは、LF-tagとデータフィルターをGlue/Athenaクエリに適用することで、列レベル、行レベル(フィルター式)、セルレベルのマスキングといった、きめ細かな制御を強制できます。

主要な設定とガバナンスのパターン:

意思決定のポイント:

Amazon Redshiftのアーキテクチャとストレージ

Redshiftは、RA3ノードではコンピューティングとマネージドストレージを分離しますが、DS2ノードではローカルSSDにバックアップされたストレージを使用します。RA3ノードはRedshift Managed Storage (RMS)を使用し、データはクラスターによって管理されるAmazon S3上に存在します。スケーラブルなストレージと一貫したクエリパフォーマンスが必要で、コンピューティングに個別課金したい場合はRA3を選択します。DS2ノードはインスタンスローカルディスクにデータを保存するため、データが増加する際には慎重なサイジングとリサイズが必要です。

設定と運用の詳細:

undefined

undefined

)は、COPYコマンドでcredentials 'aws_iam_role=arn:...'として参照されます。

比較(RA3 vs DS2):

DynamoDBと目的別データベースの選択

DynamoDBは、1桁ミリ秒台のレイテンシーが要求される、大規模なキーバリューおよびドキュメントワークロードに選択します。テーブル設計は、パーティションキー(およびオプションのソートキー)の選択にかかっています。ホットパーティションを避けるために、カーディナリティが高く、十分に分散されたキーを使用します。シーケンシャルキーやタイムスタンプベースのキーには、ランダムなプレフィックス(シャーディング)を実装するか、UUIDを使用して書き込みを分散させます。プロビジョニングを避けるためにオンデマンドキャパシティを使用しますが、予測可能なワークロードにはオートスケーリング付きのプロビジョンドキャパシティを検討し、ホットパーティションでアダプティブキャパシティを活用します。

実践的な設定に関する注意点:

undefined

エンジン選択の決定基準:

一般的な落とし穴と決定基準

実践的な問題:ユースケースシナリオ

Acme Media社は、50TBの生ビデオデータを取り込み、変換されたメタデータへのクエリアクセスをアナリストに提供し、異なる事業部門に対して行レベルおよび列レベルのアクセスを強制しながら、ストレージコストを最小限に抑える必要があります。

  1. マルチパートアップロードを使用して生のビデオをS3に取り込み、取り込み日とデータセットでオブジェクトにタグを付け、初期の不明なアクセスパターンにはIntelligent-Tieringを使用します。
  2. 設定可能な保持期間後にメディアをGLACIERまたはDEEP_ARCHIVEに移行するライフサイクルルールを設定します(Standard-IAを検討する場合は、30日以上の期間と整合性を確認します)。
  3. S3のロケーションをLake Formationに登録し、Glueクローラーを構築してデータカタログを作成し、事業部門にLFタグベースの行レベルおよび列レベルの権限を付与します。
  4. 分析用にキュレートされたメタデータをRedshift RA3に保存します。S3からのCOPYのためにクラスターにIAMロールをアタッチし、メンテナンスウィンドウでVACUUM/ANALYZE操作を使用します。
  5. ビデオマニフェストの高スループットなルックアップテーブルには、ハッシュ化されたUUIDキーを持つDynamoDBを使用し、トラフィックの急増に対応するためにオンデマンドキャパシティを有効にします。

論理的根拠:このアプローチは、Glacierクラスでコールドストレージのコストを分離し、不明なパターンにはIntelligent-Tieringを使用し、分析エンジン全体で安全かつきめ細かなアクセス制御を行うためにLake Formationを適用し、スケーラブルな分析ストレージとしてRA3を選択する一方で、DynamoDBが低レイテンシーの運用ルックアップを処理します。


データの取り込みと収集 · すべてのドメイン · データカタログ化とメタデータ管理

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能