AmazonAmazon Data Engineer Associate DEA-C01 Certification
·JA
·更新日 2 Aug 2026
あるゲーム会社は、Amazon Kinesis Data Streams を使用してクリックストリームイベントを収集し、Kinesis Data Firehose を使用して JSON ファイルを Amazon S3 に配信しています。データサイエンティストは、Amazon Athena で最新のデータをクエリしています。同社は、既存のデータパイプラインを再構築することなく、Athena のクエリコストを削減したいと考えています。要件を満たしながら管理作業を最小限に抑えるオプションはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: Firehose を設定して Apache Parquet を出力し、YYYYMMDD のようなカスタム S3 オブジェクトプレフィックスと大きなバッファサイズを設定します。履歴データについては、AWS Glue ETL ジョブを実行して小さな JSON ファイルを YYYYMMDD プレフィックスを持つより大きな Parquet ファイルに結合し、ALTER TABLE ADD PARTITION を実行して既存の Athena テーブルを更新します。.
これが解答である理由
このオプションは、Firehose でParquet形式とパーティション(YYYYMMDDプレフィックス)を設定することで、Athenaのクエリコストを削減し、パフォーマンスを向上させます。Parquetは列指向ストレージであり、JSONよりもクエリ効率が高く、データ量も削減できます。大きなバッファサイズはS3に書き込まれるファイル数を減らし、Athenaのスキャン量を最小限に抑えます。既存のJSONデータはGlue ETLジョブでParquetに変換し、パーティションを追加することで、過去のデータも最適化できます。これにより、管理作業を最小限に抑えつつ、コスト削減とパフォーマンス向上の両方を実現できます。
他の選択肢は、EMRクラスターの管理、Apache Flinkの導入、Lambdaによる変換など、より複雑な管理オーバーヘッドや追加コストが発生する可能性があります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する →
カード不要