ある企業が、データレイクとしてAmazon S3、データウェアハウスとしてAmazon Redshiftを使用して分析プラットフォームを構築しています。この企業は、S3データをクエリするためにAmazon Redshift Spectrumを使用する予定です。最も高速なクエリパフォーマンスを実現するには、どのアクションを実行すればよいですか?(2つ選択してください。)
解答を選択
オプションをタップして解答を確認してください。
正解: カラムナストレージファイル形式を使用する。, 最も一般的なクエリ述語に基づいてデータをパーティション分割する。.
これが解答である理由
カラムナストレージファイル形式(例:Parquet、ORC)を使用すると、クエリが必要な列のみを読み込むため、I/Oが削減され、クエリパフォーマンスが向上します。行指向形式(CSVなど)では、クエリが不要な列も読み込むため、効率が低下します。 最も一般的なクエリ述語に基づいてデータをパーティション分割すると、Redshift Spectrumは関連するデータのみをスキャンするため、スキャンするデータ量が大幅に削減され、クエリの高速化につながります。 gzip圧縮を使用してファイルを1 GBから5 GBに圧縮することは、Redshift Spectrumの並列処理を最適化するために推奨されるプラクティスですが、カラムナ形式やパーティショニングほど直接的なパフォーマンス向上には寄与しません。ファイルを10 KB未満に分割すると、ファイル数が増えすぎてオーバーヘッドが発生し、パフォーマンスが低下します。分割できないファイル形式は、Redshift Spectrumの並列処理能力を阻害するため、パフォーマンスが低下します。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要