ある小売企業は、日々の小売注文CSVファイルを単一のS3パスにロードし、Amazon Redshift Spectrumを使用して100列を超えるデータの一部をクエリしています。サードパーティのソースは、1日あたり30以上のCSVファイル(それぞれ50~70MB)を生成します。ユーザーは日次メトリクスを集計していますが、クエリのパフォーマンスが低下しています。最小限の開発作業でパフォーマンスの問題を解決するアクションの組み合わせはどれですか?(2つ選択)
解答を選択
オプションをタップして解答を確認してください。
正解: サードパーティアプリケーションを設定して、ファイルをカラムナー形式で生成するようにします。, S3バケット内の注文データを注文日でパーティション分割します。.
これが解答である理由
カラムナー形式(例:Parquet、ORC)は、Redshift Spectrumが列指向のクエリを効率的に実行できるようにし、必要な列のみを読み込むため、パフォーマンスが大幅に向上します。CSVは行指向形式であり、クエリ時に不要なデータをスキャンするため非効率です。注文日でデータをパーティション分割することで、Redshift Spectrumはクエリの対象となる特定の日付のデータのみをスキャンし、スキャンするデータ量を減らすことでクエリのパフォーマンスを向上させます。 複数のCSVファイルを1日あたり1つのファイルに結合しても、ファイル形式やパーティション分割によるパフォーマンス向上にはつながりません。JSON形式はカラムナー形式のようなクエリ効率を提供せず、Redshift Spectrumのパフォーマンス改善には寄与しません。JSONデータをRedshiftのSUPER型列にロードすることは、Redshift Spectrumの外部データクエリのパフォーマンス問題とは直接関係ありません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要