Amazon Athenaのクエリを高速化するために、データエンジニアは、すべての入力ファイルが非圧縮の.csvファイルであり、ほとんどのクエリが単一の列を選択していることを発見しました。Athenaのクエリパフォーマンスを最も向上させる変更はどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: データ形式を.csvからApache Parquetに変更します。Snappy圧縮を適用します。.
これが解答である理由
正解は、データ形式を.csvからApache Parquetに変更し、Snappy圧縮を適用することです。Parquetは列指向のデータ形式であり、特定の列を選択するクエリのパフォーマンスを大幅に向上させます。これは、クエリが必要な列のデータのみを読み込むためです。Snappyは、高速な圧縮と解凍を提供する圧縮アルゴリズムであり、クエリ実行時のI/Oを削減し、パフォーマンスをさらに向上させます。 .csvファイルをJSON形式に変換しても、列指向の利点が得られないため、パフォーマンスは向上しません。既存の.csvファイルにSnappy圧縮を適用しても、データ形式が列指向ではないため、大幅な改善は見込めません。gzip圧縮は高い圧縮率を提供しますが、Snappyよりも解凍に時間がかかるため、クエリパフォーマンスの観点からはSnappyがより適しています。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要