あるデータエンジニアが、.csvファイルと.jsonファイルの両方を含むS3バケット内のデータをカタログ化するためにAWS Glueクローラーを設定しました。クローラーは.jsonファイルを除外するように設定されていましたが、Athenaクエリを実行すると.jsonファイルがまだ処理されています。エンジニアは.csvファイルへのアクセスを変更せずにこれを修正する必要があり、クエリ時間を可能な限り短くしたいと考えています。最善の解決策は何ですか?
解答を選択
オプションをタップして解答を確認してください。
正解: .jsonファイルをS3バケット内の別のパスに移動します。.
これが解答である理由
AWS Glueクローラーが除外設定されていても、AthenaはGlue Data Catalogのテーブル定義に基づいてS3のデータを直接読み取ります。クローラーの除外設定は、カタログに含めるファイルを制御するものであり、AthenaがS3から読み取るファイルを直接制限するものではありません。 .jsonファイルをS3バケット内の別のパスに移動することで、Glueクローラーがそのパスをスキャン対象から除外するように設定でき、結果としてAthenaがそのファイルを参照しなくなります。これにより、.csvファイルへのアクセスを変更することなく、クエリ時間を短縮できます。 Athenaコンソールで除外設定を行うオプションはありません。S3バケットポリシーでアクセスをブロックすると、.jsonファイルが全く利用できなくなり、将来的な利用の可能性を排除してしまいます。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要