ある会社で、Amazon S3バケットに保存されているCSVファイルの量が大幅に増加しました。データ変換スクリプトとクエリの実行速度が大幅に低下しています。MLエンジニアは、運用上のオーバーヘッドを最小限に抑えつつ、クエリパフォーマンスのためにデータを最適化するソリューションを実装する必要があります。この要件を満たすオプションはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: AWS Glueの抽出、変換、ロード (ETL) ジョブを設定して、.csvファイルをApache Parquet形式に変換します。.
これが解答である理由
正解は、AWS GlueのETLジョブを設定して、.csvファイルをApache Parquet形式に変換することです。Parquetは列指向のストレージ形式であり、クエリのパフォーマンスを大幅に向上させ、ストレージコストを削減します。これは、必要な列のみを読み込むため、データ変換スクリプトとクエリの実行速度を向上させます。AWS Glueは、サーバーレスのETLサービスであるため、運用上のオーバーヘッドを最小限に抑えながら、この変換を効率的に実行できます。 他の選択肢は、この要件を満たしません。 Lambda関数でファイルを小さなオブジェクトに分割しても、クエリのパフォーマンスは根本的に改善されません。 文字列型の列を削除することは、データが失われる可能性があり、常に適切な解決策ではありません。 Amazon EMRクラスターは、大規模なデータ処理には適していますが、運用上のオーバーヘッドが大きくなる可能性があります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要