ある企業が、さまざまなファイルタイプ(CSV、JSON、XLSX、Apache Parquet)が混在するS3フォルダを持っています。MLエンジニアはAWS Glue DataBrewを使用してデータを処理し、最終出力をS3に保存して、後でAWS Glueが利用できるようにする必要があります。これらの要件を満たすアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: ファイルをファイルタイプごとに個別のフォルダに分け、DataBrewで各フォルダを処理し、出力をApache Parquet形式で書き込みます。.
これが解答である理由
AWS Glue DataBrewは、単一のデータセット内で複数のファイルタイプを直接処理する機能がありません。そのため、異なるファイルタイプが混在するS3フォルダを直接入力として使用することはできません。ファイルをファイルタイプごとに個別のフォルダに分けることで、DataBrewは各フォルダを単一のデータセットとして認識し、処理できます。最終出力をApache Parquet形式で保存することは、分析や後続のAWS Glueジョブでの利用において、効率的なストレージと高速なクエリを可能にするベストプラクティスです。AWS Glue Parquet形式という特定の形式は存在せず、DataBrewは標準のApache Parquet形式で出力します。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要