ETLジョブは、ユーザーがS3バケットに配置する日次の.csvファイルを処理する必要があります。各ファイルは100 MB未満です。最も費用対効果の高い実装はどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: AWS Glue Python shellジョブを記述します。pandasを使用してデータを変換します。.
これが解答である理由
正解は、AWS Glue Python shellジョブを記述し、pandasを使用してデータを変換することです。これは、日次で100MB未満の小さなCSVファイルを処理するのに最も費用対効果が高いからです。Python shellジョブは、Sparkクラスターをプロビジョニングする必要がないため、PySparkジョブやEMRクラスターよりもコストを抑えられます。pandasライブラリは、この規模のデータ処理に十分なパフォーマンスを発揮します。 カスタムPythonアプリケーションをEKSでホストする方法は、インフラストラクチャの管理オーバーヘッドとコストが高くなります。PySpark ETLスクリプトをEMRクラスターでホストする方法、またはAWS Glue PySparkジョブを使用する方法は、Sparkクラスターの起動と維持にコストがかかり、この小さなデータ量に対しては過剰なリソースとなります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要