ある企業がトレーニングデータをS3のネストされたJSONファイルに保存しており、XGBoostトレーニングのために表形式を必要としています。これらのJSONファイルを表形式データに変換するために、運用上のオーバーヘッドが最も少ないアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: Relationalize変換を使用してファイルを変換するAWS Glue PySparkジョブを作成します。.
これが解答である理由
AWS GlueのRelationalize変換は、ネストされたJSONデータをXGBoostが利用できるフラットな表形式に効率的に変換するために設計されています。これは運用上のオーバーヘッドが最も少ないアプローチです。Glue PySparkジョブはサーバーレスで実行され、スケーリングとインフラストラクチャ管理を自動的に処理します。 カスタムScalaコードを記述しEMR Serverlessで実行する方法は、より多くの開発と管理のオーバーヘッドを伴います。Lambda関数は、大量のデータ変換には適しておらず、実行時間とメモリの制限があります。Athenaのflatten関数はネストされた構造をフラット化できますが、XGBoostのトレーニングに必要な厳密な表形式への変換には追加の処理が必要になる場合があります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要