ある企業は、SAP HANA、SQL Server、MongoDB、Kafka、DynamoDB などのソースから、1日あたり約1TBのデータを抽出しています。一部のソースには、未定義または進化するスキーマがあります。ソリューションは、スキーマを検出し、ETL を実行し、データ作成から15分以内にデータを S3 にロードする必要があります。最小限の運用オーバーヘッドで必要な機能を提供するアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: AWS Glue を使用してスキーマを検出し、データを抽出、変換、S3 バケットにロードします。Apache Spark でパイプラインを作成します。.
これが解答である理由
AWS Glueは、スキーマの検出、ETLジョブの実行、およびS3へのデータロードをサポートするフルマネージドサービスであり、運用オーバーヘッドを最小限に抑えます。特に、未定義または進化するスキーマを持つデータソースに対応できるGlue Crawlerの機能は、この要件に最適です。Apache Sparkは、大規模なデータ処理と変換に適しており、Glue StudioやGlue DataBrewと統合してETLパイプラインを構築できます。Amazon EMRはマネージドサービスですが、Glueと比較してより多くの管理が必要になる場合があります。AWS Lambdaは、1TB/日のデータ量と15分以内のロード要件にはスケーラビリティと実行時間の制約から不向きです。Amazon Redshiftはデータウェアハウスであり、データの抽出とスキーマ検出の主要ツールとしては設計されていません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要