ある ML エンジニアが、大規模なバッチ変換とモデルトレーニング、および推論と分析のためのニアリアルタイムの低レイテンシーなクエリという 2 つのワークロードに Amazon Athena を使用するパイプラインを構築する必要があります。バッチ処理とニアリアルタイム処理の両方で最も低いレイテンシーを実現するファイル形式はどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: Apache Parquet.
これが解答である理由
Apache Parquetは、列指向のデータストレージ形式であり、大規模なデータセットの分析クエリにおいて高いパフォーマンスを発揮します。列指向形式は、特定の列のデータのみを読み込むため、クエリのI/Oを削減し、特にAmazon Athenaのようなサービスでのバッチ処理やニアリアルタイムクエリで低レイテンシーを実現します。 CSVは行指向形式であり、すべての列を読み込む必要があるため、分析クエリではParquetよりも効率が劣ります。Nested JSONとDeserialized JSONは、構造化されていない、または半構造化されたデータに適していますが、クエリ時のパフォーマンスはParquetに比べて低く、特に大規模なデータセットではレイテンシーが増加します。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要