分析のために時系列トランザクションデータをBigQueryにコピーするパイプラインが必要です。データセットの初期サイズは1.5 PBで、1日あたり3 TB増加します。数千のトランザクションが新しいステータスで1時間ごとに更新されます。データは高度に構造化されており、MLに使用されます。パフォーマンスと使いやすさを最大化するために、どの2つの戦略を採用しますか?
解答を選択
オプションをタップして解答を確認してください。
正解: 可能な限りデータを非正規化する。, ステータス更新が更新されるのではなく、BigQueryに追加されるデータパイプラインを開発する。.
これが解答である理由
BigQueryはOLAP(オンライン分析処理)データベースであり、非正規化されたデータ構造はクエリパフォーマンスを最大化します。結合(JOIN)はリソースを消費するため、可能な限り非正規化することで大規模なデータセットの分析が効率的になります。また、BigQueryは更新(UPDATE)操作よりも追加(APPEND)操作に最適化されています。既存の行を更新する代わりに、新しいステータスを持つトランザクションを新しい行として追加することで、書き込みパフォーマンスが向上し、履歴データの追跡も容易になります。データの構造を維持することは、結合を多用することになり、パフォーマンスが低下します。BigQuery UPDATEは、大規模なデータセットではコストとパフォーマンスの観点から非効率的です。Cloud Storageの外部データソースは柔軟性がありますが、BigQueryのネイティブテーブルと比較してクエリパフォーマンスが劣る場合があります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要