Cloud Pub/Sub から Dataflow を介して BigQuery にストリーミングされる IoT データに、プレビューで約 2% の破損したレコードが含まれています。破損したデータをフィルタリングするために Cloud Dataflow パイプラインをどのように変更すべきですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 破損した要素を破棄するために Cloud Dataflow に ParDo 変換を追加します。.
これが解答である理由
Cloud Dataflow パイプラインで破損したレコードをフィルタリングするには、ParDo 変換を追加するのが最も直接的で効率的な方法です。ParDo は、各要素を個別に処理し、条件に基づいて要素をフィルタリング(破棄)するのに適しています。この場合、破損をチェックするロジックを ParDo 内に実装し、破損した要素は出力しないようにします。 SideInput は、各要素を処理する際に参照する追加データを提供しますが、要素自体をフィルタリングする主要なメカニズムではありません。Partition 変換は、要素を複数の出力コレクションに分割しますが、通常は有効なデータと無効なデータを分離するために使用され、無効なデータを破棄する直接的な方法ではありません。GroupByKey は、キーに基づいて要素をグループ化するためのもので、フィルタリングには適していません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要