あるデータサイエンティストが、S3にJSONとして保存されているブログ投稿のタグを推奨するために、SageMaker Neural Topic Model (NTM) を使用しました。このモデルは、「a」、「an」、「the」のようなストップワードや、時には稀だが有効な単語を提案します。チームは稀な単語は保持したいが、ストップワードが推奨されないようにしたいと考えています。データサイエンティストは何をすべきですか?
解答を選択
オプションをタップして解答を確認してください。
正解: scikit-learnのCountVectorizerを使用してブログテキストからストップワードを削除し、S3のデータをベクトル化された結果に置き換えます。.
これが解答である理由
このシナリオでは、ストップワードを除外し、ブログ投稿のタグ付けにSageMaker Neural Topic Model (NTM) を使用したいと考えています。scikit-learnのCountVectorizerは、テキストデータからストップワードを削除し、単語の出現回数を数えることでテキストを数値ベクトルに変換する一般的な前処理ツールです。これにより、NTMがより意味のあるトピックを抽出できるようになります。 他の選択肢が不適切な理由は次のとおりです。 Amazon Comprehendのエンティティ認識は、固有表現(人名、地名など)を識別するものであり、ストップワードの削除には適していません。 SageMaker組み込みのPCAアルゴリズムは、次元削減に使用されますが、テキストデータからストップワードを削除するものではありません。 SageMaker組み込みのObject Detectionアルゴリズムは画像内のオブジェクトを検出するためのものであり、テキストのトピックモデリングには全く関係ありません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要