AmazonAmazon Machine Learning Specialty MLS-C01
·JA
·更新日 26 Jul 2026
編集者は、クエリされた単語がドキュメントコーパス内で最も重要かつ代表的である記事を返す検索ツールを必要としています。初期のツールは一般的な単語の一致を返し、手動でのフィルタリングが必要です。クエリされた単語が最も重要である記事をツールが強調表示するように、ドキュメントごとの単語の重要度と頻度をキャプチャするソリューションはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 記事内の各単語の単語頻度(記事の長さで重み付け)とコーパス全体の逆文書頻度を計算し、それらを組み合わせて(例えば、乗算して)最終的な関連性スコアを形成し、クエリされた単語に対してスコアが高い記事を返します。.
これが解答である理由
正解は、TF-IDF(Term Frequency-Inverse Document Frequency)の計算を説明しています。TF-IDFは、単語がドキュメント内でどれだけ頻繁に出現するか(単語頻度、TF)と、その単語がコーパス全体でどれだけ一般的でないか(逆文書頻度、IDF)を組み合わせることで、ドキュメントにおける単語の重要度を効果的に測定します。これにより、一般的な単語(「the」や「a」など)の重要度を下げ、特定のドキュメントに固有の単語の重要度を上げることができます。
LDAはトピックを抽出しますが、個々の単語の重要度を直接測定するものではありません。単語埋め込みは単語の意味的類似性を捉えますが、ドキュメント内での単語の重要度を直接スコアリングするものではありません。生の単語頻度だけでは、一般的な単語が不当に高いスコアを得てしまい、真に重要な単語を特定できません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する →
カード不要