ある小売企業では、顧客あたりの購入数が非常に少なく、多くの新規ユーザーに依存しています。カスタムレコメンダーのトレーニングとテストのためにデータを分割する場合、データサイエンティストは実際の使用状況を反映したテストセットをどのように作成すべきですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 各ユーザーについて、最新のインタラクションの10%を取得し、それらのユーザーごとの最新のインタラクションをテストセットとして使用します。.
これが解答である理由
このシナリオでは、新規ユーザーが多く、顧客あたりの購入数が少ないため、レコメンダーの評価には時間的要素を考慮した分割が重要です。各ユーザーの最新のインタラクションをテストセットとして使用することで、レコメンダーが将来の行動を予測する能力を評価できます。これは、実際の運用で新しいアイテムを推薦する状況を最もよくシミュレートします。 他の選択肢は適切ではありません。 すべてのインタラクションレコードをシャッフルして最後の10%をテストに使う場合、過去のインタラクションがテストセットに含まれる可能性があり、時間的順序が無視されます。 インタラクションが最も少ないユーザーの10%を選択すると、データが偏り、レコメンダーの全体的なパフォーマンスを正確に評価できません。 ユーザーの10%をランダムに選択し、それらのユーザーのすべてのインタラクションをテストに使う場合、テストセット内のインタラクションにも時間的順序が無視される問題が生じます。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要