ある企業が、過去20年間の月間売上実績(1~5)を評価する分類器を構築しています。データセットには、月、販売地域、地域の総売上、店舗数が含まれています。毎年2か月間は、一貫して高い総売上を示しています(季節的なピーク)。カテゴリカル特徴量をワンホットエンコーディングし、トレーニングした後、検証セットでのモデルの精度は期待よりも悪くなりました。検証精度を最も改善する可能性が高いステップはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 月と販売地域の分布を保持する層化されたトレーニング/検証分割を使用する。.
これが解答である理由
このシナリオでは、季節性(特定の月に高い売上)と地域性(販売地域)がデータに内在する重要なパターンです。層化サンプリングは、これらの重要なカテゴリカル特徴量(月と販売地域)の分布がトレーニングセットと検証セットの両方で均等に表現されるようにします。これにより、モデルがこれらのパターンを効果的に学習し、未知のデータに対してより正確に一般化できるようになります。 外れ値の削除は、常に精度を改善するとは限りません。特に、外れ値が実際のビジネスイベントを表している場合、それらを削除するとモデルの汎化能力が損なわれる可能性があります。総売上の正規化は、モデルの学習を助ける一般的な前処理ステップですが、検証精度が低い根本的な原因がデータの分割方法にある場合、それだけでは不十分です。地域ごとの正規化も同様に、データの分割方法の問題を解決しません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要