データセットをトレーニングセットと検証セットにランダムに分割して、鳥の分類モデルを構築しました。トレーニング精度は非常に高いですが、モデルは検証セットでうまく機能しません。元のデータセットが不均衡であることがわかりました。検証パフォーマンスを向上させるにはどうすればよいですか?
解答を選択
オプションをタップして解答を確認してください。
正解: トレーニングと検証の分割を作成するときに、層化抽出を使用します。.
これが解答である理由
データセットが不均衡な場合、ランダムな分割ではトレーニングセットと検証セットのクラス分布が大きく異なる可能性があり、モデルが少数派クラスを学習しにくくなります。層化抽出(Stratified sampling)は、各クラスの比率をトレーニングセットと検証セットで同じになるように分割するため、両方のセットが元のデータセットのクラス分布を代表するようになります。これにより、モデルはより汎用的な学習を行い、検証セットでのパフォーマンスが向上します。 多数派クラスのデータをさらに収集しても不均衡は解消されず、少数派クラスのデータが不足している問題は解決しません。トレーニングデータのより小さなランダムなサブセットでトレーニングすると、利用可能な情報が減少し、モデルの性能がさらに低下する可能性があります。系統的サンプリング(Systematic sampling)は、データが特定の順序で並んでいる場合にバイアスを導入する可能性があり、不均衡なデータセットの問題を解決するのには適していません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要