Une entreprise financière doit prévoir le prix d'une matière première en utilisant des données historiques quotidiennes. Le data scientist doit entraîner des modèles sur 80 % de l'ensemble de données et valider sur les 20 % restants. Comment les données doivent-elles être divisées afin que les comparaisons de modèles soient valides pour la prévision de séries chronologiques ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Choisir une date limite de sorte que 80 % des points de données se produisent avant cette date ; utiliser ces points antérieurs pour l'entraînement et les points ultérieurs restants pour la validation..
Pourquoi c'est la réponse
Pour les séries chronologiques, l'ordre temporel des données est crucial. La bonne approche consiste à diviser les données de manière séquentielle, en utilisant les observations passées pour prédire l'avenir. En choisissant une date limite et en utilisant les 80 % de données antérieures pour l'entraînement et les 20 % de données ultérieures pour la validation, on simule un scénario de prévision réaliste où le modèle est entraîné sur des informations connues jusqu'à un certain point et testé sur des informations futures inconnues. L'option qui utilise 80 % des données après une date limite pour l'entraînement et les 20 % antérieures pour la validation est incorrecte car elle entraînerait le modèle sur des données "futures" pour prédire le "passé", ce qui n'est pas pertinent pour la prévision. L'échantillonnage stratifié ou aléatoire est inapproprié pour les séries chronologiques car il brise les dépendances temporelles, rendant les comparaisons de modèles invalides pour la prévision.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise