Un dataset ha una colonna con il 30% di valori mancanti. Si ritiene che altre colonne possano aiutare a ricostruire le voci mancanti preservando l'integrità del dataset. Quale metodo di imputazione si dovrebbe usare?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare l'imputazione multipla per stimare e sostituire i valori mancanti..
Perché questa è la risposta
L'imputazione multipla (Multiple Imputation, MI) è il metodo più appropriato perché stima i valori mancanti più volte, creando diversi dataset completi. Questo approccio tiene conto dell'incertezza associata all'imputazione, fornendo stime più robuste e accurate, specialmente quando si ritiene che altre colonne possano aiutare a prevedere i valori mancanti. L'eliminazione listwise (eliminare tutti i record con valori mancanti) ridurrebbe significativamente la dimensione del dataset (30% di dati mancanti), portando a una perdita di informazioni e a una riduzione della potenza statistica. Riportare l'ultimo valore osservato (Last Observation Carried Forward, LOCF) è una tecnica semplice ma può introdurre bias, specialmente se i dati non sono serie temporali o se la natura dei dati non giustifica tale assunzione. Sostituire i valori mancanti con la media della colonna è un'imputazione semplice che non considera le relazioni tra le colonne e può distorcere la distribuzione dei dati e sottostimare la varianza.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta