Si dispone di un dataset tabellare con 10.000 righe e 1.020 feature. Non ci sono valori mancanti, poche duplicazioni e circa 200 coppie di feature con correlazione > 0,9. Le medie delle feature sono simili alle mediane. Quale approccio di feature engineering si dovrebbe applicare durante l'addestramento di un modello in SageMaker?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Ridurre la dimensionalità applicando l'analisi delle componenti principali (PCA)..
Perché questa è la risposta
La PCA (Principal Component Analysis) è la scelta migliore perché il dataset ha un numero elevato di feature (1.020) e molte di esse sono altamente correlate ( 0,9). La PCA è una tecnica di riduzione della dimensionalità che trasforma le feature originali in un nuovo set di feature non correlate (componenti principali), preservando la maggior parte della varianza dei dati. Questo può migliorare le prestazioni del modello e ridurre il tempo di addestramento. Eliminare le feature con bassi punteggi di correlazione non è appropriato in questo contesto, poiché il problema principale è l'elevata correlazione tra le feature, non la loro scarsa correlazione. Il rilevamento delle anomalie con Random Cut Forest non è una tecnica di feature engineering per questo scenario. Concatenare le feature altamente correlate non ridurrebbe la dimensionalità né risolverebbe il problema della multicollinearità.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta