Si dispone di un dataset tabulare con 150 feature correlate che hanno intervalli numerici diversi ed è necessario ridurre la dimensionalità con un impatto minimo sulle prestazioni del modello prima di addestrare un modello di regressione. Quale approccio di pre-elaborazione soddisfa questo obiettivo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Aprire i dati in SageMaker Data Wrangler, scalare le feature con uno scaler Min-Max, quindi applicare il PCA integrato di SageMaker ai dati scalati..
Perché questa è la risposta
L'opzione corretta è la migliore perché la PCA (Principal Component Analysis) è sensibile alla scala delle feature. Scalare le feature, ad esempio con un Min-Max Scaler, assicura che nessuna feature domini la varianza a causa del suo intervallo numerico maggiore, permettendo alla PCA di identificare i componenti principali in modo più efficace e rappresentativo. SageMaker Data Wrangler semplifica questo processo di pre-elaborazione. Le altre opzioni sono meno efficaci: Applicare la PCA direttamente ai dati raw senza scalatura può portare a risultati distorti, poiché le feature con intervalli più ampi avranno un peso sproporzionato. Rimuovere le feature più o meno correlate prima della PCA non è l'approccio ottimale per la riduzione della dimensionalità con PCA. La PCA stessa è progettata per gestire le correlazioni e trovare le direzioni di massima varianza. Inoltre, l'uso di uno Standard Scaler o Min-Max Scaler è meno cruciale della scalatura stessa, ma la rimozione arbitraria di feature può far perdere informazioni utili.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta