Utilizzando SageMaker Data Wrangler, un ingegnere rileva una feature categorica testuale con migliaia di valori leggermente diversi causati da errori di battitura. Quale metodo di codifica dovrebbe essere utilizzato affinché la feature elaborata possa essere usata per la classificazione?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare la codifica per similarità per raggruppare e rappresentare categorie con ortografia simile..
Perché questa è la risposta
La codifica per similarità (similarity encoding) è la scelta migliore perché è specificamente progettata per gestire valori categorici testuali con lievi variazioni o errori di battitura. Questo metodo raggruppa valori simili, riducendo la cardinalità della feature e migliorando la qualità dei dati per i modelli di machine learning. La codifica ordinale assegnerebbe un ordine arbitrario a valori che non ne hanno uno intrinseco, e non risolverebbe il problema degli errori di battitura. La codifica one-hot creerebbe migliaia di nuove colonne, rendendo il dataset sparso e computazionalmente inefficiente, senza correggere gli errori. La codifica target è utile per incorporare informazioni sul target, ma non raggruppa valori simili basati sull'ortografia per risolvere il problema degli errori di battitura.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta