Un ingegnere ML sta addestrando un modello di regressione logistica per prevedere l'abbandono degli abbonamenti. Il dataset include due feature stringa categoriche: location (3 categorie distinte) e job_seniority_level (più di 10 categorie distinte). Come dovrebbero essere pre-elaborate queste feature per il modello?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Usare la codifica one-hot per location. Usare la codifica ordinale per job_seniority_level..
Perché questa è la risposta
La codifica one-hot è appropriata per 'location' (3 categorie distinte) perché non c'è un ordine intrinseco tra le categorie e previene che il modello interpreti un ordine inesistente. La codifica ordinale è adatta per 'jobsenioritylevel' (più di 10 categorie distinte) poiché esiste un ordine gerarchico naturale (es. Junior < Mid < Senior), e un numero elevato di categorie renderebbe la codifica one-hot inefficiente e potenzialmente causerebbe la maledizione della dimensionalità. Tokenizzare è più comune per il testo libero. Raggruppare 'location' non è necessario con solo 3 categorie. Lo standard scaling è per feature numeriche continue, non categoriche.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta