Un'azienda di giochi free-to-play deve prevedere se un nuovo utente diventerà un cliente pagante entro un anno. Il set di training etichettato contiene 1.000 esempi positivi e 999.000 esempi negativi (1.000.000 totali) con 200 feature. Una random forest ha raggiunto un'accuratezza >99% sul set di training ma si comporta male sul set di test. Quali azioni dovrebbe intraprendere il team per risolvere questo problema? (Scegliere due.)
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Creare più esempi positivi duplicando quelli esistenti e aggiungendo un leggero rumore ad essi., Modificare la funzione di perdita per penalizzare i falsi negativi più pesantemente dei falsi positivi..
Perché questa è la risposta
L'accuratezza elevata sul training set e le scarse prestazioni sul test set indicano overfitting e uno squilibrio di classe. Duplicare gli esempi positivi e aggiungere rumore (oversampling) aiuta a bilanciare il dataset, fornendo al modello più dati sui casi rari e riducendo l'overfitting. Modificare la funzione di perdita per penalizzare maggiormente i falsi negativi è cruciale perché, in questo scenario, mancare un potenziale cliente pagante (falso negativo) è probabilmente più costoso che classificare erroneamente un non pagante come pagante (falso positivo). Aumentare il numero o la profondità degli alberi aggraverebbe l'overfitting. Copiare campioni dal test set nel training set è una pratica scorretta che invalida la valutazione del modello. Penalizzare i falsi positivi più pesantemente dei falsi negativi andrebbe contro l'obiettivo di identificare i clienti paganti.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta