Bir ML mühendisi, abonelikten ayrılmayı tahmin etmek için bir lojistik regresyon modeli eğitiyor. Veri seti iki kategorik dize özelliği içeriyor: konum (3 farklı kategori) ve job_seniority_level (10'dan fazla farklı kategori). Bu özellikler model için nasıl ön işlenmelidir?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Konum için one-hot encoding kullanın. job_seniority_level için sıralı kodlama kullanın..
Neden bu cevap
Doğru cevap, kategorik verilerin işlenmesi için uygun yöntemleri kullanır. 'Konum' özelliği nominal kategorik olduğundan (kategoriler arasında doğal bir sıralama yok), one-hot encoding her kategori için yeni bir ikili özellik oluşturarak modelin bu bilgiyi anlamasını sağlar. 'jobsenioritylevel' özelliği ise sıralı kategorik olabilir (örneğin, 'junior' < 'mid' < 'senior' gibi bir sıralama varsa). Bu durumda, sıralı kodlama (ordinal encoding) bu doğal sıralamayı koruyarak her kategoriye bir sayısal değer atar. Tokenizasyon genellikle metin verileri için kullanılır, gruplandırma (binning) sayısal veriler için kullanılır ve standart ölçeklendirme de sayısal verilerin dağılımını normalleştirmek için kullanılır, bu nedenle bu seçenekler kategorik özellikler için uygun değildir.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez