Bir mühendis, SageMaker Data Wrangler'ı kullanarak, yazım hatalarından kaynaklanan binlerce hafif farklı değere sahip bir metin kategorik özelliği bulur. İşlenmiş özelliğin sınıflandırma için kullanılabilmesi için hangi kodlama yöntemi kullanılmalıdır?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Yakın yazılmış kategorileri gruplamak ve temsil etmek için similarity encoding kullanın..
Neden bu cevap
SageMaker Data Wrangler'daki similarity encoding, yazım hataları veya küçük varyasyonlar nedeniyle binlerce hafif farklı değere sahip metin kategorik özelliklerini işlemek için idealdir. Bu yöntem, benzer yazılmış kategorileri gruplandırarak ve tek bir temsile dönüştürerek veri kalitesini artırır ve modelin bu varyasyonları tek bir anlamlı kategori olarak yorumlamasını sağlar. Ordinal encoding, kategoriler arasında doğal bir sıralama olduğunda kullanılır, ancak burada böyle bir sıralama yoktur. One-hot encoding, her farklı değeri ayrı bir sütuna dönüştürerek çok sayıda benzersiz değer olduğunda seyrek bir matris oluşturur ve model performansını düşürebilir. Target encoding ise kategorileri hedef değişkenin istatistikleriyle eşler, ancak yazım hatalarını düzeltmez.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez