Bir veri bilimcisi, S3'te JSON olarak depolanan blog gönderileri için etiket önermek amacıyla SageMaker Neural Topic Model (NTM) kullandı. Model, "a", "an" ve "the" gibi durak kelimeler (stopwords) ve bazen nadir fakat geçerli kelimeler öneriyor. Ekip, nadir kelimeleri tutmak ancak durak kelimelerin önerilmemesini sağlamak istiyor. Veri bilimcisi ne yapmalı?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: scikit-learn'ün CountVectorizer'ını kullanarak blog metninden durak kelimeleri kaldırın ve S3'teki verileri vektörleştirilmiş sonuçlarla değiştirin..
Neden bu cevap
Doğru cevap, durak kelimeleri kaldırmak ve verileri vektörleştirmek için scikit-learn'ün CountVectorizer'ını kullanmaktır. CountVectorizer, metin verilerini sayısal özelliklere dönüştürürken durak kelimeleri filtreleme yeteneğine sahiptir. Bu, NTM'nin anlamsız kelimeler yerine daha alakalı etiketler önermesini sağlar. Diğer seçenekler ya yanlış algoritma önerir (PCA, Object Detection) ya da sorunun gerektirdiği durak kelime kaldırma işlemini doğrudan ele almaz (Comprehend varlık tanıma, durak kelimeleri kaldırmak için tasarlanmamıştır ve nadir kelimelerin korunması isteğiyle çelişebilir).
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez