Bir duygu analizi modelinin doğrulama doğruluğu düşüktür ve veri bilimcisi, sorunun çok düşük ortalama kelime sıklığına sahip çok geniş bir kelime dağarcığı olduğundan şüphelenmektedir. Doğrulama doğruluğunu en iyi şekilde hangi ön işleme veya yöntem iyileştirir?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Metni TF-IDF özellik vektörlerine dönüştürün (örneğin, scikit-learn'ün TfidfVectorizer'ını kullanarak)..
Neden bu cevap
Doğru cevap, metni TF-IDF özellik vektörlerine dönüştürmektir çünkü bu yöntem, kelime sıklığına ek olarak bir kelimenin bir doküman koleksiyonundaki önemini de hesaba katar. Düşük ortalama kelime sıklığına sahip geniş bir kelime dağarcığı durumunda, TF-IDF, nadir ancak önemli terimlerin ağırlığını artırarak ve yaygın ancak az bilgi içeren terimlerin ağırlığını azaltarak modelin performansı için daha anlamlı özellikler sağlar. Diğer seçenekler neden yanlış: Amazon Comprehend'i sözdizimi analizi ve varlık tespiti için kullanmak, mevcut sorunu (düşük kelime sıklığı ve geniş kelime dağarcığı) doğrudan çözmez; daha çok anlamsal yapıya odaklanır. Amazon SageMaker BlazingText'i CBOW modunda eğitmek, kelime gömme (word embedding) oluşturur ancak bu, geniş kelime dağarcığının neden olduğu düşük doğrulama doğruluğu sorununu doğrudan çözmez. NLTK kullanarak kök bulma ve durak kelimeleri kaldırma, kelime dağarcığını küçültmeye yardımcı olabilir ancak kelimelerin önemini TF-IDF kadar etkili bir şekilde yakalamaz.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez