一位資料科學家使用 SageMaker Neural Topic Model (NTM) 來為儲存在 S3 中 JSON 格式的部落格文章推薦標籤。該模型會建議像是「a」、「an」和「the」等停用詞,有時也會建議罕見但有效的詞彙。團隊希望保留罕見詞彙,但確保不會推薦停用詞。這位資料科學家應該怎麼做?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用 scikit-learn 的 CountVectorizer 從部落格文字中移除停用詞,並用向量化結果取代 S3 中的資料。.
為什麼這是答案
正確答案是使用 scikit-learn 的 CountVectorizer 從部落格文字中移除停用詞,並用向量化結果取代 S3 中的資料。SageMaker NTM 演算法需要預處理的文本資料,其中停用詞已被移除。CountVectorizer 是一個常用的工具,可以將文本轉換為詞頻向量,並在轉換過程中提供一個 stopwords 參數來移除常見的停用詞,同時保留其他詞彙,包括罕見但有意義的詞彙。 呼叫 Amazon Comprehend 實體辨識並從部落格文字中移除偵測到的詞彙,然後用清理後的資料取代 S3 中的資料,這會移除實體,而不是停用詞,且可能移除有用的罕見詞彙。在部落格資料上執行 SageMaker 內建的 PCA 演算法,並用 PCA 輸出取代 S3 中的資料,PCA 是一種降維技術,不適用於文本預處理以移除停用詞。使用 SageMaker 內建的 Object Detection 演算法取代 NTM 來處理部落格文章的標籤,物件偵測是針對圖像資料的,不適用於文本標籤推薦。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡