AmazonAmazon Machine Learning Specialty MLS-C01
·TW
·更新於 26 Jul 2026
編輯者需要一個搜尋工具,該工具能回傳查詢字詞在文件語料庫中最重要且最具代表性的文章。目前的工具會回傳一般字詞的匹配結果,需要手動篩選。哪種解決方案能捕捉每份文件的字詞重要性和頻率,讓工具能突顯查詢字詞最相關的文章?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 計算文章中每個字詞的詞頻 (term frequency) (依文章長度加權) 和語料庫中的逆向文件頻率 (inverse document frequency);將它們結合 (例如相乘) 以形成最終的相關性分數,並回傳查詢字詞分數高的文章。.
為什麼這是答案
正確答案是 TF-IDF (詞頻-逆向文件頻率)。TF-IDF 透過結合詞頻 (Term Frequency, TF) 和逆向文件頻率 (Inverse Document Frequency, IDF) 來衡量一個詞在文件中重要性。TF 衡量詞在單一文件中的出現頻率,而 IDF 則衡量詞在整個語料庫中的稀有程度。將兩者相乘能有效突顯在特定文件中頻繁出現,但在其他文件中不常見的詞,從而精確識別與查詢詞最相關的文章,解決了現有工具回傳一般字詞匹配結果的問題。
LDA 雖然能提取主題,但其目的是主題建模而非直接衡量詞語在特定文件中的相關性。詞嵌入主要用於捕捉詞語的語義關係,而非直接用於文件相關性排序。單純的詞頻表並未考慮詞語在整個語料庫中的普遍性,仍可能導致一般詞語的過度匹配。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡