在自然語言處理中,tokenization 的目的是什麼?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將文字分割成更小的單元以便處理.
為什麼這是答案
Tokenization 是自然語言處理 (NLP) 的一個基本步驟,其目的是將原始文字資料分解成更小的、有意義的單元,稱為 token。這些 token 可以是單詞、子詞、字元或標點符號,具體取決於 tokenization 的策略。將文字分割成這些較小的單元,有助於後續的 NLP 任務,例如詞性標註、命名實體識別、情感分析和機器翻譯,因為模型可以更好地理解和處理這些離散的資訊片段。 加密文字資料 (Encrypting text data) 是為了安全目的,與 tokenization 的功能不同。壓縮文字檔案 (Compressing text files) 是為了減少儲存空間或傳輸時間,也與 tokenization 無關。在不同語言之間翻譯文字 (Translating text between different languages) 是機器翻譯的目標,而 tokenization 只是其準備步驟之一,並非其主要目的。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡