某企業需要從 PDF 中提取具名實體,以訓練分類器。哪種方法能以最短的時間提取這些實體並儲存?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用 Amazon Comprehend 提取實體。將輸出儲存到 Amazon S3。.
為什麼這是答案
正確答案是使用 Amazon Comprehend 提取實體,並將輸出儲存到 Amazon S3。Amazon Comprehend 是一項自然語言處理 (NLP) 服務,可以直接從非結構化文字中識別具名實體,例如人名、地點和組織。PDF 檔案通常包含文字層,Comprehend 可以直接處理這些文字層,因此這是最快速且最直接的方法。將結果儲存到 Amazon S3 是儲存大量資料的標準且具成本效益的方式。 在 Amazon SageMaker 上執行開源 OCR 工具需要額外的設定和管理,不如 Comprehend 快速。Amazon Textract 雖然擅長從影像或掃描的 PDF 中提取文字,但它不直接執行具名實體辨識 (NER)。選項三錯誤地建議在 Textract 之後使用 Comprehend 將「提取的內容轉換為文字」,Textract 本身就輸出文字。選項四提及 Amazon Augmented AI (A2I),這是一個用於人類審查的服務,對於自動化實體提取而言是不必要的步驟,會增加時間和複雜性。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡