法律科技新創公司 LexaLegal 需要一個 Amazon Comprehend 自訂實體辨識器,以識別當事人名稱、法律條款和法規參考。他們的標記團隊可以產生帶有實體範圍的註釋文件,或整理已知法規識別碼的清單。在建立 Comprehend 自訂實體辨識器時,他們可以使用哪兩種訓練資料方法?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 提供帶有實體範圍標記(標記文字)的註釋訓練文件,其格式符合 Comprehend 的預期(文件層級註釋)。, 提供包含已知法規識別碼的實體清單(詞彙表),Comprehend 可以將其用作訓練的一部分。.
為什麼這是答案
Amazon Comprehend 自訂實體辨識器支援兩種主要的訓練資料方法。第一種是提供帶有實體範圍標記的註釋訓練文件,這些文件明確指出每個實體的開始和結束位置。這是訓練自訂模型以識別新實體類型最常見且有效的方法。第二種方法是提供包含已知實體(例如法規識別碼)的實體清單(詞彙表)。Comprehend 可以利用此詞彙表來增強其識別這些特定實體的能力,即使它們在註釋文件中出現的頻率不高。 上傳文件 S3 物件標籤的 CSV 不適用於訓練 Comprehend 自訂實體辨識器,因為 Comprehend 需要文件內容本身的實體標記,而不是 S3 物件的元數據標籤。將原始 PDF 傳送至 Amazon Textract 並直接使用其輸出作為訓練資訊清單是不足夠的,因為 Textract 主要用於文本提取,而 Comprehend 需要明確的實體註釋才能進行訓練。僅使用 Amazon Comprehend 內建的預先訓練實體無法建立自訂實體辨識器,因為其目的是識別新的、特定領域的實體類型。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡