AmazonAmazon Machine Learning Specialty MLS-C01
·TW
·更新於 26 Jul 2026
某公司正在將大量紙本收據轉換為圖片,需要從中提取日期、地點、備註和自訂欄位(收據編號)等實體。他們已經使用 OCR 來獲取文字,但文件版面配置各不相同,而且建立標籤工作流程非常耗時。他們還有一個小型 NER 資料集,需要更多的訓練資料。哪種方法能以最少的工作量獲得可靠的實體提取?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用 Amazon Textract 從收據圖片中提取文字,然後使用 Amazon Comprehend 進行實體偵測,並使用 Comprehend custom entity recognition 處理自訂欄位。.
為什麼這是答案
正確答案是使用 Amazon Textract 提取文字,然後結合 Amazon Comprehend 進行實體偵測,並利用 Comprehend 自訂實體辨識處理自訂欄位。Textract 專為從文件(包括收據)中提取結構化資料而設計,能有效處理不同版面配置,減少手動標記工作。Comprehend 內建的 NER 功能可以偵測常見實體,而其自訂實體辨識功能則能以最少標記資料訓練模型來辨識特定領域的實體(如收據編號),這符合題目中「小型 NER 資料集」和「最少工作量」的要求。
其他選項的不足之處:
訓練 Amazon SageMaker BlazingText 模型需要更多標記資料和機器學習專業知識,不符合「最少工作量」原則。
依賴第三方 OCR 模型和預訓練 NER 模型可能無法有效處理收據的複雜性,且預訓練 NER 模型不一定能辨識自訂欄位。
雖然使用第三方 OCR 模型結合 Comprehend 看似可行,但 Textract 在處理文件結構化資料方面更具優勢,且與 Comprehend 的整合更為順暢。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡