AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
FinBank 在 S3 儲存桶中收到多頁 PDF 格式的發票(每份 3-10 頁),需要提取結構化的鍵/值欄位(InvoiceNumber、InvoiceDate、InvoiceTotal),並將結果儲存到 DynamoDB。有幾個團隊嘗試了 DetectDocumentText,但鍵/值配對不可靠。在這種 AWS 環境中,最適合 Textract 且能可靠地大規模提取結構化表單欄位的方法和組態是什麼?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用非同步 StartDocumentAnalysis,將 FeatureTypes 設定為 S3 PDF 上的 ['FORMS'];從工作結果中解析 KEY_VALUE_SET 區塊及其 RELATIONSHIPS,然後將鍵映射到值,並將結構化欄位寫入 DynamoDB。確保 Textract 服務角色可以讀取 S3 輸入並將工作結果寫入輸出位置(如果使用)。.
為什麼這是答案
正確答案是使用非同步 StartDocumentAnalysis 並將 FeatureTypes 設定為 ['FORMS']。對於多頁文件和大規模處理,非同步操作是必要的,而 'FORMS' 功能專為提取結構化鍵/值對而設計。解析 KEYVALUESET 區塊及其 RELATIONSHIPS 是從 Textract 輸出中獲取所需結構化資料的標準方法。確保 Textract 服務角色具有必要的 S3 權限是操作成功的關鍵。
同步 AnalyzeDocument 不適合多頁文件和大規模處理,且 FeatureTypes ['TABLES'] 用於表格而非表單鍵/值對。Amazon Comprehend 的 DetectEntities 雖然用於實體提取,但不如 Textract 的表單功能專為精確的鍵/值提取而設計。AnalyzeExpense 雖然專為發票設計,但它是一個獨立的 API,通常用於更通用的費用分析,而題目明確要求使用 Textract 且需要解析特定欄位。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡