AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
FinBank 在 S3 存储桶中接收多页 PDF 发票(每份 3-10 页),需要提取结构化的键/值字段(InvoiceNumber、InvoiceDate、InvoiceTotal),并将结果持久化到 DynamoDB。有几个团队尝试了 DetectDocumentText,但键/值配对不可靠。在这种 AWS 环境中,哪种 Textract 方法和配置最适合大规模可靠地提取结构化表单字段?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 对 S3 PDF 使用异步 StartDocumentAnalysis,并将 FeatureTypes 设置为 ['FORMS'];从作业结果中解析 KEY_VALUE_SET 块及其 RELATIONSHIPS,然后将键映射到值并将结构化字段写入 DynamoDB。确保 Textract 服务角色可以读取 S3 输入并将作业结果写入输出位置(如果使用)。.
为什么这是答案
正确答案是使用 StartDocumentAnalysis 并将 FeatureTypes 设置为 ['FORMS']。StartDocumentAnalysis 适用于多页文档和大规模处理,而 'FORMS' 功能专门用于提取结构化的键/值对。解析 KEYVALUESET 块及其 RELATIONSHIPS 是从 Textract 结果中获取这些结构化字段的标准方法。确保 Textract 服务角色具有必要的 S3 权限是操作成功的关键。
同步的 AnalyzeDocument 不适合多页文档和大规模场景,且 'TABLES' 功能用于表格数据而非键/值对。Amazon Comprehend 主要用于自然语言处理和实体识别,而非从文档布局中提取结构化表单字段。AnalyzeExpense 虽然专门用于发票,但其提取的字段类型和格式可能不如直接使用 'FORMS' 灵活,且题目明确指出需要提取特定的键/值字段。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡