AmazonAmazon Machine Learning Specialty MLS-C01
·CN
·更新于 26 Jul 2026
一家公司正在将大量纸质收据转换为图像,需要从中提取日期、地点、备注和自定义字段(收据编号)等实体。他们已经使用 OCR 来获取文本,但文档布局各不相同,并且构建标签工作流非常耗时。他们还有一个小型 NER 数据集,需要更多的训练数据。哪种方法能以最少的精力获得可靠的实体提取?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 Amazon Textract 从收据图像中提取文本,然后使用 Amazon Comprehend 进行实体检测,并使用 Comprehend custom entity recognition 处理自定义字段。.
为什么这是答案
正确答案是使用 Amazon Textract 提取文本,然后结合 Amazon Comprehend 的内置实体检测和自定义实体识别功能。Textract 专门用于从各种布局的文档中提取文本和结构化数据,包括收据,这解决了文档布局多变的问题。Comprehend 的内置 NER 可以识别日期和地点等常见实体,而其自定义实体识别功能可以直接处理收据编号等特定业务字段,且无需大量标记数据。这种组合最大限度地减少了手动标记工作,并利用了 AWS 服务的专业能力。
其他选项的不足在于:
训练 SageMaker BlazingText 模型需要大量的标记数据,这与“最少的精力”要求相悖。
依赖第三方 OCR 模型可能增加复杂性,且预训练的 NER 模型不一定能处理自定义字段。
即使使用第三方 OCR,如果后续的 NER 步骤不包含自定义实体识别,也无法满足所有需求。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡