法律科技初创公司 LexaLegal 需要一个 Amazon Comprehend 自定义实体识别器来识别当事人名称、法律条款和法规引用。他们的标注团队可以生成带有实体跨度的标注文档,也可以整理已知法规标识符的列表。在创建 Comprehend 自定义实体识别器时,他们可以使用哪两种训练数据方法?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 提供带有实体跨度(标注文本)的标注训练文档,其格式符合 Comprehend 的预期(文档级标注)。, 提供一个包含已知法规标识符的实体列表(词典),Comprehend 可以将其用作训练的一部分。.
为什么这是答案
LexaLegal 可以使用两种主要的训练数据方法来创建 Amazon Comprehend 自定义实体识别器。第一种是提供带有实体跨度(标注文本)的标注训练文档。这种方法直接向 Comprehend 展示了文本中特定实体(如当事人名称、法律条款)的准确位置和类型,是训练自定义实体识别器的标准且有效的方式。第二种方法是提供一个包含已知法规标识符的实体列表(词典)。Comprehend 可以利用这个词典来识别这些预定义的实体,这对于识别法规引用等具有固定格式或已知值的实体非常有用。 其他选项不正确的原因: 上传包含 S3 对象标签的 CSV 文件不适用于自定义实体识别器的训练,S3 标签通常用于对象管理,而非文本实体标注。 将原始 PDF 文件发送到 Textract 并直接使用输出作为训练清单,而无需标注,是不可行的。Comprehend 需要带有实体标注的结构化数据才能进行训练。 仅使用 Amazon Comprehend 内置的预训练实体无法满足识别特定法律领域自定义实体的需求,因为这些实体是特定于 LexaLegal 业务的。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡