Una empresa está convirtiendo muchos recibos en papel a imágenes y necesita extraer entidades como la fecha, la ubicación, las notas y los campos personalizados (números de recibo). Ya utilizan OCR para obtener texto, pero los diseños de los documentos varían y la creación de flujos de trabajo de etiquetado lleva mucho tiempo. También tienen un pequeño conjunto de datos NER que necesita muchos más datos de entrenamiento. ¿Qué enfoque requerirá el menor esfuerzo para obtener una extracción de entidades fiable?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar Amazon Textract para extraer texto de las imágenes de los recibos y luego usar Amazon Comprehend para la detección de entidades y el reconocimiento de entidades personalizadas de Comprehend para los campos personalizados..
Por qué esta es la respuesta
La opción correcta minimiza el esfuerzo al combinar Amazon Textract y Amazon Comprehend. Textract es ideal para extraer texto y datos estructurados de documentos con diseños variables, como recibos, sin necesidad de etiquetado extenso. Comprehend, con su detección de entidades preentrenada, puede identificar entidades comunes como fechas y ubicaciones. Para los campos personalizados (números de recibo), Comprehend Custom Entity Recognition permite entrenar un modelo con un conjunto de datos pequeño, que es más rápido que construir un modelo desde cero. Las opciones que involucran SageMaker BlazingText o modelos de terceros requieren más esfuerzo de desarrollo y entrenamiento, o no abordan eficazmente la extracción de datos estructurados de recibos variables. Usar un OCR de terceros en lugar de Textract también añade complejidad innecesaria.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta