FinBank получает многостраничные PDF-счета (3–10 страниц каждый) в бакете S3 и должна извлекать структурированные поля «ключ/значение» (InvoiceNumber, InvoiceDate, InvoiceTotal), а затем сохранять результаты в DynamoDB. Несколько команд пробовали DetectDocumentText, но сопоставление «ключ/значение» оказалось ненадежным. Какой подход и конфигурация Textract наиболее подходят для надежного извлечения структурированных полей форм в этом окружении AWS в масштабе?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать асинхронный StartDocumentAnalysis с FeatureTypes, установленным на ['FORMS'] для PDF-файлов в S3; анализировать блоки KEY_VALUE_SET и их RELATIONSHIPS из результатов задания, затем сопоставлять ключи со значениями и записывать структурированные поля в DynamoDB. Убедиться, что роль сервиса Textract может читать входные данные S3 и записывать результаты задания в выходное местоположение, если оно используется..
Почему это правильный ответ
Правильный ответ использует StartDocumentAnalysis с FeatureTypes = ['FORMS'], что является рекомендуемым подходом для извлечения структурированных данных форм (пар ключ/значение) из многостраничных документов, хранящихся в S3. Асинхронный режим необходим для многостраничных PDF. Анализ блоков KEYVALUESET и их RELATIONSHIPS позволяет точно сопоставлять ключи со значениями. Синхронный AnalyzeDocument не подходит для многостраничных документов и больших объемов, а ['TABLES'] не извлекает пары ключ/значение. Amazon Comprehend предназначен для извлечения сущностей и не оптимизирован для структурированных форм. AnalyzeExpense специализируется на квитанциях и не является универсальным решением для счетов, которые могут иметь различные форматы.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется