Предприятию необходимо извлечь именованные сущности из PDF-файла для обучения классификатора. Какой подход позволит извлечь эти сущности и сохранить их в КРАТЧАЙШИЕ сроки?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать Amazon Comprehend для извлечения сущностей. Сохранить результат в Amazon S3..
Почему это правильный ответ
Amazon Comprehend — это полностью управляемый сервис обработки естественного языка (NLP), который может напрямую извлекать именованные сущности из текста, включая текст, извлеченный из PDF-файлов. Это самый быстрый подход, поскольку он является высокоуровневым сервисом, не требующим развертывания или управления моделями. Сохранение результатов в Amazon S3 — стандартная практика. Запуск инструмента OCR с открытым исходным кодом на Amazon SageMaker потребует настройки и управления инфраструктурой SageMaker, что займет больше времени. Использование Amazon Textract для извлечения сущностей, а затем Amazon Comprehend для преобразования содержимого в текст является избыточным, так как Textract извлекает текст, а Comprehend извлекает сущности; Textract не преобразует текст для Comprehend. Использование Amazon Textract с Amazon Augmented AI (A2I) для извлечения сущностей добавит этап ручной проверки, что увеличит время.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется