Ein Unternehmen muss benannte Entitäten aus einem PDF-Dokument extrahieren, um einen Klassifikator zu trainieren. Welcher Ansatz extrahiert diese Entitäten und speichert sie in der KÜRZESTEN Zeitspanne?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie Amazon Comprehend, um die Entitäten zu extrahieren. Speichern Sie die Ausgabe in Amazon S3..
Warum dies die Antwort ist
Amazon Comprehend ist ein vollständig verwalteter Dienst für die Verarbeitung natürlicher Sprache (NLP), der Named Entity Recognition (NER) direkt unterstützt. Er kann benannte Entitäten wie Personen, Orte und Organisationen aus unstrukturiertem Text identifizieren und extrahieren. Da PDFs oft unstrukturierten Text enthalten, kann Comprehend diese Entitäten direkt extrahieren und die Ergebnisse schnell in Amazon S3 speichern. Die Ausführung eines Open-Source-OCR-Tools auf SageMaker wäre zeitaufwändiger, da es die Einrichtung und Verwaltung einer SageMaker-Instanz sowie die Konfiguration des OCR-Tools erfordert. Amazon Textract ist zwar für die Textextraktion aus Dokumenten konzipiert, aber es ist nicht primär für die Entitätsextraktion optimiert; es würde eine zusätzliche Verarbeitungsschicht erfordern, um Entitäten zu identifizieren. Die Kombination von Textract mit A2I würde menschliche Überprüfungsschritte hinzufügen, was die Verarbeitungszeit erheblich verlängern würde.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich