Ein Unternehmen wandelt viele Papierbelege in Bilder um und muss Entitäten wie Datum, Ort, Notizen und benutzerdefinierte Felder (Belegnummern) extrahieren. Sie verwenden bereits OCR, um Text zu erhalten, aber die Dokumentlayouts variieren und der Aufbau von Label-Workflows ist zeitaufwändig. Sie haben auch einen kleinen NER-Datensatz, der viel mehr Trainingsdaten benötigt. Welcher Ansatz erfordert den geringsten Aufwand, um eine zuverlässige Entitätsextraktion zu erhalten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie Amazon Textract, um Text aus Belegbildern zu extrahieren, und verwenden Sie dann Amazon Comprehend für die Entitätserkennung und Comprehend custom entity recognition für die benutzerdefinierten Felder..
Warum dies die Antwort ist
Die beste Lösung ist die Verwendung von Amazon Textract, da es speziell für die Extraktion von Text und Daten aus Dokumenten entwickelt wurde und auch strukturierte Daten wie Formulare und Tabellen verarbeiten kann, was bei variierenden Beleglayouts hilfreich ist. Amazon Comprehend bietet vorgefertigte NER-Modelle für gängige Entitäten und ermöglicht mit Custom Entity Recognition das Training eigener Modelle für spezifische Entitäten wie Belegnummern mit weniger Trainingsdaten als ein SageMaker BlazingText-Modell von Grund auf. Die Kombination dieser Dienste minimiert den Aufwand, da sie vollständig verwaltet sind und keine umfangreiche Modellentwicklung erfordern. Die anderen Optionen erfordern entweder mehr manuellen Aufwand (SageMaker BlazingText) oder nutzen keine optimalen AWS-Dienste für die OCR-Komponente (Drittanbieter-OCR).
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich