Firma konwertuje wiele papierowych paragonów na obrazy i musi wyodrębnić z nich takie encje jak data, lokalizacja, notatki i pola niestandardowe (numery paragonów). Używają już OCR do uzyskiwania tekstu, ale układy dokumentów są różne, a budowanie przepływów pracy związanych z etykietowaniem jest czasochłonne. Mają również mały zbiór danych NER, który wymaga znacznie więcej danych treningowych. Które podejście będzie wymagało najmniejszego wysiłku, aby uzyskać niezawodne wyodrębnianie encji?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użycie Amazon Textract do wyodrębniania tekstu z obrazów paragonów, a następnie użycie Amazon Comprehend do wykrywania encji i Comprehend custom entity recognition dla pól niestandardowych..
Dlaczego to jest odpowiedź
Poprawna odpowiedź minimalizuje wysiłek, wykorzystując w pełni zarządzane usługi AWS. Amazon Textract jest idealny do wyodrębniania tekstu i struktury z dokumentów o zmiennym układzie, takich jak paragony, bez konieczności tworzenia własnych modeli OCR. Następnie Amazon Comprehend może wykrywać standardowe encje (daty, lokalizacje), a Comprehend Custom Entity Recognition pozwala na szkolenie modelu do wykrywania niestandardowych pól (numerów paragonów) przy użyciu mniejszego zbioru danych niż tradycyjne modele NER, co rozwiązuje problem braku danych treningowych i czasochłonnego etykietowania. Pozostałe opcje są mniej efektywne: Trenowanie modelu SageMaker BlazingText wymagałoby znacznie większego zbioru danych i większego wysiłku w etykietowaniu. Użycie modelu OCR innej firmy z Marketplace wprowadza dodatkową złożoność i potencjalnie wyższe koszty, a także nie rozwiązuje problemu z małymi zbiorami danych NER.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana