FinBank otrzymuje wielostronicowe faktury PDF (3–10 stron każda) do zasobnika S3 i musi wyodrębnić ustrukturyzowane pola klucz/wartość (InvoiceNumber, InvoiceDate, InvoiceTotal) oraz utrwalić wyniki w DynamoDB. Kilka zespołów próbowało użyć DetectDocumentText, ale parowanie klucz/wartość jest zawodne. Jakie jest najbardziej odpowiednie podejście i konfiguracja Textract, aby niezawodnie wyodrębnić ustrukturyzowane pola formularza na dużą skalę w tym środowisku AWS?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj asynchronicznego StartDocumentAnalysis z FeatureTypes ustawionym na ['FORMS'] dla plików PDF w S3; przeanalizuj bloki KEY_VALUE_SET i ich RELATIONSHIPS z wyników zadania, a następnie zmapuj klucze do wartości i zapisz ustrukturyzowane pola do DynamoDB. Upewnij się, że rola usługi Textract może odczytywać dane wejściowe z S3 i zapisywać wyniki zadania w lokalizacji wyjściowej, jeśli jest używana..
Dlaczego to jest odpowiedź
Asynchroniczne StartDocumentAnalysis z FeatureTypes ustawionym na ['FORMS'] jest najbardziej odpowiednie, ponieważ Textract jest usługą do optycznego rozpoznawania znaków (OCR) i ekstrakcji danych z dokumentów, a FeatureTypes ['FORMS'] jest przeznaczone do wyodrębniania par klucz/wartość. Asynchroniczne przetwarzanie jest niezbędne dla wielostronicowych plików PDF i dużych wolumenów. Analiza bloków KEYVALUESET i ich RELATIONSHIPS pozwala na niezawodne mapowanie kluczy do wartości. Synchronizacja uprawnień roli Textract do S3 jest kluczowa dla działania. Opcja z AnalyzeDocument jest błędna, ponieważ synchroniczne API ma ograniczenia rozmiaru i nie jest przeznaczone do wielostronicowych dokumentów na dużą skalę, a FeatureTypes ['TABLES'] służy do tabel, nie formularzy. Amazon Comprehend jest do przetwarzania języka naturalnego (NLP), a nie do ekstrakcji danych z układu dokumentu. AnalyzeExpense jest dedykowane do faktur, ale StartDocumentAnalysis z ['FORMS'] jest bardziej ogólnym i elastycznym podejściem, które pozwala na precyzyjne mapowanie i kontrolę nad wyodrębnianymi polami, co jest kluczowe, gdy DetectDocumentText zawodzi.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana