AmazonAmazon ML Engineer Associate MLA-C01 Certification·KO·업데이트됨 3 Aug 2026
FinBank는 S3 버킷에서 여러 페이지로 구성된 PDF 인보이스(각 3~10페이지)를 수신하며, 구조화된 키/값 필드(InvoiceNumber, InvoiceDate, InvoiceTotal)를 추출하여 결과를 DynamoDB에 저장해야 합니다. 여러 팀에서 DetectDocumentText를 시도했지만 키/값 페어링이 신뢰할 수 없습니다. 이 AWS 환경에서 대규모로 구조화된 양식 필드를 안정적으로 추출하기 위한 가장 적절한 Textract 접근 방식과 구성은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: S3 PDF에서 FeatureTypes를 ['FORMS']로 설정하여 비동기 StartDocumentAnalysis를 사용합니다. 작업 결과에서 KEY_VALUE_SET 블록과 해당 RELATIONSHIPS를 파싱한 다음 키를 값에 매핑하고 구조화된 필드를 DynamoDB에 기록합니다. Textract 서비스 역할이 S3 입력을 읽고 사용되는 경우 출력 위치에 작업 결과를 쓸 수 있는지 확인합니다..
이것이 정답인 이유
이 시나리오에서는 여러 페이지로 구성된 PDF에서 구조화된 키/값 필드를 추출해야 합니다. StartDocumentAnalysis와 FeatureTypes를 ['FORMS']로 설정하는 것은 Textract가 문서에서 양식 필드를 식별하고 추출하도록 지시하는 가장 적절한 방법입니다. 비동기 작업은 여러 페이지 문서에 적합하며, KEYVALUESET 블록과 RELATIONSHIPS를 파싱하여 키를 값에 매핑할 수 있습니다. Textract 서비스 역할이 S3에서 읽고 쓸 수 있는 권한이 있어야 합니다.
AnalyzeDocument는 동기식이며 여러 페이지 PDF 처리에 적합하지 않으며, ['TABLES']는 양식 필드 추출에 사용되지 않습니다. Comprehend는 엔터티 추출에 사용되지만, 구조화된 양식 필드 추출에는 Textract가 더 적합합니다. AnalyzeExpense는 영수증 및 송장에 특화되어 있지만, 일반적인 인보이스에서 사용자 정의된 키/값 필드를 추출하는 데는 StartDocumentAnalysis가 더 유연하고 강력합니다.