한 회사에서 많은 종이 영수증을 이미지로 변환하고 있으며, 날짜, 위치, 메모 및 사용자 지정 필드(영수증 번호)와 같은 엔터티를 추출해야 합니다. 이 회사는 이미 OCR을 사용하여 텍스트를 가져오지만 문서 레이아웃이 다양하고 레이블 워크플로우를 구축하는 데 시간이 많이 소요됩니다. 또한, 이 회사는 훨씬 더 많은 훈련 데이터가 필요한 작은 NER 데이터 세트를 가지고 있습니다. 안정적인 엔터티 추출을 얻기 위해 가장 적은 노력이 필요한 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Amazon Textract를 사용하여 영수증 이미지에서 텍스트를 추출한 다음, Amazon Comprehend를 사용하여 엔터티를 감지하고 사용자 지정 필드에 Comprehend custom entity recognition을 사용합니다..
이것이 정답인 이유
이 회사는 다양한 문서 레이아웃과 제한된 훈련 데이터로 인해 엔터티 추출에 어려움을 겪고 있습니다. Amazon Textract는 영수증 이미지에서 텍스트와 구조화된 데이터를 자동으로 추출하는 완전 관리형 서비스이므로, 다양한 레이아웃에 대한 수동 레이블링 노력을 줄여줍니다. Amazon Comprehend는 사전 훈련된 모델을 사용하여 일반적인 엔터티(날짜, 위치)를 감지하며, Comprehend 사용자 지정 엔터티 인식은 적은 양의 훈련 데이터로도 영수증 번호와 같은 사용자 지정 필드를 식별할 수 있어 레이블링 워크플로우 구축 시간을 최소화합니다. 다른 옵션들은 다음과 같은 이유로 최적이 아닙니다. Amazon SageMaker BlazingText는 사용자 지정 엔터티 인식을 위해 더 많은 훈련 데이터가 필요하며, 이는 현재 회사의 제약 사항과 일치하지 않습니다. AWS Marketplace의 타사 OCR 모델은 Textract보다 통합 및 관리 노력이 더 많이 들 수 있으며, 사전 훈련된 NER 모델은 사용자 지정 필드를 처리하지 못할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음