AmazonAmazon ML Engineer Associate MLA-C01 Certification
·JA
·更新日 4 Aug 2026
FinBankは、S3バケットで複数ページ(各3~10ページ)のPDF形式の請求書を受け取っており、構造化されたキー/値フィールド(InvoiceNumber、InvoiceDate、InvoiceTotal)を抽出し、その結果をDynamoDBに永続化する必要があります。いくつかのチームがDetectDocumentTextを試しましたが、キー/値のペアリングが信頼できません。このAWS環境で、構造化されたフォームフィールドを大規模に確実に抽出するために最も適切なTextractのアプローチと設定は何ですか?
解答を選択
オプションをタップして解答を確認してください。
正解: S3 PDFに対してFeatureTypesを['FORMS']に設定して非同期のStartDocumentAnalysisを使用します。ジョブ結果からKEY_VALUE_SETブロックとそのRELATIONSHIPSを解析し、キーを値にマッピングして、構造化されたフィールドをDynamoDBに書き込みます。TextractサービスロールがS3入力を読み取り、使用する場合は出力場所にジョブ結果を書き込めることを確認します。.
これが解答である理由
このシナリオでは、複数ページのPDFから構造化されたキー/値フィールドを大規模に抽出する必要があります。StartDocumentAnalysisとFeatureTypesを['FORMS']に設定することで、Textractはドキュメント内のフォームフィールドを正確に識別し、キー/値のペアとして抽出できます。非同期処理は大規模なドキュメント処理に適しており、結果はKEYVALUESETブロックとして返され、DynamoDBに永続化できます。Textractサービスロールの適切な権限は、S3からの読み取りと結果の書き込みに不可欠です。
同期AnalyzeDocumentは複数ページを自動的に処理しません。Comprehendはエンティティ抽出に優れていますが、構造化されたフォームフィールドのキー/値ペア抽出には適していません。AnalyzeExpenseは請求書に特化していますが、この問題では汎用的なフォーム抽出が求められており、Textractのフォーム機能がより柔軟で正確です。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する →
カード不要