AmazonAmazon Machine Learning Specialty MLS-C01
·JA
·更新日 26 Jul 2026
ある企業が多数の紙のレシートを画像に変換しており、日付、場所、メモ、カスタムフィールド(レシート番号)などのエンティティを抽出する必要があります。同社はすでにOCRを使用してテキストを取得していますが、ドキュメントのレイアウトはさまざまであり、ラベル付けワークフローの構築には時間がかかります。また、小規模なNERデータセットがあり、さらに多くのトレーニングデータが必要です。信頼性の高いエンティティ抽出を行うために、最も少ない労力で済むアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: Amazon Textractを使用してレシート画像からテキストを抽出し、Amazon Comprehendでエンティティ検出を行い、カスタムフィールドにはComprehend custom entity recognitionを使用します。.
これが解答である理由
このシナリオでは、OCRでテキストを抽出し、さまざまなレイアウトのドキュメントからエンティティを抽出する必要があります。Amazon Textractは、レシートや請求書などのドキュメントからテキスト、フォーム、テーブルを自動的に抽出できるため、OCRタスクに最適です。Amazon Comprehendは、事前トレーニング済みのモデルを使用して一般的なエンティティ(日付、場所など)を検出でき、Comprehend Custom Entity Recognitionを使用すると、レシート番号のようなカスタムエンティティを少量のラベル付きデータでトレーニングできます。これにより、ラベル付けの手間を最小限に抑えながら、信頼性の高いエンティティ抽出を実現できます。
他の選択肢は、BlazingTextモデルのトレーニングに多くの労力を要したり、サードパーティのOCRモデルに依存したりするため、最適なソリューションではありません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する →
カード不要