Un'azienda deve estrarre entità nominate da un PDF per addestrare un classificatore. Quale approccio estrarrà tali entità e le salverà nel MINOR tempo possibile?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare Amazon Comprehend per estrarre le entità. Archiviare l'output in Amazon S3..
Perché questa è la risposta
L'opzione corretta è la più efficiente perché Amazon Comprehend è un servizio di Natural Language Processing (NLP) completamente gestito che include funzionalità di Named Entity Recognition (NER) pre-addestrate. Può elaborare direttamente documenti PDF (o testo estratto da essi) per identificare e classificare entità come nomi di persone, luoghi e organizzazioni, richiedendo il minimo sforzo e tempo per l'implementazione. L'archiviazione su S3 è uno standard per l'output. Le altre opzioni sono meno efficienti: L'OCR open source su SageMaker richiede la gestione dell'infrastruttura e lo sviluppo/integrazione di modelli, aumentando notevolmente il tempo. Amazon Textract è eccellente per l'estrazione di testo e dati da documenti, ma non esegue NER. Avrebbe comunque bisogno di Comprehend per l'analisi delle entità, aggiungendo un passaggio non necessario se il PDF è già testuale o se Comprehend può gestirlo direttamente. Amazon Textract con A2I aggiunge un ciclo di revisione umana, utile per alta precisione ma non per la minimizzazione del tempo, e non esegue comunque NER direttamente.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta