Una società di investimento acquisisce un volume sempre crescente di dati semi-strutturati e deve deduplicare i record, rimuovendo duplicati e errori di battitura comuni. Quale opzione offre questa capacità con il minor overhead operativo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare la funzionalità FindMatches di AWS Glue per rimuovere i record duplicati..
Perché questa è la risposta
La funzionalità FindMatches di AWS Glue è progettata specificamente per identificare e deduplicare record in set di dati, anche quando non esiste una chiave univoca o i dati contengono errori di battitura e variazioni. Utilizza il machine learning per trovare corrispondenze imprecise, rendendola ideale per dati semi-strutturati e problemi di qualità dei dati come quelli descritti. Questo approccio riduce al minimo l'overhead operativo perché è un servizio gestito e automatizza gran parte del processo di deduplicazione. Le funzioni non-Windows in Amazon Athena non sono adatte per la deduplicazione basata su corrispondenze imprecise; Athena è un motore di query SQL per analisi ad hoc e non offre capacità di corrispondenza fuzzy. Amazon Neptune ML e Apache Gremlin sono per l'analisi di grafi e l'inferenza su dati relazionali, non per la deduplicazione di record semi-strutturati. Le tabelle globali di Amazon DynamoDB sono per la replica multi-regione e la prevenzione di conflitti di scrittura, non per la deduplicazione logica di dati con errori di battitura.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta