Een bedrijf heeft een S3-map die gemengde bestandstypen bevat (CSV, JSON, XLSX en Apache Parquet). Een ML-engineer zal AWS Glue DataBrew gebruiken om de gegevens te verwerken en moet de uiteindelijke uitvoer terug opslaan naar S3, zodat AWS Glue deze later kan consumeren. Welke aanpak voldoet aan deze vereisten?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Scheid de bestanden in afzonderlijke mappen per bestandstype, verwerk elke map met DataBrew en schrijf de uitvoer in Apache Parquet-formaat..
Waarom dit het antwoord is
De juiste aanpak is om de bestanden eerst te scheiden op bestandstype. AWS Glue DataBrew is ontworpen om te werken met datasets van een uniform type. Het verwerken van een S3-map met gemengde bestandstypen (CSV, JSON, XLSX, Parquet) in één DataBrew-taak kan leiden tot fouten of onvolledige verwerking, omdat DataBrew mogelijk niet alle formaten correct kan interpreteren binnen één datasetdefinitie. Door de bestanden te scheiden, kan DataBrew elke dataset efficiënt en correct verwerken. De uitvoer opslaan in Apache Parquet-formaat is de beste keuze, omdat dit een geoptimaliseerd kolomgeoriënteerd formaat is dat zeer efficiënt is voor analyse en opslag, en naadloos kan worden geconsumeerd door AWS Glue en andere AWS-analysediensten. De optie "AWS Glue Parquet-formaat" is misleidend; er bestaat geen specifiek "AWS Glue Parquet-formaat", alleen het standaard Apache Parquet-formaat dat door AWS Glue wordt ondersteund.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig