Een bedrijf slaat trainingsgegevens op in geneste JSON-bestanden in S3 en heeft een tabelindeling nodig voor XGBoost-training. Welke aanpak heeft de minste operationele overhead om die JSON-bestanden naar tabelgegevens te converteren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Maak een AWS Glue PySpark-taak die de Relationalize-transformatie gebruikt om de bestanden te converteren..
Waarom dit het antwoord is
De AWS Glue Relationalize-transformatie is specifiek ontworpen om geneste JSON- of andere semi-gestructureerde gegevens om te zetten in een relationeel formaat, wat ideaal is voor XGBoost. Het automatiseert het proces van het afvlakken en normaliseren van de gegevens met minimale code, wat resulteert in de laagste operationele overhead. Aangepaste Scala-code op EMR Serverless vereist meer ontwikkelings- en beheerinspanning. Een Lambda-functie met reduce() is minder geschikt voor grote, geneste datasets en kan leiden tot geheugen- of tijdslimieten. Hoewel Athena kan queryen over JSON, heeft het geen ingebouwde flatten-functie die vergelijkbaar is met Glue's Relationalize voor het creëren van een permanente, afgevlakte tabel voor training.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig