Компания хранит обучающие данные во вложенных JSON-файлах в S3 и нуждается в табличном формате для обучения XGBoost. Какой подход имеет наименьшие операционные издержки для преобразования этих JSON-файлов в табличные данные?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать задание AWS Glue PySpark, которое использует преобразование Relationalize для конвертации файлов..
Почему это правильный ответ
Создание задания AWS Glue PySpark с использованием преобразования Relationalize является наиболее эффективным решением. AWS Glue — это бессерверный сервис ETL, который автоматически обрабатывает вложенные структуры JSON и преобразует их в плоский, табличный формат, идеально подходящий для XGBoost, с минимальными операционными издержками. Relationalize специально разработан для этой цели, упрощая процесс. Написание пользовательского кода Scala для Amazon EMR Serverless требует больше усилий по разработке и управлению кластером, даже если он бессерверный. Использование AWS Lambda с Python для reduce() может быть неоптимальным для больших объемов данных из-за ограничений по времени выполнения и памяти, а также требует ручной реализации логики преобразования. Amazon Athena может запрашивать JSON, но функция flatten() может быть сложной для глубоко вложенных структур и не предназначена для преобразования данных в новый постоянный табличный формат для последующего использования в обучении.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется