Вы получили набор данных CSV в S3, который будете использовать для обучения ML. Перед обучением необходимо найти пропущенные или недопустимые значения и подсчитать выбросы с наименьшими эксплуатационными затратами. Какой подход соответствует этому требованию?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Оставить данные в формате CSV, импортировать их в SageMaker Data Wrangler и использовать отчет Data Quality and Insights..
Почему это правильный ответ
Правильный ответ — использование SageMaker Data Wrangler. Он предоставляет мощные инструменты для подготовки данных, включая обнаружение пропущенных/недопустимых значений и подсчет выбросов, с помощью отчета Data Quality and Insights. Это решение оптимизировано для интерактивного анализа и преобразования данных, что делает его эффективным и экономичным для данной задачи. Преобразование в Parquet с помощью AWS Glue и последующий запрос через Athena (первый и второй варианты) требуют дополнительных шагов и могут быть более затратными с точки зрения времени и ресурсов для простой задачи профилирования данных. Хотя Athena может использоваться для запросов, Data Wrangler предлагает более специализированные и визуальные инструменты для анализа качества данных. Импорт в Data Wrangler без предварительного преобразования (четвертый вариант) является наиболее прямым и эффективным способом, так как Data Wrangler может работать напрямую с CSV.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется