Вы получили файл Apache Parquet размером 50 МБ для модели обнаружения мошенничества, который содержит несколько коррелированных, ненужных столбцов. Какой способ потребует наименьших усилий для удаления этих столбцов из файла?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать поток данных в SageMaker Data Wrangler и добавить шаг преобразования для удаления ненужных столбцов..
Почему это правильный ответ
SageMaker Data Wrangler — это визуальный инструмент, который позволяет легко подготавливать данные для машинного обучения. Он предлагает готовые преобразования, включая удаление столбцов, что делает его наиболее простым и наименее трудоемким решением для данной задачи. Загрузка файла на локальную рабочую станцию и использование пользовательского скрипта Python (вариант 1) требует написания кода и ручной обработки, что менее эффективно. Создание задания Apache Spark на Amazon EMR (вариант 2) или запуск задания обработки SageMaker с помощью SageMaker Python SDK (вариант 3) также требуют написания и управления кодом, что является более сложным подходом по сравнению с визуальным интерфейсом Data Wrangler. Кроме того, one-hot encoding (вариант 1) не является методом удаления столбцов, а методом кодирования категориальных признаков.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется