Инженер машинного обучения должен обрабатывать тысячи существующих CSV-файлов, а также новые загрузки CSV, хранящиеся в центральном бакете S3. Все CSV-файлы имеют одинаковую структуру столбцов и включают столбец с датой транзакции, по которому необходимо выполнять запросы. Какое решение обеспечивает это с наименьшими операционными издержками?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Запустить Amazon Athena CREATE TABLE AS SELECT (CTAS) для создания таблицы (секционированной или отфильтрованной по дате транзакции) на основе данных S3, затем выполнять запросы к этой таблице..
Почему это правильный ответ
Правильный ответ — запустить Amazon Athena CREATE TABLE AS SELECT (CTAS). Athena позволяет напрямую запрашивать данные в S3 с помощью SQL, а CTAS создает новую таблицу на основе результатов запроса, что идеально подходит для создания секционированной или отфильтрованной по дате таблицы. Это минимизирует операционные издержки, поскольку не требует управления серверами или сложной ETL-логики. Остальные варианты менее оптимальны: S3 Object Lambda не предназначена для запросов по дате транзакции в масштабе тысяч файлов и увеличивает сложность. AWS Glue for Apache Spark — это мощный инструмент ETL, но его использование для простого запроса и записи данных с одинаковой структурой создает излишние операционные издержки по сравнению с Athena. Kinesis Data Firehose предназначен для потоковой передачи данных, а не для пакетной обработки существующих файлов, и использование Lambda для запросов по дате транзакции в Firehose не является эффективным решением для этой задачи.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется