FinCorp использует конвейер обнаружения мошенничества в AWS. Вы создали несколько SageMaker Feature Groups с включенным автономным хранилищем (offline store) для сохранения исторических значений признаков в S3. Специалистам по данным необходимо генерировать обучающие наборы данных, которые объединяют записи транзакций (CSV в S3 с transaction_timestamp) с правильными историческими значениями признаков на момент каждой транзакции с использованием SQL в Athena. Какая конфигурация и шаг надежно обеспечат производительные и корректные объединения по временным меткам исторических признаков для больших экспортов обучающих данных?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: При создании каждого FeatureGroup включите автономное хранилище с DataCatalogConfig (таблица Glue), указывающее на префикс S3, куда попадают автономные файлы parquet. Убедитесь, что FeatureGroup настроен с record_identifier_column и event_time_feature_name. Предоставьте обучающей роли разрешения на чтение Glue и S3, затем напишите SQL-запрос Athena, который объединяет вашу таблицу транзакций с таблицей FeatureGroup Glue, используя первичный ключ и event_time <= transaction_timestamp с соответствующей отсечкой разделов (partition pruning)..
Почему это правильный ответ
Правильный ответ описывает стандартный и эффективный подход для создания обучающих наборов данных с историческими признаками. Использование автономного хранилища (offline store) Feature Store с DataCatalogConfig автоматически создает таблицу Glue, позволяя Athena напрямую запрашивать исторические данные признаков в S3. Настройка recordidentifiercolumn и eventtimefeaturename является ключевой для корректного объединения по временным меткам, обеспечивая, что для каждой транзакции выбираются признаки, актуальные на момент её совершения (eventtime <= transactiontimestamp). Отсечка разделов (partition pruning) в Athena значительно повышает производительность запросов к большим наборам данных. Использование только онлайн-хранилища (online store) не подходит для генерации больших обучающих наборов данных, так как запросы GetRecord для каждой транзакции будут медленными и дорогостоящими. SageMaker Batch Transform с вызовами featurestore-runtime также не является оптимальным для этой задачи, поскольку он предназначен для пакетного вывода, а не для эффективного объединения исторических данных признаков. Настройка Glue crawler без DataCatalogConfig не гарантирует правильную структуру таблицы и метаданные, необходимые для эффективных запросов с временными метками.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется