FinCorp ejecuta un pipeline de detección de fraude en AWS. Usted creó múltiples SageMaker Feature Groups con el almacén offline habilitado para persistir los valores históricos de las características en S3. Los científicos de datos necesitan generar conjuntos de datos de entrenamiento que unan los registros de transacciones (CSV en S3 con un transaction_timestamp) a los valores históricos correctos de las características a partir de cada tiempo de transacción usando SQL en Athena. ¿Qué configuración y paso permitirán de forma fiable uniones correctas y de alto rendimiento en las marcas de tiempo de las características históricas para grandes exportaciones de entrenamiento?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Al crear cada FeatureGroup, habilite el almacén offline con DataCatalogConfig (tabla de Glue) apuntando al prefijo de S3 donde se encuentran los archivos parquet offline. Asegúrese de que el FeatureGroup esté configurado con record_identifier_column y event_time_feature_name. Otorgue al rol de entrenamiento permisos de lectura de Glue y S3, luego escriba SQL de Athena que una su tabla de transacciones a la tabla de Glue del FeatureGroup usando la clave primaria y event_time <= transaction_timestamp con la poda de particiones adecuada..
Por qué esta es la respuesta
La opción correcta describe la forma más eficiente y escalable de generar conjuntos de datos de entrenamiento con características históricas. Habilitar el almacén offline con DataCatalogConfig crea una tabla de Glue que Athena puede consultar directamente sobre los datos Parquet en S3. La configuración de recordidentifiercolumn y eventtimefeaturename es crucial para que Feature Store organice los datos correctamente y permita uniones basadas en el tiempo. La unión SQL con eventtime <= transactiontimestamp y la poda de particiones garantizan que se recuperen las características correctas para cada transacción en su momento, optimizando el rendimiento para grandes exportaciones. Las opciones incorrectas presentan limitaciones: Mantener solo el almacén online y usar GetRecord para cada fila es ineficiente y costoso para grandes volúmenes de datos de entrenamiento. Usar SageMaker Batch Transform para llamar a la API featurestore-runtime es más adecuado para inferencia por lotes, no para la generación de conjuntos de datos de entrenamiento históricos, y puede ser menos eficiente que una consulta directa a Athena. Configurar un rastreador de Glue sin DataCatalogConfig puede llevar a esquemas incorrectos o incompletos, y el rastreador no infiere automáticamente todas las optimizaciones necesarias para uniones basadas en tiempo eficientes.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta