A FinCorp executa um pipeline de detecção de fraudes na AWS. Você criou vários SageMaker Feature Groups com o offline store habilitado para persistir valores de recursos históricos no S3. Os cientistas de dados precisam gerar conjuntos de dados de treinamento que unam registros de transações (CSV no S3 com um transaction_timestamp) aos valores de recursos históricos corretos a partir de cada tempo de transação usando SQL no Athena. Qual configuração e etapa permitirão junções performáticas e corretas em carimbos de data/hora de recursos históricos para grandes exportações de treinamento de forma confiável?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Ao criar cada FeatureGroup, habilite o offline store com DataCatalogConfig (tabela Glue) apontando para o prefixo S3 onde os arquivos parquet offline são armazenados. Certifique-se de que o FeatureGroup esteja configurado com record_identifier_column e event_time_feature_name. Conceda permissões de leitura do Glue e S3 à função de treinamento e, em seguida, escreva SQL do Athena que une sua tabela de transações à tabela Glue do FeatureGroup usando a chave primária e event_time <= transaction_timestamp com poda de partição apropriada..
Por que esta é a resposta
A opção correta descreve a abordagem recomendada para junções performáticas e corretas de dados históricos no SageMaker Feature Store. Habilitar o offline store com DataCatalogConfig cria uma tabela Glue que permite consultas SQL eficientes via Athena. A configuração de recordidentifiercolumn e eventtimefeaturename é crucial para junções pontuais (point-in-time joins), garantindo que os recursos históricos corretos sejam recuperados para cada transação. A poda de partição otimiza o desempenho da consulta. As outras opções são incorretas porque: Usar apenas o online store com GetRecord para grandes volumes de dados é ineficiente e caro. O SageMaker Batch Transform não é a ferramenta ideal para junções complexas de dados históricos com base em carimbos de data/hora; ele é mais adequado para inferência em lote. Configurar um Glue crawler sem DataCatalogConfig no FeatureGroup pode levar a esquemas e partições incorretos ou incompletos, dificultando junções precisas e performáticas.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão