A AdView Inc. quer construir um único fluxo do SageMaker Data Wrangler que una um CSV do S3 de logs de campanha com uma tabela do Redshift de perfis de clientes e, em seguida, exporte o conjunto de dados limpo e unido para Parquet. O cluster do Redshift está em uma sub-rede privada. Qual é a sequência correta de ações para implementar isso no Data Wrangler, garantindo conectividade e correção?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Faça upload do CSV do S3 como um conjunto de dados do Data Wrangler e adicione o Redshift como outro conjunto de dados no fluxo usando as credenciais JDBC do Redshift. Adicione uma transformação Join no fluxo especificando as chaves de junção. Configure o processamento/exportação do fluxo do Data Wrangler para ser executado em uma VPC com sub-redes e grupos de segurança que permitam acesso ao cluster do Redshift, e garanta que a função IAM usada pelo Data Wrangler tenha permissão para acessar o S3 e as credenciais do Redshift..
Por que esta é a resposta
A opção correta descreve o processo completo e seguro para integrar dados de S3 e Redshift privados no Data Wrangler. É necessário carregar o CSV do S3 e adicionar o Redshift como um conjunto de dados separado, usando credenciais JDBC. A junção é então realizada no fluxo do Data Wrangler. Crucialmente, para acessar um cluster Redshift em uma sub-rede privada, o processamento/exportação do Data Wrangler deve ser configurado para ser executado em uma VPC com as sub-redes e grupos de segurança apropriados, e a função IAM deve ter as permissões necessárias para S3 e Redshift. As outras opções estão incorretas porque: A segunda opção sugere que o Data Wrangler criará automaticamente um proxy de banco de dados e que nenhuma configuração de VPC é necessária, o que não é verdade para Redshift em sub-redes privadas. A terceira opção ignora a capacidade do Data Wrangler de realizar junções e sugere um fluxo de trabalho mais complexo e desnecessário com o Glue ETL para uma tarefa que o Data Wrangler pode gerenciar. A quarta opção propõe uma consulta federada do Redshift para o S3 e afirma que o Data Wrangler não requer alterações de rede, o que é incorreto para acessar um Redshift privado e não utiliza o Data Wrangler para a junção de forma eficaz.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão