A StreamDocs, uma SaaS de documentos jurídicos, está construindo uma base de conhecimento do Amazon Bedrock a partir de um grande bucket S3 de PDFs. Eles desejam uma pesquisa vetorial que suporte recuperação semântica e armazene metadados de documentos (document_id, page). Qual configuração melhor equilibra qualidade de recuperação, manutenibilidade e componentes gerenciados da AWS?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Configure a base de conhecimento do Bedrock para usar o prefixo do bucket S3 contendo PDFs como fonte de dados. Extraia texto e divida os documentos em blocos de texto sobrepostos (~500 tokens por bloco com sobreposição de 50 a 100 tokens), preservando os metadados (document_id, page). Indexe vetores no Amazon OpenSearch Service usando o campo k-NN (dense_vector) com HNSW ANN e armazene metadados no índice do OpenSearch. Use criptografia KMS para S3 e acesso ao OpenSearch via uma função IAM..
Por que esta é a resposta
A opção correta descreve a abordagem padrão e recomendada para construir uma base de conhecimento robusta com o Amazon Bedrock. A ingestão de dados diretamente do S3, o chunking adequado (blocos de ~500 tokens com sobreposição de 50 a 100 tokens) e a preservação de metadados são cruciais para a qualidade da recuperação. O Amazon OpenSearch Service com k-NN (HNSW ANN) é um armazenamento vetorial gerenciado e escalável que suporta pesquisa semântica eficiente e armazenamento de metadados. A criptografia KMS e o controle de acesso via IAM garantem a segurança. As opções incorretas apresentam falhas: Chunking extremamente pequeno (5 a 10 palavras) degrada o contexto e a qualidade dos embeddings. O DynamoDB não é um banco de dados vetorial otimizado para pesquisa de similaridade e o API Gateway não é a ferramenta adequada para consultas de similaridade. O Bedrock não realiza pesquisa semântica diretamente sobre chaves de objetos S3. O S3 Select não é uma ferramenta para pesquisa de similaridade semântica baseada em embeddings. Calcular embeddings sob demanda para cada consulta sem armazenamento persistente é ineficiente e caro. Confiar em cache interno do Bedrock para similaridade sem um armazenamento vetorial explícito não é uma prática recomendada para escalabilidade e controle.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão