StreamDocs, un SaaS de documents juridiques, est en train de construire une base de connaissances Amazon Bedrock à partir d'un grand bucket S3 de PDF. Ils souhaitent une recherche vectorielle qui prend en charge la récupération sémantique et stocke les métadonnées des documents (document_id, page). Quelle configuration équilibre le mieux la qualité de la récupération, la maintenabilité et les composants gérés par AWS ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Configurez la base de connaissances Bedrock pour utiliser le préfixe du bucket S3 contenant les PDF comme source de données. Extrayez le texte et découpez les documents en morceaux de texte qui se chevauchent (environ 500 tokens par morceau avec un chevauchement de 50 à 100 tokens) en conservant les métadonnées (document_id, page). Indexez les vecteurs dans Amazon OpenSearch Service en utilisant le champ k-NN (dense_vector) avec HNSW ANN et stockez les métadonnées dans l'index OpenSearch. Utilisez le chiffrement KMS pour S3 et l'accès OpenSearch via un rôle IAM..
Pourquoi c'est la réponse
La configuration correcte utilise une base de connaissances Bedrock pointant vers S3, ce qui est la méthode standard pour l'ingestion de documents. Le découpage en morceaux de 500 tokens avec chevauchement est une pratique recommandée pour la récupération sémantique, car il équilibre le contexte et la granularité. L'indexation dans Amazon OpenSearch Service avec k-NN (densevector) et HNSW ANN est une solution robuste et gérée par AWS pour le stockage et la recherche vectorielle, offrant une haute qualité de récupération et la possibilité de stocker des métadonnées. L'utilisation de KMS pour le chiffrement et des rôles IAM pour l'accès garantit la sécurité. Les options incorrectes présentent des lacunes importantes : Le découpage en très petits morceaux (5 à 10 mots) dans DynamoDB est inefficace pour la récupération sémantique et ne tire pas parti des capacités de Bedrock. La recherche directe sur les clés d'objet S3 avec S3 Select ne prend pas en charge la recherche de similarité sémantique basée sur les embeddings. Le calcul des embeddings à la demande via Kinesis Data Streams sans stockage persistant est inefficace et coûteux pour des requêtes répétées, et ne garantit pas une récupération de qualité.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise