StreamDocs, un SaaS de documentos legales, está creando una base de conocimiento de Amazon Bedrock a partir de un gran bucket de S3 con archivos PDF. Quieren una búsqueda vectorial que admita la recuperación semántica y almacene metadatos de documentos (document_id, page). ¿Qué configuración equilibra mejor la calidad de recuperación, la mantenibilidad y los componentes administrados de AWS?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Configure la base de conocimiento de Bedrock para usar el prefijo del bucket de S3 que contiene los PDF como fuente de datos. Extraiga texto y divida los documentos en fragmentos de texto superpuestos (~500 tokens por fragmento con una superposición de 50 a 100 tokens) conservando los metadatos (document_id, page). Indexe los vectores en Amazon OpenSearch Service usando el campo k-NN (dense_vector) con HNSW ANN y almacene los metadatos en el índice de OpenSearch. Use el cifrado de KMS para el acceso a S3 y OpenSearch a través de un rol de IAM..
Por qué esta es la respuesta
La opción correcta describe la configuración estándar y recomendada para una base de conocimiento de Bedrock que utiliza S3 como fuente y OpenSearch Service como almacén vectorial. La fragmentación de ~500 tokens con superposición es una práctica común para equilibrar la granularidad y el contexto, y la conservación de metadatos es crucial para la recuperación. OpenSearch Service con k-NN y HNSW ANN proporciona una búsqueda vectorial eficiente y escalable, y el cifrado de KMS con roles de IAM garantiza la seguridad. Las opciones incorrectas presentan problemas: La fragmentación en "5 a 10 palabras" es demasiado pequeña, lo que resulta en una pérdida de contexto y una recuperación ineficaz. Almacenar embeddings en DynamoDB para búsqueda de similitud no es su caso de uso principal y carece de las capacidades de búsqueda vectorial de OpenSearch. S3 Select no está diseñado para la búsqueda de similitud semántica sobre embeddings y no es un almacén vectorial. Calcular embeddings bajo demanda sin almacenamiento persistente es ineficiente y costoso para un gran volumen de documentos, y confiar en una "caché interna de Bedrock" para la búsqueda de similitud no es una solución robusta ni escalable.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta