StreamDocs, ein SaaS für juristische Dokumente, erstellt eine Amazon Bedrock-Wissensdatenbank aus einem großen S3-Bucket mit PDFs. Sie möchten eine Vektorsuche, die semantisches Retrieval unterstützt und Dokumentenmetadaten (document_id, page) speichert. Welche Konfiguration gleicht Retrieval-Qualität, Wartbarkeit und AWS Managed Components am besten aus?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Konfigurieren Sie die Bedrock-Wissensdatenbank so, dass sie das S3-Bucket-Präfix mit PDFs als Datenquelle verwendet. Extrahieren Sie Text und zerlegen Sie Dokumente in überlappende Textblöcke (~500 Tokens pro Block mit 50–100 Token-Überlappung), wobei Metadaten (document_id, page) erhalten bleiben. Indizieren Sie Vektoren in Amazon OpenSearch Service mithilfe des k-NN (dense_vector)-Feldes mit HNSW ANN und speichern Sie Metadaten im OpenSearch-Index. Verwenden Sie KMS-Verschlüsselung für den S3- und OpenSearch-Zugriff über eine IAM-Rolle..
Warum dies die Antwort ist
Die korrekte Option beschreibt die empfohlene Architektur für eine Bedrock-Wissensdatenbank. Die Konfiguration des S3-Buckets als Datenquelle, die Textzerlegung in überlappende Blöcke (Chunks) mit Metadaten (documentid, page) und die Indizierung in Amazon OpenSearch Service mit k-NN (densevector) und HNSW ANN sind Best Practices für semantisches Retrieval und Skalierbarkeit. Die Verwendung von KMS und IAM-Rollen gewährleistet Sicherheit. Die anderen Optionen sind suboptimal: Extrem kleine Chunks (5-10 Wörter) maximieren nicht die Retrieval-Qualität, sondern können den Kontext zerstören. DynamoDB ist kein Vektorspeicher und API Gateway ist nicht für die direkte Ähnlichkeitssuche konzipiert. S3 Select ist für SQL-Abfragen auf Objekten gedacht, nicht für semantische Ähnlichkeitssuchen ohne Embeddings. Das Streamen von PDFs zur Abfragezeit und die bedarfsgesteuerte Berechnung von Embeddings sind ineffizient und skalieren nicht gut. Das Verlassen auf den internen Cache von Bedrock für die Ähnlichkeitssuche ist keine dauerhafte Lösung für Metadaten.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich