StreamDocs, SaaS-сервис для работы с юридическими документами, создает базу знаний Amazon Bedrock из большого S3-бакета с PDF-файлами. Им нужен векторный поиск, который поддерживает семантический поиск и хранит метаданные документов (document_id, page). Какая конфигурация наилучшим образом сочетает качество поиска, удобство обслуживания и управляемые компоненты AWS?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Настроить базу знаний Bedrock на использование префикса S3-бакета, содержащего PDF-файлы, в качестве источника данных. Извлечь текст и разбить документы на перекрывающиеся текстовые фрагменты (~500 токенов на фрагмент с перекрытием 50–100 токенов), сохраняя метаданные (document_id, page). Индексировать векторы в Amazon OpenSearch Service, используя поле k-NN (dense_vector) с HNSW ANN, и хранить метаданные в индексе OpenSearch. Использовать шифрование KMS для S3 и доступа к OpenSearch через роль IAM..
Почему это правильный ответ
Правильный ответ использует базу знаний Bedrock с S3 в качестве источника данных, что является рекомендуемым подходом для управления большими объемами документов. Разбиение документов на перекрывающиеся фрагменты с сохранением метаданных (documentid, page) обеспечивает эффективный семантический поиск и позволяет точно указывать на источник информации. Индексирование векторов в Amazon OpenSearch Service с k-NN (densevector) и HNSW ANN обеспечивает высококачественный векторный поиск. Хранение метаданных непосредственно в индексе OpenSearch упрощает их получение. Использование шифрования KMS и ролей IAM обеспечивает безопасность. Остальные варианты не оптимальны: Использование очень маленьких фрагментов (5–10 слов) может привести к потере контекста и снижению качества поиска. Хранение эмбеддингов в DynamoDB и прямой запрос через API Gateway не является стандартным решением для векторного поиска и не обеспечивает его эффективность. Поиск по ключам объектов S3 и S3 Select не поддерживают семантический поиск и не предназначены для работы с эмбеддингами. Потоковая передача PDF-файлов в Bedrock по требованию и вычисление эмбеддингов без постоянного хранения векторов неэффективно для больших объемов данных и не обеспечивает быстрого семантического поиска.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется