Компания хранит полуструктурированные транзакционные данные в S3. Некоторые файлы очень маленькие, в то время как другие достигают десятков терабайт. Источник ежедневно отправляет полный JSON-снимок, а также измененные записи в озеро данных. Инженер данных должен выполнить захват измененных данных (CDC) для наиболее экономичного выявления изменений. Какое решение является НАИБОЛЕЕ экономичным?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать формат озера данных с открытым исходным кодом для объединения источника данных с озером данных S3 для вставки новых данных и обновления существующих данных..
Почему это правильный ответ
Использование формата озера данных с открытым исходным кодом (например, Apache Iceberg, Delta Lake или Apache Hudi) является наиболее экономичным решением, поскольку эти форматы разработаны для эффективной обработки CDC непосредственно в S3. Они позволяют выполнять операции слияния (upsert) для вставки новых и обновления существующих записей без перезаписи всего файла, что значительно снижает затраты на хранение и обработку. Другие варианты менее экономичны: AWS Lambda для выявления изменений потребует значительных вычислительных ресурсов для сравнения больших объемов данных, что может быть дорого. Использование Amazon RDS или Aurora MySQL с AWS DMS вводит дополнительные затраты на управление реляционной базой данных и ее репликацию, что является избыточным для прямого CDC в озере данных.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется