一位数据工程师需要维护一个中央元数据存储库,该存储库可从 Amazon EMR 和 Amazon Athena 查询访问,并且必须以最少的开发工作量将现有的 Apache Hive 元数据导入其中。他们应该使用哪种解决方案?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 AWS Glue Data Catalog。.
为什么这是答案
AWS Glue Data Catalog 是一个持久的元数据存储库,与 Apache Hive Metastore 兼容。它能无缝地与 Amazon EMR 和 Amazon Athena 集成,提供一个集中的、可查询的元数据存储。将现有的 Apache Hive 元数据导入 AWS Glue Data Catalog 只需要最少的开发工作量,因为它支持 Hive Metastore 协议,可以直接导入或同步。 其他选项的不足之处: 使用 Amazon EMR 和 Apache Ranger:Apache Ranger 主要用于授权和审计,而非元数据存储。 在 EMR 集群上使用 Hive metastore:这会使元数据与集群的生命周期绑定,不是持久化且独立的解决方案,不便于多服务共享。 在 Amazon RDS for MySQL 数据库实例上使用 metastore:虽然可以存储元数据,但需要手动配置和管理 Hive Metastore 服务,开发工作量大,且不如 AWS Glue Data Catalog 与其他 AWS 服务集成度高。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡