一个生命科学团队从测序仪生成的数据,每个基因组大约200 GB。他们每天运行10-15个作业。每个作业在理想计算条件下可能需要几个小时。测序数据存储在本地SAN上,公司拥有高速AWS Direct Connect链接。最终结果必须存储在Amazon S3中。该团队希望将基因组分析平台迁移到AWS,以根据需求进行扩展并缩短周转时间。哪种解决方案符合这些要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用AWS DataSync将测序数据传输到S3。使用S3事件触发一个Lambda函数,该函数启动AWS Step Functions工作流。将Docker镜像存储在Amazon ECR中,并让AWS Batch运行容器来处理测序作业。.
为什么这是答案
正确答案提供了最全面且可扩展的解决方案。AWS DataSync高效地将本地200GB基因组数据传输到S3。S3事件触发Lambda函数,进而启动AWS Step Functions工作流,实现复杂的基因组分析流程编排。将Docker镜像存储在Amazon ECR中,并利用AWS Batch处理容器化作业,可以根据需求自动扩展计算资源,显著缩短周转时间。 选项A (Snowball Edge) 不适合每日10-15个作业的频率,主要用于大规模一次性数据迁移。 选项B (Data Pipeline) 复制数据到S3,但使用EC2 Auto Scaling组启动自定义AMI实例来处理数据,不如AWS Batch在处理容器化作业方面高效和管理简单。 选项D (Storage Gateway文件网关) 适合文件共享,但对于如此大的数据集和高性能计算需求,DataSync是更优的传输选择。S3事件触发AWS Batch作业是可行的,但缺少Step Functions进行复杂工作流编排,且未提及ECR存储Docker镜像。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡