Amazon MLA-C01: Компьютерное зрение, NLP и специализированный ML — Руководство по подготовке
Часть AWS Machine Learning Engineer Associate MLA-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.
Основная концепция
Решения для компьютерного зрения и NLP в AWS строятся на трех уровнях: прием и безопасность данных, подготовка признаков и меток, а также жизненный цикл модели (обучение, реестр, развертывание, мониторинг). Для классификации изображений и обнаружения объектов рабочие процессы обучения сосредоточены на хранении размеченных данных в Amazon S3 со строгим шифрованием и сетевым контролем, а также на форматах аннотаций, таких как Pascal VOC / COCO для обнаружения объектов и RecordIO или TFRecord для высокопроизводительного обучения. Для классификации текста и распознавания именованных сущностей (NER) входными данными обычно являются токенизированные последовательности (WordPiece/BPE для трансформерных моделей) или JSON с разделителями-строками (line-delimited) с метками; предварительная обработка должна сохранять смещения токенов относительно символов при использовании выходных данных Rekognition Textract или размеченных вручную фрагментов, чтобы обеспечить согласованность привязки меток NER. Инжиниринг признаков для табличных моделей обнаружения мошенничества фокусируется на агрегации по временным окнам, сокращении кардинальности категориальных признаков и обеспечении согласованного кодирования между обучением и инференсом; использование централизованного преобразования (Feature Store или поток Data Wrangler) предотвращает расхождение (skew) между офлайн-обучением и онлайн-инференсом.
Выбор инструментов для построения моделей соответствует специализированным сервисам AWS: Amazon SageMaker предлагает встроенные алгоритмы (XGBoost, Linear Learner, Random Cut Forest) и управляемые контейнеры для фреймворков (MXNet, TensorFlow, PyTorch), а также SageMaker Clarify для анализа смещений (bias) и интерпретируемости. Amazon Rekognition предоставляет готовые API для работы с изображениями для разметки, распознавания лиц/знаменитостей и обучения пользовательских моделей (custom labels) через Rekognition Custom Labels, когда требуются низкие операционные издержки. Для извлечения текста и структурированных данных из документов Amazon Textract обеспечивает OCR и извлечение данных из форм/таблиц; для задач на уровне языка, таких как анализ тональности, распознавание сущностей или моделирование тем, Amazon Comprehend предоставляет управляемые API, а Comprehend Medical — для распознавания именованных сущностей в медицинских текстах (clinical NER). Ключевым моментом для производственной эксплуатации является объединение этих компонентов в согласованный конвейер (pipeline), чтобы предварительная обработка, входные данные модели и мониторинг были воспроизводимыми и поддавались аудиту.
Ключевые сервисы и конфигурация
Основные сервисы AWS и соответствующие параметры API/конфигурации, которые необходимо знать: Amazon SageMaker (TrainingJob, ModelPackage, ModelPackageGroup, ModelRegistry), SageMaker Pipelines (RegisterModel, CallbackStep, ConditionStep), SageMaker Model Monitor и Clarify (BaselineConfig, DataConfig, ModelConfig, bias_config), Amazon Rekognition, Amazon Comprehend, Amazon Textract, AWS Glue и Lake Formation. Для безопасного изолированного хранения настройте S3 с серверным шифрованием с использованием SSE-KMS (S3.PutBucketEncryption с SSEKMSKeyId), примените политики бакета (bucket policies), ограничивающие доступ до роли выполнения SageMaker, и включите Gateway VPC endpoint для S3 для передачи данных по приватной сети. При запуске заданий обучения установите параметр VpcConfig (SecurityGroupIds и Subnets) в CreateTrainingJob, чтобы инстансы запускались в VPC клиента, и включите NetworkIsolation и InstanceMetadataServiceConfiguration для ограничения доступа.
Для централизованного управления моделями с минимальными операционными издержками используйте SageMaker Model Registry, создав ModelPackageGroup и добавляя версии ModelPackage со статусом ModelApprovalStatus ‘PendingManualApproval’ через CreateModelPackage. Автоматизируйте этап ручного утверждения, добавив CallbackStep или специальный шаг “ManualApproval” в SageMaker Pipelines; конвейер будет ожидать внешнего сигнала, после чего вы вызываете UpdateModelPackage, чтобы установить ModelApprovalStatus=‘Approved’ для развертывания. Для оценки смещений (bias) или дрейфа по требованию для развернутых real-time эндпоинтов используйте SageMaker Clarify для метрик смещения и SageMaker Model Monitor для дрейфа данных и предсказаний: собирайте данные инференса, включив DataCaptureConfig в CreateEndpoint (EnableCapture, CaptureOptions, DestinationS3Uri), а затем запустите задание обработки Clarify через CreateProcessingJob с параметрами Clarify SDK DataConfig, ModelConfig и bias_config, чтобы немедленно рассчитать метрики дрейфа.
Ключевые сервисы:
- Amazon SageMaker (TrainingJob, CreateModelPackage, UpdateModelPackage, CreateProcessingJob, CreateMonitoringSchedule)
- SageMaker Pipelines (RegisterModel, CallbackStep, ConditionStep)
- SageMaker Clarify (DataConfig, ModelConfig, bias_config, explainability_config)
- Amazon Rekognition (StartProjectVersion, DetectLabels, CreateProjectVersion)
- Amazon Comprehend (DetectEntities, StartEntitiesDetectionJob)
- Amazon Textract (StartDocumentTextDetection, AnalyzeDocument)
- AWS Glue и AWS Lake Formation (Crawlers, Jobs, Data Catalog)
- Amazon Lookout for Metrics и Amazon QuickSight для визуализации аномалий
Распространенные ошибки и критерии принятия решений
Частая ошибка — отказ от централизации артефактов предварительной обработки. Если токенизация, сопоставление меток для NER или кодировщики категориальных признаков применяются по-разному при обучении и выводе, это приводит к ошибкам прогнозирования, которые трудно отследить. Используйте Feature Store или сохраняйте артефакты предварительной обработки (токенизатор, vocab.json, label_map) вместе с пакетом модели в Model Registry, чтобы развернутый контейнер мог извлекать и применять в точности те же преобразования. Другая распространенная проблема — недостаточный сбор данных для мониторинга: без включения DataCaptureConfig на эндпоинте и правильно организованного процесса разметки эталонных данных (ground-truth) Model Monitor не сможет рассчитать смещение или метрики качества, и выяснение причин падения F1-меры превратится в гадание. При несбалансированных классах наименее трудоемким решением является использование взвешивания, поддерживаемого алгоритмом (например, гиперпараметр scale_pos_weight в XGBoost или предоставление столбца с весами в обучающих данных), вместо слепого увеличения/уменьшения выборки (upsampling/downsampling), которое может привести к смещению выборки.
Практическая задача: сценарий использования
Компания: MeridianPay. MeridianPay должна создать конвейер для обнаружения мошенничества в реальном времени, который объединяет журналы транзакций из S3 и профили клиентов из локальной (on-prem) базы данных MySQL. Требования включают: безопасное изолированное хранилище, центральный реестр моделей с ручным утверждением, минимальную задержку запуска для последовательных сеансов обучения, автоматическое обнаружение аномалий и визуализацию после агрегации, поддержку смешанных категориальных и числовых признаков с минимальными операциями, обработку несбалансированных классов и производственную модель, которую можно отслеживать на предмет смещения (drift) и предвзятости (bias) по требованию.
Агрегация и защита данных: используйте AWS DMS для непрерывной репликации таблиц из локальной MySQL в зашифрованную целевую зону (landing zone) в S3, запускайте кроулеры AWS Glue и регистрируйте полученные таблицы в AWS Glue Data Catalog. Обеспечьте контроль доступа с помощью AWS Lake Formation и политик бакетов S3; включите Gateway VPC Endpoint для S3 и настройте роль выполнения SageMaker с минимальными привилегиями IAM. Используйте SSE-KMS в S3 с управляемым клиентом ключом KMS и установите BucketEncryption с помощью KmsMasterKeyId.
Преобразование и хранение признаков: создайте преобразования в SageMaker Data Wrangler или в задании Glue ETL, сохраняйте производные признаки в онлайн-хранилище Amazon SageMaker Feature Store для поиска с низкой задержкой при выводе и в офлайн-хранилище для обучения. Храните артефакты токенизатора/кодировщика вместе с артефактами модели. Используйте API FeatureGroup для создания групп признаков и настройте RecordIdentifierFeatureName и EventTimeFeatureName для обеспечения корректности на определенный момент времени (point-in-time correctness).
Обучение с минимальными операционными издержками: используйте встроенный контейнер SageMaker XGBoost, создав CreateTrainingJob с AlgorithmSpecification, указывающим на URI контейнера XGBoost, укажите VpcConfig для запуска в VPC, передайте HyperParameters, включая
"objective":"binary:logistic", и установите"scale_pos_weight"равным соотношению отрицательных примеров к положительным для решения проблемы несбалансированных классов. Чтобы уменьшить повторяющуюся задержку при запуске, внедрите SageMaker Pipelines и включите кеширование для шагов подготовки данных, чтобы при последовательных запусках конвейера неизмененные шаги пропускались; по возможности используйте постоянные запросы к хранилищу признаков вместо повторной обработки.Реестр моделей и ручное утверждение: регистрируйте обученные модели в ModelPackageGroup с помощью CreateModelPackage со статусом
ModelApprovalStatus='PendingManualApproval'. Интегрируйте шаг SageMaker Pipelines CallbackStep, который приостанавливает выполнение после RegisterModel; затем рецензенты вызывают UpdateModelPackage, чтобы установитьModelApprovalStatus='Approved'. Используйте этот утвержденный пакет для конфигураций CreateModel и CreateEndpoint.Обнаружение аномалий и визуализация: после агрегации используйте Amazon Lookout for Metrics для автоматического обнаружения аномалий в агрегированных временных рядах транзакций и настройте интеграцию с S3/Glue. Для визуализации подключите результаты Lookout и данные к дашбордам QuickSight или используйте ноутбуки SageMaker Studio для визуализации смещения признаков. Для оценки смещения/предвзятости модели на развернутых эндпоинтах по требованию включите DataCaptureConfig в CreateEndpoint и запустите задание обработки SageMaker Clarify по требованию (CreateProcessingJob), указав в DataConfig и ModelConfig путь к собранным данным; используйте Model Monitor/CreateMonitoringSchedule для планирования периодических проверок и для запуска однократной проверки с помощью StartMonitoringSchedule.
Обоснование: этот подход централизует данные и преобразования, использует управляемые сервисы там, где они снижают операционную нагрузку (Glue/DMS/Lookout/Comprehend/Textract для своих областей), задействует SageMaker Model Registry и Pipelines для версионирования и ручного утверждения с минимальной кастомной инфраструктурой, решает проблему несбалансированности классов с помощью параметров алгоритма, чтобы избежать ресурсоемкого ресэмплинга, и обеспечивает как плановые, так и по требованию оценки смещения/предвзятости через Model Monitor и Clarify, сохраняя при этом данные зашифрованными и изолированными на уровне сети.
← Оптимизация затрат для ML-нагрузок · Все домены
Отработать эти вопросы → · Тесты на время на ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Сдайте экзамен →