Amazon AIF-C01: Инженерия данных для ML — Руководство по подготовке
Часть AWS AI Practitioner AIF-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.
Сбор, разметка, версионирование и управление данными
Сбор репрезентативных и проверяемых наборов данных — это основополагающий шаг для всего машинного обучения. Используйте Amazon S3 в качестве центрального отказоустойчивого хранилища с включенными S3 Versioning и блокировкой объектов для сохранения исходных данных и отслеживания их происхождения. Для структурированного приёма и каталогизации данных регистрируйте наборы данных в AWS Glue Data Catalog и применяйте гранулярный контроль доступа с помощью Lake Formation. Когда требуется ручная разметка, Amazon SageMaker Ground Truth предоставляет встроенные рабочие процессы, интерфейс для аннотирования и циклы активного обучения, которые снижают затраты на разметку, создавая при этом метаданные о согласованности и уверенности разметчиков. Распространённые ошибки включают сбор смещённых или нерепрезентативных выборок, отсутствие записи о происхождении данных и правилах разметки, а также недостаточную проверку качества разметки; смягчайте эти риски, сохраняя аудиты разметки, выполняя слепую повторную разметку подмножеств и используя эвристики для консолидации меток. Решения по конфиденциальности и соответствию требованиям определяют архитектуру: используйте серверное шифрование S3 с управляемыми KMS ключами CMK, ограничивайте доступ с помощью политик IAM и эндпоинтов VPC (AWS PrivateLink), а также выполняйте обнаружение и удаление персональных данных (PII) с помощью Amazon Comprehend перед передачей данных для обучения модели. Для долгосрочных программ создавайте снимки наборов данных, помечайте их идентификаторами и отслеживайте эксперименты с помощью Amazon SageMaker Experiments или внешнего инструмента, такого как DVC, чтобы обеспечить воспроизводимость обучения и отчётность для регуляторов.
Предобработка, инжиниринг признаков и разведочный анализ данных (EDA)
Преобразования и признаки определяют способность модели к обобщению. Используйте AWS Glue или Amazon SageMaker Data Wrangler для профилирования, очистки и нормализации данных, а также выполняйте итеративный разведочный анализ данных с помощью Amazon QuickSight или ноутбуков Jupyter, размещённых в Amazon SageMaker Studio. Для управления признаками в производственной среде используйте Amazon SageMaker Feature Store, чтобы обеспечить согласованность вычисления признаков в офлайн- и онлайн-режимах и избежать расхождения между обучением и инференсом (train/serve skew); храните исходные и производные признаки раздельно и записывайте логику их создания. В конвейерах для временных рядов и потоковой обработки данных следует использовать Amazon Kinesis или потоковый ETL в AWS Glue для обновления признаков с низкой задержкой. Типичные ошибки включают утечку данных (data leakage) — когда информация из будущего попадает в обучающую выборку, — неправильную обработку пропущенных значений и несоответствие между признаками для офлайн-обучения и онлайн-инференса. Критерии принятия решений при проектировании конвейеров зависят от баланса между актуальностью данных и стоимостью: выбирайте пакетный ETL для ресурсоёмких пересчётов исторических данных, потоковую обработку для персонализации в реальном времени и гибридные архитектуры, когда требуются онлайн-признаки с низкой задержкой. Автоматизируйте проверки валидации и контроль соблюдения схемы в Glue или в рамках заданий SageMaker Processing, чтобы на ранней стадии выявлять дрейф схемы (schema drift).
Векторные представления (embeddings), аугментация, синтетические данные и наборы данных для фундаментальных моделей
Векторные представления (embeddings) преобразуют текст, изображения или мультимодальные входные данные в плотные векторы, которые отражают семантические связи; они лежат в основе семантического поиска, генерации с извлечением информации (retrieval-augmented generation) и кластеризации. Реализуйте паттерн генерации с извлечением информации (RAG), в котором вы создаёте векторные представления с помощью Amazon Bedrock или кодировщиков, размещённых на SageMaker, храните векторы в Amazon OpenSearch Service (k-NN), Amazon Kendra или управляемом векторном хранилище и извлекаете контекст для подачи в фундаментальную модель. Аугментация данных и генерация синтетических данных целесообразны при нехватке реальных примеров: используйте генеративные модели в SageMaker для создания перефразирований, преобразований изображений (через Albumentations или SageMaker Processing) или синтетических записей с сохранением конфиденциальности. Остерегайтесь чрезмерной зависимости от синтетических данных — их низкое качество может привести к сдвигу распределения и переобучению моделей на артефактах. Для наборов данных при обучении FM отбирайте высококачественные примеры, приводите форматы к каноническому виду с помощью шаблонов промптов и версионируйте каждый снимок набора данных в S3. При работе с частными данными и сторонними FM отдавайте предпочтение пути частной донастройки (private fine-tuning), перенося вычисления в VPC, или развёртывайте конвейеры, работающие только на извлечение (retrieval-only), которые отправляют в FM только неконфиденциальный контекст, сохраняя исходные документы в защищённом векторном хранилище; применяйте удаление данных и маскирование на уровне токенов для предотвращения утечек. Инжиниринг промптов и шаблоны инструкций (системные промпты) имеют решающее значение для формирования ответов модели; настраивайте параметры temperature, top_k или top_p в соответствии с требуемым уровнем детерминизма и креативности.
Оценка, развертывание, мониторинг и управление жизненным циклом
Оценка должна быть явной, с использованием метрик, соответствующих бизнес-целям: для задач регрессии используются RMSE или MAE, для бинарной классификации оцениваются precision/recall/F1 и ROC AUC, а для суммаризации — варианты ROUGE. Проводите валидацию и кросс-валидацию на этапе оценки и оставьте слепой тестовый набор для окончательной приемки. Развертывайте с помощью эндпоинтов Amazon SageMaker (для инференса в реальном времени или бессерверного) или Amazon Bedrock для управляемого хостинга FM; оптимизируйте задержку, выбирая более компактные дистиллированные модели, включая эндпоинты для нескольких моделей (multi-model endpoints) или используя SageMaker Serverless Inference для непредсказуемого трафика. Отслеживайте производительность и дрейф данных в производственной среде с помощью Amazon SageMaker Model Monitor и настраивайте оповещения о снижении метрик; применяйте канареечные или сине-зеленые развертывания для ограничения рисков. Контроль доступа к моделям обеспечивается с помощью политик ролей IAM, разрешений на уровне ресурсов и сетевой изоляции. Ловушки для практиков включают выбор неправильной метрики (например, accuracy для несбалансированных классов), игнорирование дрейфа концепции и отсутствие инструментирования данных для обучения и логов инференса для аудита. Используйте CI/CD для ML с помощью SageMaker Pipelines, чтобы стандартизировать частоту переобучения, поддерживать согласованность версий наборов данных и моделей и вести защищенный аудиторский след для соответствия требованиям.
Практическая задача: сценарий использования
Сценарий: BrightCart, сеть онлайн-супермаркетов, модернизирует свою локальную систему управления запасами, перенося ее в AWS, и хочет создать генеративного AI-чат-бота, который отвечает на вопросы клиентов и предоставляет актуальную информацию о местонахождении товаров, защищая при этом данные клиентов и запасов в соответствии с правилами комплаенса. Их среда AWS AI включает S3 для наборов данных, Amazon RDS для транзакционных данных о запасах, SageMaker Studio для разработки, доступ к Bedrock для базовых моделей и сетевую инфраструктуру VPC.
Задача: Создать приватного чат-бота с низкой задержкой на основе RAG, который извлекает актуальную информацию о запасах и избегает раскрытия конфиденциальных данных или галлюцинаций.
Рекомендуемый подход:
- Создайте приватный VPC и настройте эндпоинты AWS PrivateLink для Bedrock и SageMaker; храните канонические документы о продуктах и снимки данных о запасах в S3 с шифрованием на стороне сервера (KMS) и включите версионирование в S3.
- Непрерывно вычисляйте эмбеддинги из документов о продуктах с помощью энкодера Bedrock или модели SageMaker в приватной подсети и храните векторы в Amazon OpenSearch Service с использованием k-NN для быстрого поиска ближайших соседей; храните актуальные данные о запасах в Amazon RDS и предоставьте безопасный коннектор времени выполнения для их извлечения.
- Реализуйте конвейер с расширением за счет извлечения данных (RAG), в котором приложение сначала запрашивает контекст из OpenSearch, а затем вызывает Bedrock с системным шаблоном промпта, включающим извлеченный контекст и явные инструкции по безопасности; очищайте вводимые пользователем данные с помощью валидации и используйте Amazon Comprehend для обнаружения и скрытия PII перед извлечением.
- Разверните чат-бота за Application Load Balancer, обслуживайте FM через Bedrock с помощью API-шлюза в VPC, включите логирование в CloudWatch с ограниченным доступом и отслеживайте ответы модели и дрейф с помощью SageMaker Model Monitor и периодических аудитов, проводимых человеком.
Обоснование: Этот подход использует паттерн RAG для минимизации раскрытия конфиденциальных данных, применяет приватные сети и KMS для соответствия требованиям, разделяет актуальные данные о запасах и контекст модели для точности, а также использует мониторинг и проверки с участием человека для контроля галлюцинаций и обеспечения постоянной надежности.
← Безопасность и конфиденциальность ИИ · Все домены · Обучение →
Отработать эти вопросы → · Тесты на время на ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Сдайте экзамен →