Amazon AIF-C01: Инженерия данных для ML — Руководство по подготовке

Часть AWS AI Practitioner AIF-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Сбор, разметка, версионирование и управление данными

Сбор репрезентативных и проверяемых наборов данных — это основополагающий шаг для всего машинного обучения. Используйте Amazon S3 в качестве центрального отказоустойчивого хранилища с включенными S3 Versioning и блокировкой объектов для сохранения исходных данных и отслеживания их происхождения. Для структурированного приёма и каталогизации данных регистрируйте наборы данных в AWS Glue Data Catalog и применяйте гранулярный контроль доступа с помощью Lake Formation. Когда требуется ручная разметка, Amazon SageMaker Ground Truth предоставляет встроенные рабочие процессы, интерфейс для аннотирования и циклы активного обучения, которые снижают затраты на разметку, создавая при этом метаданные о согласованности и уверенности разметчиков. Распространённые ошибки включают сбор смещённых или нерепрезентативных выборок, отсутствие записи о происхождении данных и правилах разметки, а также недостаточную проверку качества разметки; смягчайте эти риски, сохраняя аудиты разметки, выполняя слепую повторную разметку подмножеств и используя эвристики для консолидации меток. Решения по конфиденциальности и соответствию требованиям определяют архитектуру: используйте серверное шифрование S3 с управляемыми KMS ключами CMK, ограничивайте доступ с помощью политик IAM и эндпоинтов VPC (AWS PrivateLink), а также выполняйте обнаружение и удаление персональных данных (PII) с помощью Amazon Comprehend перед передачей данных для обучения модели. Для долгосрочных программ создавайте снимки наборов данных, помечайте их идентификаторами и отслеживайте эксперименты с помощью Amazon SageMaker Experiments или внешнего инструмента, такого как DVC, чтобы обеспечить воспроизводимость обучения и отчётность для регуляторов.

Предобработка, инжиниринг признаков и разведочный анализ данных (EDA)

Преобразования и признаки определяют способность модели к обобщению. Используйте AWS Glue или Amazon SageMaker Data Wrangler для профилирования, очистки и нормализации данных, а также выполняйте итеративный разведочный анализ данных с помощью Amazon QuickSight или ноутбуков Jupyter, размещённых в Amazon SageMaker Studio. Для управления признаками в производственной среде используйте Amazon SageMaker Feature Store, чтобы обеспечить согласованность вычисления признаков в офлайн- и онлайн-режимах и избежать расхождения между обучением и инференсом (train/serve skew); храните исходные и производные признаки раздельно и записывайте логику их создания. В конвейерах для временных рядов и потоковой обработки данных следует использовать Amazon Kinesis или потоковый ETL в AWS Glue для обновления признаков с низкой задержкой. Типичные ошибки включают утечку данных (data leakage) — когда информация из будущего попадает в обучающую выборку, — неправильную обработку пропущенных значений и несоответствие между признаками для офлайн-обучения и онлайн-инференса. Критерии принятия решений при проектировании конвейеров зависят от баланса между актуальностью данных и стоимостью: выбирайте пакетный ETL для ресурсоёмких пересчётов исторических данных, потоковую обработку для персонализации в реальном времени и гибридные архитектуры, когда требуются онлайн-признаки с низкой задержкой. Автоматизируйте проверки валидации и контроль соблюдения схемы в Glue или в рамках заданий SageMaker Processing, чтобы на ранней стадии выявлять дрейф схемы (schema drift).

Векторные представления (embeddings), аугментация, синтетические данные и наборы данных для фундаментальных моделей

Векторные представления (embeddings) преобразуют текст, изображения или мультимодальные входные данные в плотные векторы, которые отражают семантические связи; они лежат в основе семантического поиска, генерации с извлечением информации (retrieval-augmented generation) и кластеризации. Реализуйте паттерн генерации с извлечением информации (RAG), в котором вы создаёте векторные представления с помощью Amazon Bedrock или кодировщиков, размещённых на SageMaker, храните векторы в Amazon OpenSearch Service (k-NN), Amazon Kendra или управляемом векторном хранилище и извлекаете контекст для подачи в фундаментальную модель. Аугментация данных и генерация синтетических данных целесообразны при нехватке реальных примеров: используйте генеративные модели в SageMaker для создания перефразирований, преобразований изображений (через Albumentations или SageMaker Processing) или синтетических записей с сохранением конфиденциальности. Остерегайтесь чрезмерной зависимости от синтетических данных — их низкое качество может привести к сдвигу распределения и переобучению моделей на артефактах. Для наборов данных при обучении FM отбирайте высококачественные примеры, приводите форматы к каноническому виду с помощью шаблонов промптов и версионируйте каждый снимок набора данных в S3. При работе с частными данными и сторонними FM отдавайте предпочтение пути частной донастройки (private fine-tuning), перенося вычисления в VPC, или развёртывайте конвейеры, работающие только на извлечение (retrieval-only), которые отправляют в FM только неконфиденциальный контекст, сохраняя исходные документы в защищённом векторном хранилище; применяйте удаление данных и маскирование на уровне токенов для предотвращения утечек. Инжиниринг промптов и шаблоны инструкций (системные промпты) имеют решающее значение для формирования ответов модели; настраивайте параметры temperature, top_k или top_p в соответствии с требуемым уровнем детерминизма и креативности.

Оценка, развертывание, мониторинг и управление жизненным циклом

Оценка должна быть явной, с использованием метрик, соответствующих бизнес-целям: для задач регрессии используются RMSE или MAE, для бинарной классификации оцениваются precision/recall/F1 и ROC AUC, а для суммаризации — варианты ROUGE. Проводите валидацию и кросс-валидацию на этапе оценки и оставьте слепой тестовый набор для окончательной приемки. Развертывайте с помощью эндпоинтов Amazon SageMaker (для инференса в реальном времени или бессерверного) или Amazon Bedrock для управляемого хостинга FM; оптимизируйте задержку, выбирая более компактные дистиллированные модели, включая эндпоинты для нескольких моделей (multi-model endpoints) или используя SageMaker Serverless Inference для непредсказуемого трафика. Отслеживайте производительность и дрейф данных в производственной среде с помощью Amazon SageMaker Model Monitor и настраивайте оповещения о снижении метрик; применяйте канареечные или сине-зеленые развертывания для ограничения рисков. Контроль доступа к моделям обеспечивается с помощью политик ролей IAM, разрешений на уровне ресурсов и сетевой изоляции. Ловушки для практиков включают выбор неправильной метрики (например, accuracy для несбалансированных классов), игнорирование дрейфа концепции и отсутствие инструментирования данных для обучения и логов инференса для аудита. Используйте CI/CD для ML с помощью SageMaker Pipelines, чтобы стандартизировать частоту переобучения, поддерживать согласованность версий наборов данных и моделей и вести защищенный аудиторский след для соответствия требованиям.

Практическая задача: сценарий использования

Сценарий: BrightCart, сеть онлайн-супермаркетов, модернизирует свою локальную систему управления запасами, перенося ее в AWS, и хочет создать генеративного AI-чат-бота, который отвечает на вопросы клиентов и предоставляет актуальную информацию о местонахождении товаров, защищая при этом данные клиентов и запасов в соответствии с правилами комплаенса. Их среда AWS AI включает S3 для наборов данных, Amazon RDS для транзакционных данных о запасах, SageMaker Studio для разработки, доступ к Bedrock для базовых моделей и сетевую инфраструктуру VPC.

Задача: Создать приватного чат-бота с низкой задержкой на основе RAG, который извлекает актуальную информацию о запасах и избегает раскрытия конфиденциальных данных или галлюцинаций.

Рекомендуемый подход:

  1. Создайте приватный VPC и настройте эндпоинты AWS PrivateLink для Bedrock и SageMaker; храните канонические документы о продуктах и снимки данных о запасах в S3 с шифрованием на стороне сервера (KMS) и включите версионирование в S3.
  2. Непрерывно вычисляйте эмбеддинги из документов о продуктах с помощью энкодера Bedrock или модели SageMaker в приватной подсети и храните векторы в Amazon OpenSearch Service с использованием k-NN для быстрого поиска ближайших соседей; храните актуальные данные о запасах в Amazon RDS и предоставьте безопасный коннектор времени выполнения для их извлечения.
  3. Реализуйте конвейер с расширением за счет извлечения данных (RAG), в котором приложение сначала запрашивает контекст из OpenSearch, а затем вызывает Bedrock с системным шаблоном промпта, включающим извлеченный контекст и явные инструкции по безопасности; очищайте вводимые пользователем данные с помощью валидации и используйте Amazon Comprehend для обнаружения и скрытия PII перед извлечением.
  4. Разверните чат-бота за Application Load Balancer, обслуживайте FM через Bedrock с помощью API-шлюза в VPC, включите логирование в CloudWatch с ограниченным доступом и отслеживайте ответы модели и дрейф с помощью SageMaker Model Monitor и периодических аудитов, проводимых человеком.

Обоснование: Этот подход использует паттерн RAG для минимизации раскрытия конфиденциальных данных, применяет приватные сети и KMS для соответствия требованиям, разделяет актуальные данные о запасах и контекст модели для точности, а также использует мониторинг и проверки с участием человека для контроля галлюцинаций и обеспечения постоянной надежности.


Безопасность и конфиденциальность ИИ · Все домены · Обучение

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт