Amazon MLA-C01: Генеративный AI и фундаментальные модели — Руководство по подготовке

Часть AWS Machine Learning Engineer Associate MLA-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Основная концепция

Фундаментальные модели — это большие, предварительно обученные сети, как правило, на основе трансформеров, которые предоставляют универсальные языковые, визуальные или мультимодальные представления. Практическое внедрение в продуктивную среду требует преобразования этих широких возможностей в специфическое для приложения поведение с помощью трех ортогональных рычагов: промпт-инжиниринга во время вывода, генерации с дополнением извлекаемой информацией (RAG) для обоснования ответов на актуальных или предметно-ориентированных знаниях, и кастомизации модели через дообучение или параметрически эффективные техники. Amazon Bedrock предоставляет управляемый способ вызова фундаментальных моделей от сторонних поставщиков и от Amazon через единый API, абстрагируя выбор модели, но сохраняя контроль над входными данными, параметрами модели (temperature, top_p, max_output_tokens) и обработкой ответов. SageMaker JumpStart дополняет Bedrock, упаковывая артефакты предварительно обученных моделей, скрипты обучения и рецепты дообучения, которые выполняются в контейнерах SageMaker Training или Hugging Face, что обеспечивает воспроизводимые рабочие процессы адаптации и интеграцию с реестром моделей.

Дообучение бывает разных видов, которые различаются компромиссом между потребностями в вычислениях и данных и точностью адаптации. Полное дообучение (full fine-tuning) обновляет все веса модели и часто дает наилучшую производительность для конкретной задачи, но требует больших парков GPU и хранилища для контрольных точек. Техники параметрически эффективного дообучения (PEFT), такие как LoRA (низкоранговые адаптеры), модули-адаптеры или QLoRA (квантованные низкоранговые адаптеры), значительно сокращают использование памяти GPU и время, внедряя и обучая небольшое количество дополнительных параметров. Эти техники совместимы с обучением в SageMaker с использованием Hugging Face и bitsandbytes для 8-битного/4-битного квантования. Обучение с подкреплением на основе обратной связи от человека (RLHF) — это более сложный конвейер: сбор парных меток человеческих предпочтений, обучение модели вознаграждения (шаг обучения с учителем с использованием SageMaker Training и ModelPackage) и оптимизация модели политики с помощью on-policy RL (PPO или аналогичного), при этом развертки и контрольные точки сохраняются в S3, а сигналы вознаграждения отслеживаются с помощью SageMaker Debugger.

Архитектуры RAG связывают фундаментальные модели с актуальными корпусами текстов для уменьшения галлюцинаций. Типичный конвейер RAG преобразует текст запроса в эмбеддинги с помощью модели эмбеддингов (Bedrock Embeddings API или эмбеддера Hugging Face на SageMaker), выполняет векторный поиск ближайшего соседа в индексе (Amazon OpenSearch Service с k-NN, Amazon Kendra или сторонние векторные БД), извлекает top-k документов и обусловливает языковую модель извлеченным контекстом через шаблоны промптов и управляемые параметры декодирования. Управление свежестью и релевантностью данных требует периодического повторного приема и переиндексации источников с помощью AWS Glue, AWS Lambda для потоковых обновлений или AWS DMS для транзакционных источников, а также хранения метаданных о происхождении (source_id, document_id, ingestion_time) вместе с векторами для возможности аудита.

Ключевые сервисы и конфигурация

Amazon Bedrock предоставляет API InvokeModel, где запросы включают идентификатор модели и параметры времени выполнения: передаются заголовки modelId, contentType и accept, тело запроса (body), содержащее промпты или inputText, и modelParameters, такие как temperature, topP и maxOutputTokens. Используйте структурированные системные и пользовательские сообщения для разделения ролевых инструкций и ограничения форматов вывода; применяйте последовательности остановки и max_output_tokens для ограничения задержки и затрат. Для генерации эмбеддингов используйте эндпоинт эмбеддингов Bedrock или инференс-контейнер SageMaker Hugging Face и сохраняйте векторы в OpenSearch, Kendra или внешней векторной БД.

SageMaker JumpStart предоставляет готовые ноутбуки и конвейеры дообучения, которые подключаются к CreateTrainingJob с конкретными параметрами API: TrainingJobName, AlgorithmSpecification (TrainingImage, TrainingInputMode), RoleArn, InputDataConfig (S3Uri, DataSource), OutputDataConfig (S3OutputPath), ResourceConfig (InstanceType, InstanceCount, VolumeSizeInGB) и StoppingCondition (MaxRuntimeInSeconds). Для управления моделями используйте SageMaker Model Registry и CreateModelPackage/CreateModelPackageGroup с ApprovalStatus, установленным в “PendingManualApproval”; интегрируйте продвижение моделей в CI/CD, используя атрибут ApprovalStatus вместе с AWS CodePipeline или AWS Step Functions и действием ManualApproval для контроля развертываний. Для непрерывного мониторинга и обнаружения предвзятости разверните SageMaker Model Monitor через CreateMonitoringSchedule с MonitoringScheduleConfig и BaselineConfig; используйте SageMaker Clarify через API ProcessingJob (ClarifyProcessor.run_pre_training_bias и run_post_training_bias) для вычисления метрик предвзятости набора данных и создания базовых линий, хранящихся в S3.

Для векторного поиска и RAG выбирайте технологию индексации и поиска в зависимости от масштаба и задержки запросов. Amazon OpenSearch Service поддерживает плагин k-NN и предоставляет REST API и гранулярный контроль доступа; Amazon Kendra предлагает корпоративный семантический поиск с коннекторами к S3, SharePoint и RDS. Используйте краулеры AWS Glue для создания центрального каталога данных (Data Catalog) и AWS Lake Formation для обеспечения гранулярного контроля доступа и изоляции данных для обучения в S3, гарантируя применение IAM, политик бакетов и шифрования (SSE-S3 или SSE-KMS).

Паттерны проектирования и компромиссы

При кастомизации базовых моделей необходимо выбрать между офлайн-дообучением и промпт-инжинирингом на этапе выполнения. Полное дообучение (full fine-tuning) максимизирует производительность для узкоспециализированных задач, но увеличивает операционную сложность: заданиям обучения требуются большие парки GPU, распределенное обучение на нескольких узлах (используйте SageMaker DistributedDataParallel или Horovod в режиме Script Mode), сохранение контрольных точек в S3 через UploadDirectory, а также последующие квантование и преобразование для эффективного инференса. Подходы PEFT, такие как LoRA, сохраняют большинство весов модели замороженными, что значительно сокращает время обучения, позволяет дешевле проводить перебор гиперпараметров и упрощает откат, поскольку базовая модель остается неизменной. Для инференса управляемые эндпоинты Bedrock снижают операционную нагрузку при работе со сторонними FM, в то время как эндпоинты реального времени SageMaker предоставляют более глубокий контроль: используйте MultiModelEndpoints для обслуживания множества моделей с одного инстанса, Serverless Inference для непредсказуемого трафика или подготовленные (provisioned) эндпоинты с автомасштабированием и подготовленной конкурентностью (provisioned concurrency) для уменьшения холодных стартов.

RAG усложняет процесс поддержания индекса в актуальном состоянии и балансировки между извлечением информации и галлюцинациями. Простой паттерн — гибридное извлечение: сначала выполняется векторный (семантический) поиск, а затем применяется фильтр по ключевым словам для обеспечения точности. Храните метаданные фрагментов (чанков) документов, чтобы на этапе генерации можно было ссылаться на источники и упростить проверки частоты галлюцинаций с помощью Model Monitor. Для приложений, чувствительных к задержкам, размещайте вычисление эмбеддингов и индекс в одном месте (инференс SageMaker + OpenSearch в одном VPC) и используйте индексацию по методу приблизительного ближайшего соседа (ANN), чтобы пожертвовать полнотой (recall) ради скорости.

RLHF — это трудоемкий процесс, но он необходим, когда требуется согласованность с человеческими ценностями или обеспечение безопасности. Конвейер (pipeline) требует инструментов для аннотирования, воспроизводимого обучения модели вознаграждения с помощью API SageMaker Estimator и стабильных оптимизаторов RL (реализации PPO в семействах RLlib или Stable Baselines). Стоимость и нестабильность RLHF необходимо сопоставлять с возможностью корректировать поведение, которое невозможно закодировать в виде статической функции потерь.

Распространенные ошибки и критерии принятия решений

Частая ошибка — полагаться исключительно на промпты для исправления систематических ошибок, требующих адаптации на уровне модели. Промпты могут помочь, но не заменяют дообучение (fine-tuning) или RAG для привязки к предметной области. Еще одна ошибка — недооценка управления: для внедрения генеративных систем в производственную среду требуется отслеживание происхождения модели (SageMaker Model Registry), автоматическое обнаружение дрейфа (базовые показатели Model Monitor и Clarify) и процесс утверждения (ApprovalStatus + ручное утверждение в CodePipeline). При выборе хранилищ эмбеддингов, использование векторного индекса без метаданных или сведений о происхождении делает последующие аудиты и анализ ошибок дорогостоящими.

Принимайте решение о хостинге модели, находя баланс между контролем и операционными издержками. Используйте Bedrock, когда вам нужен управляемый доступ к разнообразным и производительным фундаментальным моделям без необходимости управлять парком инстансов для инференса. Используйте эндпоинты SageMaker, когда вам нужны пользовательские стеки для инференса, изоляция в VPC или полная интеграция с Model Registry и Model Monitor. Что касается методов дообучения, выбирайте PEFT, когда размер набора данных невелик и важна скорость итераций. Выбирайте полное дообучение, когда предметная область требует глубокого изменения представлений данных и у вас есть достаточный бюджет на GPU.

Практическая задача: сценарий использования

Название компании: AuroraPayments — задача: развернуть аудируемый ассистент для обнаружения мошенничества с низкой задержкой, который синтезирует контекст транзакций и нормативные документы для объяснения подозрительных оценок и поддерживает контролируемые обновления модели.

  1. Агрегация и хранение данных: используйте AWS Glue для сканирования журналов транзакций в S3 и настройте AWS DMS для репликации локальных таблиц MySQL в Amazon RDS или S3. Зарегистрируйте все источники в AWS Glue Data Catalog и примените политики Lake Formation. Обоснование: Glue предоставляет бессерверный ETL и единый каталог для последующего извлечения данных, а Lake Formation обеспечивает изоляцию доступа в S3.

  2. Инжиниринг признаков и обнаружение аномалий: загрузите признаки в SageMaker Feature Store для обеспечения согласованности между офлайн- и онлайн-режимами. Запустите автоматическое обнаружение аномалий с помощью Amazon Lookout for Metrics на временных рядах транзакций и отображайте дашборды в Amazon QuickSight. Обоснование: Feature Store гарантирует воспроизводимость признаков для обучения и инференса; Lookout for Metrics автоматизирует обнаружение аномалий, а QuickSight предоставляет визуализацию для бизнес-аналитиков.

  3. Обучение модели и обработка несбалансированных данных: обучите классификатор XGBoost, используя встроенный в SageMaker XGBoost с гиперпараметрами, и установите scale_pos_weight в значение (num_negative/num_positive), чтобы скорректировать дисбаланс классов. Используйте SageMaker Training CreateTrainingJob с ResourceConfig, настроенным под размер обучающих данных, и включите сохранение контрольных точек в S3 для отказоустойчивости. Обоснование: XGBoost эффективен для задач по обнаружению мошенничества в табличных данных; scale_pos_weight требует минимальных операционных издержек по сравнению с синтетическим увеличением выборки.

  4. Реестр моделей, утверждение и развертывание: зарегистрируйте артефакты модели в SageMaker Model Registry с помощью CreateModelPackage/ModelPackageGroupName и установите ApprovalStatus в “PendingManualApproval”. Реализуйте CodePipeline, который запускает действие для утверждения, а затем развертывайте утвержденные версии на эндпоинты SageMaker для инференса в реальном времени с помощью MultiModel endpoints или Provisioned Instances за Auto Scaling. Обоснование: Model Registry обеспечивает централизованное версионирование и управление; ручное утверждение через CodePipeline обеспечивает авторизованные релизы.

  5. Объяснимость и RAG для привязки к нормативным документам: создайте эмбеддинги нормативных документов с помощью Bedrock или эмбеддера Hugging Face в SageMaker, проиндексируйте их в Amazon OpenSearch k-NN с метаданными и реализуйте процесс RAG, где промпт для подозрительной транзакции включает k наиболее релевантных фрагментов из нормативных документов, а также шаблон, предписывающий фундаментальной модели цитировать источники и генерировать человекочитаемое объяснение. Обоснование: RAG обосновывает объяснения на авторитетных документах, а OpenSearch обеспечивает масштабируемый векторный поиск в пределах периметра безопасности.

  6. Мониторинг и переобучение: включите SageMaker Model Monitor с эталоном, полученным на основе первоначальной валидации, и запланируйте запуск по требованию Clarify ProcessingJobs для проведения проверок на предвзятость после развертывания. Если Model Monitor сигнализирует о дрейфе (изменение распределения признаков или меток), запустите SageMaker Pipeline, который выполняет прием данных, переобучает модель (с дообучением LoRA, если для текстовых признаков используется энкодер фундаментальной модели), оценивает ее и помещает новую модель в реестр со статусом PendingManualApproval. Обоснование: Непрерывный мониторинг с помощью автоматизированных пайплайнов позволяет контролировать производительность и соответствие модели требованиям, сохраняя при этом ручной контроль над изменениями в производственной среде.


Безопасность · Все домены · Оптимизация затрат для ML-нагрузок

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт