Amazon AIF-C01: Оптимизация затрат и ценообразование для AI/ML — Руководство по подготовке

Часть AWS AI Practitioner AIF-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Факторы затрат и модели ценообразования в Bedrock, SageMaker и EC2

Ценообразование для рабочих нагрузок AI/ML складывается из стоимости вычислений, хранения, сети и специфичных для сервиса показателей. Доступ к базовым моделям через Amazon Bedrock обычно тарифицируется за запрос или за токен для текстовых нагрузок и за секунду для потоковых API; SageMaker взимает плату за часы работы инстансов для обучения и хостинга с поддержкой нескольких арендаторов (multi-tenancy), а также за передачу и хранение данных. Хостинг на базе EC2 влечет за собой прямые затраты на часы работы инстансов, к которым добавляются расходы на хранилища EBS, EFS или FSx и исходящий трафик из VPC (egress). Ключевые факторы затрат — это размер модели (более крупные модели увеличивают количество токенов/математических операций и потребление памяти), пропускная способность инференса (чувствительные к задержкам синхронные вызовы обходятся дороже при закреплении за дорогими GPU) и перемещение данных для генерации с дополненной информацией (RAG), где поиск эмбеддингов и векторный поиск могут многократно увеличивать количество вызовов. Распространенные ловушки для практиков включают недооценку затрат на эмбеддинги для RAG-систем с высоким QPS, оставление в работе нескольких простаивающих эндпоинтов SageMaker и игнорирование межрегионального исходящего трафика при хранении PII в пределах одного региона. Поэтому критерии принятия решений должны учитывать объем запросов, допустимую задержку на один запрос, необходимость дообучения модели (fine-tuning) или возможность использования готовой модели, а также что обеспечивает лучшую совокупную стоимость владения (TCO) с учетом накладных расходов на управление и масштабирование: управляемый провайдером инференс (эндпоинты Bedrock/SageMaker) или самостоятельный хостинг на инстансах EC2/GPU.

Выбор инстансов, спотовые инстансы и паттерны оптимизации вычислений

Выбор инстансов влияет как на производительность, так и на стоимость. Для обучения используйте Trainium (trn1) или кластеры GPU (p4/p5), когда важна высокая пропускная способность при матричных операциях; для инференса отдавайте предпочтение Inferentia/Inf2 (inf1/inf2) или инференсу на CPU на базе Graviton для небольших моделей, чтобы снизить затраты. Управляемые сервисы, такие как SageMaker Managed Spot Training и SageMaker Distributed Training, интегрируют сохранение контрольных точек (checkpointing) и автоматически возвращают спотовые мощности, чтобы существенно снизить стоимость обучения; однако спотовые инстансы — это ловушка для продакшена с низкими задержками, если их не использовать в сочетании с надежными резервными механизмами. Архитектурные паттерны, снижающие расходы, включают асинхронную пакетную обработку, автомасштабирование с защитой от холодных стартов, эндпоинты для нескольких моделей (multi-model endpoints) для консолидации множества небольших моделей на одном хосте, а также использование смешанной точности (mixed-precision) и квантования для сокращения потребностей в памяти и пропускной способности. Используйте фреймворки, такие как DeepSpeed или ZeRO, чтобы уменьшить потребление памяти при обучении больших моделей, и рассмотрите параметро-эффективное дообучение (LoRA/адаптеры), чтобы избежать полного переобучения модели. Частая ошибка — использование топовых GPU для нагрузок с интенсивным использованием эмбеддингов, где инстансы на базе CPU или Inferentia обеспечили бы гораздо лучшее соотношение цены и производительности.

Компромиссы при выборе модели и стратегии оптимизации затрат

Выбор модели — это компромисс между стоимостью, задержкой, точностью и чувствительностью к данным. Базовые модели в Bedrock предлагают управляемое масштабирование, инструменты безопасности и быструю итерацию, но влекут за собой затраты за вызов или за токен, которые могут стать доминирующими при больших масштабах; модели с открытым исходным кодом, размещенные на SageMaker или EC2, могут снизить расходы на инференс, если вы амортизируете накладные расходы на хостинг и эксплуатацию. Хорошо работают гибридные архитектуры: запускайте небольшую, дешевую модель для основной массы запросов и переключайтесь на более крупную модель для сложных запросов, или используйте генерацию с дополненной информацией, где объемный контекст предоставляется векторным хранилищем (OpenSearch, векторная БД на базе Amazon QLDB или стороннее решение), а в LLM отправляются только краткие промпты. При принятии решений о дообучении (fine-tuning) следует рассматривать параметро-эффективные методы (LoRA, адаптеры) и пары «промпт-завершение» в формате JSONL для задач text-to-text, чтобы ограничить использование наборов данных и вычислительных ресурсов. Распространенные ловушки включают дообучение неоправданно больших моделей вместо использования инженерии промптов (prompt engineering), игнорирование разрастания длины промпта в токенах и отказ от кэширования или дедупликации ответов на часто повторяющиеся запросы.

Хранение, локальность данных, управление и наблюдаемость для контроля затрат

Выбор хранилища влияет как на ежемесячные расходы, так и на соблюдение нормативных требований. Используйте S3 с политиками жизненного цикла, Intelligent-Tiering и сжатыми форматами (Parquet/TFRecord) для наборов данных; размещайте активные обучающие данные на уровнях с высокой пропускной способностью, а необработанные активы архивируйте в Glacier. Для PII и соблюдения требований к местонахождению данных храните бакеты S3, ключи KMS и вычислительные ресурсы в нужном регионе AWS и контролируйте доступ через эндпоинты VPC, политики IAM и частные сети, чтобы предотвратить случайную передачу данных за пределы региона. Конвейеры извлечения для RAG должны размещать векторные хранилища (Amazon OpenSearch Service или хранилище эмбеддингов на EC2/EBS) вместе с уровнем инференса, чтобы избежать затрат на передачу данных и задержек. Инструменты наблюдаемости и интерпретируемости, такие как SageMaker Clarify, Debugger и Model Monitor, обеспечивают управление и раннее обнаружение смещения данных, но увеличивают затраты — развертывайте мониторы на основе выборки, чтобы контролировать расходы. Минимизируйте воздействие на окружающую среду и расходы, выбирая эффективные чипы (Inferentia/Trainium) и используя пакетную обработку; распространенная ошибка — включение полного логирования и непрерывного мониторинга моделей без порогов выборки, что увеличивает как затраты, так и информационный шум, принося мало дополнительной ценности.

Практическая задача: сценарий использования

Сценарий: компания Acme Retail использует стек AWS AI, включающий Amazon Bedrock для доступа к LLM, Amazon SageMaker для обучения и хостинга моделей, S3 для данных и Amazon OpenSearch для индексации товаров. Им необходимо ежедневно генерировать тысячи описаний товаров объемом в несколько абзацев, придерживаясь единого стиля бренда, соблюдая строгие требования к хранению PII в пределах региона и укладываясь в жесткий бюджет.

Задача: обеспечить создание высококачественных брендированных описаний в больших масштабах, минимизируя стоимость каждого описания и гарантируя, что данные клиентов никогда не покинут указанный регион AWS.

Рекомендуемый подход:

  1. Использовать двухуровневый конвейер инференса: сначала направлять все запросы на легковесную локально размещенную модель на SageMaker или EC2 (квантованную) для обработки стандартных артикулов (SKU) и простых описаний; передавать сложные случаи или запросы с низкой степенью уверенности на обработку фундаментальной модели в Bedrock.
  2. Хранить эмбеддинги и индексы для извлечения в Amazon OpenSearch в том же регионе; использовать краткий извлеченный контекст, чтобы снизить потребление токенов в Bedrock, и кэшировать частые ответы в ElastiCache.
  3. Дообучать небольшую специализированную модель с помощью параметроэффективных методов (LoRA) на SageMaker Managed Spot Training с сохранением контрольных точек в S3, сводя к минимуму полное переобучение модели.
  4. Применять средства контроля границ региона: бакеты S3 и ключи KMS в пределах региона, эндпоинты VPC для Bedrock/SageMaker, а также использовать Model Monitor и Clarify на основе выборки для ограничения затрат на мониторинг.

Обоснование: сочетание дешевой базовой модели с выборочной эскалацией минимизирует затраты на токены и инстансы для каждого описания, а RAG и кэширование сокращают количество обращений к Bedrock. Использование Managed Spot Training и параметроэффективного дообучения снижает расходы на обучение и накладные расходы на хранение, в то время как средства контроля в пределах региона обеспечивают соблюдение требований к PII и нормативных требований.


MLOps и развертывание · Все домены

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт