Amazon AIF-C01: Оптимизация затрат и ценообразование для AI/ML — Руководство по подготовке
Часть AWS AI Practitioner AIF-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.
Факторы затрат и модели ценообразования в Bedrock, SageMaker и EC2
Ценообразование для рабочих нагрузок AI/ML складывается из стоимости вычислений, хранения, сети и специфичных для сервиса показателей. Доступ к базовым моделям через Amazon Bedrock обычно тарифицируется за запрос или за токен для текстовых нагрузок и за секунду для потоковых API; SageMaker взимает плату за часы работы инстансов для обучения и хостинга с поддержкой нескольких арендаторов (multi-tenancy), а также за передачу и хранение данных. Хостинг на базе EC2 влечет за собой прямые затраты на часы работы инстансов, к которым добавляются расходы на хранилища EBS, EFS или FSx и исходящий трафик из VPC (egress). Ключевые факторы затрат — это размер модели (более крупные модели увеличивают количество токенов/математических операций и потребление памяти), пропускная способность инференса (чувствительные к задержкам синхронные вызовы обходятся дороже при закреплении за дорогими GPU) и перемещение данных для генерации с дополненной информацией (RAG), где поиск эмбеддингов и векторный поиск могут многократно увеличивать количество вызовов. Распространенные ловушки для практиков включают недооценку затрат на эмбеддинги для RAG-систем с высоким QPS, оставление в работе нескольких простаивающих эндпоинтов SageMaker и игнорирование межрегионального исходящего трафика при хранении PII в пределах одного региона. Поэтому критерии принятия решений должны учитывать объем запросов, допустимую задержку на один запрос, необходимость дообучения модели (fine-tuning) или возможность использования готовой модели, а также что обеспечивает лучшую совокупную стоимость владения (TCO) с учетом накладных расходов на управление и масштабирование: управляемый провайдером инференс (эндпоинты Bedrock/SageMaker) или самостоятельный хостинг на инстансах EC2/GPU.
Выбор инстансов, спотовые инстансы и паттерны оптимизации вычислений
Выбор инстансов влияет как на производительность, так и на стоимость. Для обучения используйте Trainium (trn1) или кластеры GPU (p4/p5), когда важна высокая пропускная способность при матричных операциях; для инференса отдавайте предпочтение Inferentia/Inf2 (inf1/inf2) или инференсу на CPU на базе Graviton для небольших моделей, чтобы снизить затраты. Управляемые сервисы, такие как SageMaker Managed Spot Training и SageMaker Distributed Training, интегрируют сохранение контрольных точек (checkpointing) и автоматически возвращают спотовые мощности, чтобы существенно снизить стоимость обучения; однако спотовые инстансы — это ловушка для продакшена с низкими задержками, если их не использовать в сочетании с надежными резервными механизмами. Архитектурные паттерны, снижающие расходы, включают асинхронную пакетную обработку, автомасштабирование с защитой от холодных стартов, эндпоинты для нескольких моделей (multi-model endpoints) для консолидации множества небольших моделей на одном хосте, а также использование смешанной точности (mixed-precision) и квантования для сокращения потребностей в памяти и пропускной способности. Используйте фреймворки, такие как DeepSpeed или ZeRO, чтобы уменьшить потребление памяти при обучении больших моделей, и рассмотрите параметро-эффективное дообучение (LoRA/адаптеры), чтобы избежать полного переобучения модели. Частая ошибка — использование топовых GPU для нагрузок с интенсивным использованием эмбеддингов, где инстансы на базе CPU или Inferentia обеспечили бы гораздо лучшее соотношение цены и производительности.
Компромиссы при выборе модели и стратегии оптимизации затрат
Выбор модели — это компромисс между стоимостью, задержкой, точностью и чувствительностью к данным. Базовые модели в Bedrock предлагают управляемое масштабирование, инструменты безопасности и быструю итерацию, но влекут за собой затраты за вызов или за токен, которые могут стать доминирующими при больших масштабах; модели с открытым исходным кодом, размещенные на SageMaker или EC2, могут снизить расходы на инференс, если вы амортизируете накладные расходы на хостинг и эксплуатацию. Хорошо работают гибридные архитектуры: запускайте небольшую, дешевую модель для основной массы запросов и переключайтесь на более крупную модель для сложных запросов, или используйте генерацию с дополненной информацией, где объемный контекст предоставляется векторным хранилищем (OpenSearch, векторная БД на базе Amazon QLDB или стороннее решение), а в LLM отправляются только краткие промпты. При принятии решений о дообучении (fine-tuning) следует рассматривать параметро-эффективные методы (LoRA, адаптеры) и пары «промпт-завершение» в формате JSONL для задач text-to-text, чтобы ограничить использование наборов данных и вычислительных ресурсов. Распространенные ловушки включают дообучение неоправданно больших моделей вместо использования инженерии промптов (prompt engineering), игнорирование разрастания длины промпта в токенах и отказ от кэширования или дедупликации ответов на часто повторяющиеся запросы.
Хранение, локальность данных, управление и наблюдаемость для контроля затрат
Выбор хранилища влияет как на ежемесячные расходы, так и на соблюдение нормативных требований. Используйте S3 с политиками жизненного цикла, Intelligent-Tiering и сжатыми форматами (Parquet/TFRecord) для наборов данных; размещайте активные обучающие данные на уровнях с высокой пропускной способностью, а необработанные активы архивируйте в Glacier. Для PII и соблюдения требований к местонахождению данных храните бакеты S3, ключи KMS и вычислительные ресурсы в нужном регионе AWS и контролируйте доступ через эндпоинты VPC, политики IAM и частные сети, чтобы предотвратить случайную передачу данных за пределы региона. Конвейеры извлечения для RAG должны размещать векторные хранилища (Amazon OpenSearch Service или хранилище эмбеддингов на EC2/EBS) вместе с уровнем инференса, чтобы избежать затрат на передачу данных и задержек. Инструменты наблюдаемости и интерпретируемости, такие как SageMaker Clarify, Debugger и Model Monitor, обеспечивают управление и раннее обнаружение смещения данных, но увеличивают затраты — развертывайте мониторы на основе выборки, чтобы контролировать расходы. Минимизируйте воздействие на окружающую среду и расходы, выбирая эффективные чипы (Inferentia/Trainium) и используя пакетную обработку; распространенная ошибка — включение полного логирования и непрерывного мониторинга моделей без порогов выборки, что увеличивает как затраты, так и информационный шум, принося мало дополнительной ценности.
Практическая задача: сценарий использования
Сценарий: компания Acme Retail использует стек AWS AI, включающий Amazon Bedrock для доступа к LLM, Amazon SageMaker для обучения и хостинга моделей, S3 для данных и Amazon OpenSearch для индексации товаров. Им необходимо ежедневно генерировать тысячи описаний товаров объемом в несколько абзацев, придерживаясь единого стиля бренда, соблюдая строгие требования к хранению PII в пределах региона и укладываясь в жесткий бюджет.
Задача: обеспечить создание высококачественных брендированных описаний в больших масштабах, минимизируя стоимость каждого описания и гарантируя, что данные клиентов никогда не покинут указанный регион AWS.
Рекомендуемый подход:
- Использовать двухуровневый конвейер инференса: сначала направлять все запросы на легковесную локально размещенную модель на SageMaker или EC2 (квантованную) для обработки стандартных артикулов (SKU) и простых описаний; передавать сложные случаи или запросы с низкой степенью уверенности на обработку фундаментальной модели в Bedrock.
- Хранить эмбеддинги и индексы для извлечения в Amazon OpenSearch в том же регионе; использовать краткий извлеченный контекст, чтобы снизить потребление токенов в Bedrock, и кэшировать частые ответы в ElastiCache.
- Дообучать небольшую специализированную модель с помощью параметроэффективных методов (LoRA) на SageMaker Managed Spot Training с сохранением контрольных точек в S3, сводя к минимуму полное переобучение модели.
- Применять средства контроля границ региона: бакеты S3 и ключи KMS в пределах региона, эндпоинты VPC для Bedrock/SageMaker, а также использовать Model Monitor и Clarify на основе выборки для ограничения затрат на мониторинг.
Обоснование: сочетание дешевой базовой модели с выборочной эскалацией минимизирует затраты на токены и инстансы для каждого описания, а RAG и кэширование сокращают количество обращений к Bedrock. Использование Managed Spot Training и параметроэффективного дообучения снижает расходы на обучение и накладные расходы на хранение, в то время как средства контроля в пределах региона обеспечивают соблюдение требований к PII и нормативных требований.
← MLOps и развертывание · Все домены
Отработать эти вопросы → · Тесты на время на ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Сдайте экзамен →