Amazon MLA-C01: IA generativa y modelos fundacionales — Guía de estudio

Forma parte de la AWS Machine Learning Engineer Associate MLA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Concepto central

Los modelos fundacionales son grandes redes preentrenadas —típicamente basadas en transformers— que proporcionan representaciones multimodales, de visión o de lenguaje de propósito general. La puesta en producción práctica requiere convertir estas capacidades amplias en comportamientos específicos de la aplicación a través de tres palancas ortogonales: ingeniería de prompts en el momento de la inferencia, generación aumentada por recuperación (RAG) para basar los resultados en conocimiento actualizado o específico del dominio, y personalización del modelo a través de ajuste fino o técnicas eficientes en parámetros. Amazon Bedrock proporciona una ruta gestionada para invocar modelos fundacionales de terceros y de Amazon a través de una API unificada, que abstrae la selección del modelo mientras preserva el control de las entradas, los parámetros del modelo (temperature, top_p, max_output_tokens) y el manejo de la respuesta. SageMaker JumpStart complementa a Bedrock al empaquetar artefactos de modelos preentrenados, scripts de entrenamiento y recetas de ajuste fino que se ejecutan en contenedores de SageMaker Training o Hugging Face, permitiendo flujos de trabajo de adaptación reproducibles y la integración con el registro de modelos.

El ajuste fino viene en diferentes variantes que intercambian las necesidades de cómputo y de conjuntos de datos por la fidelidad de la adaptación. El ajuste fino completo (full fine-tuning) actualiza todos los pesos del modelo y a menudo produce el mayor rendimiento para tareas específicas, pero requiere grandes flotas de GPU y almacenamiento para los checkpoints. Las técnicas de ajuste fino eficiente en parámetros (PEFT), como LoRA (adaptadores de bajo rango), módulos adaptadores o QLoRA (adaptadores de bajo rango cuantizados), reducen drásticamente la memoria y el tiempo de GPU al inyectar y entrenar un pequeño número de parámetros adicionales, compatibles con el entrenamiento en SageMaker usando Hugging Face y bitsandbytes para la cuantización de 8 o 4 bits. El aprendizaje por refuerzo con retroalimentación humana (RLHF) es una canalización más compleja: recopilar etiquetas de preferencia humana por pares, entrenar un modelo de recompensa (un paso de aprendizaje supervisado usando SageMaker Training y un ModelPackage) y optimizar el modelo de política con RL on-policy (PPO o similar) mientras se almacenan los despliegues (rollouts) y checkpoints en S3 y se monitorean las señales de recompensa con SageMaker Debugger.

Las arquitecturas RAG conectan los modelos fundacionales con corpus actualizados para reducir las alucinaciones. La canalización RAG típica convierte el texto de la consulta en embeddings con un modelo de embeddings (la API de embeddings de Bedrock o un embedder de Hugging Face en SageMaker), realiza una búsqueda vectorial de vecinos más cercanos en un índice (Amazon OpenSearch Service con k-NN, Amazon Kendra o bases de datos vectoriales de terceros), recupera los k documentos principales y condiciona el modelo de lenguaje (LM) con el contexto recuperado a través de plantillas de prompts y parámetros de decodificación controlados. Gestionar la actualidad y la relevancia requiere la reingesta y reindexación periódica de las fuentes usando AWS Glue, AWS Lambda para actualizaciones en streaming o AWS DMS para fuentes transaccionales, y almacenando metadatos de procedencia (source_id, document_id, ingestion_time) junto con los vectores para la auditabilidad.

Servicios clave y configuración

Amazon Bedrock expone la API InvokeModel, donde las solicitudes incluyen el identificador del modelo y los parámetros de tiempo de ejecución: se pasan el modelId, las cabeceras contentType y accept, un body que contiene los prompts o inputText, y los modelParameters como temperature, topP y maxOutputTokens. Utilice mensajes estructurados de sistema y de usuario para separar las instrucciones basadas en roles y restringir los formatos de salida; imponga secuencias de parada y max_output_tokens para limitar la latencia y el costo. Para la generación de embeddings, utilice el endpoint de embeddings de Bedrock o un contenedor de inferencia de Hugging Face en SageMaker y persista los vectores en OpenSearch, Kendra o una base de datos vectorial externa.

SageMaker JumpStart proporciona notebooks preconstruidos y canalizaciones de ajuste fino que se conectan a CreateTrainingJob con parámetros de API concretos: TrainingJobName, AlgorithmSpecification (TrainingImage, TrainingInputMode), RoleArn, InputDataConfig (S3Uri, DataSource), OutputDataConfig (S3OutputPath), ResourceConfig (InstanceType, InstanceCount, VolumeSizeInGB) y StoppingCondition (MaxRuntimeInSeconds). Para la gobernanza de modelos, utilice el SageMaker Model Registry y CreateModelPackage/CreateModelPackageGroup con ApprovalStatus establecido en “PendingManualApproval”; integre la promoción de modelos en CI/CD utilizando el atributo ApprovalStatus junto con AWS CodePipeline o AWS Step Functions y una acción de ManualApproval para controlar los despliegues. Para el monitoreo continuo y la detección de sesgos, despliegue SageMaker Model Monitor a través de CreateMonitoringSchedule con MonitoringScheduleConfig y BaselineConfig; utilice SageMaker Clarify a través de las API de ProcessingJob (ClarifyProcessor.run_pre_training_bias y run_post_training_bias) para calcular métricas de sesgo del conjunto de datos y producir líneas base almacenadas en S3.

Para la búsqueda vectorial y RAG, elija la tecnología de indexación y búsqueda en función de la escala y la latencia de las consultas. Amazon OpenSearch Service es compatible con el plugin k-NN y proporciona API REST y control de acceso de grano fino; Amazon Kendra ofrece búsqueda semántica empresarial con conectores para S3, SharePoint y RDS. Utilice los crawlers de AWS Glue para construir un Catálogo de Datos central, y AWS Lake Formation para aplicar un control de acceso de grano fino y el aislamiento de los datos de entrenamiento en S3, asegurando que se apliquen IAM, las políticas de bucket y el cifrado (SSE-S3 o SSE-KMS).

Patrones de diseño y contrapartidas

Al personalizar modelos fundacionales, decida entre el ajuste fino (fine-tuning) offline y la ingeniería de prompts (prompt engineering) en tiempo de ejecución. El ajuste fino completo maximiza el rendimiento para tareas específicas, pero aumenta la complejidad operativa: los trabajos de entrenamiento requieren grandes flotas de GPU, entrenamiento distribuido multinodo (use SageMaker DistributedDataParallel o Horovod en Script Mode), checkpointing a S3 mediante UploadDirectory, y posteriormente cuantización y conversión para una inferencia eficiente. Los enfoques PEFT como LoRA mantienen congelada la mayoría de los pesos del modelo, reduciendo drásticamente el tiempo de entrenamiento, permitiendo barridos de hiperparámetros más económicos y simplificando el rollback porque el modelo base permanece intacto. Para la inferencia, los endpoints gestionados por Bedrock alivian la carga operativa para FMs de terceros, mientras que los endpoints en tiempo real de SageMaker ofrecen un control más profundo: use MultiModelEndpoints para servir muchos modelos desde una única instancia, Serverless Inference para tráfico impredecible, o endpoints aprovisionados con auto-scaling y concurrencia aprovisionada para reducir los arranques en frío.

RAG introduce complejidad al mantener el índice actualizado y al equilibrar la recuperación frente a la alucinación. Un patrón simple es la recuperación híbrida: primero se ejecuta una búsqueda vectorial (semántica) y luego un filtro de palabras clave para garantizar la precisión. Almacene los metadatos de los fragmentos de documentos para que el paso de generación pueda citar las fuentes y facilitar las comprobaciones de la frecuencia de alucinaciones con Model Monitor. Para aplicaciones sensibles a la latencia, coloque en la misma ubicación el cómputo de embeddings y el índice (inferencia de SageMaker + OpenSearch en la misma VPC) y use la indexación de vecino más cercano aproximado (ANN) para sacrificar recall a cambio de velocidad.

RLHF es de alta fricción, pero necesario cuando se requiere alineación con valores humanos o seguridad. El pipeline requiere herramientas para la anotación, entrenamiento de recompensa reproducible con las API de SageMaker Estimator y optimizadores de RL estables (implementaciones de PPO de las familias RLlib o Stable Baselines). El costo y la inestabilidad de RLHF deben sopesarse con la capacidad de corregir comportamientos que no pueden codificarse como una pérdida estática.


Seguridad · Todos los dominios · Optimización de costos para cargas de trabajo de ML

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo