Amazon AIF-C01: Fundamentos de IA y ML — Guía de estudio

Forma parte de la AWS AI Practitioner AIF-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Conceptos Fundamentales y Tipos de Modelos

Comprender la terminología fundamental es la base para una arquitectura sólida y para la toma de decisiones sobre las compensaciones (trade-offs). El aprendizaje supervisado asigna entradas a salidas etiquetadas y se divide en regresión para objetivos continuos y clasificación para clases discretas; la clasificación multiclase (20 clases de genes) frente a las decisiones binarias cambia la elección del modelo y las funciones de pérdida. El aprendizaje no supervisado encuentra estructuras en datos no etiquetados mediante la clusterización y la reducción de dimensionalidad para la segmentación y la detección de anomalías. Las familias de algoritmos comunes incluyen modelos lineales y ensambles de árboles (interpretables, rápidos para datos tabulares), métodos de kernel (SVM) y redes neuronales (flexibles, de alta capacidad para imágenes, audio y texto). Para tareas con imágenes, dominan las redes convolucionales o los modelos fundacionales de visión preentrenados (a través de Amazon SageMaker JumpStart o Amazon Rekognition Custom Labels); para texto, las arquitecturas de transformadores (transformers) impulsan los modelos de lenguaje grandes y los modelos de secuencia. Los requisitos de interpretabilidad llevan a los profesionales a utilizar modelos más simples o herramientas de explicabilidad como SageMaker Clarify. La selección del modelo equilibra el rendimiento predictivo, la interpretabilidad, la latencia de inferencia y el costo: un modelo basado en árboles puede ser suficiente para la clasificación de genes si se requiere transparencia, mientras que los modelos profundos se ajustan a tareas de imágenes o lenguaje de alta dimensionalidad. Conocer estas familias y saber cuándo reutilizar modelos preentrenados en lugar de entrenar desde cero guía hacia soluciones eficientes y conformes.

Ciclo de Vida de ML, Gestión de Datos y Características (Features)

El ciclo de vida del machine learning comienza con la definición del problema, la recopilación de datos, el etiquetado, la ingeniería de características (feature engineering), el entrenamiento, la validación, el despliegue, el monitoreo y la iteración. En los entornos de AWS, SageMaker orquesta muchas etapas del ciclo de vida: SageMaker Processing para transformaciones de datos, SageMaker Feature Store para el almacenamiento centralizado de características y su servicio (serving) en línea y fuera de línea, y SageMaker Pipelines para la CI/CD de los flujos de trabajo de los modelos. La calidad de las etiquetas y el balance de clases son cuellos de botella frecuentes; invierta en pipelines de anotación robustos o utilice SageMaker Ground Truth para reducir etiquetas ruidosas y el aprendizaje activo (active learning) para enfocar el esfuerzo humano. El linaje de las características y los controles de acceso son importantes para la reproducibilidad y la gobernanza; registre las características y los modelos en SageMaker Model Registry y versione los conjuntos de datos en Amazon S3 con políticas de ciclo de vida. Para producción, incluya el monitoreo automatizado de modelos con SageMaker Model Monitor para detectar el desvío de datos (data drift), el desvío de concepto (concept drift) y la degradación de la precisión, e integre alertas a través de Amazon CloudWatch y AWS Lambda. Diseñe pipelines con idempotencia y capacidad de recuperación: utilice patrones orientados a eventos (eventos de S3, Step Functions) y diseñe el cómputo y el almacenamiento para que escalen (entrenamiento en instancias EC2/GPU o Trainium, inferencia en instancias Inf1/Neptune/Graviton) en función de los requisitos de latencia y rendimiento (throughput).

Evaluación, Algoritmos y Errores Comunes

Seleccionar métricas de evaluación y modelos de referencia (baselines) es una práctica decisiva. Para problemas de clasificación, considere la precisión (precision), la exhaustividad (recall), la puntuación F1 (F1-score) y el área bajo la curva ROC; para problemas multiclase, utilice la exhaustividad por clase y los promedios macro/micro. La evaluación de la regresión utiliza RMSE, MAE y R-cuadrado. Para el servicio en producción, la eficiencia en tiempo de ejecución se mide por la latencia de cola (P95/P99) y el rendimiento (throughput) (solicitudes por segundo), y el costo por inferencia. Los errores comunes incluyen elegir la exactitud (accuracy) en conjuntos de datos desbalanceados, el sobreajuste (overfitting) por un ajuste excesivo de hiperparámetros en los datos de prueba y descuidar la calibración cuando las probabilidades se utilizan para decisiones de negocio. Utilice la validación cruzada (cross-validation) y la validación con un conjunto de retención (holdout), e implemente modelos de referencia (heurísticas simples) para asegurar que el ML añade valor. Cuando los datos etiquetados son escasos, utilice el aprendizaje por transferencia (transfer learning), el aumento de datos (data augmentation) para imágenes o enfoques semisupervisados. Para la explicabilidad y el cumplimiento normativo, combine modelos opacos con explicadores post-hoc (SHAP, gradientes integrados) e integre SageMaker Clarify. Elecciones de algoritmos comunes en AWS: XGBoost para datos tabulares con entrenamiento rápido en SageMaker, CNN para imágenes a través de Torch/TensorFlow en instancias de GPU, y transformadores (transformers) para texto utilizando Hugging Face en SageMaker o modelos fundacionales de Bedrock para la generación aumentada por recuperación (RAG).

Modelos fundacionales, patrones de despliegue y seguridad

Los modelos fundacionales aceleran el desarrollo, pero introducen distintas opciones de arquitectura y consideraciones de seguridad. Amazon Bedrock proporciona acceso gestionado a múltiples modelos base y admite el ajuste fino (fine-tuning), los flujos de trabajo de generación aumentada por recuperación (RAG) y la integración con almacenes de vectores como Amazon OpenSearch Service (k-NN) o Amazon Kendra para la búsqueda semántica. Elija entre el ajuste fino (fine-tuning), el ajuste por instrucciones (instruction-tuning) o los adaptadores ligeros en función del tamaño de los datos y las necesidades de seguridad. Para la inferencia de baja latencia y alto rendimiento, considere desplegar modelos optimizados en Amazon EC2 Inf1 (Inferentia) o usar SageMaker Neo/Edge Manager para compilar y alojar modelos en dispositivos de borde (edge); la inferencia en el dispositivo con la latencia más baja posible requiere cuantización y poda (pruning) del modelo, y un tiempo de ejecución local a través de SageMaker Edge Manager o AWS IoT Greengrass, sacrificando el tamaño y la precisión del modelo. Los patrones de seguridad incluyen endpoints de VPC, AWS PrivateLink para Bedrock, roles de IAM estrictos, cifrado en S3 respaldado por KMS para datos sensibles y registros de auditoría. Para reducir las alucinaciones y los ataques de prompt, implemente barreras de protección (guardrails): saneamiento de entradas, plantillas de prompt, filtros de respuesta y verificaciones con RLHF o de posprocesamiento. Supervise el uso y las llamadas anómalas a la API con CloudTrail e implemente límites de tasa y detección de anomalías para proteger el acceso al modelo y la privacidad de los datos.

Problema práctico: Escenario de caso de uso

Escenario: GreenGene Labs utiliza un entorno de IA en AWS con Amazon S3 para los datos brutos, SageMaker para el desarrollo de modelos y Amazon Bedrock para experimentar con modelos fundacionales. Mantienen metadatos genómicos y clínicos sensibles bajo estrictos controles de acceso y necesitan una inferencia escalable para los paneles de investigación.

Desafío: Clasificar muestras de genes humanos en 20 categorías con una lógica de decisión transparente, mantener la reutilización de características (features) entre equipos y desplegar una API supervisada de baja latencia para los investigadores.

Enfoque recomendado:

  1. Use SageMaker Processing y Ground Truth para preparar y etiquetar los datos, almacenando las características (features) curadas en SageMaker Feature Store.
  2. Entrene modelos interpretables (XGBoost, árboles de decisión) en SageMaker Training; registre los modelos en SageMaker Model Registry y registre el linaje.
  3. Despliegue el mejor modelo en un endpoint de SageMaker detrás de un Application Load Balancer con autoescalado; habilite SageMaker Model Monitor para la deriva (drift) y las alertas de CloudWatch.
  4. Para la experimentación con representaciones más grandes, use modelos de Bedrock o Hugging Face para los embeddings y agregue un índice vectorial de OpenSearch para la búsqueda de similitud; combine esto con el modelo interpretable para la clasificación final.

Justificación: La gestión centralizada de características y los pipelines reproducibles reducen la fuga de datos y aceleran la colaboración, mientras que la priorización de modelos interpretables satisface las necesidades de transparencia y los embeddings de Bedrock permiten una representación más rica sin sacrificar la gobernanza.


Todos los dominios · Conceptos de IA Generativa

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo