Amazon AIF-C01: Conceptos de IA Generativa — Guía de estudio
Forma parte de la AWS AI Practitioner AIF-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.
Modelos fundacionales, tokens, embeddings y fundamentos multimodales
Los modelos fundacionales son grandes redes neuronales preentrenadas que proporcionan capacidades potentes de propósito general para texto, imágenes y otras modalidades; algunos ejemplos disponibles a través de AWS incluyen el acceso de Amazon Bedrock a los modelos de Titan y de otros proveedores, y los entornos de SageMaker para entrenar y alojar modelos personalizados. Los tokens son las piezas atómicas (subpalabras o caracteres) que los LLM utilizan para la entrada y la salida; la tokenización determina el uso de la ventana de contexto, el costo y el riesgo de truncamiento. Los embeddings son vectores numéricos densos que codifican el significado semántico y son el pegamento para la búsqueda de similitud, la agrupación (clustering) y la recuperación posterior; los embeddings pueden ser generados por modelos de Bedrock o por modelos alojados en SageMaker. Los modelos multimodales aceptan y vinculan texto, imágenes y audio; los componentes básicos (building blocks) típicos de AWS incluyen Amazon Rekognition para la extracción de características visuales, Amazon Textract para documentos escaneados y Amazon Transcribe para la conversión de audio a texto, utilizando modelos de Bedrock o SageMaker para fusionar las modalidades. Las principales disyuntivas (tradeoffs) para el profesional incluyen elegir entre ajustar (fine-tune) un modelo fundacional (mayor costo, mayor tiempo de implementación, mejor alineación con la tarea) y la ingeniería de prompts con RAG (más rápido, menor costo, más seguro para la privacidad de los datos). Las trampas comunes incluyen ignorar los límites de tokens durante la construcción del prompt, no versionar los embeddings o los índices y subestimar las necesidades de preprocesamiento para las entradas de imágenes y documentos.
Ingeniería de prompts, controles de modelo y técnicas de razonamiento
La ingeniería de prompts (prompt engineering) estructura las instrucciones y el contexto para obtener resultados fiables; los prompts eficaces separan las instrucciones del sistema (rol, barreras de protección o guardrails), el contenido del usuario y ejemplos opcionales de tipo few-shot. Utilice prompts de sistema concisos para definir el estilo, las restricciones y el formato de salida, y almacene plantillas canónicas para evitar desviaciones (drift). Ajustar los parámetros de inferencia como temperature, top-p y max_tokens en Bedrock o SageMaker influye en la creatividad y el determinismo: una temperature más baja y un top-p más estrecho producen respuestas más consistentes a costa de la creatividad. Las técnicas de razonamiento incluyen la cadena de pensamiento (chain-of-thought) (razonamiento intermedio explícito para mejorar las tareas de varios pasos), la autoconsistencia (self-consistency) (muestrear múltiples rutas de razonamiento y agregar los resultados) y los bucles de verificación (pedir al modelo que verifique o cite sus fuentes). Las trampas comunes son la inyección de prompts (prompt injection) (entradas no confiables que alteran el comportamiento del sistema), ejemplos de tipo few-shot frágiles que se sobreajustan (overfit) al estilo en lugar de a la intención, y omitir el registro de los prompts para la auditabilidad. Criterios de decisión para las técnicas: utilice la cadena de pensamiento para razonamientos complejos cuando la transparencia es importante, pero agregue la verificación cuando los resultados tienen consecuencias en el mundo real; prefiera configuraciones deterministas para las interfaces de usuario (UI) de producción para garantizar la repetibilidad.
Generación Aumentada por Recuperación (RAG), almacenes de vectores, agentes y arquitecturas
La generación aumentada por recuperación (RAG) acopla una capa de recuperación con un modelo generativo: indexar documentos, calcular embeddings, realizar una búsqueda de similitud para recuperar contexto y luego condicionar el LLM con los pasajes recuperados. En AWS, las fuentes de documentos suelen residir en Amazon S3, la extracción utiliza Textract o pipelines personalizados, los embeddings se generan a través de Bedrock o SageMaker, y los vectores se almacenan en Amazon OpenSearch Service con k-NN o en almacenes de vectores (vector stores) especializados construidos sobre DynamoDB u OpenSearch; se puede usar Amazon Kendra cuando se requiere búsqueda semántica empresarial y conectores. Los agentes son controladores basados en LLM que deciden cuándo llamar a herramientas (búsquedas, consultas a bases de datos, calculadoras) y se pueden implementar orquestando llamadas al modelo con AWS Lambda o Step Functions para ejecutar las herramientas de forma segura. Los patrones de arquitectura incluyen RAG síncrono para chatbots y RAG asíncrono por lotes (batch) para trabajos de resumen (usando Athena o EMR para preprocesar grandes corpus de datos). Trampas para el profesional: índices obsoletos (no actualizar los embeddings), incluir un contexto demasiado largo que excede las ventanas de tokens y no incluir enlaces de procedencia (provenance) para el contenido recuperado. Decida entre Kendra y OpenSearch basándose en los conectores, la seguridad y la necesidad de clasificación semántica (semantic ranking).
Alucinaciones, sesgos, explicabilidad, monitoreo y gobernanza
Las alucinaciones ocurren cuando los modelos fabrican hechos que suenan plausibles pero son incorrectos; las estrategias de mitigación se centran en anclar las respuestas (RAG), la citación explícita de las fuentes recuperadas, los modelos de verificación que comprueban los hechos en las salidas y la revisión con intervención humana (human-in-the-loop) para dominios de alto riesgo. El sesgo surge de datos de entrenamiento o distribuciones de etiquetas sesgados; utilice Amazon SageMaker Clarify para detectar sesgos en el conjunto de datos, examinar la importancia de las características y producir artefactos de explicabilidad. Para el rendimiento y el drift del modelo, implemente Amazon SageMaker Model Monitor para detectar el drift de datos y predicciones, registre las entradas/salidas de inferencia en CloudWatch y S3 para auditoría, y mantenga la procedencia de los prompts y las fuentes de recuperación. La evaluación debe combinar métricas técnicas (precisión/exhaustividad, F1, mAP para detección, ROUGE para resumen, perplejidad cuando sea aplicable) con métricas centradas en el ser humano como la utilidad, la seguridad y la latencia. Las prácticas de gobernanza prácticas incluyen el red-teaming de las salidas, los filtros de contenido automatizados, la detección y redacción de PII con Amazon Comprehend PII, el versionado de modelos y embeddings, y la documentación del uso previsto y sus limitaciones. Los errores comunes incluyen depender únicamente de pruebas sintéticas, un registro insuficiente para el cumplimiento normativo y omitir la mitigación de sesgos antes de la implementación en contextos regulados.
Problema práctico: Escenario de caso de uso
Escenario: MedData Analytics opera un asistente de diagnóstico interno que utiliza Amazon Bedrock para la generación, con manuales de pacientes e informes de imágenes almacenados en Amazon S3, y una canalización de entrenamiento de SageMaker para experimentos con modelos. Deben proporcionar sugerencias de diagnóstico transparentes y verificables, minimizando al mismo tiempo las alucinaciones y los sesgos para los médicos.
Desafío: Anclar las salidas del modelo en documentos de confianza, garantizar la explicabilidad y las comprobaciones de sesgos, y crear una canalización RAG de producción que mantenga la procedencia y la supervisión humana.
Enfoque recomendado:
- Use Amazon Textract para extraer texto estructurado de archivos PDF y Amazon Comprehend PII para redactar campos sensibles; almacene los documentos depurados en Amazon S3 y rastree las versiones con el etiquetado de objetos.
- Genere embeddings con un modelo de embeddings de Amazon Bedrock (o un codificador alojado en SageMaker), indexe los vectores en Amazon OpenSearch Service con k-NN y almacene los metadatos en DynamoDB para los enlaces de procedencia.
- Construya una orquestación RAG donde Lambda (o Step Functions) recupere los pasajes top_k, ensamble una plantilla de prompt del sistema y llame a Amazon Bedrock para la generación con una temperatura baja e instrucciones explícitas de «citar fuentes».
- Aplique SageMaker Clarify sobre los datos de entrenamiento/etiquetado para detectar sesgos, use SageMaker Model Monitor para alertas de drift, registre los prompts y los ID de recuperación en CloudWatch/S3, y dirija las salidas de alto riesgo a través de Amazon A2I para la revisión por parte de los médicos.
Justificación: Anclar las salidas mediante RAG y la citación explícita de fuentes reduce las alucinaciones; la combinación de Clarify, Model Monitor y la revisión humana proporciona explicabilidad, detección de sesgos y una gobernanza operativa segura, en consonancia con las mejores prácticas del sector.
← Fundamentos de IA y ML · Todos los dominios · Servicios de IA →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →