Está construyendo un agente de trading automatizado que recomienda cuántas unidades de un activo comprar o vender y a qué precio para maximizar los retornos a largo plazo. El agente será entrenado continuamente con datos de transacciones en streaming. ¿Qué tipo de algoritmo de machine learning es apropiado para este problema de toma de decisiones secuencial con optimización de recompensa a largo plazo?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Aprendizaje por refuerzo.
Por qué esta es la respuesta
El aprendizaje por refuerzo (Reinforcement Learning) es el más apropiado porque se centra en cómo un agente debe tomar decisiones secuenciales en un entorno para maximizar una recompensa acumulativa a largo plazo. En este caso, el agente de trading aprende a comprar o vender activos para maximizar los retornos, recibiendo retroalimentación (recompensa) de sus acciones en el mercado. El aprendizaje supervisado no es adecuado porque requiere datos etiquetados de antemano con las decisiones óptimas, lo cual no es factible para un problema de optimización de recompensas futuras. El aprendizaje no supervisado se enfoca en encontrar patrones en datos sin etiquetas, no en la toma de decisiones. El aprendizaje semi-supervisado combina ambos, pero tampoco está diseñado para la optimización de decisiones secuenciales en un entorno dinámico.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta