Un ingeniero con casco y chaleco reflectante monitorea pantallas de control industrial que muestran diagramas eléctricos complejos y flujos de energía luminosos.
Mujer trabajando en una planta de generación eléctrica, supervisando sistemas de infraestructura
Machine learning en trading

Feature engineering: el paso que suele marcar la diferencia en un modelo de trading

El éxito de un modelo no depende únicamente del algoritmo. Muchas veces, la diferencia aparece mucho antes.

Ese proceso previo recibe el nombre de feature engineering o ingeniería de características: transformar los datos disponibles en variables que permitan al modelo detectar patrones con mayor facilidad. Un algoritmo sencillo con buenas variables suele superar a un modelo sofisticado entrenado con datos poco trabajados.

Los datos no siempre hablan por sí solos

Solo un dato

Conocer únicamente la velocidad máxima de un corredor.

Contexto completo

Velocidad, edad, frecuencia cardíaca, horas de entrenamiento, descanso y alimentación.

El precio de cierre contiene información, pero rara vez es suficiente para explicar toda la dinámica del mercado. El feature engineering busca construir variables que aporten más contexto.

¿Qué es exactamente una «feature»?

Puede tratarse de un dato original o de una nueva variable creada a partir de otros datos:

Precio de cierreRentabilidad diaria (%)
VolumenPromedio de 20 sesiones
Precio máximo y mínimoRango diario
Cotizaciones históricasVolatilidad de 30 días
Serie de preciosDistancia a la media móvil

El objetivo no es generar la mayor cantidad posible de variables, sino crear aquellas que realmente aporten información útil.

Así suele desarrollarse el proceso

1

Datos del mercado

2

Limpieza de la información

3

Creación de nuevas variables

4

Selección de las más útiles

5

Entrenamiento del modelo

Cada etapa influye directamente en el resultado final. Si las variables contienen ruido o información irrelevante, incluso el algoritmo más avanzado tendrá dificultades para aprender.

¿Qué tipo de variables suelen utilizarse?

Retornos diarios o intradía

Volatilidad histórica

Indicadores técnicos

Distancia a soportes y resistencias

Cambios en el volumen negociado

Correlaciones entre activos

Variables macroeconómicas

Medidas de tendencia o momentum

Más variables no significa mejores resultados

Cuando muchas variables aportan información repetida o poco relevante, aumenta el riesgo de sobreajuste (overfitting): el algoritmo aprende patrones que solo existen en los datos históricos.

«Sobre la mesa de un detective hay cientos de documentos. No todos contienen pistas importantes — el feature engineering consiste en identificar cuáles realmente ayudan a entender el caso.»

Errores que suelen aparecer

Error frecuenteConsecuencia
Crear demasiadas variablesMayor riesgo de sobreajuste
Utilizar datos futuros sin quererResultados irreales durante el entrenamiento
No normalizar algunas variablesDificulta el aprendizaje del modelo
Mantener variables muy correlacionadasInformación redundante
Omitir la limpieza de datosEl modelo aprende patrones incorrectos
Donde realmente nace un buen modelo

Aunque el algoritmo sea la parte más visible de un sistema de machine learning, la calidad del resultado depende en gran medida de las variables que recibe. Muchos proyectos fracasan no por utilizar un modelo inadecuado, sino porque las características empleadas no representan correctamente el comportamiento del mercado.

Un modelo aprende exactamente de aquello que se le muestra. Si las variables reflejan mejor la realidad del mercado, las probabilidades de construir un sistema sólido también aumentan.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *