Walk-Forward

Descubre cómo utilizar Walk-Forward Optimization y Walk-Forward Matrix en StrategyQuant X para comprobar si una estrategia mantiene su robustez a lo largo del tiempo, validar la reoptimización periódica y detectar configuraciones sobreajustadas.

WFO y la Matrix: robustez en el tiempo, no en el espacio de parámetros.

Tabla de contenidos

Una dimensión distinta de robustez

Todas las pruebas que hemos visto hasta ahora comparten una característica: alteran algo y comprueban si la estrategia aguanta. El Walk-Forward hace algo conceptualmente distinto. Simula el paso del tiempo.

La pregunta que responde no es «¿aguanta si cambio los datos?» sino «¿funcionaría si yo hubiera desarrollado esta estrategia hace cinco años y la hubiera ido reoptimizando periódicamente, como haría de verdad?».

Es la prueba que más se parece a la operativa real, porque replica el proceso completo: optimizar con lo que sabes, operar con lo que viene, repetir.

Walk-Forward Optimization

Mecánica

El WFO divide el histórico en ventanas deslizantes. Cada ventana tiene un tramo de optimización (in-sample) y un tramo de validación (out-of-sample) inmediatamente posterior. Se optimizan los parámetros en el primero y se aplican, sin tocarlos, en el segundo.

CÓDIGO

Run 1: IS [2012-2015] → optimiza → OOS [2016] → registra Run 2: IS [2013-2016] → optimiza → OOS [2017] → registra Run 3: IS [2014-2017] → optimiza → OOS [2018] → registra Run 4: IS [2015-2018] → optimiza → OOS [2019] → registra Run 5: IS [2016-2019] → optimiza → OOS [2020] → registra

El resultado final es la curva de capital formada por la unión de todos los tramos OOS. Esa curva representa el rendimiento que realmente habrías obtenido reoptimizando cada año. No es una simulación abstracta: es la reconstrucción histórica de tu propio proceso.

 

Las métricas que importan

MétricaInterpretación
WF Efficiency > 50 %Los tramos fuera de muestra acumulan más de la mitad del rendimiento de los tramos de optimización. Señal positiva: la reoptimización funciona
WF Net Profit acumuladoDebe ser positivo. Es el rendimiento real simulado con reoptimización periódica
Consistencia entre runsAl menos el 60-70 % de los tramos OOS deben ser rentables individualmente
Ratio OOS/ISSi el profit factor OOS supera el 0,6 del IS en la mayoría de runs, la estrategia es robusta

Limitación que invalida muchos WFO

El WFO necesita suficientes operaciones en cada tramo OOS para significar algo. Si tu estrategia hace 200 operaciones en 10 años y usas 5 runs, cada tramo fuera de muestra tiene unas 6 operaciones. Seis operaciones no son una muestra: son una anécdota. La regla de mínimos es de 30 a 50 operaciones por tramo OOS. Si no llegas, reduce el número de runs o acepta que el test no te está diciendo nada.

Configuración de referencia

ParámetroRecomendación
Número de runs5 a 10 para históricos de varios años
OOS %20 % – 30 % del periodo por run
Parámetros a optimizarSolo periodos de indicadores. No reoptimizar stop loss ni take profit en cada run
Fitness de optimizaciónBeneficio neto o profit factor. Evitar el Sharpe como fitness de WFO

CLAVE PRÁCTICA

La recomendación de no reoptimizar stop y objetivo en cada run merece explicación. Esos valores definen el perfil de riesgo del sistema, no su lectura del mercado. Si los reoptimizas cada año estás cambiando la estrategia, no adaptándola, y la curva WFO resultante mezcla dos cosas distintas.

Walk-Forward Matrix

El problema que resuelve

El WFO te dice si la estrategia es robusta con una configuración concreta: por ejemplo 7 runs y un 25 % de OOS. Pero surge una pregunta incómoda: ¿y si esa configuración fuera la única que funciona?

Elegir el número de runs es en sí mismo un parámetro. Y optimizar el número de runs hasta que el WFO da verde es exactamente el mismo pecado que optimizar el RSI hasta que el backtest da verde.

La Walk-Forward Matrix resuelve esto ejecutando sistemáticamente muchas configuraciones a la vez. La documentación oficial la define como un conjunto de optimizaciones Walk-Forward realizadas con distinto número de periodos de reoptimización y distinto porcentaje de out-of-sample.

Configuración

Los ajustes se definen con inicio, parada e incremento para el rango de runs, más el porcentaje de OOS:

CÓDIGO

Number of runs: 5, 7, 9, 11, 13, 15
OOS %: 20 %, 30 %, 40 %
→ 6 × 3 = 18 combinaciones, cada una un WFO completo

El resultado es una cuadrícula donde cada celda es una combinación concreta, coloreada según pase o falle, más un gráfico tridimensional que muestra la superficie de resultados.

La regla del cluster 3×3

El criterio oficial de aprobación

La documentación de StrategyQuant establece que se busca un cluster de al menos 3×3 combinaciones donde haya más éxitos que fracasos: al menos 7 de esas 9 pruebas Walk-Forward deben ser exitosas. Y añade un matiz importante: el periodo de reoptimización óptimo es el que queda en el MEDIO de ese cluster, no el del borde.

Lo que se busca no es una celda verde. Es un barrio verde. Una celda verde aislada rodeada de rojas es la definición gráfica de un máximo local: la estrategia solo funciona con esa combinación exacta, lo cual es sobreajuste de segundo orden.

Lectura del gráfico tridimensional

Patrón visualInterpretación
Superficie gradual y plana, sin cambios abruptosRobusta. El rendimiento no depende de una configuración exacta.
Pico aislado con valles alrededorSobreajuste. Solo funciona en esa combinación específica.
Gran zona verde conectadaExcelente. Múltiples configuraciones convergen en un buen resultado.
Superficie mayoritariamente rojaNo es robusta en ninguna configuración. Descartar.

Cada ejecución individual del WFO se aprueba o suspende mediante un Robustness score configurable con su propio umbral, típicamente exigiendo que se cumpla el 80 % de las condiciones del score.

Cuándo aplicarla

La WFM es computacionalmente muy costosa: puede llevar horas por estrategia, especialmente si el sistema tiene más de cinco parámetros. Por eso se reserva exclusivamente para las finalistas que ya han superado todo lo anterior.

Aplicarla a diez o veinte estrategias supervivientes es razonable. Aplicarla a mil es tirar una semana de cómputo para descubrir lo que un test barato te habría dicho en cinco minutos.

CLAVE PRÁCTICA

La mediana de todas las combinaciones es una estimación mucho más honesta del rendimiento futuro que el backtest único que salió del optimizador. Ese backtest es, por construcción, el mejor caso: fue elegido precisamente por ser el mejor. La mediana es el caso típico. Y en datos nuevos, lo que te va a tocar es el caso típico, no el mejor.

SPP contra WFM: no son sustitutos

Se confunden con frecuencia porque ambos son costosos y ambos van al final del pipeline. Pero miden cosas distintas y responden preguntas distintas.

 SPPWFM
Dimensión que mideEl espacio de parámetrosEl tiempo
Pregunta que responde¿Funcionan valores cercanos al original?¿Funciona en distintos periodos históricos?
Necesita división temporalNoSí, explícita en IS/OOS
Coste relativoMenorMayor, sobre todo con muchos parámetros
Ideal paraEstrategias con pocos parámetrosEstrategias que se van a reoptimizar periódicamente

La recomendación es aplicar ambos. Una estrategia puede tener una meseta de parámetros preciosa y aun así derrumbarse cuando el régimen de mercado cambia. Y al revés: puede adaptarse bien con reoptimización periódica y sin embargo ser hipersensible al valor exacto de un indicador.

Una advertencia sobre el Walk-Forward

El WFO tiene un atractivo que conviene mirar con cierta frialdad: parece el test definitivo porque replica el proceso real. Y en parte lo es.

Pero fíjate en lo que estás validando: no la estrategia, sino la estrategia MÁS un procedimiento de reoptimización periódica. Si el WFO sale bien, lo que has demostrado es que reoptimizar cada año funciona. Eso te obliga a reoptimizar cada año en real, con la misma configuración, sin saltártelo. Si luego operas la estrategia con parámetros fijos, el WFO no valida lo que estás haciendo.

Nota

En el estudio empírico de StrategyQuant, el Walk-Forward aparece como útil para validación final, pero su efecto medido depende mucho de la configuración. No es el juez supremo que a veces se presenta. Es una herramienta más, con su propio conjunto de supuestos.

Preguntas frecuentes (FAQs)

Las dudas que más se repiten sobre este tema, con la respuesta contrastada con la documentación oficial de StrategyQuant X.

¿Cuántos runs y qué porcentaje de out-of-sample?

En la matriz, un barrido de 5 a 15 runs con porcentajes de out-of-sample entre el 20 % y el 40 % cubre bien el espacio. La restricción real no es estética sino estadística: cada tramo fuera de muestra necesita operaciones suficientes para significar algo, y treinta o cincuenta por tramo es el mínimo razonable.

Si tu estrategia hace ochenta operaciones en diez años, con quince runs tendrás tramos de cinco operaciones y alguno sin ninguna. En ese caso, o reduces el número de runs o aceptas que el test no te está diciendo nada.

¿El SPP que calcula la matriz es el mismo que el SPP suelto?

No exactamente. El Walk-Forward Matrix incluye su propio cálculo de Optimization Profile y de Sys.Param.Permutation, pero como va cortando los periodos in-sample y out-of-sample de forma distinta, los valores no coinciden con los de un SPP ejecutado de forma independiente.

La consecuencia práctica es que si el criterio de parámetros te importa, conviene evaluarlo aquí y no antes: una estrategia puede pasar el SPP independiente y luego, dentro de la matriz, salirse del rango.

¿Cómo se hace esa revisión sin volverse loco?

Con una métrica ancla y una lectura rápida. Sobre las pestañas de Optimization Profile y Sys.Param.Permutation se mira el Return/Drawdown de la mediana y se comprueba que se mantiene dentro del rango del 70 al 130 % respecto al valor de referencia. Cuando ese número cuadra, el resto de métricas suele acompañar.

Las que se van por encima del 130 % se descartan igualmente, aunque hayan superado la matriz. Han pasado el Walk-Forward mirando otra cosa; lo que se busca es que pasen ambas.

¿Dónde evalúo el estancamiento de la curva?

Al final, dentro del Walk-Forward Matrix, y no como filtro intermedio. Colocado antes, descarta estrategias válidas que atraviesan periodos de estancamiento perfectamente normales; colocado al final, lo evalúas viendo la curva completa y en su contexto.

El estancamiento tiene además dos usos que van más allá del filtrado: comprobar antes de desarrollar que la ventaja que quieres explotar no lleva años muerta, y definir la regla de apagado de un sistema en producción. Varios campeones de trading sistemático usan criterios de este tipo —si el sistema no gana en seis meses o en un año, se apaga.

¿Cómo leo el cluster?

No buscas una celda verde, buscas un barrio verde: un bloque de al menos 3×3 combinaciones donde la mayoría pasen, con siete de las nueve como referencia. Y el periodo de reoptimización que te interesa es el del centro del cluster, no el del borde: una combinación rodeada de fracasos es la definición gráfica de un máximo local.

Si valido con Walk-Forward, ¿tengo que reoptimizar en real?

Sí, si quieres que la validación signifique algo. Lo que el test demuestra es que la estrategia funciona acompañada de un procedimiento de reoptimización periódica con una configuración concreta. Si luego la operas con parámetros fijos, has validado un proceso y estás ejecutando otro.

¿De verdad predicen el SPP y el Walk-Forward Matrix el rendimiento futuro?

Es la pregunta correcta y de momento no tiene una respuesta cerrada. Hay experimentos en marcha diseñados justamente para responderla: cuatro poblaciones de estrategias —las que pasan ambas pruebas, las que solo pasan el SPP, las que solo pasan la matriz y las que no pasan ninguna— puestas en demo simultáneamente sobre tres instrumentos.

La comparación se hará a los seis u ocho meses, sobre el agregado de operaciones de cada población y no estrategia a estrategia. Mientras no haya datos, lo razonable es seguir lo que dice la literatura, pero sabiendo que es una hipótesis y no un hecho verificado.

Sigue leyendo el contenido de esta serie

Los datos duros. Qué tests mejoran realmente el rendimiento futuro según el estudio oficial de StrategyQuant sobre 500.000 estrategias, cuál sale negativo, y un error que circula en materiales de formación sobre esas mismas cifras.

AVISO

Este artículo es material formativo. Describe un proceso de validación estadística, no una promesa de rentabilidad: ninguna batería de pruebas convierte una estrategia sin ventaja real en una rentable.

El trading conlleva riesgo real de pérdida de capital. Las cifras y nombres de ajustes corresponden a la documentación de StrategyQuant en el momento de redactar este texto; el programa se actualiza con frecuencia.

Buscar en la wikiSQX:

Seguir a Quantified Models:

Base de conocimiento:

Índice de esta entrada: