---
title: "Qué tests funcionan de verdad"
description: "¿Qué pruebas de robustez funcionan realmente? Analizamos el estudio de StrategyQuant sobre 500.000 estrategias para descubrir qué filtros mejoran el rendimiento fuera de muestra y cuáles pueden empeorar la selección."
url: https://wikisqx.com/test-robustez-tests-que-funcionan/
date: 2026-08-20
modified: 2026-08-21
author: "Wiki SQX"
image: https://wikisqx.com/wp-content/uploads/2026/08/WikiSQX-StrategyQuantX-Test-Robustez_que-test-funcionan-verdad.jpg
categories: ["Test de Robustez"]
tags: ["aleatorio", "análisis", "backtest", "calidad", "corrección", "coste", "datos", "error", "estrategia", "estudio", "EURUSD", "evaluación", "filtro", "futuros", "interpretación", "mercado", "métricas", "muestra", "Multi-mercado", "oportunidad", "periodo", "pipeline", "Profit Factor", "real", "rendimiento", "resultado", "robustez", "ruido", "test", "ventana", "verdad"]
type: post
lang: es
---

# Qué tests funcionan de verdad

El estudio empírico de StrategyQuant sobre 500.000 estrategias, y un error que conviene corregir.

#### Tabla de contenidos

Este artículo no tiene encabezados

## La pregunta que casi nadie hace

Llevamos seis artículos explicando pruebas de robustez. Cada una tiene una justificación conceptual impecable. Cada una detecta un tipo concreto de fragilidad. Todo encaja.

Pero hay una pregunta que rara vez se plantea y que debería ser la primera: ¿funcionan? Es decir, si selecciono estrategias con el filtro X, **¿rinden mejor en datos futuros reales que si no lo hubiera usado?**

No es una pregunta retórica. Un test puede ser conceptualmente correcto y sin embargo descartar estrategias buenas al mismo ritmo que malas. En ese caso no está filtrando: está reduciendo tu muestra y regalándote una falsa sensación de rigor.

En octubre de 2024, el equipo de StrategyQuant publicó un análisis empírico que responde exactamente a eso. Los resultados no son los que la mayoría espera.

## El diseño del estudio

| **Elemento** | **Valor** |
| --- | --- |
| Símbolo principal | EURUSD |
| Mercados adicionales para el test multi-mercado | GBPJPY, EURJPY, GBPUSD, USDJPY |
| Temporalidad | 4 horas |
| Reparto de datos | 30 % dentro de muestra, 70 % fuera de muestra |
| Verdadero fuera de muestra | Los 2 últimos años, nunca vistos |
| Tamaño de la muestra | 5 conjuntos × 100.000 estrategias |
| Periodos analizados | 2003-2017, 2004-2018, 2005-2019, 2006-2020, 2007-2021 |
| Métrica de evaluación | Mejora del profit factor en el verdadero fuera de muestra |

Medio millón de estrategias, cinco ventanas temporales distintas, y una métrica clara: cuánto mejora el profit factor en datos que ninguna estrategia había visto, según qué test se hubiera usado para seleccionarlas.



#### Nota

El diseño es sólido precisamente por el uso de ventanas solapadas distintas. Si un test funcionara solo en 2003-2017 y no en 2007-2021, sería una casualidad del periodo. Repetirlo en cinco ventanas separa el efecto real del ruido.

# Los resultados

| **Test de robustez** | **Mejora del PF en verdadero OOS** |
| --- | --- |
| **Multi Market Performance** | **+12,11 %** |
| **MC Retest: Randomize OHLC History Data** | +4,71 % |
| OOS/IS Ratio | +4,61 % |
| Out of Sample Metrics (básico) | +4,61 % |
| MC Randomize OHLC frente a ratio de métricas OOS | +3,59 % |
| MC Randomize Trades Order | +3,44 % |
| MC Randomize Trades Order frente a ratio de métricas OOS | +2,13 % |
| **MC Randomize Strategy Parameters — Periods** | **−6,06 %** |
| **MC Randomize Parameters frente a ratio de métricas OOS** | **−9,09 %** |

La conclusión del propio estudio es directa: el test de robustez más efectivo bajo la configuración elegida es probar la estrategia en múltiples mercados. En el análisis general la mejora media del multi-mercado llegó al 14 %, y en el análisis simplificado quedó en el 12,11 % citado arriba.



#### Cuidado con las tablas que circulan por ahí

Existen materiales de formación en español —incluidos algunos manuales de curso muy completos por lo demás— que reproducen este estudio con una tabla en la que TODOS los tests aparecen con signo positivo, incluida la aleatorización de parámetros con un supuesto +1,5 %. Eso es incorrecto. Las cifras oficiales para ese test son −6,06 % y −9,09 %. Es el peor resultado de todo el estudio, no el quinto mejor.

## Una corrección necesaria

La confusión probablemente venga de reconstruir la tabla de memoria: los dos primeros puestos sí coinciden casi exactamente (+12,11 % y +4,71 % frente a los +12,0 % y +4,7 % que suelen citarse), pero el resto se rellena con valores plausibles inventados.

Importa corregirlo porque la diferencia no es de matiz. Si crees que la aleatorización de parámetros aporta un +1,5 %, la incluyes en el pipeline y gastas horas de cómputo en ella. Si sabes que aporta un −6 %, te lo replanteas.

## Por qué un test conceptualmente correcto puede salir negativo

Esto es lo interesante del estudio y merece pensarlo despacio, porque a primera vista parece un contrasentido. La aleatorización de parámetros detecta sobreajuste. El sobreajuste es malo. ¿Cómo puede filtrar por eso empeorar el resultado?

### Hipótesis 1: penaliza la especialización legítima

Hay estrategias que funcionan porque explotan una característica concreta y persistente del activo. Esa especificidad no es sobreajuste: es adaptación al instrumento. Pero un test que exige insensibilidad a los parámetros la penaliza igual que penalizaría al ruido.

### Hipótesis 2: correlación con simplicidad, no con calidad

Las estrategias más insensibles a sus parámetros tienden a ser las más simples y las de señal más difusa. Filtrar por insensibilidad puede estar seleccionando sistemas mediocres pero estables, en lugar de sistemas buenos.

### Hipótesis 3: el test ya está cubierto por otros

Si el reparto entre dentro y fuera de muestra ya elimina la mayor parte del sobreajuste paramétrico, añadir un filtro que mide lo mismo no aporta información nueva: solo añade ruido de selección. El estudio incluye tanto las métricas OOS básicas (+4,61 %) como los tests de parámetros, y es plausible que la primera ya recoja lo que la segunda intenta capturar.



#### Nota

Ninguna de estas hipótesis está confirmada por el estudio, que reporta el dato sin explicarlo. Las incluyo como marcos de interpretación, no como conclusiones. Lo que sí está confirmado es el número.

## Por qué gana el multi-mercado

El resultado del test multi-mercado, en cambio, tiene una explicación bastante natural y refuerza lo que sabemos sobre por qué fallan las estrategias generadas automáticamente.

Una estrategia sobreajustada ha memorizado el ruido de UN histórico concreto. Ese ruido es, por definición, específico de ese activo: no hay ninguna razón para que las casualidades del EURUSD se repitan en el USDJPY.

Una estrategia con ventaja real, en cambio, ha capturado un comportamiento del mercado —una tendencia, una reversión, una pauta de volatilidad— que probablemente exista en otros instrumentos parecidos, aunque con distinta intensidad.



#### El detalle que hace válido el test

El multi-mercado debe aplicarse SIN reoptimizar. Si reoptimizas los parámetros para el nuevo mercado, no estás probando robustez: estás haciendo un backtest nuevo, y volverás a encontrar la mejor combinación para ese ruido. El valor del test está precisamente en llevar los parámetros originales a un mercado que no los vio nacer.

Y un segundo detalle: el mercado alternativo debe ser distinto de verdad. Probar una estrategia de EURUSD en EURGBP aporta poco, porque comparten el euro y buena parte del comportamiento. El estudio usa GBPJPY, EURJPY, GBPUSD y USDJPY: familia parecida, pero dinámicas propias.

## Qué implica esto para tu pipeline

### Reordenación sugerida

| **Prioridad** | **Test** | **Justificación** |
| --- | --- | --- |
| **1** | Métricas fuera de muestra y ratio OOS/IS | +4,61 %, y es prácticamente gratis |
| **2** | Multi-mercado, sin reoptimizar | +12,11 %, el más potente con diferencia |
| **3** | MC Randomize OHLC History Data | +4,71 %, el mejor de la familia Monte Carlo |
| **4** | MC Randomize Trades Order | +3,44 %, y cuesta segundos |
| **5** | MC Skip Trades | No medido en el estudio, pero barato y detecta concentración |
| **6** | Walk-Forward y SPP | Diagnóstico final sobre las supervivientes |
| **?** | MC Randomize Parameters | Signo negativo. Mídelo en tus datos antes de incluirlo |

Fíjate en el cambio de orden respecto a lo que suele enseñarse. El multi-mercado no es un test intermedio que se aplica cuando hay tiempo: es el segundo paso, justo después del filtrado básico. Y la aleatorización de parámetros, que muchos pipelines colocan como test estrella, queda en cuarentena.

### El coste de oportunidad que no aparece en ningún informe

Cada test añade tiempo de cómputo. La batería completa puede multiplicar por mil el tiempo por estrategia. Ese tiempo tiene un uso alternativo: generar más candidatas.

Planteado así, la pregunta ya no es «¿este test aporta información?» sino «¿aporta más información que el mismo tiempo dedicado a generar y cribar más estrategias?». Un test con un efecto de +1,5 % que cuesta cinco horas por estrategia pierde esa comparación con claridad.

| **Etapa del pipeline** | **Tiempo estimado sobre 1.000 estrategias** |
| --- | --- |
| Reparto IS/OOS y filtros básicos | 1 – 5 minutos |
| MC Trades Order (200 sim.) | 5 – 15 minutos |
| MC Skip Trades (200 sim.) | 5 – 15 minutos |
| Multi-mercado (2 activos) | 15 – 45 minutos |
| MC Randomize OHLC (100 sim.) | 1 – 3 horas |
| MC Randomize Parameters (200 sim.) | 2 – 5 horas |
| WFO (5 runs, 100 estrategias) | 4 – 12 horas |
| WFM y SPP (20 finalistas) | 4 – 8 horas |



#### Clave práctica

Compara las dos últimas líneas de la tabla de resultados con estas dos de la tabla de tiempos. La aleatorización de parámetros es de los tests más caros del pipeline y el único con signo negativo medido. Es la peor relación coste-beneficio de toda la batería.

## Cómo medirlo en tus propios datos

El estudio es sobre Forex en 4 horas. Tus mercados, tus temporalidades y tu tipo de estrategias pueden comportarse distinto. La forma honesta de usar esta información es replicar el experimento a pequeña escala.

1. Reserva un tramo de verdadero fuera de muestra que no vas a tocar bajo ningún concepto.
2. Genera un lote grande de estrategias y guarda el databank completo sin filtrar.
3. Aplica cada filtro por separado, no en cadena, y anota qué estrategias sobreviven a cada uno.
4. Ejecuta todas —las filtradas y las no filtradas— sobre el tramo reservado.
5. Compara el rendimiento medio de cada grupo filtrado contra el del conjunto completo.

Si un filtro no mejora el rendimiento medio en el tramo reservado, ese filtro no te está ayudando por mucho sentido conceptual que tenga. Es una tarde de trabajo que puede ahorrarte cientos de horas de cómputo inútil.

## La lección de fondo

Hay algo saludable en este estudio que trasciende sus cifras concretas. StrategyQuant publicó un análisis que dice que una de sus propias funciones, aplicada como filtro, empeora los resultados. No es lo que uno espera del material de marketing de un producto.

Y la actitud que sugiere es la que deberíamos aplicar a todo el proceso: los tests de robustez son hipótesis sobre qué predice el futuro, no verdades reveladas. Merecen el mismo escepticismo que aplicamos a las estrategias.

Un proceso de desarrollo riguroso no es el que aplica más filtros. Es el que sabe cuáles de sus filtros funcionan, porque lo ha medido.

## Preguntas frecuentes (FAQs)

Las dudas que más se repiten sobre este tema, con la respuesta contrastada con la documentación oficial de StrategyQuant X.

##### Si la aleatorización de parámetros sale negativa, ¿tiro también el SPP?

No, porque no son la misma prueba. Lo que el estudio midió con signo negativo es el Monte Carlo de aleatorización de parámetros restringido a periodos de indicadores, una prueba de la familia de retest. El SPP recorre sistemáticamente el espacio de parámetros y produce medianas; es otra mecánica y otro coste.

Lo que sí se traslada es la actitud: ninguna de las dos merece la etiqueta de prueba imprescindible por el mero hecho de estar en el menú. Si vas a gastar horas de cómputo en una de ellas, mide antes si te está ayudando.

##### ¿Vale este resultado para oro, índices o futuros?

No está verificado, y el propio StrategyQuant lo advierte: el resultado es válido para la configuración concreta del estudio —divisas, temporalidad de cuatro horas, ese conjunto de símbolos y esos ajustes de construcción—. Extenderlo a otros activos es precisamente lo que la casa señala como trabajo pendiente.

Hay razones para sospechar que el comportamiento difiere entre familias de activos. Un índice cambia de composición con el tiempo: entran y salen empresas, cambia el peso de los sectores. El oro o las materias primas responden a factores macro que han sido más estables. No es descabellado que el reparto temporal óptimo o la utilidad de cada test dependan de eso.

##### ¿Cómo compruebo en mis datos si un filtro me está ayudando?

Además del procedimiento descrito arriba, hay un diseño alternativo: en lugar de comparar filtradas contra no filtradas sobre datos históricos reservados, se ponen en demo cuatro poblaciones —las que pasan las dos pruebas que te interesan, las que pasan solo una, las que pasan solo la otra y las que no pasan ninguna— y se compara el rendimiento real al cabo de seis u ocho meses.

Es más lento, pero elimina el último resquicio de contaminación: los datos de la demo no existían cuando construiste las estrategias.

##### ¿No son pocas cinco estrategias por población?

Lo que se compara no son cinco resultados, sino el agregado de todas las operaciones que produce cada población durante el periodo. Aun así, el resultado es orientativo y está acotado a un par y una temporalidad concretos: replicar el diseño en varios instrumentos es lo que le da valor.

> Y ese es el punto de fondo del artículo. La conclusión útil de un experimento así no es «este test funciona», sino «este test funciona en este activo, en esta temporalidad y con este flujo de trabajo». Que es mucho menos vendible y mucho más cierto.

##### ¿Qué mercado alternativo elijo para el multi-mercado?

Uno con dinámica propia. Probar una estrategia de EURUSD en EURGBP aporta poco porque comparten media divisa y buena parte del comportamiento. El estudio usa pares emparentados pero con dinámicas distintas, y ese es el equilibrio a buscar.

En futuros la cosa se complica: hay operadores que solo aplican el test sobre instrumentos correlacionados, porque en instrumentos no correlacionados la estrategia falla sin reoptimizar. Es una decisión defendible, siempre que seas consciente de que un test entre correlacionados es un test más blando.

##### ¿Reoptimizo los parámetros en el mercado alternativo?

No. Si reoptimizas, no estás probando robustez: estás haciendo un backtest nuevo y volverás a encontrar la mejor combinación para el ruido de ese otro activo. Todo el valor del test está en llevar los parámetros originales a un mercado que no los vio nacer.

##### ¿Y si mi flujo ya filtra con dureza en el out-of-sample?

Entonces ya estás capturando la parte más rentable del proceso en términos de coste-beneficio: las métricas fuera de muestra y el ratio entre fuera y dentro de muestra aparecen entre los mejores del estudio y son prácticamente gratis.

Eso no hace superfluo el multi-mercado, que es el que mejor resultado obtuvo, pero sí refuerza el orden propuesto: primero lo barato y selectivo, después lo caro, y solo si has comprobado que aporta.

## Sigue leyendo el contenido de esta serie

Cerramos la serie con el montaje completo: el Retester en cadena, la gestión de databanks, la tabla de filtros recomendados con sus valores concretos, el checklist final y los diez errores que más caro salen.

[![" srcset="https://wikisqx.com/wp-content/uploads/2026/08/WikiSQX-StrategyQuantX-Test-Robustez_Desconfia-Backtest.jpg 1200w, https://wikisqx.com/wp-content/uploads/2026/08/WikiSQX-StrategyQuantX-Test-Robustez_Desconfia-Backtest-980x408.jpg 980w, https://wikisqx.com/wp-content/uploads/2026/08/WikiSQX-StrategyQuantX-Test-Robustez_Desconfia-Backtest-480x200.jpg 480w" sizes="(min-width: 0px) and (max-width: 480px) 480px, (min-width: 481px) and (max-width: 980px) 980px, (min-width: 981px) 1200px, 100vw" decoding="async" fetchpriority="high" />](https://wikisqx.com/test-robustez-backtest/)[Test de Robustez](https://wikisqx.com/test-robustez/)

#### [Desconfía de tu propio backtest](https://wikisqx.com/test-robustez-backtest/)

La filosofía de las pruebas de robustez y por qué son el paso más importante del proceso. Tabla de...

[Aprender más](https://wikisqx.com/test-robustez-backtest/)

[
