Lección de método

Multiplicidad: el mejor de muchos intentos

Con 432.053 hipótesis probadas, el mejor resultado de puro azar ya está en 4,6 desviaciones típicas. Cualquier cosa por debajo de eso no es un hallazgo.

La pregunta: Si pruebo muchas cosas y me quedo con la mejor, ¿qué tiene que dar para que signifique algo?

Qué se encontró

Un p-valor de 0,01 significa "esto pasaría por azar una vez de cada cien". Si se prueban cien mil cosas, pasará mil veces por azar. La lógica es obvia dicha así y aun así es la que hunde más investigación cuantitativa que ninguna otra: el escáner de umbrales del proyecto enumeraba por sí solo 431.256 hipótesis, ordenadas además por retorno acumulado —la métrica exactamente equivocada, dominada por unos pocos mantenimientos plurianuales de 2010-2013—. Sumando el resto de familias, el total de las dos semanas está en el orden de 10⁵ a 10⁶ pruebas, sin ninguna corrección global y sin ningún tramo de datos reservado. Los dos supervivientes se eligieron a posteriori del mismo conjunto: su significación nominal no es interpretable.

Pruébalo tú mismo

Mueve cuántas hipótesis se prueban y mira dónde queda el listón. La escala es logarítmica: cada punto multiplica por diez el número de pruebas.

Umbral |z| ≈ √(2·ln N) − (ln ln N + ln 4π) ÷ (2·√(2·ln N))
Mejor resultado esperado por puro azar (|z|)

Número de hipótesis que eso supone:

El valor por defecto (10^5,64 ≈ 437.000) está justo por encima de las 432.053 hipótesis reales que acumula el libro de cuentas del proyecto, y da el mismo 4,6 documentado. Compáralo con lo que hace falta para un solo test bien planteado: 1,64.

Números de ejemplo para practicar — no son datos reales.

Cómo se probó, paso a paso

  1. Si se sacan N números al azar de una distribución normal, el mayor de todos crece con N de forma conocida y bastante lenta: aproximadamente la raíz de 2 × ln(N), con una pequeña corrección.
  2. Con 432.053 pruebas ese máximo esperado por puro ruido está en 4,58 desviaciones típicas. Cualquier candidato del escáner por debajo de eso es, literalmente, lo que cabía esperar sin ninguna señal.
  3. La solución del proyecto no fue un ajuste estadístico más fino, sino un LIBRO DE CUENTAS: un fichero que acumula cada hipótesis probada, con su familia y su fecha, sembrado con el histórico real. La corrección se aplica contra ese contador global, no contra el número de pruebas de la sesión de hoy.
  4. Y la conclusión estratégica, que es lo contrario de la intuición habitual: cuantas más celdas se prueban, más alto sube el umbral, y el umbral sube más rápido que cualquier señal real. Probar más combinaciones con el mismo dato no acerca la respuesta: la aleja.
Qué NO dice esto. Contar hipótesis tiene su propio matiz, y el proyecto lo dice: tratar tres horizontes de la MISMA señal como tres pruebas independientes es excesivamente conservador, porque no lo son. Por eso el criterio adoptado no descansa sólo en el p-valor: descansa en signo consistente en varios horizontes, mismo signo fuera de muestra, correlación baja con lo ya validado, y un mecanismo escrito antes. Y hay un chequeo previo que evita inflar el contador con humo: comprobar el solapamiento entre candidatos ANTES de contarlos como hallazgos distintos. El proyecto encontró cinco "hallazgos" del escáner que solapaban entre el 40 % y el 100 % entre sí — eran la misma señal contada cinco veces.

Seguimiento

Este hallazgo no tiene un número en vivo: se midió sobre datos archivados y publicar un gráfico aquí daría a entender un seguimiento continuo que no existe. Las cifras están arriba, con el script que las produjo.

← Toda la investigación