Multiplicidad: el mejor de muchos intentos
Con 432.053 hipótesis probadas, el mejor resultado de puro azar ya está en 4,6 desviaciones típicas. Cualquier cosa por debajo de eso no es un hallazgo.
La pregunta: Si pruebo muchas cosas y me quedo con la mejor, ¿qué tiene que dar para que signifique algo?
Qué se encontró
Un p-valor de 0,01 significa "esto pasaría por azar una vez de cada cien". Si se prueban cien mil cosas, pasará mil veces por azar. La lógica es obvia dicha así y aun así es la que hunde más investigación cuantitativa que ninguna otra: el escáner de umbrales del proyecto enumeraba por sí solo 431.256 hipótesis, ordenadas además por retorno acumulado —la métrica exactamente equivocada, dominada por unos pocos mantenimientos plurianuales de 2010-2013—. Sumando el resto de familias, el total de las dos semanas está en el orden de 10⁵ a 10⁶ pruebas, sin ninguna corrección global y sin ningún tramo de datos reservado. Los dos supervivientes se eligieron a posteriori del mismo conjunto: su significación nominal no es interpretable.
Pruébalo tú mismo
Mueve cuántas hipótesis se prueban y mira dónde queda el listón. La escala es logarítmica: cada punto multiplica por diez el número de pruebas.
Número de hipótesis que eso supone:
El valor por defecto (10^5,64 ≈ 437.000) está justo por encima de las 432.053 hipótesis reales que acumula el libro de cuentas del proyecto, y da el mismo 4,6 documentado. Compáralo con lo que hace falta para un solo test bien planteado: 1,64.
Números de ejemplo para practicar — no son datos reales.
Cómo se probó, paso a paso
- Si se sacan N números al azar de una distribución normal, el mayor de todos crece con N de forma conocida y bastante lenta: aproximadamente la raíz de 2 × ln(N), con una pequeña corrección.
- Con 432.053 pruebas ese máximo esperado por puro ruido está en 4,58 desviaciones típicas. Cualquier candidato del escáner por debajo de eso es, literalmente, lo que cabía esperar sin ninguna señal.
- La solución del proyecto no fue un ajuste estadístico más fino, sino un LIBRO DE CUENTAS: un fichero que acumula cada hipótesis probada, con su familia y su fecha, sembrado con el histórico real. La corrección se aplica contra ese contador global, no contra el número de pruebas de la sesión de hoy.
- Y la conclusión estratégica, que es lo contrario de la intuición habitual: cuantas más celdas se prueban, más alto sube el umbral, y el umbral sube más rápido que cualquier señal real. Probar más combinaciones con el mismo dato no acerca la respuesta: la aleja.