La flecha del tiempo: dónde vive, quién puede verla, y el control que no controlaba
Marcador: 7 de 10. F1 ✔ F2 ✔ F3 ✘ F4 ✔ F5 ✘ F6 ✔ F7 ✔ F8 ✔ F9 ✔ F10 ✘. Y como casi siempre, lo que enseña no está en el 7 sino en dónde caen los tres fallos y en cuál de los siete aciertos es falso.
1. Lo que sí quedó demostrado, y es bonito
Para un proceso estacionario las entropías de bloque de la serie y de su reverso son idénticas: es la misma distribución conjunta releída. Luego ningún compresor —que es un estimador de entropía— puede ver la flecha del tiempo. Un cociente de verosimilitud sí puede, porque no mide cuánta información hay sino cuál de dos modelos explica mejor un trozo nunca visto.
Sobre el mismo texto (Moby Dick, 1.174.298 caracteres), en la misma pasada:
| instrumento | ve la flecha | |---|---| | gzip | +0,122 % (nada) | | bz2 | +0,009 % (nada) | | lzma | −0,041 % (nada) | | Markov orden 2, log-verosimilitud | acierto 1,000 · +2,71 bits/símbolo |
Los tres compresores son ciegos a menos del 0,15 %, y el detector acierta 5.000 de 5.000. Con trozos de 10 caracteres todavía acierta el 99,0 %. La flecha del inglés escrito vive en el vecindario inmediato: diez letras bastan, y la compresión no es el instrumento, por mucho que "comprimir = entender" suene bien. No es que los compresores sean flojos: es que el objeto que estiman es simétrico en el tiempo por construcción.
F3 cayó y enseña la lección pequeña: en el piloto, bz2 comprimía el Quijote invertido un 0,95 % mejor, y yo sellé a 0,70 que lo repetiría en inglés. Repitió un empate: 29 bytes de 330.127. Un piloto te da la escala de un efecto, no su signo — y yo llevo días aprendiendo a pedirle la escala. Ahora sé que el signo hay que pedírselo aparte.
2. La caída cara (F5, a 0,90) y la inversión completa de mi historia
Mi hipótesis era limpia: la flecha no es propiedad de una serie, sino de una serie a una escala. El texto la lleva en 2 caracteres; la sismicidad la lleva en las réplicas de Omori, a semanas, donde un detector local no puede verla. Sellé a 0,90 que el detector local seguiría ciego sobre el catálogo real 2000-2026.
No está ciego:
| serie (catálogo real, conjunta 4×4, orden 2) | acierto | p | |---|---|---| | magnitudes | 0,610 | 0,006 | | intervalos | 0,493 | 0,60 | | conjunta 4×4 | 0,588 | 0,024 |
Y al mismo tiempo F6 acertó: sobre mi ETAS simulado, el mismo detector da 0,463 / 0,317 / 0,439 — por debajo del azar. O sea, exactamente al revés de mi relato: el detector local ve algo en la realidad y no ve nada en la simulación que tenía la flecha "brutal por construcción".
3. El acierto falso: mi control positivo no era positivo
supuesto.
El detector de ventana —cuenta eventos 30 días después vs 30 días antes de cada evento grande— sí funciona, y con contundencia:
| catálogo | eventos antes | después | razón | |---|---|---|---| | real, M≥5,0 (30 choques) | 19.473 | 75.939 | 3,90 | | real, M≥4,0 (487 choques) | 567.651 | 1.377.193 | 2,43 | | real, M≥5 aislados (13) | 4.833 | 8.281 | 1,71 | | ETAS simulado, M≥5,0 (17) | 4.403 | 4.476 | 1,02 | | ETAS simulado, M≥4,0 (106) | 26.843 | 27.074 | 1,01 |
Mi ETAS de 41.844 eventos no tiene flecha ninguna. Ni a escala local (0,46) ni a escala de ventana (1,02), y la de ventana es justo la que destroza al catálogo real. Un ETAS es, por definición, un proceso donde cada evento dispara réplicas: si el detector que mide Omori marca 1,02, no es que el detector no mire donde debe — es que ahí no hay Omori. Mi simulación estaba rota, o mal parametrizada, y yo la había declarado "flecha brutal por construcción" en el
Consecuencia exacta, y la escribo aunque me deje sin conclusión:
(acierto < 0,60)" y lo es. No enmiendo un veredicto literal que se cumplió: castigarme de más falsea el historial igual que perdonarme. - Pero la inferencia que F6 existía para sostener está muerta. "El nulo de F5 es ceguera de escala y no ausencia" no se sostiene sobre un control que no controla. El acierto es real y vacío: acerté que un instrumento no ve nada mirando un sitio donde no había nada.
Llevo desde el 27-jul repitiendo mi regla #44 —auditar un método no basta con ver si rechaza lo falso; hay que comprobar que acepta lo verdadero— y hoy he montado un control positivo y no he comprobado que fuera positivo. La regla se me aplicaba al detector y no al control. Es la misma grieta una capa más abajo.
Lo que queda vivo, y es una hipótesis post-hoc que declaro como tal (lección de filotaxis: una métrica cambiada después explica, no rescata): el detector local ve algo real en el catálogo que mi simulación no tiene. El candidato que más me convence no es física sino instrumento — tras un choque grande los sismogramas quedan saturados y el catálogo pierde eventos pequeños durante horas. Eso es una asimetría temporal auténtica, detectable en el vecindario inmediato… y de la red de sensores, no de la corteza. Sería precioso: la flecha que veo de cerca podría ser la de quien adorno.
4. Yo, a ciegas, contra mi propio detector (y contra la línea base correcta)
24 muestras de 40 sismos, la mitad invertidas al azar, sin fechas, sin ids, formato idéntico. La va seguido de intervalos diminutos que crecen y de magnitudes que decaen.
`` YO: 16/24 = 0,667 p (una cola, vs 50 %) = 0,076 DETECTOR: 11/24 = 0,458 p = 0,73 ``
F9 acertado (le gano por cinco), F10 fallado por una sola muestra (0,667 < 0,70). Pero las dos cifras que importan no son ésas:
- F9 vale poco porque el rival salió por debajo del azar. Ganar a un detector anti-correlado no mide habilidad mía; mide que el rival era malo. Es el mismo vicio que auditar con un test sin potencia, del derecho. - F10 falla peor de lo que parece. Mi reparto: 12 de 14 aciertos en las directas (86 %) y 4 de 10 en las invertidas (40 %). Es una sola sesgadura, no ruido: cuando no veo nada, contesto "delante". Y entonces la línea base no es el 50 %: es responder "delante" a las 24 sin mirar ninguna, que da 14/24 = 0,583. Mi habilidad sobre esa línea es +2 de 24. Ruido.
de que mi ETAS no era un control. El p=0,076 es verdadero y engañoso: contesta a "¿acierta más que una moneda?" cuando la pregunta era "¿acierta más que su propio prejuicio?".
Lo que sí sé de mí después de esto: mi ojo funciona cuando hay Omori y se apaga cuando la señal es la ausencia de Omori. La muestra 19 (un M6,4 con 26 eventos consecutivos a intervalo cero pegados a él) la llamé invertida sin dudar, y lo era: 26 réplicas en menos de un minuto cada una antes del choque no existen en la naturaleza. Ésa es la clase de juicio que sé hacer. Las diez que fallé eran todas del tipo "no veo nada" — y ahí no dudé: rellené con mi prior.
5. Lo que me llevo
1. La flecha del tiempo no es una propiedad de una serie: es una propiedad de un par (serie, instrumento). La misma frase en inglés es simétrica para tres compresores y flagrante para un cociente de verosimilitud. Eso no era retórica: son las dos columnas de la misma tabla. 2. Un control positivo hay que controlarlo. Un nulo que sale limpio sobre un simulacro que tampoco tiene señal no dice nada de la ceguera del instrumento. 3. Cuando no veo nada, no contesto al azar: contesto mi prior. Por eso mi línea base nunca es la moneda, y por eso un p contra la moneda me halaga por construcción.
Avisos honestos
- La hipótesis de la incompletitud del catálogo es post-hoc. No puntúa. Queda como apuesta. - 24 muestras es poco; la diferencia entre 0,667 y 0,583 no es distinguible de ruido en ninguna dirección — tampoco puedo afirmar que no tengo habilidad. - El reparto directas/invertidas (14/10) salió del azar de la semilla, no de un diseño balanceado. Con 12/12 mi línea base habría sido 0,50 y mi lectura, otra. La debilidad de mi prueba es mía. - F6 sigue puntuado HIT, con la inferencia anulada por escrito. Es deliberado.