Reference data de US equities reconstruida todos los días: qué ticker se llamaba antes de otra forma, cuál hizo reverse split, y todos los trading halts desde 2019. Es la capa aburrida que arruina backtests cuando está mal.
- 69.256 halts reconciliados entre NYSE, Nasdaq y Cboe — un evento es una fila y se sabe qué feeds lo vieron
- Releases diarios tageados por fecha: un backtest puede pinear el snapshot exacto que usó
- Renames resueltos por CIK y splits que las fuentes perdieron
- Los halts que nunca reanudan. Los feeds siguen devolviendo los que están abiertos — hay papeles halteados desde 2023 — y cada corrida los vuelve a rutear a su año. Funciona, pero no me convence como modelo: un evento sin cierre no es lo mismo que uno cerrado y hoy viven en la misma tabla.
- Correcciones retroactivas sin rastro. Si una fuente corrige un evento de 2021, el CSV de 2021 cambia y no queda registro de qué cambió ni cuándo. Para un dataset que se usa en backtests, eso es un problema serio: dos corridas del mismo test pueden no ser comparables y no hay forma de saberlo.