Cruzar el umbral con tecnología y datos

Umbral es un laboratorio de tecnología cívica y datos abiertos.

Construimos productos y herramientas de monitoreo reproducibles para humanos y agentes.

Lo que estamos construyendo

Cada proyecto publica su código bajo licencia MIT y sus datos limpios bajo CC BY 4.0.

En desarrollo

desaparecidosmx

Pipeline que convierte el RNPDNO en CSVs limpios, mensuales y por entidad, desagregados por categoría, sexo y municipio. Todos los datos están cacheados y conciliados contra los resultados del tablero oficial.

En desarrollo

observatorio-delictivo

Pipeline abierto y reproducible de incidencia delictiva, victimización y percepción de seguridad en México. Snapshots inmutables por vintage, tasas por 100 mil habitantes con denominadores de CONAPO, y conciliación de homicidios SESNSP–INEGI.

En desarrollo

politica-meta

Descarga y análisis del gasto en anuncios políticos de Facebook e Instagram en México con la Meta Ad Library API. Agrega por página, entidad y mes, con atribución de actores para rastrear la propaganda que corre por medios locales y páginas de terceros.

En desarrollo

cabildo-libre

Buscador y línea de tiempo sobre las actas del cabildo de Colima: 636 sesiones y 6,992 puntos de agenda entre 2012 y 2026. El ayuntamiento las publica como un muro de PDF sin buscador; el sitio es estático, resuelve la búsqueda en el navegador y siempre enlaza al documento original.

Un umbral es el punto donde nos detenemos

Todo producto de datos toma decisiones que casi nunca se declaran: hasta dónde desagregar, cuándo dos series dejan de ser comparables, qué puede decir un modelo de lenguaje y qué no. Publicamos las decisiones, no solo las cifras — y cada punto se verifica en un repositorio público.

  1. 01
    El modelo no es una fuente

    Usamos modelos de lenguaje para resumir documentos y responder preguntas sobre los datos. Ninguna cifra sale de uno: los números vienen de un pipeline determinista sobre datos versionados. Cuando el documento no declara un resultado, decimos «sin resultado registrado» en lugar de inferirlo.

  2. 02
    Vintages, no «último dato»

    Las fuentes mexicanas se corrigen hacia atrás. Publicamos snapshots fechados e inmutables en vez de un archivo que se sobrescribe: si una cifra cambió, se puede ver cuándo cambió y cuánto.

  3. 03
    La incertidumbre es un tipo de dato

    Cuando la fuente entrega rangos, el rango se propaga por toda la cadena de agregación. Nunca tapamos un techo desconocido con la cota inferior para que la tabla se vea completa.

  4. 04
    Se corre sin nosotros y sin presupuesto

    Todo se reproduce siguiendo un procedimiento documentado, y se opera sin backend ni costo mensual. Queremos que sean bienes públicos.

Quiénes somos

Jay Ballesteros

Jay Ballesteros

Director general

Diseña los pipelines y las estrategias de identificación de Umbral. Es candidato al MPP de la Universidad de Chicago y es licenciado en Relaciones Internacionales por la Universidad de Colima.

Erick Ballesteros

Desarrollador

Estudiante de Ingeniería de Software en la Universidad de Colima. Trabaja en los sitios y tableros con los que se consultan nuestros datos.

TBD

Consejora

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, quis nostrud exercitation ullamco.

TBD

Consejoro

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, quis nostrud exercitation ullamco.