ETACheck ← Volver

El método, completo y abierto

Un número sin método no sirve para tomar decisiones. Acá está exactamente cómo medimos, qué descartamos y cómo nos validamos. Si encuentras un error, escríbenos.

1. Qué se mide contra qué

Un ETA se juzga contra una referencia. Usamos dos, en este orden de preferencia:

Cada corredor se consulta cada 30 minutos, de forma continua, para tener la curva completa del día y no una foto conveniente.

2. Cuándo dos mediciones se pueden comparar

Un par es una predicción y una observación del mismo viaje. Para que cuente exigimos dos cosas:

Por qué importa el segundo filtro: un par mal emparejado no se nota en el resultado, se aprende como si fuera sesgo. Al apretar ese umbral de 15% a 6%, la dispersión dentro de una misma ruta bajó de 6,6% a 6,0%, perdiendo solo 8 pares de 99.

3. El factor de corrección

Para cada par calculamos el cociente entre lo observado y lo predicho, en logaritmo:

coeficiente = log(tiempo real / tiempo predicho)

En logaritmo, pasarse un 20% y quedarse corto un 20% pesan igual, que es lo correcto: un ETA optimista y uno pesimista cuestan distinto, pero se equivocan lo mismo.

El factor de una ruta y franja es el promedio de esos coeficientes, encogido hacia el nivel superior cuando hay poca evidencia: la franja se apoya en el resto de la ruta, y la ruta en "no corregir". Así una sola medición no arrastra la corrección a un extremo.

Cuántas mediciones hacen falta

Mediciones previas de esa rutaError al predecir la siguiente
113,1%
25,8%
3 o más5,7%

La segunda medición es la que vale. La tercera casi no aporta. Por eso el piloto dura dos semanas y no dos meses.

4. Cómo nos validamos

La trampa habitual en este tipo de medición es evaluar el modelo con datos que ya vio. Nosotros reportamos la métrica honesta: entrenar solo con el pasado y predecir la medición siguiente, que es exactamente lo que ocurre en producción.

Forma de validarError calibrado
Hacia adelante en el tiempo (la que reportamos)6,3%
Dejando una medición fuera (optimista)5,5%
Sin corregir, fuente cruda11,9%

Y el límite, dicho por nosotros: en un corredor nunca medido, calibrar no sirve de nada (12,0% contra 12,7% sin corregir). El sesgo es propio de cada ruta y no se traslada entre ciudades. Cualquiera que te venda un factor genérico te está vendiendo humo.

5. La prueba contra viajes reales, y lo que salió mal

Todo lo anterior compara una predicción contra otra fuente. Eso deja una pregunta abierta: ¿cuánto se equivocan contra el reloj? Chicago publica cada viaje de taxi —hora, duración exacta y distancia, sin persona detrás— así que la pregunta se puede contestar.

Tomamos 466 viajes reales de más de 25 minutos en 12 corredores —591 comparaciones— y a cada proveedor le pedimos su predicción para ese mismo instante.

Contra viajes realesFuente AFuente B
Comparaciones413178
Error medio contra el reloj14,2%15,7%
Viajes que excedieron el ETA47%58%
Margen necesario para cumplir el 90%×1,29×1,33

Lo que importa no está en el promedio: el margen que cada corredor necesita va de ×1,04 a ×1,41, con el mismo origen, en la misma ciudad y el mismo mes. Cambia solo el destino y el margen casi se triplica en su exceso. Ese es el resultado que hace imposible vender un número genérico.

Y acá está lo que no funcionó. Aplicar nuestro factor por corredor sobre estos viajes no bajó el error medio: 12,3% sin corregir contra 13,6% corregido en la fuente con más datos. La razón es que la dispersión dentro de un mismo corredor (11% a 22%) es mayor que el sesgo. El factor recentra la predicción, pero no aprieta la distribución, porque corrige sesgo y no varianza.

La consecuencia honesta: el 6,3% de la sección anterior mide concordancia con otra fuente, no exactitud contra la realidad. Contra el reloj, en un viaje urbano de media hora, el piso está alrededor de 14% y ningún factor lo mueve mucho. Quien te prometa bajar de ahí no ha medido contra viajes reales.

Lo que sí vale, entonces, no es el ETA corregido: es el margen. Saber que un corredor necesita ×1,41 y el de al lado ×1,04 —y no el ×1,25 plano que se suele asumir— es una cifra que se mide y que nadie te está midiendo. Eso es lo que entregamos.

El estudio completo, con las cifras por franja horaria y sus límites, está en etacheck.cl/estudio.

6. Lo que probamos y descartamos

Publicamos también lo que no funcionó, porque ahorra tiempo a quien quiera replicar esto:

7. Qué hacemos con los datos