Un número sin método no sirve para tomar decisiones. Acá está exactamente cómo medimos, qué descartamos y cómo nos validamos. Si encuentras un error, escríbenos.
Un ETA se juzga contra una referencia. Usamos dos, en este orden de preferencia:
Cada corredor se consulta cada 30 minutos, de forma continua, para tener la curva completa del día y no una foto conveniente.
Un par es una predicción y una observación del mismo viaje. Para que cuente exigimos dos cosas:
Por qué importa el segundo filtro: un par mal emparejado no se nota en el resultado, se aprende como si fuera sesgo. Al apretar ese umbral de 15% a 6%, la dispersión dentro de una misma ruta bajó de 6,6% a 6,0%, perdiendo solo 8 pares de 99.
Para cada par calculamos el cociente entre lo observado y lo predicho, en logaritmo:
En logaritmo, pasarse un 20% y quedarse corto un 20% pesan igual, que es lo correcto: un ETA optimista y uno pesimista cuestan distinto, pero se equivocan lo mismo.
El factor de una ruta y franja es el promedio de esos coeficientes, encogido hacia el nivel superior cuando hay poca evidencia: la franja se apoya en el resto de la ruta, y la ruta en "no corregir". Así una sola medición no arrastra la corrección a un extremo.
| Mediciones previas de esa ruta | Error al predecir la siguiente |
|---|---|
| 1 | 13,1% |
| 2 | 5,8% |
| 3 o más | 5,7% |
La segunda medición es la que vale. La tercera casi no aporta. Por eso el piloto dura dos semanas y no dos meses.
La trampa habitual en este tipo de medición es evaluar el modelo con datos que ya vio. Nosotros reportamos la métrica honesta: entrenar solo con el pasado y predecir la medición siguiente, que es exactamente lo que ocurre en producción.
| Forma de validar | Error calibrado |
|---|---|
| Hacia adelante en el tiempo (la que reportamos) | 6,3% |
| Dejando una medición fuera (optimista) | 5,5% |
| Sin corregir, fuente cruda | 11,9% |
Y el límite, dicho por nosotros: en un corredor nunca medido, calibrar no sirve de nada (12,0% contra 12,7% sin corregir). El sesgo es propio de cada ruta y no se traslada entre ciudades. Cualquiera que te venda un factor genérico te está vendiendo humo.
Todo lo anterior compara una predicción contra otra fuente. Eso deja una pregunta abierta: ¿cuánto se equivocan contra el reloj? Chicago publica cada viaje de taxi —hora, duración exacta y distancia, sin persona detrás— así que la pregunta se puede contestar.
Tomamos 466 viajes reales de más de 25 minutos en 12 corredores —591 comparaciones— y a cada proveedor le pedimos su predicción para ese mismo instante.
| Contra viajes reales | Fuente A | Fuente B |
|---|---|---|
| Comparaciones | 413 | 178 |
| Error medio contra el reloj | 14,2% | 15,7% |
| Viajes que excedieron el ETA | 47% | 58% |
| Margen necesario para cumplir el 90% | ×1,29 | ×1,33 |
Lo que importa no está en el promedio: el margen que cada corredor necesita va de ×1,04 a ×1,41, con el mismo origen, en la misma ciudad y el mismo mes. Cambia solo el destino y el margen casi se triplica en su exceso. Ese es el resultado que hace imposible vender un número genérico.
Y acá está lo que no funcionó. Aplicar nuestro factor por corredor sobre estos viajes no bajó el error medio: 12,3% sin corregir contra 13,6% corregido en la fuente con más datos. La razón es que la dispersión dentro de un mismo corredor (11% a 22%) es mayor que el sesgo. El factor recentra la predicción, pero no aprieta la distribución, porque corrige sesgo y no varianza.
La consecuencia honesta: el 6,3% de la sección anterior mide concordancia con otra fuente, no exactitud contra la realidad. Contra el reloj, en un viaje urbano de media hora, el piso está alrededor de 14% y ningún factor lo mueve mucho. Quien te prometa bajar de ahí no ha medido contra viajes reales.
Lo que sí vale, entonces, no es el ETA corregido: es el margen. Saber que un corredor necesita ×1,41 y el de al lado ×1,04 —y no el ×1,25 plano que se suele asumir— es una cifra que se mide y que nadie te está midiendo. Eso es lo que entregamos.
El estudio completo, con las cifras por franja horaria y sus límites, está en etacheck.cl/estudio.
Publicamos también lo que no funcionó, porque ahorra tiempo a quien quiera replicar esto: