Autumn 2025
Model calibration se trata de asegurar que las probabilidades predichas por un modelo reflejen las probabilidades reales.
En otras palabras, un modelo bien calibrado da probabilidades que coinciden con los resultados reales.
Model calibration se trata de asegurar que las probabilidades predichas por un modelo reflejen las probabilidades reales.
En otras palabras, un modelo bien calibrado da probabilidades que coinciden con los resultados reales.
En resumen, si tu modelo dice que algo tiene un 70% de probabilidad de ocurrir, ese evento debería en realidad ocurrir cerca del 70% de las veces a lo largo de muchas predicciones de ese tipo.
Tenemos dos clasificadores:
¿Cuál es mejor?
Tenemos dos clasificadores:
¿Cuál es mejor?
Bueno, Model A es mejor porque si un modelo tiene 90% de accuracy en su predicción (prediciendo correctamente 9 de 10 muestras), entonces su confidence debería ser también 90%.
¿Qué pasa con Model B?
¿Qué pasa con Model B?
¿Qué pasa con Model B?
Por otro lado, si hubiera un Model C con 90% de accuracy y 0.8 de confidence en cada predicción.
¿Qué pasa con Model B?
Por otro lado, si hubiera un Model C con 90% de accuracy y 0.8 de confidence en cada predicción.
Por definición, decimos que un modelo está bien calibrado cuando una predicción de una clase con confidence p es correcta el 100p% de las veces.
De lo contrario, los modelos underconfident y overconfident se llaman ill-calibrated.
A continuación está el reliability plot (discutido más adelante) de un modelo ill-calibrated y uno well-calibrated:
A continuación está el reliability plot (discutido más adelante) de un modelo ill-calibrated y uno well-calibrated:
¡Esto significa que un modelo tiene muchos falsos negativos!!
Predicciones confiables – especialmente en áreas de alto riesgo como salud, decisiones legales, o conducción autónoma.
Mejor toma de decisiones – cuando las probabilidades se usan para disparar acciones (como alertas o intervenciones).
Predicciones confiables – especialmente en áreas de alto riesgo como salud, decisiones legales, o conducción autónoma.
Mejor toma de decisiones – cuando las probabilidades se usan para disparar acciones (como alertas o intervenciones).
Estimación de incertidumbre – útil en tareas posteriores como ensembling, active learning, o inferencia Bayesiana.
Un modelo de detección de covid donde, si el confidence es mayor a 90%, el paciente es enviado al médico.
Un modelo de detección de covid donde, si el confidence es mayor a 90%, el paciente es enviado al médico.
Un modelo de detección de covid donde, si el confidence es mayor a 90%, el paciente es enviado al médico.
Expected Calibration Error (ECE)
Maximum Calibration Error (MCE)
Reliability Diagrams – grafica las probabilidades predichas vs. las reales.
ECE mide la diferencia promedio entre el confidence predicho y el accuracy real — a través de bins de predicciones.
Divide las predicciones en M bins, luego para cada bin B, calcula accuracy y confidence: \[ECE=\sum_{i=1}^M \frac{|B_i|}{n} |acc(B_i) - conf(B_i)|\]
Donde |B| es el número de muestras en el bin B.
Un ECE menor significa mejor calibration.
MCE se enfoca en el peor bin — la diferencia máxima entre confidence y accuracy a través de todos los bins. \[MCE = \max_{i=1}^{M} |acc(B_i) - conf(B_i)|\]
Resalta la brecha de calibration más grande.
Útil cuando te importa cualquier mala calibration, no solo el promedio.