Model Calibration

Autumn 2025

¿Qué queremos decir con model calibration?

  • Model calibration se trata de asegurar que las probabilidades predichas por un modelo reflejen las probabilidades reales.

¿Qué queremos decir con model calibration?

  • Model calibration se trata de asegurar que las probabilidades predichas por un modelo reflejen las probabilidades reales.

  • En otras palabras, un modelo bien calibrado da probabilidades que coinciden con los resultados reales.

¿Qué queremos decir con model calibration?

  • Model calibration se trata de asegurar que las probabilidades predichas por un modelo reflejen las probabilidades reales.

  • En otras palabras, un modelo bien calibrado da probabilidades que coinciden con los resultados reales.

En resumen, si tu modelo dice que algo tiene un 70% de probabilidad de ocurrir, ese evento debería en realidad ocurrir cerca del 70% de las veces a lo largo de muchas predicciones de ese tipo.

Ejemplo

Tenemos dos clasificadores:

  • Model A: 90% de accuracy, 0.91 de confidence en cada predicción.
  • Model B: 90% de accuracy, 0.99 de confidence en cada predicción.

¿Cuál es mejor?

Ejemplo

Tenemos dos clasificadores:

  • Model A: 90% de accuracy, 0.91 de confidence en cada predicción.
  • Model B: 90% de accuracy, 0.99 de confidence en cada predicción.

¿Cuál es mejor?

Bueno, Model A es mejor porque si un modelo tiene 90% de accuracy en su predicción (prediciendo correctamente 9 de 10 muestras), entonces su confidence debería ser también 90%.

Ejemplo

¿Qué pasa con Model B?

Ejemplo

¿Qué pasa con Model B?

  • Model B es overconfident, ya que su confidence es 99% pero su accuracy es 90%

Ejemplo

¿Qué pasa con Model B?

  • Model B es overconfident, ya que su confidence es 99% pero su accuracy es 90%

Por otro lado, si hubiera un Model C con 90% de accuracy y 0.8 de confidence en cada predicción.

Ejemplo

¿Qué pasa con Model B?

  • Model B es overconfident, ya que su confidence es 99% pero su accuracy es 90%

Por otro lado, si hubiera un Model C con 90% de accuracy y 0.8 de confidence en cada predicción.

  • Model C es underconfident.

Ejemplo

Por definición, decimos que un modelo está bien calibrado cuando una predicción de una clase con confidence p es correcta el 100p% de las veces.

De lo contrario, los modelos underconfident y overconfident se llaman ill-calibrated.

Ejemplo

A continuación está el reliability plot (discutido más adelante) de un modelo ill-calibrated y uno well-calibrated:

Ejemplo

A continuación está el reliability plot (discutido más adelante) de un modelo ill-calibrated y uno well-calibrated:

¡Esto significa que un modelo tiene muchos falsos negativos!!

¿Por qué es importante?

  • Predicciones confiables – especialmente en áreas de alto riesgo como salud, decisiones legales, o conducción autónoma.

¿Por qué es importante?

  • Predicciones confiables – especialmente en áreas de alto riesgo como salud, decisiones legales, o conducción autónoma.

  • Mejor toma de decisiones – cuando las probabilidades se usan para disparar acciones (como alertas o intervenciones).

¿Por qué es importante?

  • Predicciones confiables – especialmente en áreas de alto riesgo como salud, decisiones legales, o conducción autónoma.

  • Mejor toma de decisiones – cuando las probabilidades se usan para disparar acciones (como alertas o intervenciones).

  • Estimación de incertidumbre – útil en tareas posteriores como ensembling, active learning, o inferencia Bayesiana.

Ejemplo

Un modelo de detección de covid donde, si el confidence es mayor a 90%, el paciente es enviado al médico.

Ejemplo

Un modelo de detección de covid donde, si el confidence es mayor a 90%, el paciente es enviado al médico.

  • Si el modelo es overconfident, la mayoría de los pacientes serán enviados a médicos, aumentando aún más la carga de trabajo.

Ejemplo

Un modelo de detección de covid donde, si el confidence es mayor a 90%, el paciente es enviado al médico.

  • Si el modelo es overconfident, la mayoría de los pacientes serán enviados a médicos, aumentando aún más la carga de trabajo.
  • Si el modelo es underconfident, entonces hay chances de que el paciente con COVID-19 no reciba el tratamiento requerido.

Técnicas: Temperature Scaling:

  • Se usa en redes neuronales multiclase.
  • Aplica una única temperature escalar para suavizar los logits antes del softmax.
  • T se aprende usando un conjunto de validación para minimizar el Negative Log Likelihood (NLL).
  • Cuando T>1, el softmax se vuelve “más suave” (menor confidence). \[\hat{p}_i = \frac{e^{z_i / T}}{\sum_j e^{z_j / T} }\]

Técnicas: Platt Scaling o Sigmoid

  • Se usa en clasificadores binarios (especialmente SVMs).
  • Ajusta una regresión logística a los logits o scores del modelo vs. las etiquetas reales.
  • A y B se aprenden usando un conjunto de validación. \[\hat{p} = \frac{1}{1 + e^{(Az+B)}}\]

Técnicas: Histogram Binning

  • Se usa tanto en clasificación binaria como multiclase.
  • Agrupa las probabilidades predichas en intervalos fijos (por ejemplo, 0–0.1, 0.1–0.2, …).
  • Reemplaza cada predicción con el accuracy empírico de su bin. \[\text{Calibrated } \hat{p} = \frac{\text{# correct predictions in bin}}{\text{# predictions in bin}}\]

Técnicas: Isotonic Regression

  • Se usa en clasificación binaria con mucha data de validación.
  • Mapea los scores del modelo a probabilidades usando una función no decreciente.
  • Divide el rango de scores en bins, luego aprende una función escalonada que mejor se ajusta a los resultados reales en cada bin. \[\sum_i (y_i - \hat{y}_i)^2\]

Técnicas: Beta Calibration

  • Cuando Platt Scaling es demasiado simple pero no quieres la complejidad completa de un método no paramétrico.
  • Ajusta un modelo basado en una distribución Beta a los scores.
  • Generaliza Platt Scaling usando una Beta CDF para ajustar mejor las distribuciones de scores.
  • Aprende los parámetros a, b, c a partir de la data de validación. \[\hat{p} = BetaCDF(az +b, c)\]

Resumen

Métricas

  • Expected Calibration Error (ECE)

  • Maximum Calibration Error (MCE)

  • Reliability Diagrams – grafica las probabilidades predichas vs. las reales.

Expected Calibration Error (ECE)

  • ECE mide la diferencia promedio entre el confidence predicho y el accuracy real — a través de bins de predicciones.

  • Divide las predicciones en M bins, luego para cada bin B, calcula accuracy y confidence: \[ECE=\sum_{i=1}^M \frac{|B_i|}{n} |acc(B_i) - conf(B_i)|\]

  • Donde |B| es el número de muestras en el bin B.

  • Un ECE menor significa mejor calibration.

Maximum Calibration Error (MCE)

  • MCE se enfoca en el peor bin — la diferencia máxima entre confidence y accuracy a través de todos los bins. \[MCE = \max_{i=1}^{M} |acc(B_i) - conf(B_i)|\]

  • Resalta la brecha de calibration más grande.

  • Útil cuando te importa cualquier mala calibration, no solo el promedio.

Reliability Diagrams

  • Una herramienta visual para graficar la probabilidad predicha vs. el accuracy real.

Resumen

Referencias