Visualization for Machine Learning

Otoño 2025

Black Box Model Assessment

Agenda


Objetivo: Estudiar Model Agnostic Interpretability Methods. Estos deberían ayudar a explicar cualquier tipo de modelo de ML.

  1. Partial Dependence Plot (PDP)

  2. Local Interpretable Model-agnostic Explanations (LIME)

  3. SHAP (SHapley Additive exPlanations)

Ejemplos y materiales del libro de Molnar: Interpretable ML

Bike Rentals (Regresión)

Este dataset contiene conteos diarios de bicicletas alquiladas de la empresa Capital-Bikeshare en Washington D.C., junto con información del clima y estacional. El objetivo es predecir cuántas bicicletas se alquilarán según el clima y el día. El dato puede descargarse del UCI Machine Learning Repository.

Bike Rentals (Regresión)

Aquí está la lista de features usadas en el libro de Molnar:

  • Conteo de bicicletas, incluyendo usuarios casuales y registrados. El conteo se usa como target en la tarea de regresión.
  • La estación del año, ya sea primavera, verano, otoño o invierno.
  • Indicador de si el día era feriado o no.
  • El año, ya sea 2011 o 2012.
  • Número de días desde el 01.01.2011 (el primer día en el dataset).
  • Indicador de si el día era laboral o fin de semana.
  • La situación del clima en ese día (por ejemplo, despejado, algunas nubes, parcialmente nublado, etc.)
  • Temperatura en grados Celsius.
  • Humedad relativa en porcentaje (0 a 100).
  • Velocidad del viento en km por hora.

Partial Dependence Plot (PDP)

Muestra el efecto marginal que una o dos features tienen sobre el resultado predicho de un modelo de machine learning (J. H. Friedman 2001).

Partial Dependence Plot (PDP)

Idea de alto nivel: marginalizar el output del modelo de machine learning sobre las distribuciones de todas las demás features, para mostrar la relación entre la feature que nos interesa y el resultado predicho.

Partial Dependence Plot (PDP)

Ventajas

  • Intuitivo
  • La interpretación es clara
  • Fácil de implementar

Desventajas

  • Asume independencia entre features
  • Solo puede mostrar pocas features
  • Efectos heterogéneos ocultos por el promediado

Local Interpretable Model-agnostic Explanations (LIME)

Entrenar modelos surrogate locales para explicar predicciones individuales

Local Interpretable Model-agnostic Explanations (LIME)

La idea es bastante intuitiva.

  • Primero, olvida los datos de entrenamiento e imagina que solo tienes el black box model, donde puedes ingresar puntos de datos y obtener las predicciones del modelo. Puedes probar la caja tantas veces como quieras. Tu objetivo es entender por qué el modelo de machine learning hizo cierta predicción. LIME prueba qué pasa con las predicciones cuando le das variaciones de tus datos al modelo de machine learning.

  • LIME genera un nuevo dataset compuesto de muestras perturbadas y las predicciones correspondientes del black box model.

  • Sobre este nuevo dataset, LIME entrena un modelo interpretable, que se pondera según la proximidad de las instancias muestreadas a la instancia de interés. El modelo interpretable puede ser cualquiera de los modelos interpretables, por ejemplo Lasso o un árbol de decisión. El modelo aprendido debería ser una buena aproximación de las predicciones del modelo de machine learning a nivel local, pero no tiene que ser una buena aproximación global. Este tipo de precisión también se llama local fidelity.

Local Interpretable Model-agnostic Explanations (LIME)

Local Interpretable Model-agnostic Explanations (LIME)

Algoritmo

  1. Elige un input para el que quieras una explicación.
  2. Muestrea los vecinos del input seleccionado (es decir, perturbation).
  3. Entrena un clasificador lineal sobre los vecinos.
  4. Los pesos del clasificador lineal son la explicación.

Local Interpretable Model-agnostic Explanations (LIME)

Predicciones de un random forest dadas las features x1 y x2.

Clases predichas: 1 (oscuro) o 0 (claro).

Local Interpretable Model-agnostic Explanations (LIME)

Instancia de interés (punto amarillo grande) y datos muestreados de una distribución normal (puntos pequeños).

Local Interpretable Model-agnostic Explanations (LIME)

Asigna mayor peso a los puntos cerca de la instancia de interés. Es decir, \(weight(p) = \sqrt{\frac{e^{-d^2}}{w^2}}\) donde \(d\) es la distancia entre \(p\) y la instancia de interés, y \(w\) es el ancho del kernel (definido por el usuario).

Local Interpretable Model-agnostic Explanations (LIME)

Usa tanto las muestras como sus pesos para entrenar un clasificador lineal.

Los signos en la grilla muestran las clasificaciones del modelo aprendido localmente a partir de las muestras ponderadas. La línea roja marca el decision boundary (P(class=1) = 0.5).

La implementación oficial usa un Ridge Classifier como modelo lineal para la explicación.

Local Interpretable Model-agnostic Explanations (LIME)

Veamos un ejemplo concreto. Volvamos a los datos de bike rental y convirtamos el problema de predicción en una clasificación: después de tener en cuenta que el alquiler de bicicletas se ha vuelto más popular con el tiempo, queremos saber, en cierto día, si el número de bicicletas alquiladas estará por encima o por debajo de la línea de tendencia. También puedes interpretar “por encima” como estar por encima del número promedio de bicicletas, pero ajustado por la tendencia.

Primero entrenamos un random forest con 100 árboles para la tarea de clasificación. ¿En qué día el número de bicicletas alquiladas estará por encima del promedio libre de tendencia, según el clima y la información del calendario?

Las explicaciones se crean con 2 features. Los resultados de los modelos lineales locales sparse entrenados para dos instancias con diferentes clases predichas:

Local Interpretable Model-agnostic Explanations (LIME)

Ventajas

  • Las explicaciones son cortas (= selectivas) y posiblemente contrastivas.
    • Podemos controlar la sparsity de los coeficientes de peso en el método de regresión.
  • Muy fácil de usar.

Desventajas

  • Resultados inestables debido al muestreo.
  • Difícil ponderar vecinos similares en un dataset de alta dimensión.
  • Muchos parámetros que permiten a los data scientists ocultar biases.

SHAP (SHapley Additive exPlanations)

Ejemplos y materiales del nuevo libro de Molnar: https://christophmolnar.com/books/shap/

SHAP (Lundberg and Lee 2017a) es un método inspirado en la game theory, creado para explicar predicciones hechas por modelos de machine learning. SHAP genera un valor por cada feature de entrada (también conocido como valor SHAP) que indica cómo esa feature contribuye a la predicción del punto de dato especificado.

Una Breve Historia de los Valores de Shapley y de SHAP

  • 1953: La introducción de los valores de Shapley en la game theory (por Lloyd Shapley).
  • 2010: Los primeros pasos hacia aplicar los valores de Shapley en machine learning
    • ¡el paper original no tenía código!
  • 2017: El surgimiento de SHAP (por Lundberg y Lee), un punto de inflexión en machine learning.

Teoría de los Valores de Shapley

¿Quién va a pagar ese taxi?

Alice, Bob, y Charlie cenan juntos y comparten un viaje en taxi de vuelta a casa. El costo total es $51. La pregunta es, ¿cómo deberían dividir los costos de forma justa?

Teoría de los Valores de Shapley

La contribución marginal de un jugador a una coalición es el valor de la coalición con el jugador, menos el valor de la coalición sin el jugador. En el ejemplo del taxi, el valor de una coalición es igual al costo del viaje, tal como se detalla en la tabla anterior. Por lo tanto, la contribución marginal de, por ejemplo, Charlie a un taxi que ya contiene a Bob, es el costo del taxi con Bob y Charlie, menos el costo del taxi con solo Bob.

Teoría de los Valores de Shapley

Teoría de los Valores de Shapley

¿Cómo promediar estas contribuciones marginales por pasajero?

Una forma de responder esta pregunta es considerando todas las permutaciones posibles de Alice, Bob, y Charlie. Hay 3! = 3 * 2 * 1 = 6 permutaciones posibles de pasajeros:

  • Alice, Bob, Charlie
  • Alice, Charlie, Bob
  • Bob, Alice, Charlie
  • Charlie, Alice, Bob
  • Bob, Charlie, Alice
  • Charlie, Bob, Alice

Podemos usar estas permutaciones para formar coaliciones, por ejemplo, para Alice.

Teoría de los Valores de Shapley

En dos de estos casos, Alice fue agregada a un taxi vacío, y en un caso fue agregada a un taxi solo con Bob. Ponderando las contribuciones marginales en consecuencia, calculamos el siguiente promedio ponderado de la contribución marginal para Alice, abreviando Alice, Bob, y Charlie como A, B, y C:

Teoría de los Valores de Shapley

para Bob:

para Charlie:

Calculando los Valores de Shapley

El valor de Shapley es el promedio ponderado de las contribuciones marginales de un jugador a todas las coaliciones posibles.

Los axiomas detrás de los valores de Shapley

  • Eficiencia: La suma de las contribuciones debe sumar exactamente el pago total.

  • Simetría: Si dos jugadores son idénticos, deben recibir contribuciones iguales.

  • Dummy o Null Player: El valor de un jugador que no contribuye a ninguna coalición es cero.

  • Aditividad: En un juego con dos funciones de valor, los valores de Shapley para la suma pueden expresarse como la suma de los valores de Shapley.

Estos cuatro axiomas garantizan la unicidad de los valores de Shapley.

De los Valores de Shapley a SHAP

Considera el siguiente escenario: has entrenado un modelo de machine learning \(f\) para predecir precios de apartamentos.

De los Valores de Shapley a SHAP

Queremos evaluar el efecto de cat-banned

De los Valores de Shapley a SHAP

Queremos evaluar el efecto de cat-banned

Interpretando los valores SHAP

El valor de Shapley puede malinterpretarse. El valor de Shapley del valor de una feature no es la diferencia del valor predicho después de remover esa feature del entrenamiento del modelo. La interpretación del valor de Shapley es: Dado el conjunto actual de valores de las features, la contribución del valor de una feature a la diferencia entre la predicción real y la predicción promedio es el valor de Shapley estimado.

El valor de Shapley es el método de explicación equivocado si buscas explicaciones sparse (explicaciones que contienen pocas features). Las explicaciones creadas con el método de valor de Shapley siempre usan todas las features. Los humanos prefieren explicaciones selectivas, como las producidas por LIME. LIME podría ser la mejor opción para explicaciones que deban manejar personas sin experiencia técnica.

(Del libro de Molnar)

SHAP (SHapley Additive exPlanations)

Ventajas

  • Importancia de features distribuida de forma justa hacia una predicción

  • Explicaciones contrastivas (se puede comparar una instancia con un subconjunto o incluso con un único punto de dato)

  • Teoría sólida

Desventajas

  • Mucho tiempo de cómputo
  • No son explicaciones sparse (cada feature es importante)

SHAP (SHapley Additive exPlanations)

Limitaciones de SHAP

Paper